TypeSafe AI, el laboratorio fundado por el exinvestigador de OpenAI Diogo Almeida, presentó el 15 de septiembre Jev, un modelo que no escribe texto: recibe un contenido, contesta a preguntas cerradas sobre él y devuelve una respuesta tipada con probabilidades y un índice de confianza. Según la documentación de la compañía, cada llamada tarda entre 70 y 500 milisegundos y cuesta 0,042 dólares por millón de tokens de entrada, con la salida sin coste. Esta guía explica cómo hacer la primera llamada, cómo formular las preguntas y qué conviene no pedirle.
Las claves de Jev en 20 segundos
- Qué es: un «System One model», un modelo pensado para decisiones rápidas dentro de un programa (clasificar, enrutar, puntuar), no para conversar ni generar código.
- Cómo se usa: una sola petición POST con dos campos, el texto que se quiere juzgar y las preguntas. No hace falta SDK.
- Cuánto cuesta: 0,042 dólares por millón de tokens de entrada; la salida no se cobra.
- El límite que más importa en España: el inglés es su idioma principal de entrenamiento y la propia TypeSafe admite que en otros idiomas la precisión es menor.
Un modelo que no genera texto
La idea de TypeSafe parte de una observación: los modelos de lenguaje llevan años conversando mejor que muchas personas, pero la automatización real sigue siendo escasa. Almeida, que trabajó en OpenAI en los métodos que acabaron detrás de ChatGPT, sostiene en el anuncio que el problema está en la salida. Un LLM devuelve cadenas de texto que el software tiene que interpretar y validar, y siempre existe el riesgo de que se salga del formato.
Jev renuncia a generar texto. Las posibles respuestas se definen de antemano en la petición y el modelo solo puede elegir entre ellas, de modo que no hay JSON mal formado ni campos inventados. La empresa lo presenta como una especie de llamada a función con inteligencia de frontera: entra estado sin estructurar, salen decisiones tipadas con probabilidades. Para entrenarlo ha desarrollado un método propio que llama aprendizaje por refuerzo para decisiones calibradas (RLCD, por sus siglas en inglés).
El nombre es un guiño a William Stanley Jevons y a su paradoja: la compañía espera que abaratar la inteligencia multiplique su demanda, como ocurrió con el carbón cuando mejoró la eficiencia de las máquinas de vapor. El término «System One» procede de la distinción de Daniel Kahneman entre el pensamiento rápido e intuitivo y el lento y deliberado.
La primera llamada, paso a paso
Hace falta una clave de API, que se obtiene en la consola de TypeSafe (console.typesafe.ai). En el anuncio del 15 de septiembre la empresa hablaba de un acceso anticipado con lista de espera; las guías publicadas en los días siguientes describen ya un registro directo con clave inmediata, así que conviene comprobar en la consola cómo está el acceso en cada momento. También se puede llegar a Jev sin clave de TypeSafe, a través de pasarelas como OpenRouter, Vercel AI Gateway o el AI Gateway de Cloudflare.
Una llamada tiene dos partes: el estado (state), que es el texto a juzgar, y las preguntas (questions). Este ejemplo analiza un mensaje de un cliente:
curl -X POST https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "jev-latest",
"state": "Me cobrasteis dos veces la cuota de septiembre y nadie contesta al teléfono.",
"questions": {
"departamento": {
"type": "choice",
"instructions": "Which team should handle this message?",
"criteria": {
"billing": "Charges, invoices, refunds or subscriptions",
"technical": "Access, errors or service outages",
"other": "Anything that fits neither of the above"
}
},
"requiere_humano": {
"type": "noul",
"instructions": "A person should reply to this message personally"
}
}
}'
La respuesta llega con la opción elegida, la probabilidad de cada alternativa y un índice de confianza. Un detalle que confunde a casi todo el mundo al empezar: la clave de cada pregunta (departamento, requiere_humano) nunca llega al modelo. Todo lo que Jev necesita saber tiene que ir en instructions, y cada criterio debe describir una situación, no ser una simple etiqueta.
Para quien prefiera no montar la petición a mano, TypeSafe ofrece SDK oficiales para JavaScript y TypeScript (npm install @typesafe-ai/sdk) y para Python (pip install typesafe-sdk), que añaden reintentos automáticos cuando se supera el límite de peticiones. Hay además integraciones para LangChain, Pydantic AI y LiteLLM.
Tres tipos de pregunta
Jev solo sabe contestar de tres formas, y elegir mal la forma es el error más habitual. La regla práctica es pensar en qué necesita recibir el código, no en cómo suena la pregunta.
- Choice elige una opción de una lista cerrada, de hasta 255 elementos. Sirve para enrutar y clasificar. Conviene incluir siempre una opción de escape tipo «otro», porque las probabilidades suman uno y, sin esa salida, el modelo se ve obligado a repartirlas entre opciones que no encajan.
- Score sitúa el texto en una escala de entre 2 y 10 niveles que el usuario describe con palabras. Funciona mucho mejor si cada nivel describe un caso concreto («el servicio no funciona y no hay alternativa») que si usa adjetivos de intensidad («bastante grave»).
- Noul responde a una pregunta de sí o no con la probabilidad de que la respuesta sea afirmativa. No mide grados: un 0,5 no significa «a medias», sino que el modelo no se decanta.
La confianza es el número que importa
El patrón que se repite en todos los proyectos construidos con Jev es el mismo: el código no decide según la opción elegida, sino según la confianza. Por encima de un umbral, el sistema actúa solo; por debajo, pasa el caso a una persona o a un modelo más caro. Con el ejemplo anterior, en JavaScript quedaría así:
const { departamento, requiere_humano } = respuesta;
if (departamento.confidence < 0.7) return aRevisionManual(mensaje);
if (requiere_humano.noul > 0.8) return aColaPrioritaria(mensaje, departamento.choice);
return asignar(mensaje, departamento.choice);
Dónde colocar ese umbral no tiene respuesta de fábrica. La propia TypeSafe lo plantea como una cuestión empírica que depende de los datos de cada uno, y un umbral razonable para mostrar un dato no tiene por qué servir para aprobar un reembolso. Aquí conviene un matiz: la calibración, es decir, que una confianza alta signifique realmente acierto, es la promesa central del modelo y todavía no cuenta con evaluaciones independientes que la respalden.
Muchas preguntas en una sola llamada
Jev evalúa todas las preguntas de una petición en paralelo contra el mismo estado. Como el estado es lo que ocupa casi todos los tokens, añadir preguntas apenas cambia el precio ni la latencia. El directorio independiente Made with Jev recoge el caso de un desarrollador que lanzó 61 preguntas sobre un mismo borrador en torno a un segundo, por 0,0004 dólares.
La consecuencia práctica va contra la intuición: en lugar de ahorrar preguntas, lo eficiente es hacerlas todas de golpe, incluso las que solo servirán según lo que respondan las demás. Hacer una llamada por pregunta es, según coinciden la documentación y quienes lo han probado, el error más caro que se puede cometer con este modelo. Y los agentes de programación tienden justo a eso, así que conviene revisar el código que proponen.
Los límites de cada petición son 64.000 tokens en total y 32.000 para el estado más la pregunta más larga. Solo acepta texto: ni imágenes, ni audio, ni vídeo, que habría que convertir antes en texto o en campos estructurados.
Lo que Jev hace mal, según TypeSafe
La empresa publica una página de limitaciones del modelo, y es de lo más útil de su documentación. Jev no cuenta con fiabilidad (ni caracteres, ni apariciones de una palabra, ni elementos de una lista), lee las fechas como texto y no como cantidades que se puedan ordenar, y empeora cuando la pregunta exige encadenar varios razonamientos o contiene dobles negaciones. La solución en todos los casos es la misma: que el modelo extraiga las piezas y que el código haga las cuentas.
Tampoco sustituye a una regla determinista. Si una condición tiene que cumplirse siempre, eso es una sentencia if, no una llamada a un modelo probabilístico. Y si ya existe una señal fiable (un campo de la base de datos, una expresión regular que funciona), añadir Jev encima tiende a empeorar el resultado.
Sobre el español, la documentación es clara: el inglés es el idioma donde la precisión es mejor y el resto se admite con menor calidad. La recomendación más extendida entre quienes lo usan con contenido en castellano es escribir las instrucciones y los criterios en inglés, aunque el texto a juzgar vaya en español (como en el ejemplo de arriba), exigir más confianza antes de automatizar y etiquetar a mano unas decenas de casos reales para comprobar si los umbrales se sostienen.
Cifras de la propia empresa
TypeSafe afirma en su web que Jev es hasta 193,6 veces más rápido y 444,6 veces más barato que los modelos de referencia en sus evaluaciones de flujos de trabajo. La propia compañía matiza en el anuncio que esas cifras están en el extremo alto de lo que cabe esperar en producción, que las pruebas las diseñó su propio equipo, que la referencia es la media de GPT-6 Astra y Fable 5.1 y que las mediciones de velocidad se hicieron desde la costa oeste de Estados Unidos, donde está su servicio. Tampoco puede demostrar todavía que el precio actual sea sostenible y no esté subvencionado. Son datos que conviene leer como lo que son: resultados publicados por el fabricante, no verificaciones externas.
Para integrarlo desde un agente de programación, TypeSafe distribuye una skill que enseña a Claude Code, Codex y otros agentes a escribir código que llama a Jev (npx skills add typesafe-ai/skills), y la comunidad ha publicado servidores MCP para que el agente lo consulte como herramienta mientras trabaja.
Preguntas frecuentes
¿Jev sustituye a ChatGPT o a Claude? No. No genera texto, no escribe código y no conversa. Está pensado para trabajar junto a ellos: filtrar, clasificar o decidir en milisegundos lo que no merece una llamada a un modelo grande.
¿Hace falta instalar algo para probarlo? No. Basta con una clave y una petición HTTP; los SDK de JavaScript y Python son opcionales.
¿Cuánto cuesta una prueba? Muy poco. Con 0,042 dólares por millón de tokens de entrada y la salida gratuita, una tarde de pruebas con textos normales se queda en céntimos, según las tarifas publicadas por TypeSafe.
¿Funciona en español? Sí, pero con menos precisión que en inglés, según reconoce la propia empresa. Conviene escribir las preguntas en inglés y validar los resultados con casos propios antes de automatizar nada.
Fuente: TypeSafe AI — Introducing System One Models & Jev, TypeSafe Docs — Models y Made with Jev — How to use Jev









