# Jev, el modelo que no escribe

- Sitio: Ikusmira — enciclopedia en castellano de ciencias sociales y humanidades
- URL canónica: https://ikusmira.org/p/jev-el-modelo-que-no-escribe/
- Categoría: Informática
- Publicado: 2026-09-22
- Autoría: Josemari Sarasola Ledesma — Editor coordinador; Profesor titular de escuela universitaria, Universidad del País Vasco/Euskal Herriko Unibertsitatea
- Perfiles del autor: https://ekoizpen-zientifikoa.ehu.eus/investigadores/127490/detalle, https://dialnet.unirioja.es/servlet/autor?codigo=333202
- Política editorial (autoría, revisión, correcciones, financiación): https://ikusmira.org/politica-editorial/

**Jev** es un modelo de inteligencia artificial (en inglés, *artificial intelligence model*) que entiende el lenguaje humano pero no lo escribe. Se le da un texto, un correo de un cliente, un contrato o la descripción de una partida, y una serie de preguntas cerradas (*closed-ended questions*) sobre él, y devuelve para cada una la respuesta elegida entre las que se le ofrecieron, con la probabilidad de cada alternativa. No redacta, no explica y no conversa. Lo presentó el 15 de septiembre de 2026 TypeSafe AI, una empresa de San Francisco fundada en 2024 por Diogo Almeida, Erik Gafni y Sasha Sheng, junto con una ronda de cuarenta millones de dólares encabezada por el fondo DCVC. Almeida trabajó cuatro años en OpenAI y firma el artículo de 2022 sobre InstructGPT, el método de entrenamiento con valoraciones humanas que convirtió a los modelos de lenguaje en asistentes de conversación. Jev es, en cierto modo, su enmienda.

TypeSafe llama a Jev un modelo *System One*, por la distinción que popularizó el psicólogo Daniel Kahneman en *Pensar rápido, pensar despacio*: el sistema 1 es el juicio rápido e intuitivo, el que decide sin pensarlo si una cara está enfadada, y el sistema 2, el razonamiento lento y deliberado. Los grandes modelos de lenguaje han ido hacia el segundo, con cadenas de razonamiento que pueden tardar minutos. Jev va hacia el primero. El nombre, en cambio, es de economista: viene de William Stanley Jevons, el de la [paradoja de Jevons](https://ikusmira.org/p/paradoja-de-jevons-efecto-rebote/), que observó en 1865 que las máquinas de vapor más eficientes no redujeron el consumo de carbón sino que lo multiplicaron. La apuesta de la empresa es que con la inteligencia artificial barata ocurrirá lo mismo.

La manera de usarlo se parece más a rellenar un formulario que a escribir una instrucción. El programa envía un *estado*, el texto o los datos sobre los que se pregunta, y una o varias preguntas de tres tipos. Una *Choice* elige una opción de una lista, hasta 255: ¿qué equipo debe atender este ticket, facturación, técnico o cuenta? Un *Score* sitúa el estado en una escala de niveles descritos: ¿cuán enfadado está el cliente, de 0 a 2? Y un *Noul*, el nombre que TypeSafe da a la pregunta de sí o no, devuelve la probabilidad de que la respuesta sea sí: ¿pide este mensaje una devolución? Cada pregunta se evalúa por separado y todas a la vez, y la documentación recomienda descomponer: en lugar de preguntar si hay que devolver el dinero, preguntar si el cliente lo pide, si el cargo está duplicado y si la política lo permite, y combinar las tres respuestas con lógica escrita en el programa.

De ahí sale su velocidad. Un modelo de lenguaje genera texto palabra a palabra, o más exactamente fragmento a fragmento, y cada fragmento exige recorrer la red entera otra vez, como hace a escala mínima el [modelo de n-gramas](https://ikusmira.org/p/el-modelo-de-lenguaje-de-n-gramas/) que predice la palabra siguiente. Incluso cuando solo tiene que devolver `{"equipo": "facturación"}`, escribe la llave, las comillas, el nombre del campo y el valor, una pasada tras otra. Jev no genera nada: responde todas las preguntas en una sola consulta. TypeSafe mide tiempos de respuesta de entre 70 y 500 milisegundos, frente a los varios segundos habituales, cobra 0,042 dólares por millón de *tokens* de entrada, los fragmentos en que se trocea el texto, y no cobra la salida, que son unos pocos números. La empresa asegura que es de 40 a 200 veces más rápido y de 40 a 400 veces más barato que los modelos punteros en tareas comparables, con la precisión de estos. Esas cifras salen de flujos de trabajo que diseñó la propia empresa.

La otra mitad de la propuesta está en los números que acompañan a cada respuesta, y es lo que dibuja la figura de esta página. A la izquierda hay una pregunta Choice con tres opciones y sus probabilidades, que se pueden mover. De la forma de esa distribución sale la *confianza*: vale 1 si toda la probabilidad cae en una opción y 0 si se reparte por igual, y la figura la calcula con la aproximación que publica la propia documentación. Un programa puede actuar cuando la confianza supera un umbral y pasar el caso a una persona, o a un modelo más caro, cuando no. Ese mecanismo solo funciona si las probabilidades dicen la verdad, y a eso se llama estar *calibrado*: de todas las respuestas a las que el modelo da un 80 %, deben acertar más o menos ocho de cada diez.



El diagrama de la derecha muestra por qué eso importa. Un modelo calibrado sigue la diagonal, y con un umbral alto se automatizan menos casos pero se aciertan más, en la proporción que el modelo anunciaba. Un modelo sobreconfiado dice 95 % cuando acierta 80, y el umbral deja pasar errores que parecían seguros. Es un defecto documentado de los asistentes actuales: el informe técnico de GPT-4, de 2023, mostraba que el modelo antes de ajustarlo con valoraciones humanas estaba muy bien calibrado, y que después lo estaba bastante menos. TypeSafe sostiene que el problema está en el objetivo, porque entrenar para dar respuestas que gustan a las personas premia la seguridad en el tono, y entrena Jev con otro método al que llama RLCD, *aprendizaje por refuerzo para decisiones calibradas*, en el que las probabilidades se ajustan contra resultados. Según la empresa, el modelo es un transformador, como los de lenguaje, y se entrenó solo con datos sintéticos. Qué datos y con qué arquitectura exacta no lo ha publicado.

La documentación es franca sobre sus límites, que llama las *aristas* del modelo. Jev lee de forma literal, responde a la pregunta escrita y no a la que se quiso hacer. No cuenta bien, ni letras ni elementos de una lista. No compara fechas ni hace cuentas, y la recomendación es sacar todo eso al programa: que el modelo extraiga el mes y el día, y que el código decida cuál es anterior. Tampoco razona en varios pasos, porque no tiene dónde: pensar despacio exigiría generar, que es justo lo que ha dejado de hacer.

Las críticas se han centrado en dos promesas. La primera es que Jev *no puede alucinar*. Es cierto en un sentido estrecho, porque no puede inventar un campo que no existe ni devolver algo que no encaje en el formato; pero, como han señalado Anthony Maio y Sean Goedecke, nada le impide elegir la opción equivocada con una probabilidad alta, y eso, para quien recibe la respuesta, es un error como cualquier otro. La calibración (*calibration*), además, describe grupos de respuestas y no garantiza ninguna en particular, algo que la propia TypeSafe advierte. La segunda es la novedad: Goedecke recuerda que un modelo de lenguaje ya puede responder a una pregunta cerrada generando un único fragmento restringido a las opciones dadas, lo que se lleva buena parte de la ventaja de velocidad. Y Maio observa que en una de las comparativas publicadas las respuestas de referencia se obtuvieron promediando las de otros dos modelos, no de datos reales, lo que emparenta la evaluación con el problema del [juez automático](https://ikusmira.org/p/el-juez-automatico/).

Lo que nadie discute es el hueco que ocupa. Vercel contó que el 13 % de los clientes de pago de su pasarela de modelos lo había probado en las primeras veinticuatro horas, el doble que con cualquier lanzamiento anterior, y los usos que se repiten son los que un programa hace miles de veces por minuto: clasificar tickets, filtrar mensajes, puntuar pasajes antes de pasárselos a otro modelo, decidir a quién le toca. El reparto que propone TypeSafe tiene sentido con o sin sus cifras: el modelo de lenguaje para lo abierto, que es escribir, razonar y explicar, y un modelo pequeño y rápido para las decisiones cerradas, con un programa en medio que sabe cuándo fiarse de cada uno. La paradoja de Jevons dice lo que pasará si funciona: nadie ahorrará en decisiones automáticas, se tomarán muchas más.

## Fuentes

- TypeSafe AI — *Introducing System One Models & Jev*, TypeSafe AI Blog (2026) — https://typesafe.ai/blog/introducing-system-one-models-and-jev
- TypeSafe AI — *AI primer; Jev 1.13 jaggedness; Models*, Documentación de TypeSafe (2026) — https://docs.typesafe.ai/introduction/machine-learning-primer
- Tim Fernholz — *A new kind of AI model from a ChatGPT inventor is thrilling developers*, TechCrunch (2026) — https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/
- Sean Goedecke — *Jev means structured output is interesting again*, seangoedecke.com (2026) — https://www.seangoedecke.com/jev-means-structured-output-is-interesting-again/
- Anthony Maio — *Jev: The Language Model That Won't Talk*, Substack (2026) — https://anthonymaio.substack.com/p/jev-the-language-model-that-wont
- Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida et al. — *Training Language Models to Follow Instructions with Human Feedback*, arXiv 2203.02155 (2022) — https://arxiv.org/abs/2203.02155
- OpenAI — *GPT-4 Technical Report*, arXiv 2303.08774 (2023) — https://arxiv.org/abs/2303.08774
- Daniel Kahneman — *Thinking, Fast and Slow*, Farrar, Straus and Giroux (2011)

---

Cómo citar: Sarasola, Josemari (2026). «Jev, el modelo que no escribe». Ikusmira. https://ikusmira.org/p/jev-el-modelo-que-no-escribe/
Índice del sitio para modelos: https://ikusmira.org/llms.txt
