Jev, el modelo de IA que no sabe escribir: solo decide, en una décima de segundo

Rubén Castro, actualizado a 24 septiembre 2026
que es jev typesafe modelo ia decisiones

Llevamos dos años viendo el mismo anuncio: un modelo más grande, que razona mejor, que aguanta más contexto y que conversa mejor. Jev va en dirección contraria y presume de lo que no hace. No escribe correos. No explica sus respuestas. No tiene ventana de chat. Lo único que hace es decidir, en torno a una décima de segundo y por una fracción de céntimo.

Lo ha sacado TypeSafe AI, una empresa de San Francisco fundada por Diogo Almeida, que trabajó en OpenAI en la investigación que convirtió un modelo de lenguaje en ChatGPT. Salió del anonimato el 15 de septiembre de 2026 con 40 millones de dólares de financiación —unos 35 millones de euros—, y su tesis es incómoda: el chat nunca fue la herramienta adecuada para automatizar nada.

El ejemplo que mejor lo explica es una factura. Una aplicación quiere saber si es fraudulenta. Un modelo de lenguaje tarda ocho segundos en escribir una frase diciendo que parece legítima; después hay que leer esa frase con código, validarla y reintentar cuando el modelo se sale del guion. Jev contesta en una décima de segundo con tres números: 7 % fraude, 88 % limpia, 5 % a revisar.

Qué hace distinto Jev frente a un modelo de lenguaje normal

Un LLM normalJev
Qué devuelveTexto, palabra a palabraUna respuesta tipada y su probabilidad
Cómo lo usa tu programaHay que interpretar el texto y reintentar si se sale del guionSe lee directamente; no hay nada que interpretar
Cuánto tardaDe 3 segundos a varios minutosEntre 70 y 500 milisegundos
Qué se pagaLa entrada y, más cara, la salidaSolo la entrada: la salida es gratis porque no hay texto
Puede inventarse la respuestaNo puede salirse de la lista que le des, pero sí puede elegir mal
Sabe cuándo dudaNo, salvo que se lo preguntes y te conteste escribiendoSí: cada respuesta trae su probabilidad y su confianza
Sirve paraEscribir, razonar, programar, conversarClasificar, puntuar, filtrar y decidir

Cómo funciona: un estado y unas preguntas

Jev no recibe un prompt. Recibe dos cosas:

  1. Un estado, que es el material sobre el que hay que decidir: un ticket de soporte, el historial de una cuenta, un documento, la situación de una partida. Puede ser texto suelto, un objeto JSON o una lista.
  2. Un conjunto de preguntas que tú defines de antemano, cada una con sus respuestas posibles.

El modelo lee el estado una sola vez y evalúa todas las preguntas a la vez, en paralelo, en lugar de ir escribiendo una respuesta palabra a palabra. De ahí sale la velocidad.

Los tres tipos de pregunta

TypeSafe los llama primitivas, y no hay más que estos tres:

Las tres preguntas que se le pueden hacer a Jev

TipoQué preguntaQué devuelveLímite
Noul¿Esto es verdad? Sí o noUn número de 0 a 1 con la probabilidad de que sea que síNo trae valor de confianza
Choice¿Cuál de estas opciones?La opción elegida, la probabilidad de cada una y la confianzaHasta 255 opciones
Score¿Cuánto, en esta escala?Una puntuación que puede caer entre dos niveles, con sus probabilidadesDe 2 a 10 niveles

El nombre raro es Noul, que es como la empresa llama a una pregunta de sí o no. La diferencia con un sí o un no de toda la vida es que no devuelve «sí»: devuelve 0,95, es decir, la probabilidad de que la respuesta sea que sí.

Qué cuesta y qué límites tiene

  • Precio: unos 0,037 euros por millón de tokens de entrada (0,042 dólares). La salida es gratis, porque no hay texto que cobrar.
  • Latencia declarada: de 70 a 500 milisegundos.
  • Contexto: 64.000 tokens por petición en total, de los cuales 32.000 como máximo para el estado más la pregunta más larga.
  • Solo texto. Ni imágenes, ni audio, ni vídeo. Lo que no sea texto hay que convertirlo antes.
  • Límites de uso: 250.000 tokens por segundo y 1.200 peticiones por minuto.

La versión actual es jev-1.13, y la empresa no ha publicado ni un artículo técnico ni el número de parámetros del modelo.

La confianza: el dato que de verdad cambia las cosas

Aquí está lo interesante, y no es la velocidad.

Cada respuesta de tipo Choice y Score trae, además de la probabilidad de cada opción, un número de confianza entre 0 y 1. No es un dato aparte: se calcula a partir de la forma que tiene el reparto de probabilidades. Si casi toda la probabilidad se concentra en una opción, la confianza es alta; si está repartida entre varias, es baja.

Un ingeniero lo resumió con una frase que se ha quedado: Jev es «una sentencia if con IA».

La diferencia es esta. Un programa normal dice: si la transacción pasa de 10.000 euros, que la revise una persona. Es un umbral fijo, escrito a mano, que no sabe nada de la transacción. Con Jev la regla pasa a ser: si esto parece sospechoso con más de un 95 % de confianza, que lo revise una persona.

El umbral deja de ser una cifra arbitraria y pasa a ser el punto en el que el programa admite que no lo tiene claro. Y eso es justo lo que un modelo de chat no te da: puedes preguntarle si está seguro, pero te contestará escribiendo, y esa respuesta no es más fiable que la anterior.

Consistencia. El otro argumento de venta es que Jev responde siempre lo mismo ante la misma entrada. A un chatbot le haces dos veces la misma pregunta y puedes obtener dos respuestas distintas; para un formulario da igual, para un sistema que aprueba o deniega automáticamente, no.

Conviene entender también dónde queda la responsabilidad. Jev solo elige entre las opciones que alguien ha escrito. Quien redacta la lista de respuestas posibles y quien fija el umbral de confianza para actuar es quien está tomando la decisión de verdad; el modelo solo la ejecuta muy rápido y muy barato.

Las ventajas

Se acabó interpretar texto

Es la ventaja menos vistosa y la que más código ahorra. Hoy, meter IA dentro de una aplicación significa pedirle algo a un modelo, esperar a que lo escriba, leer ese texto con código, validarlo y reintentar cuando no viene en el formato esperado. Con una respuesta tipada, todo ese andamiaje desaparece.

No puede salirse del guion

Si le das tres niveles de riesgo —bajo, medio y alto—, no puede inventarse un «extremadamente alto». Esa es la parte cierta del eslogan de que «no alucina», y tiene un matiz importante que verás en el capítulo siguiente.

Preguntar muchas cosas de golpe sale casi gratis

Como el estado se lee una sola vez y todas las preguntas se evalúan contra él en paralelo, hacer veinte preguntas cuesta poco más que hacer una. En un ejemplo de la propia documentación, agrupar trece preguntas sobre un mismo documento en una única llamada salió 12,2 veces más barato y 10 veces más rápido que hacerlas por separado, con las mismas respuestas.

Eso permite algo que antes no compensaba: preguntar también cosas que a lo mejor no necesitas, por si acaso, y que decida tu código cuáles usar.

Vigilar a los modelos grandes

Es, probablemente, el uso más útil y el menos llamativo. A este precio se puede revisar cada una de las respuestas de un modelo caro antes de que llegue al usuario: comprobar si una cita está realmente respaldada por el documento que la acompaña, si un mensaje contiene datos personales o si la respuesta se ha ido de tema.

Esa vigilancia existía como idea desde siempre; lo que no existía era poder ejecutarla sobre el cien por cien del tráfico sin duplicar la factura.

Velocidad que habilita cosas nuevas

Quien haya visto a un agente de IA navegar por una web conoce la lentitud: cada clic es una llamada de varios segundos. Con décimas de segundo, el agente empieza a ser utilizable.

Las demostraciones de la empresa van por ahí: Jev jugando al Doom a diez decisiones por segundo, por unos seis euros la hora, leyendo una descripción en texto del estado de la partida y no los píxeles. En una partida de ajedrez rápido, le ganó a un modelo de chat que se quedó sin tiempo pensando mientras Jev iba muy por detrás en piezas. No es un resultado de ajedrez: es un resultado de latencia.

Los inconvenientes, contados por la propia empresa

TypeSafe publica una página titulada «jaggedness», los bordes dentados de jev-1.13, con nueve modos de fallo reconocidos. Es un gesto poco habitual y, de paso, el mejor resumen de lo que este modelo no sabe hacer.

Lee de forma literal

Contesta la pregunta que escribiste, no la que querías hacer. Las negaciones, los matices y las condiciones implícitas se leen al pie de la letra. La propia documentación lo dice con una frase que vale para cualquier sistema de este tipo: cuando veas una respuesta mal y te descubras explicando lo que de verdad querías decir, esa explicación es la mitad que le faltaba a la instrucción.

No sabe contar ni hacer cuentas

No es una calculadora y no cuenta de forma fiable: ni caracteres, ni apariciones de una palabra, ni elementos de una lista larga. Reconoce la forma de la respuesta en lugar de contar, y el error crece con el tamaño. Tampoco compara bien números en formatos técnicos: preguntar por colores en hexadecimal le sale peor que preguntar por «rojo» y «azul».

Las fechas son texto, no cantidades ordenadas

Cuál de dos fechas va antes, cuánto tiempo hay entre ellas o si una cae dentro de un periodo son preguntas poco fiables. Empeora con formatos mezclados y con conceptos como trimestres o periodos de liquidación.

Se deja llevar por el contenido

El estado que le pasas no se trata como hostil por defecto. Un texto escrito para manipular al modelo —una instrucción inyectada, un encuadre engañoso, un párrafo que argumenta a favor de su propia clasificación— puede mover la respuesta.

Y un detalle que rompe la intuición

Este es el que más conviene interiorizar. Se le preguntó a Jev por el mismo ticket, «¿el cliente pide un reembolso?» y su contraria, «¿el cliente pide algo que no es un reembolso?». Las dos probabilidades fueron 0,72 y 0,47: suman 1,19.

No es un error del modelo, es que no garantiza las identidades aritméticas que uno daría por hechas. La misma pregunta planteada como Noul o como Choice da números que no son comparables entre sí. La consecuencia práctica: un umbral ajustado para un tipo de pregunta no se puede trasladar a otro.

Las cifras que enseña son suyas

La empresa no se ha presentado a ninguna clasificación pública. Sus pruebas puntúan los modelos por coincidencia con la respuesta media de dos modelos de chat grandes, no contra una verdad comprobada. Con esa vara, Jev logra un 67,8 % de coincidencia frente al 74,1 % de un modelo de referencia. Está cerca en atención al cliente (76 % frente a 78,3 %) y se queda bastante atrás procesando facturas: 61,8 % frente a 79,1 %.

Las cifras de «193 veces más rápido» y «444 veces más barato» salen de esas mismas pruebas, y la propia TypeSafe admite que están en el extremo optimista de lo que se ve en la realidad.

Lo que le falta

Solo texto, sin imágenes ni audio. Sin artículo técnico ni número de parámetros publicados. Y está en acceso anticipado.

Para qué sirve, y para qué no

La regla es sencilla: sirve cuando la respuesta cabe en una lista que puedes escribir de antemano. Si hay que redactar algo, no es su sitio.

Donde encaja

  • Clasificar y enrutar. A qué equipo va un ticket, en qué categoría cae un producto, en qué idioma está un fragmento de código. Es el caso de libro.
  • Moderar y filtrar. Revisar todo lo que entra y sale de una aplicación con IA, y decidir por umbrales si pasa, se bloquea o lo mira una persona.
  • Verificar a otro modelo. Comprobar si una cita está respaldada por su fuente, o si una respuesta larga se sostiene sobre los documentos que dice usar.
  • Ordenar resultados de búsqueda. En una prueba de la documentación, reordenar candidatos legales con una pregunta por pareja subió el acierto en el primer resultado del 5 % al 18 %.
  • Extraer datos, pero en dos pasos. Las expresiones regulares encuentran los candidatos —correos, teléfonos, importes— y Jev elige cuál es el que se pedía. Él solo no extrae: elige.
  • Convertir lenguaje natural en llamadas a funciones, cuando los nombres y los argumentos son un conjunto cerrado.
  • Decidir dentro de un bucle rápido, como un agente que navega o un juego.

Donde no

  • Escribir cualquier cosa. No está entrenado para generar texto. Se puede forzar encadenando elecciones, pero sale mal y sale lento.
  • Cualquier cosa con números, fechas o cuentas. Eso va en código, siempre.
  • Razonar en varios pasos. Cada salto de indirección le cuesta precisión.
  • Decidir sobre un montón de material sin filtrar. La precisión baja según crece el estado con información que no hace falta. Primero se filtra, después se pregunta.

La forma sensata de usarlo no es sustituir a un modelo de chat, sino rodearlo. Un modelo lento y caro para lo difícil, y decisiones rápidas y baratas alrededor para todo lo demás: filtrar lo que entra, elegir a dónde va cada caso y comprobar lo que sale.

Por qué se llama Jev

El nombre es la tesis de la empresa. En 1865, el economista William Stanley Jevons observó que las máquinas de vapor más eficientes no redujeron el consumo de carbón: lo abarataron tanto que se empezó a usar en todas partes y el consumo se disparó.

TypeSafe apuesta a que pasará lo mismo aquí: que cada vez que el coste de una decisión de IA baje un orden de magnitud, aparecerán muchísimos más usos de los que se ahorran. Y el objetivo no son las personas, sino los miles de millones de decisiones pequeñas y aburridas que el software toma cada día y que hoy no justifican pagar una llamada a un modelo grande.

Hay un eco de algo que ya pasó. En 2017, la arquitectura Transformer ganó renunciando al procesamiento secuencial a cambio de paralelizar, y acabó dando lugar a los chatbots contra los que Jev se posiciona ahora. Jev renuncia justo a lo que hizo famosos a esos modelos —escribir— a cambio de velocidad.

Si Jev concreto triunfa o no importa menos que la idea. El futuro del software con IA puede que no sea un modelo gigante haciéndolo todo, sino uno lento y listo para lo difícil, rodeado de decisores rápidos y baratos para todo lo demás. Y esa forma de montar las cosas no depende de que la empresa que la propone sobreviva.

Si quieres seguir por aquí, en cómo saber cuál es el mejor modelo de IA en cada momento explicamos qué miden los rankings y por qué las cifras que publica una empresa sobre sí misma, como las de este artículo, hay que leerlas con pinzas.

Fuentes

  1. docs.typesafe.ai
  2. docs.typesafe.ai
  3. docs.typesafe.ai
  4. docs.typesafe.ai
  5. docs.typesafe.ai
  6. techspot.com
Rubén Castro

Rubén Castro

Redactor

Apasionado de explorar y diseccionar lo último en tecnología. Tengo mucha experiencia en el mundo de los ordenadores y el gaming, aunque también me gustan todos los tipos de gadgets.