Jev de TypeSafe: el modelo que no escribe, decide (y lo probamos)

El 15 de septiembre TypeSafe AI lanzó Jev, el primero de una categoría que llaman System One Models. Detrás está Diogo Almeida, investigador que ayudó a construir ChatGPT. Tres días después, Vercel dijo que Jev era el modelo de adopción más rápida en la historia de su AI Gateway: casi el 13% de sus equipos de pago lo usaron en las primeras 24 horas.
En Agentik lo probamos con casos reales. Te cuento qué es, en qué sirve y en qué no.
Qué es Jev
Un LLM genera texto. Jev no genera texto: toma una decisión. Le das un estado (un correo, una fila de una hoja de cálculo, un ticket) y preguntas con respuestas definidas de antemano, y te devuelve valores tipados con probabilidades calibradas:
- Choice: elige entre opciones que tú defines (hasta 255).
- Score: califica contra una escala ordenada.
- Noul: sí o no, con una probabilidad entre 0 y 1.
Los números
- Precio: unos $0.04 USD por millón de tokens de entrada, y la salida es gratis.
- Velocidad: entre 70 y 500 milisegundos por respuesta.
- Lanzamiento: junto con una ronda semilla de 40 millones de dólares liderada por DCVC.
- TypeSafe habla de hasta 193 veces más rápido y 444 veces más barato que un LLM en tareas de decisión. Son benchmarks del propio fabricante con flujos internos, y ellos mismos reconocen que probablemente están en la parte alta. Tómalos con calma.
Lo que medimos nosotros
Lo conectamos a casos de clientes. Algunos resultados:
- Clasificar partidas presupuestales con la fila completa: 44 de 44 correctas. Con solo el nombre del proveedor: 34 de 44.
- Latencia: unos 410 milisegundos eligiendo entre 141 opciones.
- Costo: alrededor de $0.00012 USD por decisión.
- Si tus categorías se enciman, la confianza se desploma. Con opciones mutuamente excluyentes la confianza es alta y útil. Con categorías difusas, se queda en la mitad y no sirve para nada. Nunca agregues una opción tipo "dudoso".
- Clasifica el contexto, no la entidad. Un mismo proveedor puede caer en categorías distintas; la fila completa es lo que desambigua. Con poco contexto, ni la compuerta de confianza te rescata.
- Mide el costo por tarea bien hecha, no por decisión. Una decisión de una centésima de centavo puede mandar un monto de siete cifras a la partida equivocada con confianza de 1.00. Por eso la regla de escalamiento a una persona es parte del diseño, no un extra.
Dónde encaja
Jev no reemplaza a un LLM; lo complementa. En un agente bien diseñado, el LLM conversa y razona, y un modelo como Jev toma las decisiones rápidas y repetitivas: enrutar, clasificar, calificar, decidir si escalar. Y como devuelve una probabilidad real, sirve como compuerta: si la confianza no pasa el umbral, el caso va a una persona.
Ojo, que la competencia ya llegó: en su DevDay del 29 de septiembre, OpenAI presentó una Decisions API en vista previa con la misma idea. Es una categoría que va a crecer.
¿Tienes un flujo lleno de decisiones repetitivas (clasificar, enrutar, aprobar)? Agenda un diagnóstico y vemos si un modelo de decisión te ahorra tiempo y dinero.
Fuentes: TechCrunch · Startup Fortune: adopción en Vercel · Wikipedia: Jev) · DigitalOcean: qué es Jev