Actualidad

Inteligencia Artificial

Jev frente a GPT y Haiku, el software que decide sin escribir

Jev, el modelo System One de TypeSafe, decide en milisegundos por 0,042$ el millón sin escribir texto. Comparativa de precio y velocidad frente a GPT y Haiku.

Jev frente a GPT y Haiku, el software que decide sin escribir
Jev frente a GPT y Haiku, el software que decide sin escribir

TypeSafe AI, una startup salida de dos años de sigilo, presentó el 15 de septiembre su primer System One llamado, Jev, un modelo que no genera texto, sino decisiones estructuradas con probabilidad calibrada, según el anuncio oficial de la compañía. Su vídeo de demostración superó los 30 millones de visualizaciones en días y los desarrolladores empezaron a sustituir modelos frontera en sus tuberías de clasificación.

El éxito de esta idea se puede ver claramente en dos cifras. Jev responde entre 70 y 500 milisegundos y cuesta 0,042 dólares por millón de tokens de entrada, con la salida gratis por resultar demasiado barata para medir, siempre según cifras del propio fabricante. Frente a los 0,20 a 10 dólares por millón que cobran los grandes modelos de lenguaje, más una salida que suele costar cinco veces más, la promesa es una velocidad de vértigo a precio de saldo.

La clave está en que Jev renuncia a la palabra para quedarse con el juicio. Recibe una situación descrita en texto o JSON y unas preguntas con respuestas permitidas, y devuelve etiquetas, puntuaciones o síes y noes con su confianza asociada. No redacta ni razona en voz alta, porque no puede cometer un error de tipo en su salida.

Un modelo que no escribe

La idea bebe de la psicología de Kahneman y su pensamiento rápido y lento. Los System One (como el caso de Jev) deciden por intuición entrenada, mientras los System Two (como Gemini, Claude o GPT Astra) deliberan paso a paso como un modelo de razonamiento actual. TypeSafe traslada esa distinción a la arquitectura del software, con un modelo para decidir y otro distinto para redactar cuando haga falta prosa.

El contrato con el programador rompe con todo lo conocido. En lugar de mensajes se envía un estado con preguntas tipadas y cada respuesta trae la opción elegida con su probabilidad. Esas formas cubren el trabajo automatizable típico, desde clasificar tickets hasta puntuar riesgos.

Los límites del formato son tan explícitos como sus virtudes. Cada petición admite 64.000 tokens de contexto y el estado más la pregunta larga no pueden pasar de 32.000. Solo acepta texto en forma de cadena, objeto JSON o lista, sin imagen ni audio ni vídeo, y el modelo no se adapta con datos del cliente ni entrena con las peticiones recibidas.

Después de todo, lo rompedor no es la precisión, sino la garantía mecánica. Un modelo de lenguaje con salida JSON constreñida puede saltarse el esquema bajo presión y hay que validarlo todo. Jev devuelve tipos nativos por construcción, así que la capa de verificación posterior se reduce a comprobar el negocio y no el formato.

Jev frente a los grandes en cifras

La comparativa honesta exige poner todas las cartas sobre la mesa. Los precios de los modelos frontera varían por proveedor y fecha, y las cifras de Jev proceden del propio vendedor sin auditoría independiente, según reconoce la propia TypeSafe. Con esa cautela, la tabla resume el orden de magnitud de cada alternativa a septiembre de 2026.

Modelo Latencia típica Precio entrada Precio salida Su terreno
Jev 1.13 70 a 500 ms 0,042 $/M Gratis Clasificar, enrutar, puntuar
GPT-5 Nano Segundos 0,05 $/M De pago Tareas ligeras con texto
GPT-5.6 Luna 3 a 30 s 0,20 $/M ref. 5x aprox. Chat y código general
Haiku 4.5 2 s en demo Gama media De pago Agentes rápidos con texto

El matiz que casi todos los resúmenes omiten está en la letra pequeña de los precios. El GPT-5.6 rebajado en APIMaster cotiza a 0,0178 dólares por millón de entrada, menos de la mitad que Jev, aunque cobra la salida a 0,1067. Como Jev no genera tokens de salida, la comparación justa depende de cuánta prosa necesite tu tarea y no solo del precio de entrada.

Enjambres de OpenAI hackeando bases de datos en marzo

El precio al microscopio

La matemática del fabricante resulta elocuente a escala. Mil tokens cuestan unos 0,00004 dólares, así que clasificar los treinta turnos de una llamada larga sale por una décima de céntimo. La propia compañía ilustra la escala con un robot que ejecuta diez consultas por segundo por unos 7 dólares la hora, cifra que obliga a multiplicar por tu tráfico real antes de firmar nada.

Conviene matizar que el precio puede estar subvencionado en esta fase de acceso anticipado. TypeSafe lo admite con una franqueza inhabitual y avisa de que necesitará el largo plazo para demostrar la sostenibilidad de la tarifa. Los 444,6 veces más barato de su página proceden de cuatro flujos de trabajo escritos por su propio equipo, que la empresa sitúa en el extremo optimista de las ganancias reales.

El coste por llamada esconde además el peaje de la arquitectura partida. Jev decide, pero no redacta, así que cualquier tarea que necesite texto exige pagar también un modelo generativo. La factura total de un flujo híbrido suma ambas piezas y el ahorro se concentra en los pasos de decisión puros, que son muchos pero no todos.

Mi lectura es que el ahorro existe y es sustancial en el nicho adecuado. Miles de microdecisiones diarias de enrutado o moderación queman presupuesto en modelos grandes que cobran cara cada palabra generada. Trasladar esos pasos a un decisor barato recorta la factura sin tocar la calidad del texto final.

La velocidad importa

El tiempo de respuesta sigue la misma lógica de orden de magnitud. TypeSafe anuncia de 70 a 500 milisegundos por llamada frente a horquillas de 3 a 329 segundos en modelos frontera para tareas equivalentes. En la demostración del robot, Jev marcó una mediana de 233 milisegundos contra 1.971 de Haiku 4.5 haciendo el mismo trabajo de decisión.

La diferencia se nota en el producto y no solo en el panel de métricas. Un clasificador que responde en décimas de segundo permite validar cada turno de una conversación en tiempo real. El mismo paso con un modelo grande introduce pausas perceptibles o exige paralelizar con más infraestructura y complejidad operativa.

Aun así, las ganancias se estrechan fuera de su terreno ideal. En tareas con razonamiento encadenado pesado, donde hay que deliberar antes de decidir, el modelo rápido no sustituye al deliberativo. Si tu clasificador actual ya está bien ajustado y resuelve con pocas llamadas, la mejora puede resultar modesta frente al coste de migrar.

La infraestructura acompaña con límites generosos para producción seria. La documentación declara 250.000 tokens por segundo y 1.200 peticiones por minuto con carácter dinámico. Son cifras de autopista pensadas para tráficos de clasificación masiva y no para experimentos de laboratorio.

Lo que Jev no puede hacer

El catálogo de ausencias decide tantos proyectos como el de virtudes. Jev no extrae campos libres ni redacta resúmenes, no ejecuta razonamiento de varios pasos y no procesa imágenes. Cualquiera de esas necesidades devuelve el proyecto a un modelo de lenguaje clásico o a una combinación de ambos mundos.

El acceso también impone sus condiciones en esta fase temprana. El modelo vive tras una lista de espera como API alojada, sin pesos abiertos ni despliegue propio en el centro de datos del cliente. Las organizaciones con requisitos estrictos de residencia del dato deberán esperar a una oferta instalable que hoy no existe.

El método de entrenamiento introduce su propia incógnita. TypeSafe describe una arquitectura nueva con un muestreador paralelo y un algoritmo llamado aprendizaje por refuerzo para decisiones calibradas. Ningún laboratorio independiente ha reproducido todavía los resultados y la arquitectura permanece cerrada al escrutinio externo.

Nvidia blinda a los agentes de IA con Openshell y Sentry

Verificación pendiente

El escepticismo aquí es claro. Cada cifra relevante del lanzamiento procede de mediciones del vendedor, tomadas desde portátiles junto a su infraestructura en la costa oeste estadounidense. La propia empresa publica sus cautelas y pide que se lean, un gesto raro que conviene agradecer sin concederle valor probatorio.

Los observadores independientes confirman el interés y piden las pruebas. Simon Willison publicó su análisis el 21 de septiembre y al día siguiente liberó un complemento para usar Jev desde su herramienta de línea de comandos. DigitalOcean lo incorporó a su catálogo de modelos el 24 de septiembre con las cifras del fabricante y la advertencia de que los preceptivos ensayos de terceros aún están por llegar.

La comparación con los modelos frontera y los agentes que el sector espera exige prudencia adicional. Los modelos frontera compiten generando texto y razonando, un terreno donde Jev ni siquiera juega. Medirlos por la misma vara sería como comparar una báscula con una cinta métrica porque ambas dan números.

El historial del sector aconseja esperar seis meses antes de dictar sentencia. Los precios de lanzamiento rara vez sobreviven al contacto con la escala y las latencias de laboratorio se degradan con colas reales. Lo sólido de momento es el concepto y la garantía de tipos, no la tabla de récords.

Cuándo te conviene cada uno

El marco de decisión para tu equipo cabe en tres preguntas. Cuántas microdecisiones pagas al día a un modelo grande, cuánta latencia tolera tu producto y cuánta prosa necesita cada paso. Mucho volumen con poca prosa señala a Jev, mientras el texto abierto y el razonamiento piden un modelo clásico.

La arquitectura ganadora para la mayoría será híbrida y sin dogmas. Un decisor barato que enruta y filtra, más un generador que redacta solo cuando hace falta, combina lo mejor de ambos precios. Esa tubería ya existe en APIMaster con el identificador jev-latest junto a modelos de texto convencionales.

Habrá que esperar a los ensayos independientes y a la estabilidad del precio para cerrar el debate. Y quedará la pregunta que responderá 2027, si los decisores se convierten en una categoría propia o en una función más de los grandes modelos. De momento, decidir sin escribir ya tiene precio oficial y son cuatro céntimos por millón.

Spec driven development y por qué cambia el software

José Maldonado

Autor

José Maldonado

Activista y bloguero de tecnología, software libre y blockchain.

Lo último
Bitcoin pierde los 83.000 y los mercados miran al petróleo

Una lectura semanal imprescindible sobre inteligencia artificial y blockchain.

Te explicamos cómo transforman la economía, qué nuevas puertas te abren y cómo te afectan.