El modelo de IA que no escribe ni una palabra. Y por qué eso, para nosotros, puede ser una ventaja.
Cuando lo único que necesitas es una decisión que tu software consuma (clasificar, rutear, puntuar), un LLM te cobra dos impuestos que no querías: es lento y alucina.
Para chatear son insuperables. Para decidir, son un cañón para matar una mosca.
TypeSafe AI, San Francisco, fundada en 2024 por Diogo Almeida, Erik Gafni y Sasha Sheng. Almeida pasó unos 4 años en OpenAI trabajando en RLHF, InstructGPT, ChatGPT y GPT-4.
Su tesis: la IA ya chatea a nivel superhumano, pero la automatización real seguía sin resolverse. Tras unos 2 años en stealth, lanzan Jev.
Almeida deja OpenAI y funda la empresa. Empieza el desarrollo en stealth.
Early access limitado más una seed de US$40M liderada por DCVC. Valuación cercana a US$200M.
Primero de su clase. El nombre viene del System 1 de Kahneman: rápido e intuitivo.
Kahneman separó dos modos de la mente. El System 1 es el juicio veloz que haces sin razonar paso a paso: ¿spam o no?, ¿urgente o no?
Jev automatiza ese reflejo. No delibera, no explica: decide.
Entrenado con un método propio, RLCD (Reinforcement Learning for Calibrated Decisions), optimizado para probabilidades honestas y solo con datos sintéticos.
Un LLM es autoregresivo: escribe una palabra, se relee entero, escribe la siguiente, cientos de veces. Jev hace parallel sampling y resuelve todo de una.
Elige una opción de un set declarado (hasta 255). Devuelve la elegida, la probabilidad por opción y la confianza.
Puntúa contra una escala ordenada con niveles descritos. Devuelve score continuo, distribución y confianza.
Evalúa una proposición binaria y devuelve la probabilidad (0 a 1) de que sea verdadera. La probabilidad es la señal.
La lógica de negocio vive en tu código, no escondida en un prompt. Descomponible, inspeccionable, mantenible.
Ese es el punto de RLCD: no lo entrenaron para agradar, lo entrenaron para que su probabilidad signifique algo.
Los LLMs suelen ser sobre-confiados: dicen 0.95 y aciertan 0.7. Con Jev, la confianza es un umbral sobre el que puedes construir reglas.
| Dimensión | Jev | LLM frontier |
|---|---|---|
| Output | Valor tipado más probabilidad calibrada | String que hay que parsear y validar |
| Sampling | Paralelo, una pasada | Token por token (autoregresivo) |
| Latencia | 70 a 500 ms | 3 a 329 s |
| Costo | $0.042 / MTok, output gratis | $0.20 a $10 / MTok, output 5× más caro |
| Confianza | Siempre calibrada | A menudo sobre-confiada e inconsistente |
| Contexto | Unos 64.000 tokens | Cientos de miles |
Claim de TypeSafe: 40 a 200× más rápido y 40 a 400× más barato en tareas “System One”, con inteligencia comparable.
Benchmark interno de TypeSafe: 193.6× más rápido, 444.6× más barato. A 100 ms puedes meter IA dentro de un loop en tiempo real (una UI, un feed, un juego) sin que el usuario espere.
por millón de tokens de input. El output es gratis: es diminuto, una decisión y no un párrafo.
El contador arranca en $10, el techo de un LLM frontier.
100.000 requests × 1.000 tokens dan $4.20 en total.
384 titulares en 25 s por $0.19, unas 390× más barato que Claude Opus en la misma tarea.
La respuesta no puede salir del schema que declaras. Cero errores de tipo, cero campos inventados. A nivel de formato, es cierto.
Type-safe garantiza un formato válido, no una respuesta correcta.
Un “billing” equivocado de tu lista permitida sigue siendo un error. Solo que ahora es un error bien tipado.
La confianza calibrada es tu red: úsala como umbral para escalar a un humano o a un LLM.
El bot de trading que no rindió en su primera hora lo resume: velocidad no es acierto.
No compiten. Jev es el nervio reflejo, el LLM es la corteza que delibera.
@nedwizepor página, 34× más barato
@johnyeo_más rápido su agente de Slack
@steventeypara un problema de años
@TheMattBermandecisiones por 22 centavos
@fazlerockspor artículo, 16 anuncios fuera
Brillante para clasificar, rutear y puntuar a escala. Inútil para escribir o razonar. Un modelo nuevo, no un LLM mejor.
Preguntas, y después revisamos los casos de uso en vivo.