Jev i els System One Models: quan la IA deixa d'escriure i comença a decidir

TypeSafe AI proposa amb Jev una idea diferent: models que no generen text, sinó decisions tipades, probabilístiques i pensades per integrar-se directament dins del software.

Durant els últims anys, bona part de la cursa de la intel·ligència artificial ha girat al voltant de la mateixa pregunta: quin model és capaç de generar millor text, raonar durant més temps o resoldre tasques cada vegada més complexes?

TypeSafe AI acaba de plantejar una pregunta bastant diferent: i si per automatitzar software no necessitéssim un model que escriu millor, sinó un model que decideix millor?

El 15 de setembre de 2026, TypeSafe va presentar Jev, el seu primer System One Model. La idea és curiosa perquè va justament en direcció contrària a la tendència habitual: Jev no està pensat per escriure textos, mantenir una conversa o generar codi. Està pensat per rebre un estat, prendre decisions estructurades i retornar-les de manera que el software les pugui consumir directament.

I, sincerament, és una aproximació que em sembla especialment interessant perquè toca un dels problemes que més apareixen quan deixem de jugar amb un LLM i intentem integrar-lo de veritat dins d'un sistema.

El problema no sempre és la intel·ligència

Un LLM és extremadament flexible. Li pots donar text, instruccions, dades, eines i context i demanar-li pràcticament qualsevol cosa. Aquesta flexibilitat és precisament el que el fa tan potent.

Però també és una font de complexitat.

Quan volem que un LLM formi part d'un workflow real, moltes vegades no necessitem una resposta brillant. Necessitem una decisió molt més simple: a quin departament va aquest ticket? Aquest correu és urgent? Aquest lead té intenció de compra? Aquesta operació necessita revisió humana? Aquesta resposta compleix la política?

Podem resoldre això amb un LLM, evidentment. Li definim un esquema JSON, li demanem structured output, validem la resposta, tornem a provar si falla i continuem el workflow.

Funciona. Però estem utilitzant una màquina generalista de generació de llenguatge per executar una cosa que, conceptualment, s'assembla molt més a un if intel·ligent.

Què fa diferent Jev?

TypeSafe defineix Jev com una mena de function call amb intel·ligència de frontera: entra estat no estructurat i surten decisions probabilístiques i tipades.

En lloc de generar una cadena de tokens, Jev treballa sobre un conjunt de respostes possibles definides prèviament. Segons la documentació del projecte, això permet retornar valors estructurats sense errors de tipus i acompanyar cada decisió amb probabilitats i nivells de confiança.

La seva API gira al voltant de primitives bastant simples: escollir entre opcions, puntuar en una escala o respondre una decisió binària. No sembla especialment espectacular fins que penses en quantes automatitzacions reals consisteixen exactament en això.

Classificar. Enrutar. Puntuar. Detectar. Decidir si continuar o escalar.

Una capa de decisió, no un substitut del LLM

Aquí crec que és on la idea es torna més interessant.

No veig Jev com un substitut dels LLMs. Al contrari: el veig com una possible peça intermèdia dins de sistemes més complexos.

Imaginem un agent que rep centenars de peticions. No totes necessiten una crida a un model gran amb reasoning. Algunes es poden resoldre amb codi determinista. D'altres només necessiten classificació o routing. I només una minoria necessiten realment un model potent que analitzi, escrigui o raoni.

En aquest escenari, una arquitectura podria quedar així:

estat → decisió ràpida → codi determinista → LLM només quan cal.

Això té bastant més sentit que enviar-ho absolutament tot al model més car i esperar que sempre ens torni exactament l'estructura que volem.

L'article d'Eigent sobre Jev ho explica amb una idea que em sembla especialment útil: utilitzar llindars de confiança. Decisions barates i reversibles poden executar-se automàticament quan la confiança és alta; decisions més delicades poden requerir confirmació; i els casos dubtosos poden escalar-se a un humà o a un model de reasoning més complet.

Velocitat i cost: la part espectacular, però també la que cal llegir amb calma

TypeSafe publica números molt agressius. Parla de latències d'entre aproximadament 70 i 500 ms, un preu d'entrada de 0,042 dòlars per milió de tokens i benchmarks interns en què Jev arriba a ser gairebé 200 vegades més ràpid i més de 400 vegades més barat que determinats workflows construïts amb LLMs.

Si aquestes diferències es mantenen en producció i en casos d'ús independents, poden ser molt importants.

Però aquí convé no confondre una idea interessant amb una conclusió ja demostrada.

La mateixa TypeSafe és bastant transparent explicant les limitacions de les seves proves: els benchmarks són propis, els workflows han estat creats pel seu equip, part de les comparatives poden afavorir la seva arquitectura i el producte encara està en early access.

Per tant, jo no em quedaria amb el "193,6x més ràpid" com a titular principal. Em quedaria amb una pregunta molt més rellevant: què passa si separem la generació de llenguatge de la presa de decisions?

I això de "no al·lucina"?

Aquí també faria una distinció important.

TypeSafe diu que Jev no pot al·lucinar en el sentit habitual d'un LLM perquè no genera text lliure ni pot inventar una estructura fora de l'esquema definit. Si una resposta només pot ser A, B o C, el model no et retornarà D ni un paràgraf inventat.

Això elimina una classe sencera de problemes: errors d'esquema, JSON trencat, camps inexistents o respostes que no compleixen el contracte esperat.

Però sortida vàlida no significa decisió correcta.

Jev es pot equivocar escollint A quan la resposta correcta era B. La diferència és que l'error continua vivint dins d'un espai controlat, amb una probabilitat associada i amb un contracte que el software pot entendre.

I això, per automatització, ja és una diferència important.

Per què "System One"?

El nom ve de la distinció popularitzada per Daniel Kahneman entre un Sistema 1 ràpid i intuïtiu i un Sistema 2 lent i deliberatiu.

La metàfora encaixa bastant bé amb el que TypeSafe intenta construir: no un model que es pari a desenvolupar una resposta llarga, sinó una capa de decisió ràpida que pugui executar-se milers o milions de vegades dins d'aplicacions.

En certa manera, estem acostumats a veure la IA des de la interfície humana: chatbots, copilots i agents que ens expliquen què estan fent.

Però probablement una part enorme de la IA aplicada del futur no tindrà cap interfície visible. Seran petites decisions executant-se a l'interior del software.

El que em sembla realment interessant

Encara és massa aviat per saber si Jev serà una peça important del stack d'IA o simplement una aproximació interessant que acabarà absorbida per altres models.

Però la direcció em sembla molt coherent.

Durant molt temps hem intentat encaixar LLMs a tot arreu perquè era la peça d'intel·ligència que teníem disponible. Ara comencem a veure especialització: models de reasoning, models petits, models multimodals, models locals i, en aquest cas, models orientats específicament a decisions estructurades.

Potser el següent salt en automatització no vindrà només de tenir un model més intel·ligent.

Pot venir de deixar de demanar al mateix model que ho faci absolutament tot.

I si una part del nostre software només necessita una decisió ràpida, barata, tipada i amb una confiança mesurable, probablement té poc sentit obligar una IA a escriure'ns una frase abans de poder executar-la.

Fonts i referències: TypeSafe AI — Introducing System One Models & Jev i Eigent — ¿Qué es Jev?.

MÉS COSES

Segueixo
escrivint.

Veure el blog →