Arriva un'email al servizio clienti e qualcuno deve decidere dove mandarla: amministrazione, assistenza tecnica o vendite. Molte aziende oggi affidano questo passaggio a un modello linguistico. Gli passano l'email, gli chiedono di rispondere con una sola parola, e un programma legge quella parola e smista. Funziona quasi sempre. Ogni tanto però il modello risponde "Assistenza tecnica." con il punto finale, oppure aggiunge una frase di spiegazione, oppure si inventa una categoria che non esiste. E il programma che deve leggere la risposta si inceppa.
Jev, il modello che TypeSafe AI ha rilasciato il 15 settembre, alla stessa email risponde così:
tecnica 0,85 · fatturazione 0,08 · vendite 0,07 · confidenza 0,82
Non scrive nessuna parola. Restituisce tre probabilità e un numero che dice quanto il modello si fida della propria stima. L'esempio è quello pubblicato da The Register, tradotto.
Chi c'è dietro
TypeSafe AI è stata fondata nel 2024 da Diogo Almeida, Erik Gafni e Sasha Sheng. Almeida ha lavorato circa quattro anni in OpenAI su InstructGPT, ChatGPT e GPT-4, ed è il quarto dei venti autori dell'articolo del 2022 che ha descritto l'RLHF applicato ai modelli linguistici: il metodo con cui hanno imparato a seguire le istruzioni e, come ho raccontato parlando di sicofanzia, anche a compiacere chi le dà. L'azienda ha raccolto 40 milioni di dollari in un primo round guidato da DCVC. Jev per ora è in accesso anticipato: gli sviluppatori entrano da una lista d'attesa.
Come funziona
Un modello linguistico scrive un token alla volta. Sceglie il pezzo di parola più probabile, lo aggiunge a quelli già scritti e ricomincia. Una risposta di trecento token richiede trecento passaggi, e le tecniche che ne prevedono più d'uno insieme riducono il numero dei passaggi senza cambiare il principio. È il meccanismo che gli permette di scrivere qualunque cosa. È anche il motivo per cui è lento, e per cui la risposta può prendere forme che nessuno aveva previsto.
Jev rinuncia a scrivere. Lo sviluppatore gli passa uno stato, cioè un testo, i dati di un programma o un file strutturato, e una o più domande di cui ha fissato in anticipo le risposte possibili. Le domande sono di tre tipi:
- Choice sceglie fra opzioni definite, fino a 255, e restituisce l'opzione scelta, una probabilità per ciascuna e la confidenza.
- Score colloca lo stato su una scala da 2 a 10 livelli descritti a parole, per esempio da "richiesta banale" a "cliente pronto a disdire".
- Noul risponde a una domanda sì o no e restituisce la probabilità del sì.
Tutte le risposte vengono calcolate insieme, in una sola passata. Da qui la velocità dichiarata: fra 70 e 500 millisecondi dall'invio della richiesta alla risposta. Anche il prezzo discende da questa scelta. L'ingresso costa 0,042 dollari per milione di token, e l'uscita non si paga, perché sono pochi numeri. Il listino, come ho scritto ad agosto, dice solo metà della spesa: l'altra metà sono i token che servono per finire il lavoro. Qui quelli in uscita sono quasi zero, e quelli in ingresso dipendono da quanto stato gli si passa.
Il modello è un transformer, la stessa architettura di base dei modelli linguistici, addestrato solo su dati sintetici con un metodo che TypeSafe chiama RLCD (Reinforcement Learning for Calibrated Decisions). L'obiettivo dell'addestramento è la calibrazione: quando Jev dice 80%, su cento risposte di quel tipo circa ottanta dovrebbero essere giuste, e a domande simili dovrebbe dare risposte simili.
TypeSafe chiama Jev un "System One Model", con un richiamo a Daniel Kahneman. Il Sistema 1 di Pensieri lenti e veloci è il pensiero rapido e intuitivo, quello che di solito si associa all'errore. La tesi dell'azienda è che le decisioni rapide si possano rendere più affidabili delle alternative, se il modello impara a dire quanto è sicuro.
"Non allucina": vero a metà
Diversi siti italiani hanno titolato su un'intelligenza artificiale che non allucina mai. La frase viene da TypeSafe, e in senso stretto è vera. Jev non può rispondere fuori dall'elenco che gli è stato dato, non può inventare una categoria e non produce risposte malformate. L'azienda dichiara zero errori di formato, ed è una conseguenza diretta del progetto.
Nei chatbot, però, allucinare vuol dire affermare con sicurezza una cosa falsa. E questo Jev può farlo. Può scegliere l'opzione sbagliata, leggere male i dati, assegnare il 90% a una risposta sbagliata. Cambia la forma dell'errore: al posto di una frase plausibile e falsa c'è una probabilità sbagliata. The Register e l'analista Anthony Maio hanno fatto la stessa osservazione.
C'è un secondo limite, più sottile. La calibrazione è una proprietà della media. Se Jev è ben calibrato, delle sue risposte all'80% ne saranno giuste otto su dieci, ma il numero non dice se quella che hai davanti è fra le otto o fra le due. Armin Ronacher, CTO di Earendil, l'ha detto in modo pratico a TechCrunch: se la risposta torna con il 50% di probabilità, forse è un lancio di moneta, e la scarta. Che cosa fare con l'incertezza lo decide chi costruisce il sistema.
I numeri, uno per uno
Velocità e costo. TypeSafe dichiara che Jev è da 40 a 200 volte più veloce dei modelli di frontiera sui compiti per cui è pensato, e nei suoi flussi di lavoro migliori arriva a 193,6 volte più veloce e 444,6 volte più economico. Nella dimostrazione più citata Jev gioca a Doom leggendo lo stato del gioco, e risponde in 0,114 secondi contro gli 8,566 di GPT-5.6 Terra. La stessa azienda avverte che questi risultati stanno sulla fascia alta dei guadagni reali e che li ha prodotti il suo team, quindi possono essere distorti.
Accuratezza. È il dato che i titoli hanno lasciato fuori. Nella valutazione interna di TypeSafe su quattro flussi di lavoro (incidenti di sicurezza, monitoraggio di agenti, fatture, servizio clienti), Jev concorda con le risposte di riferimento nel 67,8% dei casi. GPT "Sol" arriva al 74,1%, Claude Opus 5 al 73,1%. Le risposte di riferimento, poi, non vengono da casi verificati sul campo: sono la media di altri due modelli, GPT-6 Astra e Claude Fable 5.1. Sui dati dell'azienda stessa, dunque, Jev è molto più veloce, molto più economico e circa sei punti meno preciso dei migliori modelli linguistici.
I primi utenti. Secondo TechCrunch, Vercel ha sostituito un modello OpenAI con Jev e ha ottenuto risultati da 5 a 18 volte più rapidi e più accurati. Bryo AI l'ha provato per smistare le email aziendali: Gemini era un po' più accurato, ma costava da 10 a 20 volte di più. Mudholkar, che ha condotto la prova, ha scelto Jev per le probabilità, "l'unico che restituisce una probabilità vera".
Che cosa cambia per chi usa l'IA
Molti compiti che oggi affidiamo a un chatbot sono scelte chiuse: smistare una richiesta, classificare un documento, decidere se un'operazione è sospetta, stabilire quale modello deve gestire un lavoro. Per questi compiti, far scrivere una risposta e poi interpretarla è un giro lungo, costoso e fragile. Jev lo accorcia. E aggiunge una cosa che un testo non dà: la misura dell'incertezza.
Somiglia alla mossa che proponevo per l'IA alle prese con i numeri: il pezzo di lavoro che il modello linguistico fa male gli si toglie di mano e si affida a uno strumento costruito per quello.
Con quella misura si può fissare una soglia. Un ufficio che riceve cinquecento fatture al giorno lascia passare in automatico quelle che il modello classifica con probabilità sopra il 95%, e manda a una persona tutte le altre. La soglia si regola guardando gli errori, e la persona vede solo i casi dubbi. È un modo misurabile di decidere dove resta una persona nel loop, la domanda da cui partiva l'articolo su WarGames. Con un chatbot lo stesso schema richiede di chiedere al modello quanto è sicuro, e fidarsi di una risposta che è a sua volta testo generato.
I limiti restano. Jev non legge immagini, non scrive testo, funziona solo se le risposte possibili si conoscono in anticipo. Sull'architettura TypeSafe dice poco, e alcuni osservatori ipotizzano che poggi su un modello linguistico a pesi aperti: non è confermato.
Che cosa guardare nei prossimi mesi
Tre cose. Test indipendenti, fatti su casi con una risposta giusta verificata e non sulla media di altri modelli. La tenuta della calibrazione su dati reali, diversi da quelli sintetici dell'addestramento. E l'apertura dell'accesso, perché oggi i numeri li conoscono solo TypeSafe e chi è uscito dalla lista d'attesa.
Se questi test confermeranno anche solo una parte delle promesse, Jev avrà reso visibile una distinzione che l'entusiasmo per i chatbot aveva coperto. Scrivere una risposta e stimare una probabilità sono due lavori diversi, e il secondo serve più spesso di quanto sembri.
