La tabella è sempre la stessa: modelli in riga, prezzo per milione di token in colonna, il più conveniente evidenziato in verde. È metà dell'informazione, e la metà che manca non la pubblica nessuno.
Un collega me l'ha fatto notare qualche settimana fa, fermandomi con una domanda che sembrava semplice: "Ho capito quanto costa il token. Ma nessuno mi dice quanti token consumo."
Ha ragione, e l'esempio che ha usato è migliore di qualunque spiegazione tecnica. Quando entriamo dal panettiere sappiamo due cose: il prezzo al chilo, scritto sul cartello, e il peso del filone, che la bilancia mostra mentre ci serve. Il conto nasce dal prodotto delle due. Con l'intelligenza artificiale abbiamo il cartello e non abbiamo la bilancia. Anzi, abbiamo una bilancia che pesa dopo, a lavoro finito, e che spesso segna un numero molto diverso da quello che ci aspettavamo.
La formula che manca nelle classifiche
Il costo di un compito svolto da un modello si scompone in quattro voci:
costo = (token di input × prezzo input) + (token in cache × prezzo cache) + (token di risposta + token di ragionamento) × prezzo output + costo degli strumenti
Le classifiche pubblicano soltanto i prezzi. Tutto il resto, cioè le quantità, dipende dal modello e dal compito, e cambia da una richiesta all'altra.
C'è poi un passaggio ulteriore, quello che interessa a chi deve firmare un budget:
costo per risultato corretto = costo totale delle esecuzioni ÷ numero di compiti completati correttamente
Un modello che sbaglia una volta su tre e va richiamato può costare più di uno che riesce al primo colpo pur avendo un listino doppio.
Quanto pesa il filone
Epoch AI ha misurato la lunghezza delle risposte su tre benchmark di matematica e scienze - GPQA Diamond, MATH livello 5 e OTIS Mock AIME - raccogliendo dati su 77 modelli per un totale di 235 valutazioni. I risultati, pubblicati ad aprile 2025 e aggiornati nel novembre successivo:
- i modelli di ragionamento consumavano in media circa 8 volte più token di quelli tradizionali;
- fra i modelli OpenAI analizzati, passare dallo sforzo di ragionamento "medium" a "high" aumentava i token in uscita di 1,6 volte;
- la lunghezza delle risposte cresceva di cinque volte l'anno per i modelli di ragionamento e di 2,2 volte per gli altri.
I dati grezzi sono scaricabili. Un esempio: o4-mini allo sforzo massimo produceva in media 7.855 token per domanda su GPQA Diamond e 14.084 token su AIME. Molti modelli non-reasoning della generazione precedente stavano sotto il migliaio.
Quei token in più servono ad alzare l'accuratezza: o4-mini su GPQA Diamond rispondeva correttamente nel 79,6% dei casi. Resta che fra due modelli con lo stesso prezzo di listino uno può consumare dieci volte l'altro per arrivare alla stessa risposta, e il listino tace su questo.
Un'avvertenza sulla freschezza: quella misurazione ha ormai più di un anno e i modelli si sono mossi parecchio. Il rapporto di 8 a 1 va letto come ordine di grandezza di un fenomeno, non come costante.
Perché il peso non si vede
I token di ragionamento vengono fatturati come output. Tutti e tre i principali fornitori lo dichiarano, e ognuno aggiunge un dettaglio suo.
OpenAI li conteggia dentro output_tokens, con la voce separata reasoning_tokens nell'oggetto usage: non li vedi nella risposta, li paghi al prezzo pieno dell'output.
Anthropic è ancora più esplicita, e il dettaglio è quello che sorprende di più chi legge una fattura per la prima volta: con i modelli recenti il ragionamento restituito è un riassunto, mentre la fatturazione riguarda il pensiero completo. Il conteggio dei token che leggi nella risposta non coincide con quello che paghi. Per sapere quanto hai speso davvero devi guardare usage.output_tokens_details.thinking_tokens.
Google segue la stessa regola e la mette nel listino, dove il prezzo dell'output è dichiarato comprensivo dei token di pensiero. Il suo sta nel default: nei modelli della serie Gemini 3 il ragionamento è attivo in partenza, con un'intensità che il modello regola da solo sulla complessità della richiesta. Il pensiero si paga anche quando non lo si è chiesto.
Il risultato pratico è che una risposta di trecento parole può nascondere trecento, tremila o trentamila token pagati.
Un esempio costruito
Prendiamo lo stesso compito, con mille token di input, e due modelli.
Modello A: input 1 $/M, output 5 $/M. Risposta visibile di 500 token, nessun ragionamento interno. Costo della singola risposta: 0,0035 $.
Modello B: input 0,50 $/M, output 2 $/M. Risposta visibile di 500 token, più 10.000 token di ragionamento interno. Costo della singola risposta: 0,0215 $.
Il modello B ha il listino dimezzato su entrambe le voci e costa sei volte tanto. I numeri sono inventati per far vedere il meccanismo, ma il rapporto fra ragionamento e risposta visibile che ho usato è dentro l'ordine di grandezza misurato da Epoch.
Su una singola richiesta la differenza è invisibile: parliamo di frazioni di centesimo. Su centomila pratiche l'anno diventano 350 dollari contro 2.150.
Cinque cose che rendono il confronto scivoloso
I tokenizer sono diversi. Lo stesso testo italiano diventa un numero diverso di token a seconda del modello, e la differenza penalizza sistematicamente le lingue diverse dall'inglese. Artificial Analysis distingue infatti i token "nativi", quelli che finiscono in fattura, da una tokenizzazione standardizzata usata solo per confrontare le velocità.
Il ragionamento è invisibile. È il punto della sezione precedente: la lunghezza di quello che leggi non ti dice quasi nulla di quello che paghi.
Il contesto si ripete. A ogni messaggio vengono rispedite istruzioni, documenti e conversazione precedente. Alvarez & Marsal, in una guida di agosto 2026 sul controllo della spesa IA, fa il conto su un caso tipico: un prompt di sistema da 2.000 token inviato 10.000 volte al giorno produce 20 milioni di token di input al giorno, prima che gli utenti abbiano chiesto qualcosa. In un sistema RAG o in un agente l'input pesa spesso più della domanda dell'utente, e cresce mano a mano che il lavoro procede. È l'altra faccia del problema che ho descritto in La risorsa scarsa dell'IA: l'attenzione: riempire la finestra costa in accuratezza e costa anche in fattura.
Un compito non è una chiamata. Un agente che cerca sul web, interroga un database, esegue codice e ricontrolla il proprio lavoro fa decine di chiamate al modello per un solo risultato. Ne ho parlato in Il loop: quello che trasforma un modello in un agente: il loop è ciò che rende utile un agente, ed è anche ciò che moltiplica il conto.
I tentativi contano. Se la qualità non basta, il compito viene rifatto. A volte dal modello, a volte da una persona, e il costo di quella persona non compare in nessuna classifica.
Chi misura già così
Il riferimento più utile oggi è Artificial Analysis, che pubblica per ciascun modello un Cost per Task: prende i prezzi di input, cache e output, li moltiplica per i token effettivamente consumati sull'insieme di benchmark del loro Intelligence Index e divide per il numero di compiti. La loro metodologia lo dice in una riga che vale l'articolo intero: poiché il costo riflette il consumo reale di token, modelli che producono risposte più lunghe o più ragionamento avranno un costo per compito più alto anche a parità di prezzo per token.
Va però letto per quello che è. Quella metrica misura prezzo per quantità, non ancora prezzo per risultato: al denominatore ci sono i compiti tentati, non quelli riusciti. L'accuratezza sta in un indice separato. Chi deve decidere ha bisogno di tenerli insieme, e nessuno lo fa al posto suo.
L'indicazione intanto è arrivata anche alla consulenza direzionale: la stessa guida di Alvarez & Marsal raccomanda alle aziende di analizzare il costo per compito completato, non il costo per chiamata API.
Una scala di indicatori
- Prezzo per milione di token - il listino.
- Token per risposta - la quantità generata.
- Costo per richiesta - prezzo × quantità.
- Costo per compito corretto - la qualità.
- Costo per workflow completato - strumenti, tentativi, passaggi dell'agente.
- Costo totale per l'azienda - supervisione umana, errori, manutenzione.
Si scende di riga solo quando serve. Per una prova su una singola funzionalità la terza riga basta. Per decidere se un processo aziendale può essere affidato a un sistema, le prime tre righe non dicono niente di utile.
Come misurarlo davvero
Il metodo è noioso, e per questo quasi nessuno lo segue fino in fondo.
Si prendono da cinquanta a cento attività realmente rappresentative del lavoro, non prompt da demo. Si eseguono con ciascun modello candidato. Per ognuno si registra il costo medio e quello al novantesimo percentile, i token di input, cache, ragionamento e risposta, la percentuale di compiti completati correttamente, il numero di ripetizioni, il tempo totale. Alla fine si divide la spesa per i risultati accettati.
Il novantesimo percentile è la voce che salta più spesso e che serve di più: la media nasconde le richieste che entrano in un ragionamento lungo e costano venti volte le altre. Un servizio che deve reggere un picco si dimensiona su quelle, non sulla media.
Serve anche il termine di paragone giusto, cioè il processo attuale. Anche il lavoro umano ha un costo per pratica, un tempo di esecuzione e una percentuale di errore, e quasi mai qualcuno li ha misurati con la stessa cura che pretendiamo dal modello.
Il prezzo del pane, non il prezzo della farina
Al mio collega risponderò la prossima volta che lo incontro, ora che ci ho riflettuto: la sua domanda era già la risposta. Il listino per token è il prezzo della farina. Quello che un'azienda compra è il pane: una pratica istruita, una fattura controllata, un documento redatto e verificato.
Fra le due cose ci sono il ragionamento invisibile, il contesto che si ripete, gli strumenti, i tentativi e la persona che ricontrolla. La domanda utile riguarda sempre un lavoro specifico: quale modello costa meno per portarlo a termine al livello di qualità che ho deciso in anticipo. La risposta cambia da processo a processo, e si ottiene misurando sul proprio.
Nel frattempo le due grandezze si muovono in direzioni opposte: il prezzo per token scende, la quantità di token consumati per compito sale. Guardare solo il cartello dei prezzi lascia credere che la tecnologia stia diventando gratis, mentre la fattura racconta una storia diversa.
