Verso l’uso aziendale

Il prezzo al token è metà del conto

Le classifiche confrontano quanto costa un milione di token. Nessuna dice quanti token servono per finire il lavoro, e lì si decide la bolletta.

Pubblicato il 23 agosto 20268 minuti di lettura
Il prezzo al token è metà del conto
costitokenprezzimodelli di ragionamentobenchmarkagentiEpoch AIArtificial Analysis
Questo tema nel libroParte III - Verso l’uso aziendale2 capitoli: apri la sintesi e leggi come iniziano

Questa parte accompagna verso l’uso in un’organizzazione: le tre domande per scegliere e governare una soluzione, e il metodo per smontare un processo in attività e decidere quali delegare, con i processi reali seguiti passo per passo.

I capitoli di questa parte

  • Capitolo 8 · pagina 127Scegliere e governare una soluzioneLa prima domanda: cosa deve fare davvero il sistema? · La seconda domanda: quali dati servono e come gestirli? · La terza domanda: dove far girare il modello? · Che cosa c’è sul mercato · Governare e integrare il sistema

    Le competenze della parte precedente bastano a chi lavora da solo. Quando la scelta la fa un’organizzazione per tutti, le domande cambiano: con quali dati, con quale budget, con quali responsabilità. Il capitolo le ordina in tre, da prendere in sequenza, perché ognuna restringe quella dopo. La prima domanda è che cosa deve fare davvero il sistema. Gli usi sono di quattro tipi, produrre contenuti, rispondere su documenti che esistono già, automatizzare un processo, tenere una relazione nel tempo, e uno strumento buono per il primo può essere inadatto al terzo. La seconda domanda è quali dati servono e dove stanno. Un modello non conosce i dati della tua organizzazione, e usarli non vuol dire caricarli dentro il modello: si collegano, come hai visto con la RAG, e la scelta di dove i dati passano incide sull’architettura, sui costi e sui rischi. La terza domanda è dove far girare il modello. I livelli sono quattro: la chat personale, dove i tuoi dati vanno sui server del fornitore; la stessa chat comprata dall’organizzazione con un contratto; un’applicazione costruita sulle API; il modello installato in casa, quando i dati non possono uscire. A ogni gradino cresce quello che decidi e quello di cui rispondi. Il conto ha cinque voci, e il listino ne dice una sola. Il capitolo si chiude con quello che nessuna architettura risolve da sola: il mercato italiano, con molte licenze e poca governance; la responsabilità, che non si delega al modello; e il modo di misurare se un sistema funziona, con un banco di prova fatto di casi veri del proprio lavoro e un’autonomia che si allarga un gradino alla volta.

    Perché leggerlo: dipende da dove lavori. Se lavori da solo ti servono la seconda e la terza domanda, i dati e i quattro livelli, perché decidono dove finisce quello che incolli in una chat, e il resto lo puoi attraversare. Se il tuo compito è scegliere per un’organizzazione, leggilo per intero: la sezione su come si misura se funziona separa i progetti che reggono da quelli che si spengono dopo il pilota. Il capitolo che segue lo presuppone in un punto solo: il perimetro dei dati decide lo strumento.

  • Capitolo 9 · pagina 139Ridisegnare il proprio lavoroUsare e riprogettare · Smontare il processo in attività · Quali attività reggono la delega · Che cosa misuri · Chi verifica, e che cosa · I dati che non escono · Quando l’errore arriva · Il processo non è solo tuo · Delegare a un agente · Quattro processi smontati · Quello che resta tuo

    Un lavoro non si delega. Si delegano le attività che lo compongono, una alla volta, e ognuna ha un prezzo da pagare in controlli. Il capitolo serve a fare quel conto su un processo tuo. Il metodo comincia dallo smontare il processo in attività, ciascuna con un ingresso, un’uscita e un momento in cui è finita. Per ognuna si compilano sei righe: che cosa entra, che cosa esce, quanto dura, come si capisce che è venuta bene, che cosa succede se viene male e nessuno se ne accorge, chi risponde del risultato. Poi ogni attività si classifica con due domande, e la difficoltà non c’entra: quanto costa verificare il risultato, e che fine fa un errore che ha superato i controlli. Ne escono quattro casi, dalla delega piena all’attività che resta tua. Il capitolo dice poi che cosa misurare, a partire da quanto ci mettevi prima, che quasi nessuno sa; come si progetta la verifica, che è un’attività con un nome, una durata e una persona, e perché la buona volontà si consuma; quali dati non escono dal tuo perimetro; che cosa fare quando l’errore arriva, perché arriverà; con chi va concordato il cambiamento; e che cosa cambia quando deleghi a un agente una catena di passi invece di uno solo. Seguono quattro processi smontati per esteso: una nota su un fascicolo di duecento pagine, un’analisi di mercato con fonti esterne, l’adeguamento delle procedure interne a una norma nuova e il lavoro con cui è fatto questo libro. In tutti e quattro la delega si concentra sulle stesse attività, ricostruire, cercare, fare una prima versione, e non tocca mai capire che cosa vuole chi ha chiesto, decidere e rispondere di quello che esce.

    Perché leggerlo: ti dà il metodo per usare la IA per efficientare delle attività, e ti spiega come e cosa delegare a un agente. Va letto tutto e in ordine; dei quattro casi puoi leggerne uno solo, quello che assomiglia di più al tuo lavoro, e tornare sugli altri dopo. Se hai poco tempo per tutto il libro, questo è il capitolo da leggere per intero.

Il libro costruisce le basi in modo progressivo; gli articoli approfondiscono e aggiornano i singoli temi man mano che cambiano.

La tabella è sempre la stessa: modelli in riga, prezzo per milione di token in colonna, il più conveniente evidenziato in verde. È metà dell'informazione, e la metà che manca non la pubblica nessuno.

Un collega me l'ha fatto notare qualche settimana fa, fermandomi con una domanda che sembrava semplice: "Ho capito quanto costa il token. Ma nessuno mi dice quanti token consumo."

Ha ragione, e l'esempio che ha usato è migliore di qualunque spiegazione tecnica. Quando entriamo dal panettiere sappiamo due cose: il prezzo al chilo, scritto sul cartello, e il peso del filone, che la bilancia mostra mentre ci serve. Il conto nasce dal prodotto delle due. Con l'intelligenza artificiale abbiamo il cartello e non abbiamo la bilancia. Anzi, abbiamo una bilancia che pesa dopo, a lavoro finito, e che spesso segna un numero molto diverso da quello che ci aspettavamo.

La formula che manca nelle classifiche

Il costo di un compito svolto da un modello si scompone in quattro voci:

costo = (token di input × prezzo input) + (token in cache × prezzo cache) + (token di risposta + token di ragionamento) × prezzo output + costo degli strumenti

Le classifiche pubblicano soltanto i prezzi. Tutto il resto, cioè le quantità, dipende dal modello e dal compito, e cambia da una richiesta all'altra.

C'è poi un passaggio ulteriore, quello che interessa a chi deve firmare un budget:

costo per risultato corretto = costo totale delle esecuzioni ÷ numero di compiti completati correttamente

Un modello che sbaglia una volta su tre e va richiamato può costare più di uno che riesce al primo colpo pur avendo un listino doppio.

Quanto pesa il filone

Epoch AI ha misurato la lunghezza delle risposte su tre benchmark di matematica e scienze - GPQA Diamond, MATH livello 5 e OTIS Mock AIME - raccogliendo dati su 77 modelli per un totale di 235 valutazioni. I risultati, pubblicati ad aprile 2025 e aggiornati nel novembre successivo:

  • i modelli di ragionamento consumavano in media circa 8 volte più token di quelli tradizionali;
  • fra i modelli OpenAI analizzati, passare dallo sforzo di ragionamento "medium" a "high" aumentava i token in uscita di 1,6 volte;
  • la lunghezza delle risposte cresceva di cinque volte l'anno per i modelli di ragionamento e di 2,2 volte per gli altri.

I dati grezzi sono scaricabili. Un esempio: o4-mini allo sforzo massimo produceva in media 7.855 token per domanda su GPQA Diamond e 14.084 token su AIME. Molti modelli non-reasoning della generazione precedente stavano sotto il migliaio.

Quei token in più servono ad alzare l'accuratezza: o4-mini su GPQA Diamond rispondeva correttamente nel 79,6% dei casi. Resta che fra due modelli con lo stesso prezzo di listino uno può consumare dieci volte l'altro per arrivare alla stessa risposta, e il listino tace su questo.

Un'avvertenza sulla freschezza: quella misurazione ha ormai più di un anno e i modelli si sono mossi parecchio. Il rapporto di 8 a 1 va letto come ordine di grandezza di un fenomeno, non come costante.

Perché il peso non si vede

I token di ragionamento vengono fatturati come output. Tutti e tre i principali fornitori lo dichiarano, e ognuno aggiunge un dettaglio suo.

OpenAI li conteggia dentro output_tokens, con la voce separata reasoning_tokens nell'oggetto usage: non li vedi nella risposta, li paghi al prezzo pieno dell'output.

Anthropic è ancora più esplicita, e il dettaglio è quello che sorprende di più chi legge una fattura per la prima volta: con i modelli recenti il ragionamento restituito è un riassunto, mentre la fatturazione riguarda il pensiero completo. Il conteggio dei token che leggi nella risposta non coincide con quello che paghi. Per sapere quanto hai speso davvero devi guardare usage.output_tokens_details.thinking_tokens.

Google segue la stessa regola e la mette nel listino, dove il prezzo dell'output è dichiarato comprensivo dei token di pensiero. Il suo sta nel default: nei modelli della serie Gemini 3 il ragionamento è attivo in partenza, con un'intensità che il modello regola da solo sulla complessità della richiesta. Il pensiero si paga anche quando non lo si è chiesto.

Il risultato pratico è che una risposta di trecento parole può nascondere trecento, tremila o trentamila token pagati.

Un esempio costruito

Prendiamo lo stesso compito, con mille token di input, e due modelli.

Modello A: input 1 $/M, output 5 $/M. Risposta visibile di 500 token, nessun ragionamento interno. Costo della singola risposta: 0,0035 $.

Modello B: input 0,50 $/M, output 2 $/M. Risposta visibile di 500 token, più 10.000 token di ragionamento interno. Costo della singola risposta: 0,0215 $.

Il modello B ha il listino dimezzato su entrambe le voci e costa sei volte tanto. I numeri sono inventati per far vedere il meccanismo, ma il rapporto fra ragionamento e risposta visibile che ho usato è dentro l'ordine di grandezza misurato da Epoch.

Su una singola richiesta la differenza è invisibile: parliamo di frazioni di centesimo. Su centomila pratiche l'anno diventano 350 dollari contro 2.150.

Cinque cose che rendono il confronto scivoloso

I tokenizer sono diversi. Lo stesso testo italiano diventa un numero diverso di token a seconda del modello, e la differenza penalizza sistematicamente le lingue diverse dall'inglese. Artificial Analysis distingue infatti i token "nativi", quelli che finiscono in fattura, da una tokenizzazione standardizzata usata solo per confrontare le velocità.

Il ragionamento è invisibile. È il punto della sezione precedente: la lunghezza di quello che leggi non ti dice quasi nulla di quello che paghi.

Il contesto si ripete. A ogni messaggio vengono rispedite istruzioni, documenti e conversazione precedente. Alvarez & Marsal, in una guida di agosto 2026 sul controllo della spesa IA, fa il conto su un caso tipico: un prompt di sistema da 2.000 token inviato 10.000 volte al giorno produce 20 milioni di token di input al giorno, prima che gli utenti abbiano chiesto qualcosa. In un sistema RAG o in un agente l'input pesa spesso più della domanda dell'utente, e cresce mano a mano che il lavoro procede. È l'altra faccia del problema che ho descritto in La risorsa scarsa dell'IA: l'attenzione: riempire la finestra costa in accuratezza e costa anche in fattura.

Un compito non è una chiamata. Un agente che cerca sul web, interroga un database, esegue codice e ricontrolla il proprio lavoro fa decine di chiamate al modello per un solo risultato. Ne ho parlato in Il loop: quello che trasforma un modello in un agente: il loop è ciò che rende utile un agente, ed è anche ciò che moltiplica il conto.

I tentativi contano. Se la qualità non basta, il compito viene rifatto. A volte dal modello, a volte da una persona, e il costo di quella persona non compare in nessuna classifica.

Chi misura già così

Il riferimento più utile oggi è Artificial Analysis, che pubblica per ciascun modello un Cost per Task: prende i prezzi di input, cache e output, li moltiplica per i token effettivamente consumati sull'insieme di benchmark del loro Intelligence Index e divide per il numero di compiti. La loro metodologia lo dice in una riga che vale l'articolo intero: poiché il costo riflette il consumo reale di token, modelli che producono risposte più lunghe o più ragionamento avranno un costo per compito più alto anche a parità di prezzo per token.

Va però letto per quello che è. Quella metrica misura prezzo per quantità, non ancora prezzo per risultato: al denominatore ci sono i compiti tentati, non quelli riusciti. L'accuratezza sta in un indice separato. Chi deve decidere ha bisogno di tenerli insieme, e nessuno lo fa al posto suo.

L'indicazione intanto è arrivata anche alla consulenza direzionale: la stessa guida di Alvarez & Marsal raccomanda alle aziende di analizzare il costo per compito completato, non il costo per chiamata API.

Una scala di indicatori

  1. Prezzo per milione di token - il listino.
  2. Token per risposta - la quantità generata.
  3. Costo per richiesta - prezzo × quantità.
  4. Costo per compito corretto - la qualità.
  5. Costo per workflow completato - strumenti, tentativi, passaggi dell'agente.
  6. Costo totale per l'azienda - supervisione umana, errori, manutenzione.

Si scende di riga solo quando serve. Per una prova su una singola funzionalità la terza riga basta. Per decidere se un processo aziendale può essere affidato a un sistema, le prime tre righe non dicono niente di utile.

Come misurarlo davvero

Il metodo è noioso, e per questo quasi nessuno lo segue fino in fondo.

Si prendono da cinquanta a cento attività realmente rappresentative del lavoro, non prompt da demo. Si eseguono con ciascun modello candidato. Per ognuno si registra il costo medio e quello al novantesimo percentile, i token di input, cache, ragionamento e risposta, la percentuale di compiti completati correttamente, il numero di ripetizioni, il tempo totale. Alla fine si divide la spesa per i risultati accettati.

Il novantesimo percentile è la voce che salta più spesso e che serve di più: la media nasconde le richieste che entrano in un ragionamento lungo e costano venti volte le altre. Un servizio che deve reggere un picco si dimensiona su quelle, non sulla media.

Serve anche il termine di paragone giusto, cioè il processo attuale. Anche il lavoro umano ha un costo per pratica, un tempo di esecuzione e una percentuale di errore, e quasi mai qualcuno li ha misurati con la stessa cura che pretendiamo dal modello.

Il prezzo del pane, non il prezzo della farina

Al mio collega risponderò la prossima volta che lo incontro, ora che ci ho riflettuto: la sua domanda era già la risposta. Il listino per token è il prezzo della farina. Quello che un'azienda compra è il pane: una pratica istruita, una fattura controllata, un documento redatto e verificato.

Fra le due cose ci sono il ragionamento invisibile, il contesto che si ripete, gli strumenti, i tentativi e la persona che ricontrolla. La domanda utile riguarda sempre un lavoro specifico: quale modello costa meno per portarlo a termine al livello di qualità che ho deciso in anticipo. La risposta cambia da processo a processo, e si ottiene misurando sul proprio.

Nel frattempo le due grandezze si muovono in direzioni opposte: il prezzo per token scende, la quantità di token consumati per compito sale. Guardare solo il cartello dei prezzi lascia credere che la tecnologia stia diventando gratis, mentre la fattura racconta una storia diversa.

Articoli correlati su Libro Vivo IA

  1. La risorsa scarsa dell'IA: l'attenzione
  2. Il loop: quello che trasforma un modello in un agente
  3. Il modello è il motore, ma tu guidi l'automobile
  4. LLM in pratica: come decidere quale soluzione adottare
Resta aggiornato

Un solo aggiornamento per articoli, eventi e nuove edizioni

Nuovi articoli sull'IA
Nuove edizioni del libro ed eventi