Capire

La predizione multi-token: ripensare la generazione del linguaggio nei Large Language Model

Quando l'LLM "sa" già le prossime parole

Pubblicato il 13 agosto 20257 minuti di lettura
La predizione multi-token: ripensare la generazione del linguaggio nei Large Language Model
LLMApplemulti-tokenottimizzazioneLoRAvelocità
Questo tema nel libroParte I - Capire4 capitoli: apri la sintesi e leggi come iniziano

Questa parte ricostruisce da dove viene l’IA, come impara una macchina, come nascono i modelli di linguaggio e che cosa sta intorno al modello: fine-tuning, RAG, finestra di contesto, harness.

I capitoli di questa parte

  • Capitolo 1 · pagina 25Da dove viene l’IA che usi ogni giornoLa nascita dell’IA · Dove siamo oggi

    La chat che usi tutti i giorni nasce da una storia lunga settant’anni. Siamo nel 1950, l’epoca in cui i primi calcolatori entrano nei laboratori. Alan Turing, matematico inglese, si domandò se quelle macchine fossero in grado di pensare. Cercando la risposta si rese conto che il concetto stesso di “pensare” era difficile, se non impossibile, da definire. Cambiò allora prospettiva e concluse che il modo migliore per stabilire se una macchina pensa fosse una prova: se una persona, conversando con un calcolatore, non riesce a capire che sta parlando con una macchina, allora quella macchina ha superato il test. Sei anni dopo, a Dartmouth, John McCarthy diede un nome a quella che stava diventando una disciplina: “intelligenza artificiale, la scienza e l’ingegneria di creare macchine intelligenti”. Molti studiosi si dedicarono a quell’obiettivo, e in poco tempo si consolidarono due approcci diversi. Il primo diceva: scriviamo noi le regole, una per una, e la macchina le applica, come fa un programma tradizionale. Il secondo diceva: diamo alla macchina molti esempi e lasciamo che le regole se le ricavi da sola, con algoritmi ispirati ai neuroni del cervello. La prima strada diede presto risultati tangibili e sembrò la migliore, e lo rimase fino alla fine degli anni Ottanta. Poi, con il crescere della potenza di calcolo, con l’arrivo dei cosiddetti big data e grazie ad algoritmi sempre più raffinati, la seconda strada, quella delle reti neurali artificiali, ebbe la meglio. Nel 2012 una rete neurale profonda (deep neural network) vinse una gara di riconoscimento di immagini con un distacco che nessuno si aspettava. Negli anni seguenti arrivarono i modelli di linguaggio (i large language model), e il 30 novembre 2022 ChatGPT li mise a disposizione del grande pubblico, con una velocità di diffusione da record: oltre cento milioni di persone nei primi due mesi. Il capitolo racconta questa storia e si chiude con una panoramica di quello che l’IA sa fare oggi, dalle proteine alle auto senza conducente. Una cosa da tenere a mente per tutto il libro è la differenza fra le due strade: un programma tradizionale segue istruzioni scritte da qualcuno e dà sempre la stessa risposta; una rete neurale impara dai dati e risponde con la cosa probabilmente più giusta.

    Perché leggerlo: senza questa storia ogni annuncio sembra il primo, e non hai modo di pesarlo. È breve e si legge per intero in mezz’ora; per seguire il resto basta portarsi dietro la distinzione fra regole scritte a mano e regole ricavate dagli esempi, che torna in ogni capitolo.

  • Capitolo 2 · pagina 31Come impara una macchinaIA simbolica: i sistemi esperti · Machine learning: l’apprendimento dai dati · Machine learning tradizionale: la cassetta degli attrezzi · Deep learning: il salto di qualità · Reti neurali artificiali: architetture di base · Reti neurali artificiali: architetture avanzate

    Questo capitolo apre la macchina e racconta, un pezzo alla volta, come fa a imparare. La storia comincia dai sistemi esperti degli anni Sessanta e Settanta. Un esperto umano scriveva le regole, per esempio “se febbre e tosse, allora possibile influenza”, e un programma le applicava una dopo l’altra. Il metodo funzionava finché le regole erano poche; al primo caso che nessuno aveva previsto si rompeva. Il machine learning (l’apprendimento automatico) rovesciò il metodo: invece di scrivere le regole, si raccolgono molti esempi già risolti e si lascia che il programma trovi da solo le regolarità. Un albero decisionale, per esempio, impara da centinaia di pazienti quale domanda fare per prima per capire se un caso è urgente. Queste tecniche, insieme alle regressioni e alle foreste di alberi, decidono ancora oggi se concedere un prestito o come smistare la posta. Hanno però un limite: lavorano su caratteristiche dei dati che qualcuno ha già scelto per loro. Il deep learning fa il passo in più, perché la rete trova da sola che cosa guardare, ed è proprio quello che serve con le immagini, le frasi e i suoni. Per spiegare come, il capitolo parte dal neurone artificiale, il mattone di base delle reti: una somma pesata dei dati in ingresso, seguita da una piccola curva che si chiama funzione di attivazione. Mettendo insieme qualche neurone si ottiene una rete neurale, e con una rete di questo tipo il capitolo mostra come prevedere se uno studente supererà un esame a partire dai risultati di altri studenti prima di lui. Poi quella rete viene addestrata davvero: si parte con pesi scelti a caso, si misura l’errore e si correggono tutti i pesi insieme, un poco alla volta, per migliaia di giri, finché l’errore è il più piccolo possibile. Questo meccanismo, la discesa del gradiente con la backpropagation, è lo stesso che addestra i modelli da miliardi di parametri. Il capitolo si chiude con le quattro architetture che hanno reso possibile l’IA generativa: la diffusione, che impara a togliere il rumore da un’immagine; l’autoencoder, che comprime e ricostruisce; le GAN, due reti che si sfidano; e il Transformer, che con il meccanismo dell’attenzione legge tutte le parole di una frase insieme e decide quali contano per ciascuna.

    Perché leggerlo: è la parte che rende possibile tutto il resto. Senza sapere che cosa sono i pesi e come si addestrano, non è possibile capire davvero perché le risposte dei modelli possono essere sbagliate. Serve leggerlo tutto? No. Per seguire il libro bastano le sezioni sui sistemi esperti e sul machine learning tradizionale, più la sottosezione sul Transformer, in coda alla seconda sezione sulle reti neurali; il resto delle due sezioni sulle reti neurali, con i conti della rete a tre neuroni, si può saltare al primo giro e riprendere quando vorrai vedere come si arriva a quei numeri. Chi salta deve però almeno portarsi dietro tre parole e il loro significato: pesi, addestramento, attenzione.

  • Capitolo 3 · pagina 69I large language modelCome si addestra un modello di linguaggio · Grande non è sempre meglio: i modelli efficienti · Nuove tecniche per migliorare le capacità degli LLM · Chi fa gli LLM, e come li rilascia · Le architetture, in ordine di tempo

    I modelli di linguaggio, i large language model o LLM, sono l’intelligenza artificiale con cui hai a che fare tutti i giorni, e questo capitolo racconta come nascono e chi li costruisce. Un LLM è una rete neurale addestrata a fare una cosa sola: leggere un pezzo di testo e indovinare la parola che viene dopo. Sembra un compito modesto, ma per farlo bene la rete deve assorbire la grammatica, i fatti e i ragionamenti che stanno dietro le parole, ed è così che impara a rispondere, riassumere e tradurre. Tre grandezze decidono quanto un modello è bravo a prevedere la parola successiva: quanti parametri ha, cioè quanti pesi aggiusta mentre impara; quanto testo ha visto; quanto calcolo è servito per addestrarlo. Nel 2020 ci si accorse che l’errore cala in modo regolare quando le tre grandezze crescono. Sono le cosiddette leggi di scala, e da quella scoperta è partita la corsa a costruire modelli sempre più grandi. Il costo di addestramento, però, sale in fretta, e il capitolo racconta le strade che si stanno percorrendo per contenerlo: modelli più piccoli ma addestrati molto più a lungo, oppure pesi scritti con pochi bit, cioè numeri con meno decimali. Presenta poi due tecniche che negli ultimi anni hanno migliorato i risultati a parità di dimensioni: far scrivere al modello un ragionamento prima della risposta, che è l’idea dei modelli di ragionamento, e organizzarlo dentro come una squadra di specialisti che si attivano solo quando servono, la Mixture of Experts. Il capitolo si chiude con chi costruisce questi modelli e come li rilascia: a pesi chiusi, che restano sui server di chi li ha prodotti, oppure a pesi aperti, scaricabili e modificabili; e con quello che ciascun laboratorio ha scelto di vendere.

    Perché leggerlo: qui impari a capire le caratteristiche di un modello nuovo da solo, e ne esce uno al mese. La prima sezione, l’addestramento e le leggi di scala, aiuta a capire come mai leggiamo sui giornali tutti i giorni della corsa alla costruzione di data center sempre più grandi. La sezione sui laboratori si può attraversare in fretta e riprendere quando ti serve un nome.

  • Capitolo 4 · pagina 83Che cosa sta intorno al modelloAdattare un modello al proprio materiale · La finestra di contesto · Capienza e attenzione · L’harness: l’impianto attorno al modello

    Lo stesso modello, dentro due prodotti diversi, può dare risultati lontanissimi. La differenza la fa quello che gli sta intorno, e questo capitolo lo descrive dall’interno verso l’esterno. Un modello appena addestrato ha una conoscenza generale molto ampia, che viene dal materiale su cui è stato addestrato, ma non sa niente di te e del tuo lavoro. Per portarlo sul tuo materiale ci sono due strade. La prima è riaddestrarlo un poco, il fine-tuning: gli si mostrano esempi curati tratti dai tuoi documenti e il modello cambia il modo in cui si comporta, il tono, il formato, il vocabolario di un mestiere. La seconda è collegarlo ai tuoi documenti, la RAG: il modello resta com’è, ma quando arriva una domanda va a cercare nei tuoi file i pezzi che servono e li legge prima di rispondere. La regola per scegliere è semplice: si addestra per insegnare una forma, si dà un documento per aggiungere un fatto. Tutto quello che il modello legge prima di rispondere sta in uno spazio che si chiama finestra di contesto: le istruzioni, la conversazione fino a quel punto, gli allegati, i risultati delle ricerche. La finestra viene riletta per intero a ogni scambio ed è, in pratica, quanto il modello riesce a tenere a mente mentre lo usi. In tre anni la capienza è cresciuta enormemente: i primi modelli tenevano a mente un documento di poche pagine, quelli di oggi lavorano su testi di centinaia di pagine. Restano però dei limiti nella capacità di tenere l’attenzione su tutto quel materiale, e conviene conoscerli. Il capitolo si chiude con l’impianto completo, l’harness: il contesto, gli strumenti che il modello può usare, la memoria, il ciclo con cui rilegge quello che ha fatto e le istruzioni permanenti. Nessuna di queste cinque cose è il modello, e alcune non si comprano: le costruisci tu. È per questo che due persone con lo stesso abbonamento possono avere esperienze molto diverse.

    Perché leggerlo: è il capitolo che presenta tutte le componenti della IA che usiamo tutti i giorni. Ed è proprio utilizzando al meglio queste componenti che è possibile trarre i migliori risultati dalla IA. I capitoli successivi entrano nel dettaglio: la finestra di contesto torna nel capitolo sull’uso della chat, l’harness in quello sugli agenti, la RAG in quello sulla scelta di una soluzione. Va letto per intero; è breve, e la sezione sulla finestra di contesto è la più utile del libro per chi usa una chat tutti i giorni.

Il libro costruisce le basi in modo progressivo; gli articoli approfondiscono e aggiornano i singoli temi man mano che cambiano.

La maggior parte dei Large Language Model (LLM) oggi in uso genera testo seguendo un paradigma autoregressivo. In pratica, il modello produce un token alla volta, basandosi su quelli già generati. È lo stesso principio che governa molti modelli di linguaggio sin dagli inizi del deep learning: prevedere il prossimo elemento di una sequenza, aggiungerlo al contesto e ripetere il processo fino al completamento del testo.

Questo approccio ha dimostrato una straordinaria efficacia. Ha permesso di costruire modelli sempre più grandi, coerenti e capaci di gestire contesti complessi. Allo stesso tempo, però, porta con sé un limite strutturale: la generazione procede in modo rigidamente sequenziale. Anche su hardware altamente parallelo, come le GPU moderne, il modello è costretto ad "aspettare sé stesso" a ogni passo. È un collo di bottiglia che incide su velocità, costi e consumi energetici.

Negli ultimi anni, mentre l'hardware ha continuato a migliorare rapidamente, questo vincolo algoritmico è diventato sempre più evidente. È in questo contesto che si inserisce il lavoro di un gruppo di ricercatori di Apple, che ha esplorato un approccio alternativo alla generazione del linguaggio: la predizione multi-token.

Cos'è un token e perché conta

Per comprendere il cambiamento, è utile chiarire cosa sia un token. Un token è l'unità minima di testo elaborata da un modello di linguaggio. Può corrispondere a una parola intera, a una parte di parola o a un simbolo di punteggiatura. Le frasi vengono scomposte in sequenze di token, che il modello trasforma in rappresentazioni numeriche per calcolare le probabilità delle unità successive.

Nel paradigma autoregressivo, ogni token viene generato uno dopo l'altro. Il modello calcola la distribuzione di probabilità del token successivo, ne seleziona uno, lo aggiunge alla sequenza e ricomincia da capo. Questo garantisce coerenza locale e stabilità del processo, ma rende la generazione intrinsecamente lenta.

Il limite del paradigma autoregressivo

Il successo dell'approccio autoregressivo non è casuale. Predire il prossimo token è un problema ben definito, facilmente ottimizzabile e compatibile con l'architettura Transformer. È anche uno schema di addestramento stabile, che ha consentito la crescita dimensionale degli LLM.

Tuttavia, proprio questa semplicità introduce una dipendenza sequenziale rigida. Ogni passo richiede un'elaborazione completa del contesto corrente, anche quando il contenuto da generare è altamente prevedibile. In altre parole, l'architettura dei modelli è diventata più veloce del metodo con cui viene sfruttata.

L'idea alla base della predizione multi-token

La predizione multi-token nasce per superare questo limite. Invece di generare un solo token per iterazione, il modello viene addestrato a prevederne più di uno simultaneamente. Riducendo il numero di passaggi necessari, il flusso di generazione accelera in modo significativo.

Una metafora utile è quella del linguaggio umano. Quando parliamo, raramente costruiamo le frasi parola per parola senza una visione d'insieme. Spesso abbiamo già in mente una struttura, o almeno un frammento coerente, prima di articolare i singoli termini. Il multi-token cerca di avvicinare il comportamento del modello a questa logica: non eliminare la probabilità, ma estenderla su più posizioni future.

Dal punto di vista concettuale, il modello non prevede una sequenza rigida, ma una distribuzione congiunta di token futuri. È un piccolo spostamento cognitivo, che introduce una forma embrionale di pianificazione nella generazione del testo.

Come implementare il multi-token: due strade possibili

Un modo per ottenere questa capacità sarebbe addestrare un LLM da zero, progettando architetture e funzioni di perdita specifiche per la predizione multi-token. È una strada teoricamente valida, ma estremamente costosa in termini di dati, tempo e risorse computazionali.

I ricercatori di Apple propongono invece un approccio incrementale e pragmatico: partire da modelli già addestrati e abilitarli alla generazione multi-token attraverso meccanismi aggiuntivi. Questo rende la soluzione più sostenibile e facilmente integrabile nei sistemi esistenti.

Le maschere di predizione

Il primo elemento chiave sono le maschere di predizione. Durante l'addestramento, vengono inseriti token segnaposto, come [mask], alla fine della sequenza. Il modello viene istruito a completare simultaneamente più posizioni future.

Questo schema ricorda, in parte, il funzionamento dei modelli bidirezionali come BERT, ma con una differenza cruciale: qui l'obiettivo resta la generazione del testo. Il modello impara a "riempire buchi" futuri mantenendo coerenza semantica e sintattica su più token, anziché concentrarsi solo sul passo immediatamente successivo.

Il risultato è un addestramento che rafforza la capacità del modello di ragionare su blocchi di testo, non solo su transizioni locali.

Gli adapter LoRA come leva strategica

Il secondo elemento fondamentale sono gli adapter LoRA (Low-Rank Adaptation). Si tratta di moduli leggeri che si innestano su una rete neurale già addestrata, modificandone il comportamento senza alterarne i pesi principali.

Nel caso della predizione multi-token, LoRA consente di introdurre questa nuova modalità di generazione senza riaddestrare l'intero modello. Quando l'adapter è attivo, orienta la rete verso la produzione simultanea di più token; quando è disattivato, il modello torna al comportamento autoregressivo standard.

Questo aspetto è particolarmente rilevante. Il multi-token non diventa una caratteristica irreversibile del modello, ma una capacità attivabile. È un esempio concreto di AI modulare, in cui il "sapere" del modello resta stabile, mentre il suo comportamento operativo può essere adattato al contesto d'uso.

Il ruolo del controllore: verificare prima di integrare

Per preservare la qualità dell'output, il sistema introduce un controllore. Questo componente verifica la coerenza dei token previsti in anticipo rispetto al contesto. Se individua incongruenze o errori, può scartare o sostituire i token problematici prima che vengano integrati nella sequenza finale.

Il controllore svolge una funzione cruciale: separa la fase di proposta da quella di validazione. In questo modo riduce la propagazione degli errori, uno dei limiti più noti della generazione autoregressiva, in cui un token sbagliato può compromettere l'intera continuazione del testo.

Questa architettura anticipa un'evoluzione più ampia: modelli non più monolitici, ma composti da più componenti che collaborano, controllano e correggono il processo generativo.

I risultati sperimentali

Secondo i dati riportati dai ricercatori, l'approccio multi-token offre miglioramenti significativi in termini di velocità:

  • fino a cinque volte più rapido in compiti di calcolo e generazione di codice
  • fino a due volte e mezzo più veloce nelle conversazioni

Il tutto senza una perdita qualitativa rilevante. In molti casi, l'output risulta addirittura più fluido, perché la generazione avviene in blocchi coerenti anziché in una sequenza frammentata.

Perché la velocità è una questione strategica

Aumentare la velocità di generazione non significa solo migliorare l'esperienza utente. Ha implicazioni più ampie:

  • Risposte più immediate rendono le interazioni più naturali
  • Ridurre i cicli di inferenza aumenta l'efficienza computazionale
  • Minori operazioni significano consumi energetici più bassi
  • Una maggiore efficienza consente di servire più utenti con le stesse risorse

In un'epoca in cui l'impatto energetico e ambientale dell'AI è sotto crescente attenzione, questi aspetti diventano un vero vantaggio competitivo.

Un esempio pratico

Prompt: "Nel Rinascimento, Leonardo da Vinci è ricordato soprattutto per…"

Con un approccio autoregressivo, il modello genera il testo token dopo token, costruendo lentamente la risposta.

Con un approccio multi-token, può invece produrre direttamente un frammento coerente, ad esempio: "le sue opere d'arte come la Gioconda", con un controllo immediato di coerenza prima dell'integrazione nell'output finale.

Conclusione

La predizione multi-token rappresenta più di una semplice ottimizzazione prestazionale. È un segnale di maturazione dell'ecosistema dei Large Language Model. Dopo anni in cui l'attenzione si è concentrata quasi esclusivamente sulla scala dei modelli, emergono approcci che ripensano il modo in cui questi sistemi operano internamente.

Attraverso tecniche come le maschere di predizione, gli adapter LoRA e i sistemi di controllo, è possibile rendere i modelli più veloci, più efficienti e più sostenibili, senza sacrificare la qualità dell'output e senza dover ricominciare da zero.

È un passo nella direzione di un'AI meno "magica" e più consapevolmente ingegnerizzata. Un'AI che non solo sa parlare bene, ma lo fa in modo sempre più efficiente, controllato e responsabile.

Glossario
Token
Unità minima di testo elaborata dal modello
Autoregressivo
Modalità di generazione che produce un token per volta sulla base di quelli precedenti
Maschere
Segnaposto usati per addestrare il modello a completare posizioni multiple
Adapter LoRA
Modulo leggero che abilita nuove capacità senza riaddestramento completo
Controllore
Sistema di verifica della coerenza delle previsioni multi-token
Resta aggiornato

Un solo aggiornamento per articoli, eventi e nuove edizioni

Nuovi articoli sull'IA
Nuove edizioni del libro ed eventi