Capire

Le diverse forme di memoria della IA

Memoria strutturale, conversazionale, persistente e repository: come l'intelligenza artificiale gestisce il contesto

Pubblicato il 14 dicembre 202510 minuti di lettura
Le diverse forme di memoria della IA
memoriaLLMRAGAgentic AIfinestra di contestorepository
Questo tema nel libroParte I - Capire4 capitoli: apri la sintesi e leggi come iniziano

Questa parte ricostruisce da dove viene l’IA, come impara una macchina, come nascono i modelli di linguaggio e che cosa sta intorno al modello: fine-tuning, RAG, finestra di contesto, harness.

I capitoli di questa parte

  • Capitolo 1 · pagina 25Da dove viene l’IA che usi ogni giornoLa nascita dell’IA · Dove siamo oggi

    La chat che usi tutti i giorni nasce da una storia lunga settant’anni. Siamo nel 1950, l’epoca in cui i primi calcolatori entrano nei laboratori. Alan Turing, matematico inglese, si domandò se quelle macchine fossero in grado di pensare. Cercando la risposta si rese conto che il concetto stesso di “pensare” era difficile, se non impossibile, da definire. Cambiò allora prospettiva e concluse che il modo migliore per stabilire se una macchina pensa fosse una prova: se una persona, conversando con un calcolatore, non riesce a capire che sta parlando con una macchina, allora quella macchina ha superato il test. Sei anni dopo, a Dartmouth, John McCarthy diede un nome a quella che stava diventando una disciplina: “intelligenza artificiale, la scienza e l’ingegneria di creare macchine intelligenti”. Molti studiosi si dedicarono a quell’obiettivo, e in poco tempo si consolidarono due approcci diversi. Il primo diceva: scriviamo noi le regole, una per una, e la macchina le applica, come fa un programma tradizionale. Il secondo diceva: diamo alla macchina molti esempi e lasciamo che le regole se le ricavi da sola, con algoritmi ispirati ai neuroni del cervello. La prima strada diede presto risultati tangibili e sembrò la migliore, e lo rimase fino alla fine degli anni Ottanta. Poi, con il crescere della potenza di calcolo, con l’arrivo dei cosiddetti big data e grazie ad algoritmi sempre più raffinati, la seconda strada, quella delle reti neurali artificiali, ebbe la meglio. Nel 2012 una rete neurale profonda (deep neural network) vinse una gara di riconoscimento di immagini con un distacco che nessuno si aspettava. Negli anni seguenti arrivarono i modelli di linguaggio (i large language model), e il 30 novembre 2022 ChatGPT li mise a disposizione del grande pubblico, con una velocità di diffusione da record: oltre cento milioni di persone nei primi due mesi. Il capitolo racconta questa storia e si chiude con una panoramica di quello che l’IA sa fare oggi, dalle proteine alle auto senza conducente. Una cosa da tenere a mente per tutto il libro è la differenza fra le due strade: un programma tradizionale segue istruzioni scritte da qualcuno e dà sempre la stessa risposta; una rete neurale impara dai dati e risponde con la cosa probabilmente più giusta.

    Perché leggerlo: senza questa storia ogni annuncio sembra il primo, e non hai modo di pesarlo. È breve e si legge per intero in mezz’ora; per seguire il resto basta portarsi dietro la distinzione fra regole scritte a mano e regole ricavate dagli esempi, che torna in ogni capitolo.

  • Capitolo 2 · pagina 31Come impara una macchinaIA simbolica: i sistemi esperti · Machine learning: l’apprendimento dai dati · Machine learning tradizionale: la cassetta degli attrezzi · Deep learning: il salto di qualità · Reti neurali artificiali: architetture di base · Reti neurali artificiali: architetture avanzate

    Questo capitolo apre la macchina e racconta, un pezzo alla volta, come fa a imparare. La storia comincia dai sistemi esperti degli anni Sessanta e Settanta. Un esperto umano scriveva le regole, per esempio “se febbre e tosse, allora possibile influenza”, e un programma le applicava una dopo l’altra. Il metodo funzionava finché le regole erano poche; al primo caso che nessuno aveva previsto si rompeva. Il machine learning (l’apprendimento automatico) rovesciò il metodo: invece di scrivere le regole, si raccolgono molti esempi già risolti e si lascia che il programma trovi da solo le regolarità. Un albero decisionale, per esempio, impara da centinaia di pazienti quale domanda fare per prima per capire se un caso è urgente. Queste tecniche, insieme alle regressioni e alle foreste di alberi, decidono ancora oggi se concedere un prestito o come smistare la posta. Hanno però un limite: lavorano su caratteristiche dei dati che qualcuno ha già scelto per loro. Il deep learning fa il passo in più, perché la rete trova da sola che cosa guardare, ed è proprio quello che serve con le immagini, le frasi e i suoni. Per spiegare come, il capitolo parte dal neurone artificiale, il mattone di base delle reti: una somma pesata dei dati in ingresso, seguita da una piccola curva che si chiama funzione di attivazione. Mettendo insieme qualche neurone si ottiene una rete neurale, e con una rete di questo tipo il capitolo mostra come prevedere se uno studente supererà un esame a partire dai risultati di altri studenti prima di lui. Poi quella rete viene addestrata davvero: si parte con pesi scelti a caso, si misura l’errore e si correggono tutti i pesi insieme, un poco alla volta, per migliaia di giri, finché l’errore è il più piccolo possibile. Questo meccanismo, la discesa del gradiente con la backpropagation, è lo stesso che addestra i modelli da miliardi di parametri. Il capitolo si chiude con le quattro architetture che hanno reso possibile l’IA generativa: la diffusione, che impara a togliere il rumore da un’immagine; l’autoencoder, che comprime e ricostruisce; le GAN, due reti che si sfidano; e il Transformer, che con il meccanismo dell’attenzione legge tutte le parole di una frase insieme e decide quali contano per ciascuna.

    Perché leggerlo: è la parte che rende possibile tutto il resto. Senza sapere che cosa sono i pesi e come si addestrano, non è possibile capire davvero perché le risposte dei modelli possono essere sbagliate. Serve leggerlo tutto? No. Per seguire il libro bastano le sezioni sui sistemi esperti e sul machine learning tradizionale, più la sottosezione sul Transformer, in coda alla seconda sezione sulle reti neurali; il resto delle due sezioni sulle reti neurali, con i conti della rete a tre neuroni, si può saltare al primo giro e riprendere quando vorrai vedere come si arriva a quei numeri. Chi salta deve però almeno portarsi dietro tre parole e il loro significato: pesi, addestramento, attenzione.

  • Capitolo 3 · pagina 69I large language modelCome si addestra un modello di linguaggio · Grande non è sempre meglio: i modelli efficienti · Nuove tecniche per migliorare le capacità degli LLM · Chi fa gli LLM, e come li rilascia · Le architetture, in ordine di tempo

    I modelli di linguaggio, i large language model o LLM, sono l’intelligenza artificiale con cui hai a che fare tutti i giorni, e questo capitolo racconta come nascono e chi li costruisce. Un LLM è una rete neurale addestrata a fare una cosa sola: leggere un pezzo di testo e indovinare la parola che viene dopo. Sembra un compito modesto, ma per farlo bene la rete deve assorbire la grammatica, i fatti e i ragionamenti che stanno dietro le parole, ed è così che impara a rispondere, riassumere e tradurre. Tre grandezze decidono quanto un modello è bravo a prevedere la parola successiva: quanti parametri ha, cioè quanti pesi aggiusta mentre impara; quanto testo ha visto; quanto calcolo è servito per addestrarlo. Nel 2020 ci si accorse che l’errore cala in modo regolare quando le tre grandezze crescono. Sono le cosiddette leggi di scala, e da quella scoperta è partita la corsa a costruire modelli sempre più grandi. Il costo di addestramento, però, sale in fretta, e il capitolo racconta le strade che si stanno percorrendo per contenerlo: modelli più piccoli ma addestrati molto più a lungo, oppure pesi scritti con pochi bit, cioè numeri con meno decimali. Presenta poi due tecniche che negli ultimi anni hanno migliorato i risultati a parità di dimensioni: far scrivere al modello un ragionamento prima della risposta, che è l’idea dei modelli di ragionamento, e organizzarlo dentro come una squadra di specialisti che si attivano solo quando servono, la Mixture of Experts. Il capitolo si chiude con chi costruisce questi modelli e come li rilascia: a pesi chiusi, che restano sui server di chi li ha prodotti, oppure a pesi aperti, scaricabili e modificabili; e con quello che ciascun laboratorio ha scelto di vendere.

    Perché leggerlo: qui impari a capire le caratteristiche di un modello nuovo da solo, e ne esce uno al mese. La prima sezione, l’addestramento e le leggi di scala, aiuta a capire come mai leggiamo sui giornali tutti i giorni della corsa alla costruzione di data center sempre più grandi. La sezione sui laboratori si può attraversare in fretta e riprendere quando ti serve un nome.

  • Capitolo 4 · pagina 83Che cosa sta intorno al modelloAdattare un modello al proprio materiale · La finestra di contesto · Capienza e attenzione · L’harness: l’impianto attorno al modello

    Lo stesso modello, dentro due prodotti diversi, può dare risultati lontanissimi. La differenza la fa quello che gli sta intorno, e questo capitolo lo descrive dall’interno verso l’esterno. Un modello appena addestrato ha una conoscenza generale molto ampia, che viene dal materiale su cui è stato addestrato, ma non sa niente di te e del tuo lavoro. Per portarlo sul tuo materiale ci sono due strade. La prima è riaddestrarlo un poco, il fine-tuning: gli si mostrano esempi curati tratti dai tuoi documenti e il modello cambia il modo in cui si comporta, il tono, il formato, il vocabolario di un mestiere. La seconda è collegarlo ai tuoi documenti, la RAG: il modello resta com’è, ma quando arriva una domanda va a cercare nei tuoi file i pezzi che servono e li legge prima di rispondere. La regola per scegliere è semplice: si addestra per insegnare una forma, si dà un documento per aggiungere un fatto. Tutto quello che il modello legge prima di rispondere sta in uno spazio che si chiama finestra di contesto: le istruzioni, la conversazione fino a quel punto, gli allegati, i risultati delle ricerche. La finestra viene riletta per intero a ogni scambio ed è, in pratica, quanto il modello riesce a tenere a mente mentre lo usi. In tre anni la capienza è cresciuta enormemente: i primi modelli tenevano a mente un documento di poche pagine, quelli di oggi lavorano su testi di centinaia di pagine. Restano però dei limiti nella capacità di tenere l’attenzione su tutto quel materiale, e conviene conoscerli. Il capitolo si chiude con l’impianto completo, l’harness: il contesto, gli strumenti che il modello può usare, la memoria, il ciclo con cui rilegge quello che ha fatto e le istruzioni permanenti. Nessuna di queste cinque cose è il modello, e alcune non si comprano: le costruisci tu. È per questo che due persone con lo stesso abbonamento possono avere esperienze molto diverse.

    Perché leggerlo: è il capitolo che presenta tutte le componenti della IA che usiamo tutti i giorni. Ed è proprio utilizzando al meglio queste componenti che è possibile trarre i migliori risultati dalla IA. I capitoli successivi entrano nel dettaglio: la finestra di contesto torna nel capitolo sull’uso della chat, l’harness in quello sugli agenti, la RAG in quello sulla scelta di una soluzione. Va letto per intero; è breve, e la sezione sulla finestra di contesto è la più utile del libro per chi usa una chat tutti i giorni.

Il libro costruisce le basi in modo progressivo; gli articoli approfondiscono e aggiornano i singoli temi man mano che cambiano.

Il concetto di memoria all'interno dell'intelligenza artificiale ha assunto negli ultimi anni un ruolo sempre più centrale. In una fase iniziale, parlare di memoria significava quasi esclusivamente riferirsi alla conoscenza appresa durante l'addestramento. Un sapere distribuito nei pesi della rete neurale, che consente al modello di riconoscere strutture linguistiche, relazioni semantiche e schemi ricorrenti, producendo risposte coerenti. Una "memoria strutturale" del modello. Questa memoria è fondamentale, perché definisce ciò che il modello è in grado di comprendere sul mondo. Allo stesso tempo, però, non riguarda l'utente, i suoi progetti o le sue preferenze. È una memoria stabile, che rimane invariata finché non interviene un nuovo ciclo di addestramento.

A questa memoria strutturale si aggiunge una seconda forma di memoria, legata al dialogo. È la "memoria conversazionale", quella che permette al modello di mantenere il filo di una discussione, riprendere un concetto espresso poco prima, adattarsi alle osservazioni dell'utente o correggersi nel corso della stessa sessione. Questa dimensione coincide con ciò che il modello riesce a "vedere" nella finestra di contesto. È essenziale per la continuità immediata dell'interazione, ma è per sua natura effimera. Quando la conversazione termina o diventa troppo lunga, le informazioni più vecchie escono dal contesto e cessano di influenzare le risposte. Non si costruisce alcuna continuità nel tempo, né una vera identità dell'interazione.

La crescente complessità dei compiti ha reso evidente la necessità di un terzo livello di memoria: la "memoria persistente". Questa memoria non riguarda ciò che il modello sa del mondo, ma ciò che il sistema conserva o ricava sull'utente che lo utilizza. Può contenere preferenze operative, convenzioni stilistiche, indicazioni sul modo di lavorare e informazioni sui progetti. Non coincide necessariamente con un archivio integrale delle chat: può essere composta da ricordi salvati, voci categorizzate o sintesi aggiornate. Contenuti, controlli e tempi di conservazione dipendono però dalla piattaforma, quindi vanno gestiti con la stessa attenzione riservata agli altri dati personali.

A queste forme di memoria interne si è ora aggiunto un elemento esterno che sta diventando sempre più centrale nel lavoro digitale: il "progetto". Il progetto è un ambiente di lavoro che raccoglie file, documenti, bozze, dataset e materiali riferiti a una stessa iniziativa. Non è una memoria dell'intelligenza artificiale, ma una repository strutturata che il sistema può esplorare e interrogare quando serve. I contenuti non vengono incorporati nel modello, ma restano risorse attive che l'IA consulta ogni volta che deve rispondere o prendere una decisione. Il progetto rappresenta una memoria del compito, distinta sia dalla memoria dell'utente sia da quella strutturale del modello, e rende possibile lavorare su testi lunghi, versioni successive e materiali complessi senza perdere il contesto operativo. È utile chiamarla memoria del compito, anche se tecnicamente si tratta di una memoria esterna: non vive nei pesi del modello, ma in un ambiente di lavoro consultabile.

L'uso combinato di queste quattro dimensioni, memoria strutturale del modello, memoria conversazionale, memoria persistente dell'utente e progetto come repository, costituisce oggi l'architettura tipica dei sistemi di intelligenza artificiale più evoluti.

La figura seguente sintetizza dove "vive" ciascuna forma di memoria e come viene richiamata durante l'interazione.

Figura 1: Le diverse forme di memoria nei sistemi di intelligenza artificiale contemporanei

Le diverse piattaforme adottano nomi e soluzioni tecniche differenti, ma la logica sottostante è comune. ChatGPT affianca ricordi salvati, cronologia e una sintesi della memoria che l'utente può ispezionare e correggere. Claude organizza la memoria in voci aggiornate in tempo reale, con spazi separati per i progetti e possibilità di importazione ed esportazione; questa memoria non è attualmente disponibile in Cowork. Gemini costruisce parte del contesto attraverso documenti e servizi dell'ecosistema Google, mentre Copilot può appoggiarsi al Microsoft Graph nell'ambiente aziendale. In tutti i casi emerge la stessa struttura di fondo: conoscenza del modello, contesto temporaneo, memoria persistente, repository e meccanismi di recupero che fanno da ponte tra questi livelli.

L'integrazione tra memorie, repository, strumenti e capacità di azione apre la strada a sistemi in grado non solo di generare testo, ma di collaborare, organizzare e prendere iniziative in ambienti digitali complessi. È una trasformazione che sta cambiando in profondità il modo in cui interagiamo con l'intelligenza artificiale e, sempre più spesso, il modo stesso in cui il lavoro digitale viene organizzato.

Come funziona la memoria conversazionale nei modelli linguistici e che cosa accade quando la conversazione diventa troppo lunga

Il modello non conserva la conversazione come un ricordo umano: a ogni turno lavora sul contesto che la piattaforma gli prepara. La finestra ha una dimensione finita e, nelle conversazioni molto lunghe, le parti iniziali possono essere escluse, sintetizzate o recuperate selettivamente. Anche quando un'informazione è ancora presente, può ricevere meno attenzione in mezzo a molto materiale. Se regole o decisioni importanti non vengono consolidate in una sintesi, in istruzioni stabili o nella documentazione di progetto, rischiano quindi di indebolirsi con il procedere del lavoro.

A questa dinamica si aggiunge un secondo effetto. Le conversazioni lunghe contengono spesso tentativi, versioni intermedie, riscritture e correzioni. Il modello non distingue queste fasi come tappe di un processo, ma le legge tutte come testo potenzialmente valido. In assenza di una sintesi esplicita che chiarisca quale versione è definitiva, il sistema può attingere a istruzioni superate, generando incoerenze o deviazioni di stile.

Un terzo aspetto riguarda il rapporto tra informazione utile e rumore. Più il contesto si amplia, più l'attenzione del modello si distribuisce su elementi secondari. Le istruzioni decisive rischiano di essere indebolite dalla presenza di materiale che non è più rilevante, ma che resta comunque visibile. Quando il rumore supera una certa soglia, la qualità delle risposte può degradare. In presenza di istruzioni in conflitto, il modello non ha modo di distinguere automaticamente quale sia quella definitiva se non viene esplicitata nel contesto.

Per questo i sistemi moderni affiancano alla memoria conversazionale sia la memoria persistente sia i progetti. Le preferenze salvate nella memoria persistente non dipendono dalla lunghezza del dialogo e continuano a essere applicate anche in nuove sessioni. I file presenti nel progetto svolgono invece la funzione di memoria stabile del contenuto. Non diventano ricordi del modello, ma risorse consultabili che permettono di recuperare lo stato del lavoro senza affidarsi alla cronologia della chat.

Quando una conversazione diventa troppo lunga, è utile fermarsi e chiedere una sintesi ordinata delle decisioni finali e delle regole operative. Questa sintesi può essere trasferita in una nuova chat, creando un contesto pulito e privo dei residui delle fasi preliminari. Dichiarare esplicitamente quale versione è definitiva riduce l'ambiguità e migliora la coerenza. Nei progetti complessi è spesso preferibile ancorarsi ai file piuttosto che al flusso della conversazione. I file rappresentano la fonte stabile della verità, mentre la chat resta uno strumento operativo.

Chiedere periodicamente al modello un riepilogo coerente delle scelte compiute è un modo semplice ed efficace per mantenere ordine. Questa operazione filtra il rumore, riporta l'attenzione sulle decisioni chiave e permette di correggere eventuali deviazioni prima che si consolidino. È così che si gestiscono in modo consapevole i limiti della finestra di contesto, sfruttando al meglio la memoria persistente e i progetti quando si lavora su testi lunghi o percorsi che maturano nel tempo.

Cosa cambia con la Agentic AI

Con l'emergere dell'Agentic AI, questo assetto viene riorganizzato attorno all'azione. L'agente non è più un modello che risponde a una richiesta, ma un sistema che pianifica, esegue operazioni, valuta i risultati e adatta il proprio comportamento in funzione di un obiettivo. Un chatbot produce risposte; un agente produce cambiamenti verificabili nello spazio di lavoro. In questo scenario il progetto assume un ruolo operativo centrale. Non diventa una memoria interna dell'agente, ma uno spazio di lavoro esterno che riflette lo stato delle attività in corso.

Il progetto non serve solo a conservare materiali o contesti, ma a rendere visibile e verificabile ciò che è già stato fatto, ciò che è in corso e ciò che resta da fare. In questo modo l'agente può evitare duplicazioni, riconoscere errori già compiuti, aggiornare il progresso del lavoro e coordinare strumenti esterni senza affidarsi al ricordo della conversazione. Il "progetto" cambia quindi natura. Non è più una semplice raccolta di documenti, ma l'ambiente in cui l'azione si svolge e il luogo dove restano tracciate le operazioni eseguite. La memoria conversazionale, persistente e strutturale continua a esistere, ma il progetto diventa il punto di riferimento principale per organizzare il lavoro. In pratica, il progetto diventa la "memoria operativa" dell'agente, distinta sia dal ricordo conversazionale sia dalle preferenze dell'utente.

Nel passaggio dagli assistenti conversazionali agli agenti, l'attenzione si sposta quindi dalla risposta corretta all'azione corretta. Non si tratta solo di generare un testo, ma di modificare file, attivare strumenti, verificare risultati e pianificare ulteriori passi. Il progetto, in questo nuovo contesto, diventa il luogo dove l'agente traccia ciò che ha già fatto e dove conserva i risultati intermedi. È attraverso il progetto che l'agente rende il proprio lavoro ispezionabile e controllabile da parte dell'utente, permettendo una collaborazione trasparente e un intervento correttivo in qualsiasi momento.

Questo cambiamento segna un passaggio importante. L'intelligenza artificiale non genera più solo contenuti, ma agisce in uno spazio di lavoro definito. La memoria non serve più solo a mantenere la coerenza conversazionale, ma a coordinare operazioni complesse, evitare errori e garantire che ogni azione contribuisca all'obiettivo finale. È un'architettura che sta ridefinendo il modo in cui progettiamo i sistemi di intelligenza artificiale e il modo in cui collaboriamo con loro.

Cosa non è la memoria

Quando si parla di memoria nei sistemi di intelligenza artificiale, è importante chiarire anche cosa non è. La memoria che il sistema conserva non equivale alla coscienza di un ricordo, come avviene nell'esperienza umana. Non c'è consapevolezza né un senso del tempo che scorre. Il modello non sa di ricordare qualcosa, ma semplicemente applica il proprio stato interno (la memoria strutturale), rilegge ciò che rientra nella finestra di contesto (memoria conversazionale), consulta preferenze esplicite salvate dall'utente (memoria persistente) o accede a documenti nel progetto quando necessario.

La memoria non è inoltre uno strato che cresce progressivamente, accumulando tutto ciò che avviene. Non è un archivio che registra ogni interazione nel tempo per costruire una storia personale. Il modello non costruisce una biografia della relazione con l'utente, né conserva un diario permanente delle conversazioni passate. Memorizza solo ciò che viene esplicitamente salvato, e solo nei limiti della struttura tecnica che gli viene offerta. La memoria persistente non cresce automaticamente: viene popolata tramite scelte consapevoli, e la memoria conversazionale esiste solo all'interno della finestra di contesto attiva. Quando una conversazione si chiude, ciò che non è stato esplicitamente salvato cessa di esistere per il sistema.

Un altro aspetto importante riguarda la distinzione tra memoria e addestramento. Salvare una preferenza nella memoria persistente non modifica il modello. L'intelligenza artificiale non impara nuovi concetti né aggiorna le proprie capacità attraverso le interazioni con l'utente. Le preferenze non modificano i pesi della rete neurale, ma creano uno strato di configurazione sopra il modello. È una differenza tecnica rilevante. L'addestramento conferisce conoscenze generali e capacità linguistiche, mentre la memoria offre orientamento operativo. L'uno non sostituisce l'altro, e la memoria non compensa una conoscenza che il modello non possiede.

Infine, la memoria non è sinonimo di comprensione profonda. Ricordare una preferenza o riprendere un'informazione dalla conversazione non significa che il sistema abbia colto pienamente il significato di un'esperienza condivisa o abbia sviluppato un'intuizione più sofisticata su come preferisci lavorare. La memoria permette coerenza e personalizzazione, ma resta un meccanismo di recupero e applicazione di regole esplicite o di contesto attivo. Non va confusa con una crescita progressiva della comprensione.

Resta aggiornato

Un solo aggiornamento per articoli, eventi e nuove edizioni

Nuovi articoli sull'IA
Nuove edizioni del libro ed eventi