Perché la differenza tra gli assistenti IA non sta quasi più nel modello - sta in quello che gli viene costruito intorno
C'è un paradosso che chiunque segua l'IA ha davanti agli occhi, anche senza averlo messo a fuoco. I modelli di punta, nei test, sono ormai quasi indistinguibili: l'AI Index 2026 di Stanford documenta che a marzo 2026 i primi quattro modelli della classifica Arena erano separati da meno di 25 punti Elo - un anno prima il divario tra gli stessi primi quattro era di circa 97 punti. Anthropic a 1.503, xAI a 1.495, Google a 1.494, OpenAI a 1.481: scarti da fotofinish. Il report ne trae la conclusione ovvia: se la capacità del modello non distingue più i concorrenti, la competizione si sposta su costo, affidabilità, utilità nel lavoro reale.
Eppure l'esperienza d'uso, tra un prodotto e l'altro, resta abissalmente diversa. La stessa domanda posta a una chat ti restituisce una risposta generica; posta a un agente di ricerca ti restituisce un'analisi con le fonti; posta a un assistente che ha accesso ai tuoi file ti sistema il documento vero, quello a cui stavi lavorando. Come si conciliano le due cose - modelli quasi uguali, esperienze lontanissime?
Si conciliano con una distinzione che è la tesi di questo articolo: il modello linguistico è il motore, ma tu non guidi un motore. Guidi un'automobile. E due veicoli con lo stesso identico motore possono essere una berlina e un trattore.
Lo stesso motore, veicoli diversi
Il punto non è una metafora a effetto: è letteralmente ciò che accade. Il modello dentro un agente sofisticato è spesso lo stesso identico modello che usi nella chat gratuita - stessa rete, stessi pesi, stesso "cervello". Quello che cambia è l'architettura attorno: cosa il modello vede, cosa può toccare, cosa ricorda, come itera, cosa gli è stato insegnato sul tuo modo di lavorare. Chi costruisce questi sistemi lo dice senza giri di parole: Anthropic, nel suo testo di riferimento su come costruire agenti efficaci, descrive gli agenti come "tipicamente solo LLM che usano strumenti sulla base del feedback dell'ambiente, in un ciclo". Solo. Il valore non è nel componente, è nella costruzione.
Per il lettore di questo sito la conseguenza è concreta: quando confronti due assistenti e uno ti sembra "più intelligente" dell'altro, nella maggior parte dei casi non stai misurando i motori. Stai misurando le automobili.
Anatomia dell'intorno
Di cosa è fatto, questo intorno? Se hai seguito gli articoli dell'ultimo anno, i pezzi li hai già visti tutti - uno alla volta. Messi in fila, formano la carrozzeria completa.
Il primo componente è il contesto: cosa il modello ha davanti nel momento in cui risponde. Non ciò che "sa", ma ciò che vede - i documenti giusti, selezionati e puliti, dentro una finestra che ha limiti veri di capienza e soprattutto di attenzione. Un motore eccellente con il contesto sbagliato produce risposte eleganti e fuori bersaglio; la selezione di ciò che entra nella finestra vale spesso più di un modello superiore. È il principio su cui si regge anche la RAG.
Il secondo sono gli strumenti: le mani. Un modello da solo può soltanto parlare; collegato a ricerca web, file, calendari e sistemi aziendali può agire. Ho raccontato come lo standard MCP stia diventando la presa universale con cui questi collegamenti si fanno - e non è un dettaglio tecnico: decide quanta parte del tuo mondo l'assistente può toccare.
Il terzo è la memoria: cosa il sistema si porta dietro nel tempo. Le preferenze su di te sono il livello di base; il salto vero è la memoria del lavoro - a che punto siamo, cosa è stato deciso e perché - che distingue gli agenti episodici da quelli long-running. Stesso motore, con e senza memoria operativa: due specie diverse.
Il quarto è il loop: il processo con cui il sistema itera invece di rispondere di getto - agisce, osserva il risultato, corregge, riprova. Ne ho scritto in dettaglio nell'articolo sul loop. È il componente che trasforma un sistema che risponde in un sistema che indaga, ed è interamente "intorno": il motore dentro il ciclo è quello di sempre.
Il quinto sono le istruzioni: il mestiere che gli insegni. Le indicazioni permanenti su come lavori, i formati che pretendi, le competenze confezionate che gli metti a disposizione. È la differenza tra un motore generico e uno tarato sulla tua officina.
Nessuno di questi cinque componenti è il modello. Tutti e cinque determinano quello che vivi tu.
La lezione della dinamo
Se questa dinamica ti sembra nuova, la storia economica ha un precedente che le somiglia in modo quasi imbarazzante. L'ha raccontato l'economista Paul David in un articolo del 1990 diventato un classico, "The Dynamo and the Computer".
Quando il motore elettrico arrivò nelle fabbriche a fine Ottocento, la prima cosa che gli industriali fecero fu la più ovvia: sostituire la macchina a vapore con un grande motore elettrico, lasciando tutto il resto com'era - gli alberi di trasmissione, le cinghie, l'edificio a più piani costruito attorno alla vecchia fonte di potenza centrale. Risultato: guadagni di produttività modesti, per decenni. Il salto arrivò solo negli anni Venti, quando le fabbriche vennero ridisegnate attorno alle caratteristiche del nuovo motore - un motore piccolo per ogni macchina, capannoni a un piano, il layout dettato dal flusso dei materiali e non più dalla meccanica delle cinghie. Il valore non stava nel motore: stava nella riorganizzazione che il motore rendeva possibile, e che richiese una generazione per essere concepita.
Sostituisci "motore elettrico" con "modello linguistico" e il parallelo si scrive da solo. Infilare un LLM dentro un flusso di lavoro pensato per gli umani - la chat come sportello a cui fare domande - è l'equivalente del motore elettrico attaccato alle vecchie cinghie: funziona, ma rende una frazione del possibile. L'intorno di cui parlo in questo articolo - contesto, strumenti, memoria, loop, istruzioni - è l'equivalente del ridisegno della fabbrica. Ed è lì che si sta giocando la partita vera.
La parte dell'intorno che costruisci tu
C'è un corollario che mi sta a cuore, perché ribalta un atteggiamento diffuso: quello di chi aspetta che sia il fornitore a fare la differenza. Se il valore sta nell'intorno, allora la domanda "qual è il modello migliore?" - la più frequente che ricevo - è quasi sempre la domanda sbagliata. Quella giusta è: quale ambiente attorno al modello serve al mio lavoro? Che è poi il criterio che avevo proposto parlando di come scegliere una soluzione LLM in pratica.
Ma soprattutto: una parte dell'intorno non la compri - la costruisci tu. I documenti che metti a disposizione dell'assistente sono contesto. Le istruzioni permanenti che scrivi una volta e valgono per sempre sono mestiere insegnato. La memoria che gli lasci accumulare sul tuo lavoro è continuità. Due persone con lo stesso identico abbonamento allo stesso identico prodotto possono avere esperienze lontanissime, perché una ha attrezzato l'ambiente e l'altra no. La competenza da sviluppare, oggi, non è "saper scrivere il prompt perfetto" - è saper allestire l'officina: quali file, quali istruzioni, quale memoria, quali strumenti collegati. Cilindrata che aggiungi tu, non il fornitore.
Il motore conta ancora
E ora il contrappunto, perché la tesi detta senza contrappesi diventerebbe falsa. Il motore conta ancora, eccome. Ogni salto generazionale dei modelli sblocca cose che nessun intorno poteva compensare: gli agenti stessi sono diventati praticabili solo quando i motori hanno superato una certa soglia di affidabilità nel seguire istruzioni, usare strumenti, recuperare dai propri errori. Sotto quella soglia, il loop più elegante del mondo produce solo errori più veloci. E lo stesso AI Index che documenta la convergenza al vertice ricorda che gli agenti falliscono ancora circa un tentativo su tre: il margine di miglioramento del motore è tutt'altro che esaurito.
La formulazione onesta della tesi è quindi questa: a parità di generazione dei modelli, la differenza che vivi tu utente sta quasi tutta nell'intorno. E quando il motore salta di generazione, il primo effetto non è che le chat rispondono meglio - è che diventa possibile costruire un intorno nuovo, che prima non stava in piedi. Motore e carrozzeria si tirano a vicenda: è la carrozzeria a portare il progresso del motore fino a te.
La mappa
Se dovessi condensare l'ultimo anno di articoli di questo sito in una frase, sarebbe questa: ho descritto pezzi di carrozzeria. La finestra di contesto e la sua igiene, la memoria nelle sue forme, gli strumenti e il loro standard, il loop, gli agenti che durano nel tempo. Ognuno di quei pezzi, da solo, è un dettaglio tecnico. Insieme sono la risposta alla domanda con cui questo articolo è partito: perché, con motori ormai quasi uguali, alcuni assistenti ti cambiano il lavoro e altri restano giocattoli. Non è il motore. È l'automobile - e una parte del volante ce l'hai in mano tu.
Articoli correlati su Libro Vivo IA
- Chunking e finestra di contesto
- La risorsa scarsa dell'IA: l'attenzione
- Vincere mollando la presa: MCP, lo standard regalato
- Come far sì che l'IA si ricordi davvero di te
- Agenti episodici e agenti long-running: il vero salto della Agentic AI
- LLM in pratica: quale soluzione adottare
- RAG passo dopo passo
- Il loop: quello che trasforma un modello in un agente
