Come usare gli LLM

LLM e numeri: come l'acqua e l'olio

Un testo sbagliato lo vedi, un numero sbagliato no - e cosa fare, in pratica, per fidarsi delle risposte

Pubblicato il 6 agosto 202610 minuti di lettura
LLM e numeri: come l'acqua e l'olio
LLMnumeridatiaffidabilitàtabelleSQL
Questo tema nel libroParte II - Come usare gli LLM3 capitoli: apri la sintesi e leggi come iniziano

Questa parte spiega come ottenere quello che ti serve da una chat, cosa cambia quando il modello diventa un agente e come riconoscere i tre modi in cui un modello sbaglia: invenzione, compiacenza, errore di calcolo.

I capitoli di questa parte

  • Capitolo 5 · pagina 95Ottenere quello che ti servePrompt engineering: come parlare ai modelli · Quando la chat si satura · La memoria degli LLM · Come far sì che l’IA si ricordi di te

    Il modello non impara niente mentre gli parli: i suoi pesi sono stati fissati mesi prima e restano fermi per tutta la conversazione. Quello che separa una risposta generica da una calibrata su di te sta in ciò che gli metti davanti e nel modo in cui glielo chiedi. Il capitolo racconta le tre cose che dipendono da te, e alla terza dedica due sezioni. La prima è la richiesta. Dare al modello un ruolo, spiegargli il contesto, dirgli in che formato vuoi la risposta, che cosa deve fare e che cosa no, cambia il risultato più di un cambio di modello; e due o tre esempi di quello che intendi valgono più di una lunga spiegazione. La seconda è accorgersi quando una conversazione è diventata troppo lunga e il modello comincia a perdere lucidità: l’assistente chiede cose che gli avevi già detto, o contraddice una decisione presa poco prima. Succede perché i messaggi più vecchi sono usciti dalla finestra di contesto, e accanirsi rispiegando ogni volta l’errore non serve. Il rimedio è chiedergli un passaggio di consegne e ripartire in una chat nuova. La terza è la memoria. Un chatbot ricorda per cinque vie diverse: quello che ha imparato in addestramento, che è come il suo DNA; la conversazione che ha davanti; un profilo su di te che il prodotto gli passa all’inizio di ogni chat; i materiali di un progetto; e gli strumenti con cui va a cercare le informazioni che gli servono. Conoscere le caratteristiche e i limiti di questi cinque tipi di memoria cambia molto l’esperienza d’uso.

    Perché leggerlo: sono le competenze che rendono da subito, su una chat qualunque, senza comprare niente, e sono il presupposto dei due capitoli che seguono. Leggilo per intero e con la chat aperta: ogni tecnica si prova in trenta secondi su una conversazione tua.

  • Capitolo 6 · pagina 103Dall’assistente all’agenteChe cosa si intende per “Agentic AI” · I quattro pilastri dell’Agentic AI · Sfide dell’Agentic AI: autonomia, sicurezza e responsabilità · Controllare gli agenti: architetture, limiti e supervisione · Dagli agenti episodici agli agenti long-running · L’attenzione come risorsa scarsa: i sistemi multi-agente · Chi costruisce gli agenti, e con quale idea

    Un agente fa la cosa di cui un modello ti parla soltanto. Se chiedi a un modello un’email di ringraziamento, ottieni il testo; se la chiedi a un agente, ti apre la posta, compila il destinatario e la manda. Il capitolo spiega che cosa permette al modello di avere questa autonomia e come si tiene sotto controllo. Il meccanismo è più semplice di quanto il marketing lasci intendere: un agente è un modello che usa strumenti dentro un ciclo. Riceve un obiettivo, compie un’azione, legge il risultato, decide la mossa successiva, e si ferma quando l’obiettivo è raggiunto o quando finiscono i tentativi. Quattro cose distinguono un vero agente da una chat con qualche funzione in più: una memoria che dura oltre la singola conversazione, la capacità di pianificare una sequenza di passi, l’uso di strumenti esterni e un’autonomia controllata, cioè confini entro cui può agire da solo e punti in cui deve chiedere. C’è però un’avvertenza. Gli agenti rendono dove qualcuno può giudicare ogni passo, come i test nel codice; altrove gli errori si accumulano in silenzio, e un passo sbagliato diventa la premessa di quello dopo. Per questo il controllo si distribuisce su quattro livelli, dai dati a cui l’agente può accedere fino alla persona che approva. Il capitolo si chiude con due frontiere: gli agenti che lavorano per giorni, che hanno bisogno di una memoria del lavoro in corso che i prodotti di oggi ancora non danno, e i sistemi in cui più agenti si dividono il compito, perché l’attenzione di uno solo non basta.

    Perché leggerlo: la delega a un agente è una delle cose che il libro promette di farti saper fare, e questo capitolo dice che cosa stai delegando quando la fai. Le sezioni sul ciclo, sui quattro pilastri, sulle sfide e sul controllo servono per seguire il capitolo sul ridisegno del lavoro. Le due sull’orizzonte, gli agenti che lavorano per giorni e i sistemi di più agenti, si possono rimandare senza perdere il filo; l’ultima, su chi li costruisce, si legge quando ti serve un nome.

  • Capitolo 7 · pagina 117Quando il modello sbagliaQuando l’IA inventa: il problema delle allucinazioni · Quando l’IA ti dà ragione: la sicofanzia · Quando l’IA fa i conti: un problema di significato

    Una risposta sbagliata arriva con lo stesso tono di una giusta, nella stessa forma ordinata, nello stesso mezzo secondo. Non c’è un’esitazione che la distingua: te ne accorgi dopo, quando qualcuno controlla un numero o apre una fonte che non esiste. Il capitolo racconta tre modi in cui un modello può sbagliare. Si somigliano nell’aspetto, ma richiedono controlli diversi. Il primo è l’invenzione: il modello afferma qualcosa che non esiste, una sentenza, un articolo di legge, una citazione. Succede perché il modello non consulta un archivio: prevede la continuazione più probabile del testo, e quando su un argomento ha visto poco produce qualcosa che ha l’aspetto di un fatto. Il rischio sale in quattro situazioni riconoscibili: i riferimenti, i fatti rari, i numeri che nessuno ha mai pubblicato e il dettaglio falso dentro una risposta per il resto giusta. Il secondo è la compiacenza: il modello ti dà ragione anche quando hai torto, perché ha imparato che la risposta compiacente è quella che preferisci. Nasce dall’addestramento, dove le persone premiano le risposte in linea con le loro aspettative, e continua nell’uso; per questo “sei sicuro?” è il controllo meno affidabile di tutti. Il terzo è l’errore di calcolo: i dati sono veri e l’operazione è sbagliata, per esempio somma le percentuali o fa la media delle medie, e un numero sbagliato ha la stessa faccia di uno giusto. Per ciascuno dei tre il capitolo dà un controllo che costa poco: verificare che la fonte esista prima di leggere che cosa dice, e chiedere se un numero è un dato o una stima; far difendere al modello la sua risposta prima di cambiarla; far scrivere il calcolo in una forma che si possa rieseguire. La regola generale è una sola: il tono con cui il modello risponde non dice niente sulla sua accuratezza.

    Perché leggerlo: è il capitolo della seconda promessa, e il più utile da solo: vale per la chat, per l’agente e per qualunque sistema della parte aziendale. Va letto tutto, e le tre sezioni in ordine, perché il controllo istintivo contro il primo errore innesca il secondo. Se di questo libro leggi tre capitoli, questo è uno dei tre.

Il libro costruisce le basi in modo progressivo; gli articoli approfondiscono e aggiornano i singoli temi man mano che cambiano.

Un testo sbagliato lo vedi, un numero sbagliato no - e cosa fare, in pratica, per fidarsi delle risposte

Acqua e olio non si mescolano. E la soluzione non è agitare più forte.

Fai un esperimento. Prendi il file dove segni le spese di casa e caricalo in una chat con l'IA. Chiedi: "quanto ho speso in ristoranti quest'anno?". La risposta arriva in pochi secondi: un numero pulito, credibile, magari con il confronto sull'anno scorso. Sembra il compito più facile del mondo - i dati sono lì, ordinati in righe e colonne, nessuna frase ambigua da interpretare. È invece uno dei problemi su cui l'IA inciampa di più, per una ragione che non c'entra con la matematica.

Su questo sito ho raccontato come l'IA legge i documenti - la RAG, il chunking. Non ho mai raccontato come se la cava con le tabelle: fogli di calcolo, database, archivi - tutto ciò che è fatto di righe, colonne e numeri. La tesi di questo articolo è secca: il modo di rendere affidabile un'IA sui numeri non è renderla più brava a calcolare. È toglierle il calcolo di mano. E stavolta, oltre alla tesi, c'è il manuale: le mosse concrete, una per una.

Un testo sbagliato lo vedi, un numero sbagliato no

Prima il perché, che sta tutto in un'asimmetria. Se chiedi un riassunto e dentro c'è una frase falsa, hai buone probabilità di accorgertene: la frase stona, contraddice qualcosa che sai. Un numero sbagliato no. "1.340 euro" ha esattamente lo stesso aspetto di "1.430 euro": stessa forma, stessa faccia tranquilla. L'unico modo di smascherarlo è rifare il conto - ma se devi rifare il conto ogni volta, l'assistente non ti serviva.

E non è un sospetto: è misurato. Nelle gare internazionali in cui i sistemi di IA rispondono a domande su veri database, le persone esperte danno la risposta giusta 93 volte su 100; i migliori sistemi al mondo si fermano a 82 - quasi un errore ogni cinque risposte, sui dati preparati per la gara. Su database aziendali veri, disordinati come sono le cose vere, uno dei modelli più diffusi è passato da 87 risposte giuste su 100 a 10.

Il punto è che il modello non sbaglia i conti: sbaglia il significato. Somma le percentuali (se in ognuno dei quattro trimestri il tuo bar ha servito il 30% del quartiere, il foglio dichiara che hai servito il 120% del quartiere). Fa la media delle medie senza pesarle (la 3A ha 8 di media ma sono in dieci, la 3B ha 6 ma sono in trenta: la media della scuola non è 7). Somma i saldi (1.000 euro sul conto a fine gennaio e 1.000 a fine febbraio non fanno 2.000: il saldo si guarda, non si somma). E tratta il buco come zero (il mese in cui non hai segnato le spese non è un mese in cui hai speso zero). Chiunque vada di fretta inciampa negli stessi errori - ma noi, davanti al bar che serve il 120% del quartiere, ci fermiamo. Il modello no: risponde con la stessa calma con cui dà la risposta giusta, e quella calma è identica nei due casi.

Chiudere la cucina, scrivere il menù

Come se ne esce? Non rendendo il cuoco più bravo: chiudendo la cucina. Se il modello inventa il calcolo ogni volta, l'errore possibile è infinito e invisibile. Se sceglie da un menù di risposte già preparate, l'errore possibile è uno solo ed è visibile: ha portato il piatto sbagliato, e te ne accorgi perché sul piatto c'è scritto il nome. Chi segue questo sito riconosce il filone: è ancora una volta l'intorno, non il motore. Non si cambia l'IA: si cambia ciò che le sta attorno.

Ecco il menù tradotto in pratica: una mossa zero e cinque mosse. Valgono per un'azienda con un database come per una persona con un foglio di calcolo - cambia la scala, non la logica.

Mossa zero: porta i dati in forma di tabella. È la parte di cui nessuno parla ed è quasi sempre la più lunga. I dati raramente nascono ordinati: arrivano da esportazioni di programmi in formati tecnici, da PDF, da fogli compilati a mano - con le date scritte in tre modi, le celle unite, i "N.D." infilati in mezzo ai numeri. Prima di qualunque domanda vanno portati alla forma più noiosa e più preziosa che esista: una riga per ogni fatto, una colonna per ogni caratteristica, formati uniformi. E qui l'IA aiuta, ma nel modo giusto: non chiederle di "leggere" il file disordinato ogni volta - ogni lettura può andare diversa dalla precedente - ma di scrivere lo script che lo trasforma. Scritto una volta, controllabile, riusabile a ogni nuova estrazione.

Prima mossa: scrivi le definizioni. Prima di collegare l'IA ai dati, si mette per iscritto l'elenco delle domande che devono avere risposta, e per ognuna la regola del calcolo. Per una ferramenta potrebbero essere tre righe: "Incasso del mese: somma degli scontrini. Clienti abituali: chi ha comprato almeno due volte negli ultimi novanta giorni, contati all'ultimo giorno del mese. Sconto medio: media pesata sul valore degli acquisti, non media semplice". Sembra burocrazia, è il contrario: sono le decisioni sui numeri prese una volta sola, a mente fredda, invece che improvvisate dal modello a ogni domanda. All'IA resta il compito in cui è brava davvero: capire quale definizione serve.

Seconda mossa: metti in ordine i nomi. Guarda la rubrica del telefono: lo stesso amico salvato tre volte, "Marco", "Marco Rossi", "Rossi Marco idraulico". Nei dati succede lo stesso, con fornitori e clienti. L'IA capisce benissimo che sono la stessa cosa, ed è proprio questo il pericolo: lo decide ogni volta da capo, e ogni volta può deciderlo in modo leggermente diverso. Lunedì raggruppa due varianti, giovedì tre, e i totali ballano senza che nessuno abbia sbagliato. La soluzione è una tabellina di due colonne - nome ufficiale, varianti accettate - e la regola che ogni dato nuovo passa di lì. Sui numeri la coerenza vale più dell'intelligenza: meglio una regola fissa scritta una volta che un genio che improvvisa ogni volta.

Terza mossa: etichetta ogni numero. Ogni valore dovrebbe portare con sé la propria qualità: misurato, stimato, mancante. Basta una colonna in più. La regola d'oro è una sola: il "mancante" non deve mai trasformarsi in zero, perché zero è un valore e la mancanza è un'altra cosa. E insieme viaggia la provenienza: la differenza tra una risposta e una risposta di cui fidarsi è poter chiedere "da quale riga l'hai preso?". Quasi mai controllerai davvero - ma serve poter controllare.

Quarta mossa: dichiara i confini. La cosa che quasi nessuno fa: scrivere che cosa i dati non possono dire. "Le vendite partono dal 2021, prima non c'è nulla. I resi non sono tracciati. Il margine non si può calcolare, mancano i costi." Tre frasi così, date all'IA insieme ai dati, cambiano la natura degli errori possibili: il fallimento peggiore non è la risposta sbagliata a una domanda legittima, è la risposta sicura a una domanda a cui non si poteva rispondere. Un assistente che una volta su cento dice "questo non lo so" è un assistente di cui puoi fidarti le altre novantanove.

Quinta mossa: fai tornare i conti due volte. Questa è vecchia di cinque secoli. Nel 1494 esce a Venezia la "Summa de arithmetica" di Luca Pacioli, il primo libro a stampa che spiega la partita doppia - un metodo che i mercanti veneziani usavano già, e che Pacioli codifica e diffonde. L'idea: ogni operazione si registra due volte, in due colonne diverse, e alla fine le colonne devono tornare uguali. Non rende i contabili più bravi a fare i conti: rende gli errori visibili. Con l'IA funziona identica, in due varianti. Tieni da parte quattro o cinque domande di controllo di cui conosci già la risposta, e rifalle dopo ogni modifica ai dati: se le risposte note tornano, la fiducia sulle altre cresce. Oppure chiedi lo stesso numero per due strade diverse - il totale dell'anno e la somma dei dodici mesi - e confronta: se non coincidono, c'è un errore che da solo non si sarebbe mai dichiarato. E tra le domande di controllo mettine un paio a cui il sistema deve saper rispondere "non lo so": misurare la qualità del non rispondere vale quanto misurare le risposte.

Queste mosse insieme sono l'uovo nella maionese. Olio e aceto agitati con energia sembrano mescolarsi - è l'effetto demo, il prototipo che in riunione risponde giusto alle cinque domande preparate, e si separa la settimana dopo. La maionese non si separa perché c'è l'emulsionante. Definizioni, nomi, etichette, confini e controlli sono la differenza tra la dimostrazione del venerdì e il sistema che funziona anche a novembre.

"E io, con il mio Excel?"

In scala uno a uno, le mosse diventano abitudini da chat. Quattro.

Metti un foglio "Leggimi" dentro il file: cosa c'è in ogni colonna, da quando a quando arrivano i dati, cosa manca. Sono le mosse uno e quattro in miniatura, e l'IA lo leggerà prima di rispondere. Poi, alla prima domanda di calcolo, scrivi: "scrivi ed esegui il codice e mostramelo". Il modello può rispondere "a mente" - un numero di cui non puoi verificare nulla - oppure con un programmino di tre righe che apre il file e calcola: la seconda strada si può rileggere, rifare domani, ottenere identica. E un'occhiata al codice paga anche se non sai programmare: c'è scritto quali colonne ha usato e cosa ci ha fatto - se ha sommato i saldi invece di prendere l'ultimo, lì si vede. Terza abitudine: comincia con una domanda di cui sai già la risposta, e solo se torna passa a quelle di cui non la sai. Quarta: ogni tanto chiedi "da quali righe viene questo numero?" - non perché controllerai, ma perché un sistema che sa rispondere a quella domanda sbaglia meno di uno che non sa farlo.

E gli assistenti integrati direttamente nel foglio di calcolo, come Claude for Excel o Copilot in Excel? Metà della regola lì è già incorporata: il loro output naturale non è un numero ma una formula scritta nella cella - il calcolo lo esegue il motore di Excel, e la formula resta lì, ispezionabile, ricalcolata identica quando i dati cambiano. Ma la scelta del significato - quale colonna, se sommare o prendere l'ultimo valore - resta del modello. Le mosse valgono anche lì.

È lo stesso criterio che avevo suggerito parlando di come scegliere una soluzione in pratica: non giudicare la risposta, giudicare come è stata prodotta.

Quando tutto questo è troppo

Non tutto merita questa impalcatura. Se il file ce l'hai sotto gli occhi - cinquanta righe che conosci bene - l'errore lo vedi a occhio, e l'IA che improvvisa è lo strumento giusto: veloce, comoda, perfetta per esplorare. Le mosse servono quando i numeri escono dalla stanza: quando finiscono in un report, in una decisione, davanti a un capo o a un cliente.

E hanno un costo, anche se meno rigido di quanto sembri. Settanta definizioni non fanno settanta domande: misure, periodi, filtri e raggruppamenti si combinano, e da una dispensa di settanta ingredienti sicuri nascono migliaia di richieste legittime. Ma il confine esiste, e non è il numero delle domande: è la grammatica. La richiesta che ne esce - quella nuova, quella interessante - riceve un "non lo so" finché qualcuno non prepara l'ingrediente che manca. L'affidabilità si paga in flessibilità. Non è un difetto di gioventù che sparirà: è uno scambio, e sceglierlo sapendolo è diverso da subirlo.

Il lavoro si sposta prima

Resta l'ultima cosa. Tutte le mosse, e tutte le abitudini, hanno in comune un dettaglio: si fanno prima che l'IA entri in scena, o comunque fuori dalla singola conversazione. Il lavoro decisivo sui numeri non è più scrivere la domanda perfetta: è tenere la dispensa in ordine. Pulire i dati, decidere le definizioni, sistemare i nomi, segnare i buchi, dichiarare i confini, preparare i controlli.

Acqua e olio, del resto, convivono benissimo nello stesso recipiente. Basta smettere di pretendere che si mescolino - e dare a ciascuno il suo strato.


Articoli correlati su Libro Vivo IA

Glossario
Partita doppia
Metodo di registrazione contabile codificato da Luca Pacioli nel 1494: ogni operazione si annota due volte, in due colonne diverse, che alla fine devono tornare uguali. Non migliora la bravura del contabile, rende visibili gli errori.
Bench SQL (BIRD-SQL, Spider)
Gare internazionali in cui sistemi di IA rispondono a domande su veri database. Misurano quanto i modelli sono affidabili nell'estrarre numeri da tabelle reali: gli umani esperti raggiungono ~93% di risposte corrette, i migliori modelli ~82%.
Media pesata
Media che tiene conto del 'peso' di ogni valore (quante volte compare o la sua entità). Evita l'errore della 'media delle medie' in cui gruppi di dimensioni diverse contribuiscono in ugual misura.
Saldo
Il valore di un conto in un dato istante. Si guarda, non si somma: il saldo a fine gennaio più quello a fine febbraio non dà il totale delle entrate, perché il secondo include già il primo.
Dato mancante
Un valore che non è stato registrato. Non è zero: zero è un valore, la mancanza è un'altra cosa. Trattare i buchi come zero falsa le medie e i totali.
Emulsionante
Sostanza (come l'uovo nella maionese) che impedisce a olio e aceto di separarsi. Nell'analogia dell'articolo: definizioni, nomi puliti, etichette, confini e controlli sono ciò che tiene insieme il sistema oltre la dimostrazione.
Fonti e Bibliografia
Resta aggiornato

Un solo aggiornamento per articoli, eventi e nuove edizioni

Nuovi articoli sull'IA
Nuove edizioni del libro ed eventi