Un testo sbagliato lo vedi, un numero sbagliato no - e cosa fare, in pratica, per fidarsi delle risposte
Acqua e olio non si mescolano. E la soluzione non è agitare più forte.
Fai un esperimento. Prendi il file dove segni le spese di casa e caricalo in una chat con l'IA. Chiedi: "quanto ho speso in ristoranti quest'anno?". La risposta arriva in pochi secondi: un numero pulito, credibile, magari con il confronto sull'anno scorso. Sembra il compito più facile del mondo - i dati sono lì, ordinati in righe e colonne, nessuna frase ambigua da interpretare. È invece uno dei problemi su cui l'IA inciampa di più, per una ragione che non c'entra con la matematica.
Su questo sito ho raccontato come l'IA legge i documenti - la RAG, il chunking. Non ho mai raccontato come se la cava con le tabelle: fogli di calcolo, database, archivi - tutto ciò che è fatto di righe, colonne e numeri. La tesi di questo articolo è secca: il modo di rendere affidabile un'IA sui numeri non è renderla più brava a calcolare. È toglierle il calcolo di mano. E stavolta, oltre alla tesi, c'è il manuale: le mosse concrete, una per una.
Un testo sbagliato lo vedi, un numero sbagliato no
Prima il perché, che sta tutto in un'asimmetria. Se chiedi un riassunto e dentro c'è una frase falsa, hai buone probabilità di accorgertene: la frase stona, contraddice qualcosa che sai. Un numero sbagliato no. "1.340 euro" ha esattamente lo stesso aspetto di "1.430 euro": stessa forma, stessa faccia tranquilla. L'unico modo di smascherarlo è rifare il conto - ma se devi rifare il conto ogni volta, l'assistente non ti serviva.
E non è un sospetto: è misurato. Nelle gare internazionali in cui i sistemi di IA rispondono a domande su veri database, le persone esperte danno la risposta giusta 93 volte su 100; i migliori sistemi al mondo si fermano a 82 - quasi un errore ogni cinque risposte, sui dati preparati per la gara. Su database aziendali veri, disordinati come sono le cose vere, uno dei modelli più diffusi è passato da 87 risposte giuste su 100 a 10.
Il punto è che il modello non sbaglia i conti: sbaglia il significato. Somma le percentuali (se in ognuno dei quattro trimestri il tuo bar ha servito il 30% del quartiere, il foglio dichiara che hai servito il 120% del quartiere). Fa la media delle medie senza pesarle (la 3A ha 8 di media ma sono in dieci, la 3B ha 6 ma sono in trenta: la media della scuola non è 7). Somma i saldi (1.000 euro sul conto a fine gennaio e 1.000 a fine febbraio non fanno 2.000: il saldo si guarda, non si somma). E tratta il buco come zero (il mese in cui non hai segnato le spese non è un mese in cui hai speso zero). Chiunque vada di fretta inciampa negli stessi errori - ma noi, davanti al bar che serve il 120% del quartiere, ci fermiamo. Il modello no: risponde con la stessa calma con cui dà la risposta giusta, e quella calma è identica nei due casi.
Chiudere la cucina, scrivere il menù
Come se ne esce? Non rendendo il cuoco più bravo: chiudendo la cucina. Se il modello inventa il calcolo ogni volta, l'errore possibile è infinito e invisibile. Se sceglie da un menù di risposte già preparate, l'errore possibile è uno solo ed è visibile: ha portato il piatto sbagliato, e te ne accorgi perché sul piatto c'è scritto il nome. Chi segue questo sito riconosce il filone: è ancora una volta l'intorno, non il motore. Non si cambia l'IA: si cambia ciò che le sta attorno.
Ecco il menù tradotto in pratica: una mossa zero e cinque mosse. Valgono per un'azienda con un database come per una persona con un foglio di calcolo - cambia la scala, non la logica.
Mossa zero: porta i dati in forma di tabella. È la parte di cui nessuno parla ed è quasi sempre la più lunga. I dati raramente nascono ordinati: arrivano da esportazioni di programmi in formati tecnici, da PDF, da fogli compilati a mano - con le date scritte in tre modi, le celle unite, i "N.D." infilati in mezzo ai numeri. Prima di qualunque domanda vanno portati alla forma più noiosa e più preziosa che esista: una riga per ogni fatto, una colonna per ogni caratteristica, formati uniformi. E qui l'IA aiuta, ma nel modo giusto: non chiederle di "leggere" il file disordinato ogni volta - ogni lettura può andare diversa dalla precedente - ma di scrivere lo script che lo trasforma. Scritto una volta, controllabile, riusabile a ogni nuova estrazione.
Prima mossa: scrivi le definizioni. Prima di collegare l'IA ai dati, si mette per iscritto l'elenco delle domande che devono avere risposta, e per ognuna la regola del calcolo. Per una ferramenta potrebbero essere tre righe: "Incasso del mese: somma degli scontrini. Clienti abituali: chi ha comprato almeno due volte negli ultimi novanta giorni, contati all'ultimo giorno del mese. Sconto medio: media pesata sul valore degli acquisti, non media semplice". Sembra burocrazia, è il contrario: sono le decisioni sui numeri prese una volta sola, a mente fredda, invece che improvvisate dal modello a ogni domanda. All'IA resta il compito in cui è brava davvero: capire quale definizione serve.
Seconda mossa: metti in ordine i nomi. Guarda la rubrica del telefono: lo stesso amico salvato tre volte, "Marco", "Marco Rossi", "Rossi Marco idraulico". Nei dati succede lo stesso, con fornitori e clienti. L'IA capisce benissimo che sono la stessa cosa, ed è proprio questo il pericolo: lo decide ogni volta da capo, e ogni volta può deciderlo in modo leggermente diverso. Lunedì raggruppa due varianti, giovedì tre, e i totali ballano senza che nessuno abbia sbagliato. La soluzione è una tabellina di due colonne - nome ufficiale, varianti accettate - e la regola che ogni dato nuovo passa di lì. Sui numeri la coerenza vale più dell'intelligenza: meglio una regola fissa scritta una volta che un genio che improvvisa ogni volta.
Terza mossa: etichetta ogni numero. Ogni valore dovrebbe portare con sé la propria qualità: misurato, stimato, mancante. Basta una colonna in più. La regola d'oro è una sola: il "mancante" non deve mai trasformarsi in zero, perché zero è un valore e la mancanza è un'altra cosa. E insieme viaggia la provenienza: la differenza tra una risposta e una risposta di cui fidarsi è poter chiedere "da quale riga l'hai preso?". Quasi mai controllerai davvero - ma serve poter controllare.
Quarta mossa: dichiara i confini. La cosa che quasi nessuno fa: scrivere che cosa i dati non possono dire. "Le vendite partono dal 2021, prima non c'è nulla. I resi non sono tracciati. Il margine non si può calcolare, mancano i costi." Tre frasi così, date all'IA insieme ai dati, cambiano la natura degli errori possibili: il fallimento peggiore non è la risposta sbagliata a una domanda legittima, è la risposta sicura a una domanda a cui non si poteva rispondere. Un assistente che una volta su cento dice "questo non lo so" è un assistente di cui puoi fidarti le altre novantanove.
Quinta mossa: fai tornare i conti due volte. Questa è vecchia di cinque secoli. Nel 1494 esce a Venezia la "Summa de arithmetica" di Luca Pacioli, il primo libro a stampa che spiega la partita doppia - un metodo che i mercanti veneziani usavano già, e che Pacioli codifica e diffonde. L'idea: ogni operazione si registra due volte, in due colonne diverse, e alla fine le colonne devono tornare uguali. Non rende i contabili più bravi a fare i conti: rende gli errori visibili. Con l'IA funziona identica, in due varianti. Tieni da parte quattro o cinque domande di controllo di cui conosci già la risposta, e rifalle dopo ogni modifica ai dati: se le risposte note tornano, la fiducia sulle altre cresce. Oppure chiedi lo stesso numero per due strade diverse - il totale dell'anno e la somma dei dodici mesi - e confronta: se non coincidono, c'è un errore che da solo non si sarebbe mai dichiarato. E tra le domande di controllo mettine un paio a cui il sistema deve saper rispondere "non lo so": misurare la qualità del non rispondere vale quanto misurare le risposte.
Queste mosse insieme sono l'uovo nella maionese. Olio e aceto agitati con energia sembrano mescolarsi - è l'effetto demo, il prototipo che in riunione risponde giusto alle cinque domande preparate, e si separa la settimana dopo. La maionese non si separa perché c'è l'emulsionante. Definizioni, nomi, etichette, confini e controlli sono la differenza tra la dimostrazione del venerdì e il sistema che funziona anche a novembre.
"E io, con il mio Excel?"
In scala uno a uno, le mosse diventano abitudini da chat. Quattro.
Metti un foglio "Leggimi" dentro il file: cosa c'è in ogni colonna, da quando a quando arrivano i dati, cosa manca. Sono le mosse uno e quattro in miniatura, e l'IA lo leggerà prima di rispondere. Poi, alla prima domanda di calcolo, scrivi: "scrivi ed esegui il codice e mostramelo". Il modello può rispondere "a mente" - un numero di cui non puoi verificare nulla - oppure con un programmino di tre righe che apre il file e calcola: la seconda strada si può rileggere, rifare domani, ottenere identica. E un'occhiata al codice paga anche se non sai programmare: c'è scritto quali colonne ha usato e cosa ci ha fatto - se ha sommato i saldi invece di prendere l'ultimo, lì si vede. Terza abitudine: comincia con una domanda di cui sai già la risposta, e solo se torna passa a quelle di cui non la sai. Quarta: ogni tanto chiedi "da quali righe viene questo numero?" - non perché controllerai, ma perché un sistema che sa rispondere a quella domanda sbaglia meno di uno che non sa farlo.
E gli assistenti integrati direttamente nel foglio di calcolo, come Claude for Excel o Copilot in Excel? Metà della regola lì è già incorporata: il loro output naturale non è un numero ma una formula scritta nella cella - il calcolo lo esegue il motore di Excel, e la formula resta lì, ispezionabile, ricalcolata identica quando i dati cambiano. Ma la scelta del significato - quale colonna, se sommare o prendere l'ultimo valore - resta del modello. Le mosse valgono anche lì.
È lo stesso criterio che avevo suggerito parlando di come scegliere una soluzione in pratica: non giudicare la risposta, giudicare come è stata prodotta.
Quando tutto questo è troppo
Non tutto merita questa impalcatura. Se il file ce l'hai sotto gli occhi - cinquanta righe che conosci bene - l'errore lo vedi a occhio, e l'IA che improvvisa è lo strumento giusto: veloce, comoda, perfetta per esplorare. Le mosse servono quando i numeri escono dalla stanza: quando finiscono in un report, in una decisione, davanti a un capo o a un cliente.
E hanno un costo, anche se meno rigido di quanto sembri. Settanta definizioni non fanno settanta domande: misure, periodi, filtri e raggruppamenti si combinano, e da una dispensa di settanta ingredienti sicuri nascono migliaia di richieste legittime. Ma il confine esiste, e non è il numero delle domande: è la grammatica. La richiesta che ne esce - quella nuova, quella interessante - riceve un "non lo so" finché qualcuno non prepara l'ingrediente che manca. L'affidabilità si paga in flessibilità. Non è un difetto di gioventù che sparirà: è uno scambio, e sceglierlo sapendolo è diverso da subirlo.
Il lavoro si sposta prima
Resta l'ultima cosa. Tutte le mosse, e tutte le abitudini, hanno in comune un dettaglio: si fanno prima che l'IA entri in scena, o comunque fuori dalla singola conversazione. Il lavoro decisivo sui numeri non è più scrivere la domanda perfetta: è tenere la dispensa in ordine. Pulire i dati, decidere le definizioni, sistemare i nomi, segnare i buchi, dichiarare i confini, preparare i controlli.
Acqua e olio, del resto, convivono benissimo nello stesso recipiente. Basta smettere di pretendere che si mescolino - e dare a ciascuno il suo strato.
