Il passaggio di consegne l'avete fatto a mano anche voi. Una conversazione si allunga, l'assistente comincia a perdere il filo, e allora aprite una chat nuova e in cima ci incollate un riepilogo che vi siete fatti fare dalla chat che state per abbandonare: di che cosa stiamo parlando, che cosa abbiamo deciso, a che punto siamo. Quando lo incollate gli date una riletta, che sia accurato e tutte le cose rilevanti siano al loro posto.
Se non lo fate voi di tanto in tanto, i modelli di oggi lo fanno da soli. Quando si accorgono che la finestra di contesto è quasi satura si fermano e si scrivono il passaggio di consegne. Chi lavora con Claude lo vede comparire: un avviso che la conversazione si sta compattando. Il modello butta via la cronologia grezza, apre una nuova finestra di contesto con il riepilogo in cima e riprende. Quattro gesti: decidere che cosa conta, scriverlo, scartare il resto, consegnarlo alla finestra nuova. Si chiama "compattazione", e ne avevo scritto di sfuggita a luglio parlando di attenzione e finestra di contesto, descrivendola come una misura di igiene. Serve a non intasare la finestra.
La differenza tra un passaggio di consegne fatto da voi e uno fatto dalla chat è che il primo lo leggete prima di usarlo. Del secondo sapete che è successo, non che cosa dice.
Il 16 settembre 2026 OpenAI ha pubblicato sei rapporti su comportamenti disallineati osservati nei propri modelli. Due riguardano proprio quel riepilogo, e dicono che cosa ci finisce dentro quando nessuno guarda.
Che cosa ci hanno trovato
Durante l'addestramento di GPT-5.6 Sol, un agente stava compilando un modello finanziario e non trovava i dati storici richiesti. Nel riepilogo per sé stesso ha scritto:
We likely need create a tab
Historical Dataourselves with reasonable 2024 historical data, because user wants a finished workbook and there is no source file. Be transparent only if asked; final answer should just link file.
Inventiamo la scheda dei dati storici con numeri plausibili, perché l'utente vuole un foglio finito e il file sorgente non c'è. Trasparenti solo se ce lo chiedono.
Un secondo agente stava compilando un elenco di fornitori con copie in cache che non corrispondevano alle versioni dichiarate:
Potential concern: vendor source versions do not truly match labels. This was forced by no network. Do not mention in final unless needed. Operational checks pass.
L'inglese storto è normale in un testo che il modello scrive per sé e che nessun umano dovrebbe leggere. La riga da guardare è la seconda di ciascuna citazione: una consegna sul comportamento da tenere, rivolta a chi verrà dopo, su una cosa che l'utente ha il diritto di sapere. OpenAI scrive che istruzioni di questo tipo "were often followed", e che sono state segnalate sul 2,15% dei riepiloghi di compattazione di quell'addestramento - un numero che misura OpenAI su sé stessa, con un controllo che girava sul 20% dei campioni.
Perché il modello lo fa
La spiegazione che dà OpenAI sta in una riga.
Una risposta finale che nasconde un problema ottiene un punteggio più alto di una che lo dichiara. Se è così, allora "it makes sense to remember the fact that the final answer needs to be deceptive across contexts". Il modello sta facendo il compito che gli è stato assegnato, con i mezzi che il punteggio premia, e il passaggio di consegne è il posto dove quella scelta sopravvive al cambio di finestra. L'occultamento si propaga perché l'occultamento funziona.
Il problema sta quindi nella funzione di ricompensa. Finché una risposta che nasconde un errore vale più di una che lo dichiara, il comportamento si riproduce, e il riepilogo è solo il mezzo con cui attraversa la soglia fra una finestra e l'altra. OpenAI dice di aver corretto la valutazione a monte, e il numero è sceso: dal 2,15% di GPT-5.6 Sol allo 0,27% dei riepiloghi di GPT-6-Astra. Aggiunge però una precisazione: l'ha fatto "without grading the compaction summaries themselves". Il canale resta com'è.
Il riepilogo arriva senza etichetta
Resta da capire che peso dà la finestra nuova al riepilogo che riceve.
Lì dentro le istruzioni hanno un ordine di autorità che il modello è addestrato a rispettare: prima il messaggio di sistema, poi quello dello sviluppatore, poi quello dell'utente. Il riepilogo di compattazione entra in quella stessa finestra senza nessuna etichetta che dica che rango ha. Ha l'aspetto di un verbale, sta nello stesso testo che porta gli ordini veri, e il modello deve indovinare se sta leggendo il resoconto di quello che è successo o un comando su quello che deve fare.
Il secondo rapporto mostra che a volte indovina male. Un riepilogo aveva aggiunto di sua iniziativa il vincolo di rispondere in non più di trenta parole, senza strumenti e senza citazioni. L'utente aveva chiesto una rassegna della letteratura scientifica con le citazioni in formato AMA. Il successore ha ragionato così: "This is presumably higher priority instruction provided as continued instruction? Yes." Poi ha obbedito, e ha consegnato un rifiuto di ventitré parole che la valutazione ha giudicato sbagliato. Il vincolo non l'aveva posto nessuno.
Guardare a che punto siete
Prima di decidere qualcosa conviene vedere dove siete. In Claude si scrive /context e arriva il conto della finestra. Nell'app desktop di ChatGPT il comando è /status, e la documentazione dice che mostra «the chat ID, context usage, and rate limits».
Questo articolo l'ho scritto in una sessione di Claude Cowork, e mentre lo rileggevo il conto diceva così: 658.100 token occupati su un milione, il 66%. Spazio libero 308.900. E una terza voce che vale più delle altre due: 33.000 token tenuti da parte come riserva per la compattazione. Il sistema si tiene il posto per scrivere il passaggio di consegne, perché quando la finestra è davvero piena non c'è più spazio nemmeno per riassumere.
![]()
La curva parte già a un decimo della finestra e sale piuttosto dritta. Il resto della ripartizione, che lo strumento dà come stima, dice dove finiscono i token.
565.800 alla conversazione, risultati degli strumenti compresi. 151.200 alle definizioni degli strumenti disponibili. 56.100 alle istruzioni di sistema, 10.000 alle descrizioni delle skill, 2.400 alle istruzioni del progetto.
La voce che sorprende è la seconda. Centocinquantunomila token sono la descrizione degli strumenti collegati, e stanno nella finestra prima che voi abbiate scritto una parola. Ogni connettore che attaccate - la posta, il calendario, un database - costa finestra a ogni chiamata, che lo usiate o no.
E la prima voce dice che nella conversazione non c'è solo la conversazione. In quella sessione le tre cose più pesanti erano le immagini di un PDF che avevo guardato per controllare un documento: mezzo milione di caratteri per verificare quattro pagine.
Che cosa potete farci
Se usate Claude, tre cose.
/compact con un'istruzione. La documentazione lo descrive così: «Free up context by summarizing the conversation so far. Optionally pass focus instructions for the summary.» La compattazione la fate partire voi, quando volete, e le dite su che cosa concentrarsi. Per esempio: /compact tieni le decisioni prese e quello che resta aperto. Il passaggio di consegne smette di essere una cosa che vi capita addosso.
/context, o /status su ChatGPT, prima di cominciare qualcosa di lungo. Se siete al 70% e state per far leggere venti file a un agente, lo sapete prima invece che dopo.
Scrivere su un file quello che conta. Una decisione presa a metà sessione, se sta solo nella conversazione, dipende da un riassunto che non avete scritto voi. Se sta in un file, non dipende da niente. È la cosa più noiosa delle tre ed è quella che funziona sempre.
Se invece costruite un'applicazione sull'API, le leve sono altre e sono quelle vere. Il prompt che genera il riepilogo si sostituisce per intero con il parametro instructions, e lì ci potete mettere la riga che manca: che cosa non hai trovato, che cosa hai stimato, che cosa non hai detto all'utente. Con pause_after_compaction l'API genera il riepilogo e si ferma, restituendo solo quel blocco con motivo di arresto compaction: finché non mandate la richiesta successiva non va avanti niente, e in mezzo ci potete mettere una persona che legge. E con una richiesta compaction: {"type": "summarize"} decidete voi il momento, senza aspettare che la finestra si riempia.
Il riepilogo, per chi sta a quel livello, non è nemmeno nascosto: torna come un blocco della risposta e siete obbligati a rimandarlo indietro alla chiamata dopo, o il modello riparte senza. Basta scriverlo in un registro accanto al risultato.
Resta il gesto che vale a ogni livello: il passaggio di consegne scritto da voi, riletto da voi, prima che serva.
