Aggiornamento dal libro
Frontiera: previsioni, benchmark, dibattiti aperti
Dove sono arrivati i modelli rispetto alle prestazioni umane, cosa dicono i laboratori sull'AGI, e su cosa il campo è ancora in disaccordo.
Punteggi dei test, città servite dai robotaxi, previsioni sull'AGI, consumi di energia e acqua: questa pagina raccoglie quello che si muove troppo in fretta per la stampa. I criteri per pesare ogni voce restano nel libro: lo stato dell'arte (capitolo 1), le leggi di scala (sezione 3.1), i numeri ambientali (sezione 12.5), il dibattito sull'AGI (sezione 13.4).
Modelli e umani sugli stessi test
Il confronto ha senso solo dove qualcuno ha misurato anche gli umani. La prima tabella raccoglie i test che dichiarano un riferimento umano, con la distanza attuale; ogni riga dice anche di quando è la prova, che è l'informazione che scade prima.
| Test | Che cosa chiede | Miglior modello oggi | Umani | Distanza |
|---|---|---|---|---|
| GPQA Diamond | domande di scienze a livello di dottorato | 96,0% - GPT-6 Astra, dichiarato da OpenAI al rilascio, 3 set. 2026 | 69,7% | +26,3 |
| ARC-AGI-2 | puzzle di ragionamento astratto mai visti prima | 95,0% - GPT-6 Astra, prova del 2 set. 2026 | 100% | -5,0 |
| WebArena | compiti da svolgere su siti web | 74,3% - inizio 2026 | 78,2% | -3,9 |
| OSWorld | usare un computer vero: file, programmi, impostazioni | 81,8% con passaggio parziale - Claude Opus 5.5, dichiarato da Anthropic il 22 set. 2026, su OSWorld 2.1 | 72,4% | — |
| GAIA | domande da assistente che richiedono ricerca e strumenti | 74,5% - set. 2025 | 92% | -17,5 |
Riferimenti umani come dichiarati da chi gestisce ogni test, dove una dichiarazione esiste. Per ARC-AGI-2 è un panel in cui ogni puzzle è stato risolto da almeno due persone. Per GPQA Diamond il riferimento è più fragile di quanto sembri: gli autori del test dichiarano 65% per esperti nel proprio dominio, 74% scontando gli errori che loro stessi hanno riconosciuto dopo, e sono misure sull'insieme intero. Il 69,7% in tabella è la misura di OpenAI sui soli problemi Diamond, quella che Epoch AI riporta. L'81,2% che circola, e che questa pagina ha portato fino a oggi, non l'ho ritrovato in nessuna fonte primaria: l'ho tolto. OSWorld ha cambiato versione, e il 72,4% umano è stato misurato sulla prima: i punteggi in tabella sono su OSWorld 2.1, per questo la colonna della distanza resta vuota. L'81,8% è dichiarato da Anthropic; sulla classifica ufficiale di OSWorld, aggiornata al 17 settembre 2026, il miglior risultato è di Claude Opus 5, 77,7% con passaggio parziale e 44,3% con passaggio stretto, e i modelli di settembre non ci sono ancora. Dati di WebArena e GAIA dall'AI Index 2026, capitolo 2, esportati a inizio 2026; ARC-AGI-2 dalla classifica di ARC Prize. Consultate il 16 agosto e di nuovo il 18 settembre 2026; ARC-AGI-2 e OSWorld ricontrollati il 3 ottobre 2026.
Il quadro d'insieme dell'AI Index 2026 distingue tre gruppi: riferimento umano superato su ImageNet, SuperGLUE e MMLU; raggiunto o quasi su GPQA Diamond, MMMU e AIME; modelli ancora sotto sui compiti da agente come SWE-bench Verified e OSWorld. Sono fotografie di inizio 2026, e la prova di GPQA in tabella, di settembre, è ormai ventisei punti oltre il riferimento. Una riserva su SWE-bench: il rapporto lo riscala su un riferimento umano di cui non pubblica il valore, e gli autori del test non ne hanno mai dichiarato uno, per cui in questa pagina lo trovi nella seconda tabella. La fondazione di ARC-AGI pubblica invece anche il costo accanto al punteggio: il panel umano costa 17 dollari a puzzle, GPT-6 Astra 1,12 per il suo 95,0%, e GPT-6.1 Sol, uscito il 29 settembre, 0,25 per il 94,2%: un punto sotto, a meno di un quarto del costo. E il test successivo non è più fermo: su ARC-AGI-3, che chiede di agire in piccoli ambienti interattivi, GPT-6 Astra segna 62,7% con l'impianto di prova standard di ARC Prize e 99,95% con quello che passa dall'adattatore del fornitore, mentre OpenAI ha comunicato 98,6% usando la propria interfaccia con due impostazioni cambiate. Il numero confrontabile con gli altri modelli è il primo: Claude Opus 5, misurato allo stesso modo, sta al 30,2%, e GPT-6.1 Sol, uscito il 29 settembre, al 52,7%. Quando sullo stesso modello e sullo stesso test circolano tre cifre così lontane, la differenza non sta nel modello, sta nell'impianto di prova.
La seconda tabella raccoglie i test più citati fra quelli che un riferimento umano complessivo non ce l'hanno: nessuna persona conosce tutte le discipline di Humanity's Last Exam, e i problemi di FrontierMath richiedono a un matematico esperto ore o giorni ciascuno. Se leggi che un modello "ha superato gli umani" su uno di questi, il termine di paragone se l'è inventato chi scrive.
| Test | Che cosa chiede | Miglior modello oggi |
|---|---|---|
| Humanity's Last Exam | 2.500 domande accademiche costruite per mettere in difficoltà i modelli | 67,7% con strumenti - Claude Opus 5.5, dichiarato da Anthropic il 22 set. 2026 (GPT-6 Astra, nella stessa tabella: 57,2%). Sulla classifica indipendente di Scale, aggiornata al 17 set. 2026, senza strumenti, è primo GPT-6 Astra con 54,8%, davanti a Claude Fable 5.1 con 46,5% |
| FrontierMath, livelli 1-3 | matematica dall'università al dottorato avanzato | 93,7% - GPT-6 Astra (prova del 30 ago. 2026) e GPT-6.1 Sol (prova del 29 set. 2026), a pari merito, valutazioni Epoch |
| FrontierMath, livello 4 | matematica a livello di ricerca | 87,8% - Claude Fable 5, prova di giu. 2026 |
| SWE-bench Verified | riparare difetti reali in progetti software | 83,5% - Claude Opus 4.7, valutazione Epoch di apr. 2026 |
La data in cima a una classifica dice quando è stata rigenerata la pagina, e i punteggi dentro possono essere di mesi prima: quella di Humanity's Last Exam ad agosto portava la data di quel giorno e modelli fermi a marzo. Si è sbloccata a settembre, ma la lezione resta: cerca la data della singola prova, non quella in cima.
I test hanno versioni, come il software. FrontierMath a giugno 2026 ha corretto errori nel 42% dei suoi problemi: i punteggi sulla versione vecchia e sulla nuova vengono da prove diverse, e in tabella qui sopra ci sono solo quelli sulla versione corretta.
Dal laboratorio al servizio: i numeri
Il capitolo 1 invita a distinguere la dimostrazione dal servizio con clienti paganti. Ecco dove sta il confine oggi.
Medicina. La FDA americana elenca 1.614 dispositivi medici con IA autorizzati, 1.230 dei quali in radiologia (76,2%). La lista è stata aggiornata il 4 settembre 2026 e contiene decisioni fino al 29 giugno 2026; la FDA non pubblica un totale, e i due conteggi li ho rifatti riga per riga su quella versione il 3 ottobre 2026. La FDA stessa avverte che è costruita cercando termini legati all'IA nei documenti di autorizzazione, e che quindi il totale reale è più alto. AlphaFold, il caso più citato di IA nella scienza, è arrivato a 241 milioni di strutture proteiche previste con la versione 6 del suo database, ottobre 2025, e dal 16 marzo 2026 contiene anche i complessi fra proteine, circa 30 milioni, con gli eterodimeri aggiunti il 19 maggio e, dal 24 settembre, i complessi previsti per oltre 2.800 virus. In tutto il database supera ora i 260 milioni di previsioni. Il Nobel per la Chimica 2024 legato a quel lavoro ha premiato tre persone: Demis Hassabis e John Jumper per la predizione delle strutture, David Baker per la progettazione di proteine nuove.
Guida autonoma, il servizio. Waymo serve passeggeri in 15 aree metropolitane americane, se le conto una per una: le 14 città che l'azienda elencava il 1 settembre, quando ha aperto Denver, San Diego e Tampa, più Las Vegas, aperta al pubblico il 14. Il totale è un conto mio: Waymo non lo dichiara. Il 25 agosto l'azienda ha annunciato l'ingresso in Germania, a Monaco. Altre città sono in lista di espansione, fra cui Londra, New York e Washington DC, che ci sta da marzo 2025. Due hanno ora una data: Tokyo, con corse aperte al pubblico nel 2027 insieme a Nihon Kotsu e GO (annuncio del 14 settembre), e Singapore, primo mercato nel Sud-est asiatico, con corse commerciali senza conducente previste nel 2028 se arriva l'autorizzazione (17 settembre). Sulle corse, l'ultima cifra datata dichiarata dall'azienda resta di oltre 400.000 a settimana al 2 febbraio 2026, il giorno del round da 16 miliardi di dollari su una valutazione di 126; le pagine del sito dicono ancora "oltre 500.000", senza data. Il 24 settembre Waymo ha invece datato un'altra misura: 270 milioni di miglia percorse in completa autonomia.
Guida autonoma, l'inseguitore. Tesla dichiara alla SEC (22 luglio 2026) il servizio robotaxi attivo in sette aree; la pagina per i clienti ne elenca sei fra Texas e Florida, perché nella Bay Area si viaggia con conducente di sicurezza a bordo, sotto un permesso da vettore con autista. Ai registri della California, al 12 agosto e di nuovo al 18 settembre 2026, Tesla ha il permesso di test con conducente e non compare né fra chi può testare senza conducente né fra chi può operare in commercio. L'azienda non pubblica corse settimanali né dimensione della flotta: chi confronta le due aziende con un numero solo sta confrontando un dato pubblicato con uno stimato.
AGI: chi prevede che cosa
Una previsione sull'AGI si pesa con tre informazioni: chi la fa, quando l'ha fatta, in quale sede. La tabella le riporta tutte e tre.
| Chi | Che cosa ha detto | Quando e dove |
|---|---|---|
| Sam Altman OpenAI | "Fra altri dieci anni credo che costruiremo quasi certamente la superintelligenza" | 11 dic. 2025, post per i dieci anni di OpenAI |
| Dario Amodei Anthropic | se le leggi di scala "continuano solo per un altro anno o due", arriva la "powerful AI", il suo "Paese di geni in un data center" | giu. 2026, sito personale |
| Demis Hassabis Google DeepMind | "50% di probabilità nei prossimi cinque anni, quindi diciamo entro il 2030", con la riserva che dipende dalla definizione di AGI | 23 lug. 2025, podcast di Lex Fridman; a mag. 2026 (Axios) indica il 2029 come possibile |
| Geoffrey Hinton Nobel Fisica 2024 | "Credo che siano già coscienti"; la sua stima più citata, 10-20% di probabilità di estinzione umana entro trent'anni, è del dic. 2024 alla BBC | 5 giu. 2026, Big Technology Podcast |
| Yann LeCun AMI Labs | contare sugli LLM per arrivare all'intelligenza umana "è una completa sciocchezza"; al meglio, fra cinque anni sapremo se la strada nuova è quella buona | 1 apr. 2026, lezione alla Brown University |
Le date di Altman raccontano uno spostamento: a gennaio 2025 scriveva "ora sappiamo come costruire l'AGI", a dicembre 2025 la superintelligenza stava a dieci anni, e nel piano firmato a giugno 2026 la sola data concreta riguarda una tappa interna dell'azienda, marzo 2028, quando "una frazione consistente della ricerca" dovrebbe essere svolta da sistemi IA. Le date di Amodei insegnano un controllo diverso: il suo "1-2 anni" compare identico nell'ottobre 2024 e nel giugno 2026. Quando leggi una previsione, guarda se contiene un anno o una distanza, perché la distanza scorre in avanti insieme a chi la pronuncia.
A settembre il registro è cambiato. Il 12 Amodei ha pubblicato un saggio che chiede di rallentare subito lo sviluppo, con l'avvertimento che sciami di agenti fuori controllo potrebbero prendersi internet "in 6-12 mesi"; Altman ha risposto lo stesso giorno dicendosi d'accordo sul fatto che alla frontiera vada dato un passo, e promettendo accesso a valutatori esterni. Il 13 Amodei ha indicato nella Cina il dilemma più duro della propria proposta. Il 14 Hassabis ed Elon Musk hanno firmato l'appello, e lo stesso giorno LeCun lo ha respinto come allarme finto, ricordando che nel 2019 Amodei sosteneva che GPT-2 fosse troppo pericoloso da pubblicare. La richiesta non contiene né una data né una soglia: vale come posizione, non come impegno verificabile.
Nello stesso mese François Chollet, che gestisce ARC, ha anticipato la propria previsione sull'AGI: la dava al 2030, e dopo il risultato di Astra su ARC-AGI-3 dice prima, perché il progresso sta andando più in fretta di quanto si aspettasse. Vale la pena notare su quale cifra si è mosso, visto quello che si legge qui sopra sugli impianti di prova.
LeCun alle parole ha aggiunto una società: ha lasciato Meta a fine 2025 e il 10 marzo 2026 ha lanciato AMI Labs, un miliardo e 30 milioni di dollari di finanziamento iniziale già raccolto, per una linea di ricerca alternativa: "world model" che imparino osservando il mondo fisico invece di prevedere la parola successiva. Per ora sono una tesi di ricerca e un finanziamento.
Chi fa ricerca e non vende modelli la vede in un altro modo. Nella survey del panel presidenziale AAAI (rapporto di marzo 2025, 475 rispondenti in tutto, comunità accademica per due terzi), il 76% di chi ha risposto alla domanda giudica improbabile che basti ingrandire gli approcci attuali per arrivare all'AGI. E l'ultima grande rilevazione sui tempi, 2.778 ricercatori interpellati nell'autunno 2023, mette il 50% di probabilità che le macchine superino gli umani in ogni compito solo nel 2047. Fra chi costruisce e chi osserva ballano quindici anni, e nessuna delle due parti ha dati che chiudano la questione.
Il disaccordo sullo scaling, con i fatti di ciascuno
Ilya Sutskever, il ricercatore più citato fra gli scettici, ha messo la sua tesi a verbale in un'intervista del 25 novembre 2025: dal 2020 al 2025 è stata "l'era dello scaling", ora "si torna all'era della ricerca, solo con computer grandi", perché centuplicare la scala non trasformerebbe più le capacità. Otto mesi dopo la sua società ha firmato con Nvidia un accordo per decuplicare il proprio calcolo. Le due mosse stanno insieme solo nella sua formulazione esatta, ed è il motivo per cui conviene citarla intera.
Amodei, dal lato opposto, a febbraio 2026 dichiarava che il pre-training "continua a dare guadagni" e che il rinforzo mostra la stessa curva. I numeri pubblici di Epoch AI, ricontrollati il 3 ottobre 2026, danno intanto un calcolo di addestramento che, in tendenza sui modelli di punta, quintuplica ogni anno - anche se un singolo modello può costare meno del predecessore - e un indice aggregato di capacità che, da quando sono arrivati i modelli che ragionano, guadagna circa 14 punti l'anno in linea retta, contro 6 per i modelli che non ragionano. Quanto al carburante, la stima di riferimento resta quella di Epoch del giugno 2024: lo stock di testo pubblico scritto da umani verrà raggiunto dai dataset di addestramento fra il 2026 e il 2032. Da allora nessun laboratorio pubblica più la dimensione dei propri dati, quindi la previsione non si può ancora verificare.
Nel frattempo l'industria ha aggirato il problema per un'altra via: far pensare i modelli più a lungo al momento della risposta invece di ingrandirli in partenza. Epoch stima che questo salto valga, su alcuni test, quanto dieci volte più calcolo di addestramento, e nelle classifiche del 2026 quasi ogni modello di punta compare in varianti distinte per livello di ragionamento.
Il conto di energia e acqua
I numeri dell'elettricità stanno già su /r/hardware, aggiornati alle stime IEA del 16 aprile 2026: 485 TWh consumati nel 2025 da tutti i data center del mondo, +17% in un anno, con i soli data center per l'IA a +50% e una proiezione intorno ai 950 TWh per il 2030. Qui restano l'acqua e le aziende. Per l'acqua la stima IEA è quella del rapporto 2025: 560 miliardi di litri consumati nel 2023 dall'insieme dei data center, con una proiezione a più del doppio nel 2030 e il perimetro che il libro riporta - due terzi nella filiera che produce l'energia, un quarto nel raffreddamento. La stima parallela per i soli sistemi di IA, 312-765 miliardi di litri nel 2025, sta su /r/hardware: metodo e perimetro diversi, e le due serie non si sommano.
I report aziendali del 2026 portano una novità di metodo. Google dichiara per il 2025 emissioni totali in crescita dell'81% sull'anno base 2019 nel perimetro che usa per i propri obiettivi, con le sole emissioni operative in calo del 2% sull'anno: le due percentuali convivono nello stesso rapporto perché contano insiemi diversi di emissioni. Il consumo elettrico è salito a 43,6 TWh, +37% in un anno. Microsoft dichiara +25% di emissioni totali sull'anno fiscale precedente e ha tolto dall'edizione 2026 la tabella con i confronti verso l'anno base 2020; le componenti che erano in calo sono tornate a crescere dopo la rinuncia ai certificati rinnovabili non addizionali. Entrambe confermano gli obiettivi al 2030, ed entrambe hanno ricalcolato gli anni base.
Un anno fa Google dichiarava +51% sul 2019; oggi dichiara +81%, e in mezzo c'è anche il ricalcolo dell'anno base: i due numeri non si sottraggono. Ogni percentuale di emissioni ha un perimetro e un anno di riferimento, e vanno controllati entrambi dentro la stessa edizione del rapporto.
Che cosa è cambiato
3 ottobre 2026 · revisione
In due settimane due modelli nuovi, e il costo scende più in fretta del punteggio. Claude Opus 5.5 è uscito il 22 settembre e GPT-6.1 Sol il 29. Su ARC-AGI-2 il primo resta GPT-6 Astra, ma GPT-6.1 Sol gli arriva a un punto con 0,25 dollari a puzzle, meno di un quarto di quanto spende Astra. Su FrontierMath, livelli 1-3, i due modelli di OpenAI stanno a pari merito al 93,7%.
Su Humanity's Last Exam l'ordine dipende da chi misura. Nella tabella di Anthropic del 22 settembre, con strumenti, Claude Opus 5.5 segna 67,7% e GPT-6 Astra 57,2%; nella classifica indipendente di Scale, senza strumenti, Astra è primo con 54,8%. Ho tolto la frase che dava Astra dietro su questo test, perché valeva per una sola delle due misure. OSWorld è passato alla versione 2.1, e lì l'unico dato con entrambe le soglie viene dalla classifica ufficiale, su un modello di luglio.
Servizi, e due correzioni. Waymo serve 15 aree, contate da me una per una: la revisione precedente aveva perso Tampa, aperta il 1 settembre insieme a Denver e San Diego. Tokyo ha una data, il 2027, e Singapore il 2028 se arriva l'autorizzazione. Ho rifatto il conto della FDA sulla lista di settembre: 1.614 dispositivi. E ho corretto due cose che la pagina riportava male: il saggio di Amodei parla di "6-12 mesi", e l'indice di capacità di Epoch cresce di circa 14 punti l'anno in linea retta, senza l'accelerazione che avevo scritto.
18 settembre 2026 · revisione
Sulle domande il divario è chiuso; sui compiti da agente si sta chiudendo. In cinque settimane GPT-6 Astra ha portato GPQA Diamond a 96,0% e ARC-AGI-2 a 95,0%, e Claude Fable 5.1 ha sbloccato Humanity's Last Exam, la classifica che ad agosto era ferma ai modelli di marzo. Su OSWorld 2.0 il migliore passa il 77,9% dei compiti in modo parziale e il 41,7% in modo stretto: è lì che si vede la differenza fra rispondere e fare.
Su ARC-AGI-3 lo stesso modello segna 62,7% o 99,9% secondo l'impianto di prova. È il fatto più utile di questa revisione, e non riguarda le capacità: riguarda il fatto che un punteggio senza il suo impianto di prova non si può confrontare con niente. Nella stessa revisione ho tolto dalla tabella il riferimento umano di GPQA Diamond che questa pagina portava dall'inizio, 81,2%, perché non l'ho ritrovato in nessuna fonte primaria.
Chi costruisce chiede di rallentare, e non va d'accordo su come. Fra il 12 e il 14 settembre Amodei, Altman, Hassabis e Musk si sono trovati dalla stessa parte su una richiesta di rallentamento, e LeCun dall'altra. La richiesta non ha una data né una soglia, e il suo punto debole l'ha detto Amodei stesso il giorno dopo: la Cina.
16 agosto 2026 · prima pubblicazione
Rispetto all'edizione di giugno del libro, il divario da guardare ha cambiato natura. Sulle domande, anche a livello di dottorato, il riferimento umano - dove esiste - risulta raggiunto o superato; resiste sui compiti in cui bisogna agire a lungo, usare un computer, combinare strumenti. Ed è il terreno su cui si giocano gli agenti in azienda.
Le previsioni dei laboratori si sono fatte più caute nella forma: la data più concreta in circolazione, marzo 2028, è una tappa aziendale di OpenAI - quanta ricerca interna sarà affidata a sistemi IA - mentre per l'AGI circolano finestre mobili e probabilità.
E i due maggiori report ambientali del 2026 rendono più difficile il confronto con il passato: anni base ricalcolati da entrambe le aziende, tabella degli avanzamenti eliminata da Microsoft. I consumi si trovano ancora; le percentuali tocca ricostruirle da soli.
Fonti
- Revisione del 3 ottobre 2026. Punteggi: Anthropic, pagina di Claude Opus 5.5, 22 settembre 2026, per OSWorld 2.1 e Humanity's Last Exam; classifica ufficiale di OSWorld (dati al 17 settembre 2026); Scale AI, classifica di Humanity's Last Exam (aggiornata al 17 settembre 2026); ARC Prize Foundation, file dati delle classifiche ARC-AGI-2 e ARC-AGI-3; Epoch AI, archivio dei dati dei benchmark (GPQA Diamond, FrontierMath, SWE-bench Verified) e pagina trends; darioamodei.com, "We Must Pace the Frontier" (settembre 2026). Consultati il 3 ottobre 2026.
- Revisione del 18 settembre 2026. Punteggi: OpenAI, pagina di rilascio di GPT-6 Astra, 3 settembre 2026; Anthropic, annuncio di Claude Fable 5.1 e Mythos 5.1, 1 settembre 2026; ARC Prize Foundation, pagina dei risultati di GPT-6 Astra su ARC-AGI-2 e ARC-AGI-3. Riferimento umano di GPQA Diamond: Rein et al., "GPQA: A Graduate-Level Google-Proof Q&A Benchmark", per il 65% e il 74%, ed Epoch AI per il 69,7% misurato da OpenAI sul solo Diamond.
- Waymo, blog e pagina degli aggiornamenti, consultati il 3 ottobre 2026, per le aperture del 1 settembre (Denver, San Diego e Tampa, "14 città" in tutto) e del 14 settembre (Las Vegas), da cui il conto delle quindici aree, per le date di Tokyo e Singapore, la lista di espansione e i 270 milioni di miglia del 24 settembre; per Singapore anche TechRepublic, 18 settembre 2026. L'annuncio di Monaco del 25 agosto è quello letto il 18 settembre 2026. California DMV, elenchi permessi al 18 settembre 2026, consultati il 3 ottobre 2026. FDA, lista aggiornata al 4 settembre 2026, contata riga per riga il 3 ottobre 2026. EMBL-EBI, annunci del database di AlphaFold del 16 marzo 2026 (complessi) e del 24 settembre 2026 (complessi virali), consultati il 3 ottobre 2026.
- Richiesta di rallentamento: Axios, 12 settembre 2026, per il saggio di Amodei e la risposta di Altman; CNBC, 13 settembre 2026, per la Cina; stampa internazionale del 14 settembre 2026 per le firme di Hassabis e Musk e per la risposta di LeCun. Consultate il 18 settembre 2026.
- Non aggiornati nella revisione del 3 ottobre 2026: WebArena e GAIA, che vengono dall'AI Index 2026, una fonte annuale. SWE-bench Verified è ricontrollato: Epoch non ha ancora valutato i modelli di settembre, e il primo resta Claude Opus 4.7. Le righe restano quelle delle revisioni precedenti, e si vede dalla data accanto.
- Benchmark: Stanford HAI, AI Index Report 2026, capitolo 2 (dati esportati a inizio 2026); classifiche di ARC Prize Foundation (dati al 13 agosto 2026), Epoch AI (benchmark e trends; per lo stock di testo, "Will we run out of data?", versione del giugno 2024), Scale AI per Humanity's Last Exam, swebench.com. Consultate il 16 agosto 2026.
- Servizi: FDA, lista "Artificial Intelligence-Enabled Medical Devices", aggiornata al 16 giugno 2026; waymo.com (pagine corse e blog); Tesla, aggiornamento Q2 2026 depositato alla SEC il 22 luglio 2026 e pagina di supporto robotaxi; California DMV, elenchi permessi al 12 agosto 2026; EMBL-EBI per AlphaFold DB v6; nobelprize.org. Consultate il 16 agosto 2026.
- Dichiarazioni: blog personale di Sam Altman ("Reflections", gennaio 2025) e sito OpenAI (11 dicembre 2025, 8 giugno 2026); darioamodei.com ("Machines of Loving Grace", ottobre 2024; "The Adolescence of Technology", gennaio 2026; post di giugno 2026); Lex Fridman Podcast n. 475 (23 luglio 2025); Axios (26 maggio 2026); BBC Radio 4 (27 dicembre 2024); Big Technology Podcast (5 giugno 2026); Brown University, resoconto della lezione del 1° aprile 2026; amilabs.xyz; Dwarkesh Podcast (25 novembre 2025 e 13 febbraio 2026); comunicato Nvidia-SSI (27 luglio 2026).
- Survey: AAAI, Presidential Panel on the Future of AI Research, rapporto marzo 2025; Grace et al., "Thousands of AI Authors on the Future of AI", JAIR 2025, rilevazione ottobre 2023.
- Energia e acqua: IEA, "Key Questions on Energy and AI" (16 aprile 2026) e "Energy and AI" (aprile 2025, riquadro 5.4); Google 2026 Environmental Report (giugno 2026, anno solare 2025); Microsoft 2026 Environmental Sustainability Report (luglio 2026, anno fiscale chiuso a giugno 2025).
- Dove una classifica non datava la singola prova, la data indicata è quella dichiarata dal gestore per il modello o per l'esportazione dei dati.