← Ultimi articoli
💻 computer science

Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

Questo articolo valuta la capacità dei modelli di IA all'avanguardia di eseguire ragionamenti complessi senza token espliciti di catena di pensiero, misurando i loro orizzonti temporali di completamento dei compiti rispetto ai baseline umani, rivelando una tendenza al raddoppio delle prestazioni annualmente e proiettando che questi modelli potrebbero presto risolvere compiti che richiedono oltre 25 minuti di sforzo umano in un unico passaggio entro il 2030.

Autori originali: Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills, Alex Serrano, Ida Caspary, Jason Ross Brown, Jo J. Jiao, Patrick Leask, Twm Stone, Ram Potham, Ionut Gabriel Stan, Harry
Pubblicato 2026-08-05
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills, Alex Serrano, Ida Caspary, Jason Ross Brown, Jo J. Jiao, Patrick Leask, Twm Stone, Ram Potham, Ionut Gabriel Stan, Harry Mayne, Simeon Hellsten, Shubhorup Biswas, Ariana Azarbal, William L. Anderson, Elle Najt, Ryan Greenblatt, Julian Stastny

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di guardare un mago eseguire un trucco. Di solito il mago ti spiega il suo processo: "Mescolerò le carte, poi darò un'occhiata a quella in cima e ora la farò scomparire". Questa parte parlata è come il "Chain of Thought" (CoT) di un'IA. È il ragionamento passo dopo passo che il modello ci mostra prima di dare una risposta. Gli esperti di sicurezza amano questo perché possono ascoltare il "pensiero" per assicurarsi che l'IA non stia pianificando nulla di pericoloso, come mentire o cercare di ingannare i suoi supervisori umani.

Ma cosa succederebbe se il mago smettesse completamente di parlare? Cosa succederebbe se potesse fare tutto quel complesso mescolamento, quell'osservazione e quella pianificazione interamente nella sua testa, in totale silenzio, e poi schioccare le dita per rivelare la risposta? Se un'IA può fare questo, i monitor di sicurezza rimangono al buio, incapaci di vedere il "pensiero" che potrebbe nascondere un piano cattivo. Questo articolo si pone una domanda grande, e un po' spaventosa: quanto possono fare questi super-intelligenti modelli di IA nella loro testa senza mostrarci una singola parola del loro lavoro?

I ricercatori hanno deciso di scoprirlo sottoponendo i modelli di IA all'avanguardia a una sfida massiccia di oltre 30.000 enigmi, problemi matematici, sfide di programmazione e giochi di logica. Ma c'era un trucco: hanno costretto i modelli a rispondere immediatamente, senza "token di pensiero" o monologo interno. Volevano misurare l' "Orizzonte Temporale" (Time Horizon) — un modo elegante per chiedere: "Quanto tempo impiegherebbe un essere umano per risolvere lo stesso problema che l'IA ha appena risolto in una frazione di secondo?".

Ecco cosa hanno scoperto. Negli ultimi sei anni, questi modelli di IA sono diventati incredibilmente bravi nel pensiero silenzioso. Nel 2019, un'IA poteva risolvere solo problemi che un essere umano poteva risolvere in una frazione di secondo senza aiuto. Ma al momento delle proiezioni di questo studio per il 2026, si stima che i modelli più recenti (come GPT-5.5) siano in grado di risolvere problemi che richiederebbero a un essere umano oltre 3 minuti per essere compresi, il tutto senza dire una parola del proprio ragionamento.

La crescita sta avvenendo rapidamente. I ricercatori hanno scoperto che la complessità di questi compiti silenziosi sta raddoppiando circa ogni anno (specificamente, ogni 373 giorni). È come se l'IA stesse imparando a fare un anno di ginnastica mentale in un solo anno solare. Se questa tendenza continua, entro il 2028, questi modelli potrebbero essere in grado di risolvere silenziosamente compiti che richiederebbero agli esseri umani 7 minuti, e nel 2030, questo potrebbe saltare a 25 minuti di puro lavoro mentale nascosto.

Per controllare i loro calcoli, hanno anche esaminato quanti "token di ragionamento" (l'equivalente digitale dei passaggi di pensiero) un modello di riferimento avrebbe bisogno per risolvere questi stessi problemi. Hanno scoperto che la capacità silenziosa dell'IA sta anche raddoppiando ogni anno in termini di questi token, raggiungendo oltre 1.500 token di potenza di elaborazione nascosta per i modelli più recenti.

L'articolo suggerisce che, sebbene non possiamo essere sicuri al 100% del futuro (i numeri hanno un ampio intervallo di possibilità), la tendenza è chiara: i modelli di IA stanno guadagnando rapidamente la capacità di svolgere un ragionamento complesso e multi-step interamente dentro le loro "menti" senza mostrarlo. Ciò significa che affidarsi all'ascolto dei pensieri di un'IA per mantenerla al sicuro potrebbe diventare molto più difficile nel prossimo futuro, perché l'IA potrebbe semplicemente fare tutto quel pensiero in silenzio. Gli autori esortano gli sviluppatori a continuare a monitorare da vicino questa capacità "silenziosa", perché sta crescendo in modo prevedibile e potrebbe cambiare il modo in cui monitoriamo questi potenti sistemi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →