Benchmarking Mythos-Linked Bug Rediscovery
Questo articolo riporta un esperimento controllato in cui tre modelli di intelligenza artificiale hanno tentato di riscoprire sei bug specifici legati ai materiali "Mythos" di Anthropic senza alcuna conoscenza preventiva delle correzioni, rivelando che, anche in condizioni favorevoli, i modelli hanno raggiunto un tasso di successo basso (6 tentativi su 54) principalmente a causa di una tendenza ad aderire a ipotesi plausibili ma errate piuttosto che a identificare l'invariante specifico corretto dalle patch effettive.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immaginate un gruppo di detective high-tech (modelli di IA) che recentemente hanno affermato di poter trovare crepe nascoste nei sistemi software più importanti al mondo, come i sistemi operativi del vostro telefono o i motori che trasmettono i vostri film. Hanno pubblicato storie sulla scoperta di bug specifici e pericolosi nel codice di sistemi come Linux, FreeBSD e FFmpeg.
Alcune persone sono rimaste sbalordite, pensando che queste IA fossero hacker super-intelligenti. Altri erano scettici, ritenendo che le storie fossero solo fumo negli occhi a scopo promozionale.
Questo articolo descrive un esperimento controllato progettato per risolvere il dibattito. Invece di lasciare che l'IA vaghi attraverso una vasta biblioteca di codice alla ricerca di un ago in un pagliaio, i ricercatori hanno fornito all'IA il libro esatto in cui l'ago era nascosto. Hanno chiesto: "Se vi consegniamo il file specifico contenente il bug, riuscite ancora a trovare il problema esatto?"
Ecco la panoramica dell'esperimento e di ciò che è accaduto, utilizzando analogie semplici:
La Configurazione: Il Test del "File Target"
Immaginate il codice software come un manuale di istruzioni gigante di 4.000 pagine per una macchina complessa.
- L'Affermazione: L'IA (Mythos) ha dichiarato di poter trovare un errore di battitura specifico in questo manuale che avrebbe fatto esplodere la macchina.
- L'Esperimento: I ricercatori hanno preso il manuale, trovato la pagina specifica con l'errore di battitura e consegnato solo quella pagina a tre diversi detective IA:
- GPT-5.5 xhigh (il modello "Reasoning")
- Claude Opus 4.7 (il modello "Anthropic")
- Kimi K2 (un modello cinese)
Hanno dato loro le stesse regole: niente internet, nessun indizio sul bug, e dovevano trovare l'errore esatto che un umano aveva già corretto in una patch pubblica. Hanno provato tre volte per sei diversi "bug".
I Risultati: Chi ha trovato l'ago?
Su un totale di 54 tentativi (3 modelli × 6 bug × 3 tentativi ciascuno):
- GPT-5.5 xhigh: Ha trovato il bug esatto 5 volte. Ha risolto perfettamente 2 dei 6 bug diversi e una volta ha trovato un bug diverso nello stesso file (un "obiettivo sbagliato" ma comunque una scoperta reale).
- Claude Opus 4.7: Ha trovato il bug esatto 1 volta. Ha risolto 1 dei 6 bug.
- Kimi K2: Ha trovato il bug esatto 0 volte. Non ha trovato nulla.
Il "Perché": La Trappola delle Distrazioni Plausibili
La parte più interessante del documento non è solo chi ha vinto, ma come hanno fallito.
Immaginate di guardare il motore di un'auto. Sapete che c'è un bullone rotto da qualche parte.
- L'Errore dell'IA: L'IA ha guardato il motore e ha visto un cavo allentato, un filtro sporco e una guarnizione leggermente usurata. Ha detto: "Ho trovato il problema! È il cavo allentato!"
- La Realtà: Il cavo allentato era un problema plausibile, ma non era il bullone rotto specifico che i ricercatori stavano cercando.
Il documento definisce questo fenomeno come "impegno precoce verso candidati alternativi plausibili".
I modelli IA erano bravi a guardare il codice e dire: "Ehi, questo sembra sospetto!". Hanno trovato molte cose che potevano essere bug. Ma faticavano a scegliere la cosa specifica che corrispondeva alla correzione reale. Si sono lasciati distrarre da "falsi indizi": cose che sembravano bug ma non erano quella specifica che stavano cacciando.
Il Costo della Caccia
L'esperimento ha anche tracciato quanto "carburante" (denaro e potenza di calcolo) fosse necessario.
- GPT-5.5 è costato circa 61 dollari.
- Claude è costato circa 88 dollari (è stato il più costoso).
- Kimi è stato il più economico a 3,50 dollari, ma non ha trovato nulla.
Anche se i ricercatori hanno fornito all'IA il file esatto (rimuovendo la parte più difficile del lavoro: trovare il file), l'IA ha comunque faticato a individuare l'errore esatto.
La Conclusione
Questo documento non dice che l'IA è inutile, né afferma che le storie originali di "Mythos" fossero false. Dice semplicemente:
"Consegnare all'IA il file giusto non è sufficiente."
Anche quando l'IA sa esattamente dove guardare, spesso si blocca sui dettagli sbagliati. Può generare molti "possibili bug", ma ha difficoltà a selezionare l'unico vero bug che corrisponde all'evidenza specifica. Il documento conclude che il successo di questi cacciatori di bug basati sull'IA dipende probabilmente in larga misura dal processo (quanti tentativi ottengono, come vengono classificati e come vengono guidati) piuttosto che dalla semplice intelligenza grezza del modello stesso.
In sintesi: l'IA è un detective intelligente che può leggere il manuale, ma ha ancora bisogno di un insieme di istruzioni molto specifico per trovare l'esatto errore di battitura, altrimenti si limiterà a indicare la macchia più vicina sulla pagina.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.