Inferring the Size of Large Language Models From Popular Text Memorization
Questo articolo introduce un metodo black-box che inferisce limiti inferiori conservativi sul numero di parametri dei grandi modelli linguistici analizzando la loro accuratezza di memorizzazione di testi popolari, consentendo la classificazione delle dimensioni dei modelli e rivelando strategie di scalatura industriali nascoste anche per sistemi con pesi chiusi.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di entrare in una stanza dove diverse persone stanno recitando storie famose come Alice nel Paese delle Meraviglie o la Bibbia. Non puoi vederle, non puoi chiedere loro quanto siano grandi i loro cervelli e non puoi sbirciare nei loro appunti. Puoi solo ascoltare ciò che dicono dopo, quando le interrompi a metà di una frase.
Questo è esattamente il problema che i ricercatori hanno affrontato con i moderni modelli di intelligenza artificiale (Large Language Models). Le grandi aziende tecnologiche costruiscono queste IA potenti ma tengono segreti i loro "progetti". Non ti dicono quanti "neuroni" (parametri) ha l'IA, che è il modo standard per misurare quanto sia intelligente o costoso un modello.
Questo articolo introduce un astuto metodo investigativo "a scatola nera" per indovinare la dimensione di questi segreti cervelli artificiali semplicemente ascoltando quanto bene completano le frasi.
L'idea centrale: Il "test di memoria"
I ricercatori hanno realizzato che quasi ogni grande IA viene addestrata sullo stesso enorme mucchio di testi internet. Questo significa che hanno tutti letto gli stessi libri popolari, testi religiosi e documenti famosi.
Pensaci come a un concorso di memoria. Se chiedi a una persona di completare una frase tratta da un libro che ha memorizzato, una persona con un cervello più grande (più parametri) generalmente indovinerà correttamente più spesso di qualcuno con un cervello più piccolo.
I ricercatori hanno testato questa ipotesi:
- Scegliendo 37 testi famosi di pubblico dominio (come Amleto, la Bibbia e la Costituzione degli Stati Uniti).
- Tagliandoli in migliaia di piccoli frammenti.
- Chiedendo a diversi modelli di IA di prevedere la parola successiva in quei frammenti.
Hanno trovato un modello chiaro: Più grande è l'IA, meglio riesce a indovinare la parola successiva in queste storie famose. Anche se altri fattori (come il modo in cui l'IA è stata insegnata) contano, la dimensione del cervello è stata il principale motore del successo.
I due strumenti investigativi
Per trasformare questi "punteggi di memoria" in una stima della dimensione, il team ha costruito due strumenti diversi:
1. La "Legge di Scalatura" (La Mappa)
Immagina di avere un gruppo di persone note (IA open-source) di cui conosci le dimensioni del cervello. Tracci i loro punteggi di memoria contro le loro dimensioni note e disegni una curva liscia che collega i punti. Sembra una scala: man mano che il punteggio sale, la dimensione sale in modo esponenziale.
- Come funziona: Quando un'IA segreta sostiene il test, vedi dove si posiziona sulla scala. Se ottiene un punteggio simile a un modello da 100 miliardi di parametri, stimi che sia circa di quella dimensione.
- Il limite: Poiché l'IA segreta potrebbe essere costruita diversamente (come un modello "Mixture of Experts" dove solo una parte del cervello è attiva alla volta), i ricercatori hanno deciso di essere molto conservativi. Non indovinano la dimensione esatta; indovinano un pavimento minimo. Dicono: "Questa IA è almeno grande così".
2. Il Test "Testa a Testa" (La Gara)
A volte non hai bisogno di un numero esatto; ti basta sapere chi è più grande.
- Come funziona: I ricercatori mettono a confronto due IA segrete nello stesso test di memoria. Usano una "gara" statistica per vedere se un'IA è costantemente migliore nel completare le frasi rispetto all'altra.
- Il risultato: Se l'IA A batte l'IA B nella gara, possono affermare con sicurezza che "l'IA A è sicuramente più grande dell'IA B", anche senza conoscere i numeri esatti.
Cosa hanno scoperto
Il team ha testato il loro metodo su 19 modelli open-source (dove conoscevano le risposte) e ha avuto ragione nel 95% dei casi. Poi, hanno rivolto la loro attenzione ai modelli "segreti" di aziende come OpenAI, Google, Anthropic e Alibaba.
Ecco cosa ha rivelato il "lavoro investigativo" sulle strategie nascoste del settore:
- La strategia del "Grande Cervello" (Google e Anthropic): Queste aziende sembrano costruire modelli con enormi conteggi di parametri. Ad esempio, i loro modelli di fascia alta mostravano segni di avere centinaia di miliardi di parametri, suggerendo che stanno diventando sempre più grandi con ogni nuova generazione.
- La strategia dell'"Efficienza" (OpenAI e Alibaba): Sorprendentemente, i ricercatori hanno scoperto che i modelli più recenti di OpenAI (come le varianti GPT-4o e GPT-5) non sembravano diventare significativamente più grandi in termini di conteggio grezzo dei parametri rispetto alle versioni più vecchie. Sembra che stiano raggiungendo un "tetto dimensionale". Invece di ingrandire il cervello, sembrano rendere il cervello esistente più intelligente attraverso un addestramento migliore o algoritmi più intelligenti.
- Il controllo della gerarchia: Il metodo ha correttamente identificato la classificazione interna dei prodotti. Ad esempio, ha correttamente indovinato che il modello "Opus" di Anthropic è più grande del suo modello "Sonnet", che a sua volta è più grande del suo modello "Haiku", senza che gli venisse comunicata questa gerarchia in anticipo.
I limiti (Le note a piè di pagina)
L'articolo è molto onesto su ciò che non può fare:
- È un limite inferiore: Il metodo è progettato per essere sicuro. Ti dirà che l'IA è almeno grande X, ma la dimensione reale potrebbe essere molto più grande. È come dire: "Questa scatola pesa almeno 10 libbre", quando in realtà potrebbe pesare 50.
- Il problema "MoE": Alcune IA moderne utilizzano un'architettura "Mixture of Experts". Immagina una biblioteca dove solo alcuni bibliotecari specifici vengono chiamati per rispondere a una domanda, invece di tutto il personale. Poiché i ricercatori non possono vedere quanti bibliotecari ci sono in totale rispetto a quanti sono attivi, non possono ottenere un conteggio totale esatto per questi modelli, solo un minimo conservativo.
- Nessun imbroglio: Il metodo presuppone che l'IA non stia cercando di ingannarli. Se un'azienda avesse programmato intenzionalmente la sua IA per dimenticare i libri famosi per nascondere la sua dimensione, questo metodo fallirebbe.
La conclusione
Questo articolo dimostra che non hai bisogno dei progetti segreti di un'azienda per avere una buona idea di quanto sia grande la sua IA. Semplicemente testando quanto bene un'IA ricorda storie famose, puoi dedurre una "dimensione minima" affidabile e scoprire se un'azienda sta facendo crescere i suoi modelli rendendoli più grandi o rendendoli più intelligenti. Trasforma la "scatola nera" dell'IA in qualcosa in cui possiamo sbirciare, anche se non possiamo vedere tutto.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.