← Ultimi articoli
🤖 AI

Scalable Visual Pretraining for Language Intelligence

Questo articolo sfida il paradigma basato esclusivamente sul testo del preaddestramento dei modelli di fondazione, dimostrando che il preaddestramento visivo non supervisionato su documenti visivi grezzi, che preserva informazioni ricche come figure e layout, supera costantemente gli approcci basati solo sul testo e offre un percorso scalabile verso un'intelligenza linguistica potenziata.

Autori originali: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

Pubblicato 2026-07-13
📖 5 min di lettura🧠 Approfondimento

Autori originali: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di insegnare a un robot super intelligente come comprendere il mondo. Per molto tempo, la ricetta standard è stata quella di nutrirlo con montagne di libri, articoli e siti web, ma con un dettaglio: prima che il robot legga, gli esseri umani (o i computer) eliminano tutte le immagini, i simboli matematici contorti, i grafici e i layout di pagina elaborati, trasformando tutto in testo semplice e noioso. È come cercare di insegnare a qualcuno come preparare una torta fornendogli solo un elenco di ingredienti scritto su un tovagliolo, mentre si gettano via la foto del dolce finito, il diagramma della ciotola per mescolare e il grafico colorato che mostra come cambia la temperatura del forno.

Un nuovo articolo del 2026 suggerisce che questo approccio "solo testo" sta perdendo un pezzo enorme del puzzle. I ricercatori, guidati da un team di Shanghai e Zhejiang, sostengono che eliminando le parti visive dei documenti, stiamo buttando via proprio gli indizi di cui il robot ha bisogno per diventare davvero intelligente. Chiamano questo nuovo metodo Pre-addestramento Visivo (VP), ed è come insegnare al robot a leggere le pagine effettive di un libro di testo, completi di diagrammi ed equazioni, invece di limitarsi alla descrizione testuale di essi.

La Grande Scoperta: Vedere è Credere (e Imparare)
Il team ha testato questa idea su alcuni dei modelli di IA più intelligenti disponibili (come Qwen e Llama). Hanno preso lo stesso identico mucchio di documenti scientifici — pensa a articoli di fisica, libri di testo di matematica e rapporti tecnici — e li hanno divisi in due gruppi.

  • Gruppo A (Il Vecchio Metodo): Hanno convertito le pagine in testo semplice, eliminando tutti gli elementi visivi.
  • Gruppo B (Il Nuovo Metodo - VP): Hanno fornito al modello le immagini grezze delle pagine, lasciando che "vedesse" figure, tabelle e layout senza mai trasformarli in parole prima.

Il risultato? Il robot addestrato sulle immagini grezze (Gruppo B) ha costantemente superato quello addestrato sul solo testo (Gruppo A). Infatti, nei test scientifici e matematici più complessi, l'apprendista visivo ha ottenuto punteggi più alti. Ad esempio, in un difficile test di matematica chiamato AIME, il modello visivo ha migliorato il suo punteggio in modo significativo rispetto al modello testuale. L'articolo suggerisce che il processo "lossy" (con perdita di informazioni) di conversione di una pagina complessa con un diagramma in una sequenza di parole elimina in realtà proprio le informazioni necessarie per risolvere problemi difficili.

L'Hack di Efficienza: Fare di Più con Meno
Ecco la parte davvero incredibile: il metodo visivo non era solo migliore; era anche molto più efficiente. Il modello basato sul testo ha dovuto elaborare circa 80 miliardi di token di testo per imparare da questi documenti. Il modello visivo, invece, ha avuto bisogno di soli 20 miliardi di token visivi per ottenere gli stessi (o migliori) risultati. Questo significa utilizzare solo il 25% del budget di dati!

Pensa a questo: se il modello testuale sta cercando di descrivere una città elencando ogni singolo nome di strada e indirizzo di edificio, ci mette un'eternità. Il modello visivo, al contrario, guarda semplicemente una mappa. Cattura l'intera immagine istantaneamente. I ricercatori hanno scoperto che più "elementi visivi" (come diagrammi complessi ed equazioni) erano presenti in una pagina, maggiore era il vantaggio del modello visivo. Sulle pagine piene di grafici e formule, il vantaggio del modello visivo cresceva enormemente, mentre sulle pagine di solo testo, i due modelli erano simili.

Nessun Trucco, Solo Pura Visione
Potreste chiedervi: "Hanno barato mostrando al robot sia le immagini che le risposte?". No. Non hanno usato etichette speciali "immagine-testo" o fogli di soluzioni. Al robot è stato solo chiesto di guardare la patch successiva dell'immagine e indovinare come sarebbe apparsa, in modo simile a come indovina la parola successiva in una frase.

Sorprendentemente, questo addestramento basato sul "semplice guardare" ha reso il robot migliore in tutto, non solo nel guardare. È diventato più bravo a comprendere anche il testo e ancora più bravo a collegare le immagini alle parole quando è stato testato successivamente. I ricercatori hanno misurato questo verificando quanto bene il "cervello" del robot allineasse le immagini alle parole, e hanno scoperto che l'addestramento visivo ha fatto sì che i due concetti si incastrassero molto più strettamente, come se il robot avesse finalmente capito che l'immagine di un gatto e la parola "gatto" sono in realtà la stessa cosa.

Cosa Significa Questo (e Cosa Non Significa)
Gli autori avvertono che questo non è un bacchetta magica che sostituisce la lettura del testo. Il testo è ancora ottimo per imparare fatti che sono già scritti chiaramente. Ma per i documenti scientifici, dove il layout, la forma di un'equazione e la posizione di un diagramma portano un significato cruciale, l'approccio visivo suggerisce una nuova via scalabile.

Ammettono di non aver ancora risolto tutto. Ad esempio, non sono sicuri se questo funzioni altrettanto bene per foto casuali della natura o video, poiché i loro test riguardavano principalmente PDF scientifici ad alta densità. Ma per il caso specifico di apprendere da documenti complessi, l'articolo suggerisce che lasciare che l'IA veda il mondo così com'è — visivo, disordinato e pieno di diagrammi — potrebbe essere la chiave per sbloccare la sua vera intelligenza. È un passaggio dalla "leggere la descrizione della mappa" al "guardare effettivamente la mappa".

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →