← Ultimi articoli
💻 computer science

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo è un framework efficiente nell'addestramento che sfrutta un modello Vision-Language preaddestrato come encoder intrinseco per comprimere i token visivi in un insieme compatto di memory token, ottenendo prestazioni e stabilità superiori attraverso vari rapporti di compressione senza richiedere un addestramento esteso o moduli esterni.

Autori originali: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

Pubblicato 2026-08-10
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un amico robot super intelligente che può guardare una foto e raccontarti una storia su di essa. Questo robot è incredibilmente talentuoso, ma ha un cervello minuscolo e molto costoso. Quando gli mostri una foto ad alta definizione, il robot cerca di guardare ogni singolo pixel, trasformando l'immagine in una lista massiccia di migliaia di piccoli appunti chiamati "token". È come cercare di leggere un'intera enciclopedia solo per decidere se un'immagine mostra un gatto o un cane. Questo processo è così pesante che rende il robot lento, affamato di memoria e difficile da usare su telefoni comuni o in situazioni in tempo reale. Gli scienziati hanno cercato di insegnare al robot a essere più efficiente, solitamente gettando via gli appunti "noiosi" (il che a volte fa sì che il robot perda dettagli importanti) o costruendo una macchina completamente nuova e pesante per aiutarlo a riassumere (il che è costoso e difficile da addestrare). La grande domanda è: possiamo far riassumere al robot l'immagine stessa, usando la sua stessa capacità cerebrale esistente, senza aver bisogno di una ristrutturazione massiccia?

Questo è esattamente ciò che i ricercatori dietro VisCo si sono posti l'obiettivo di risolvere. Si sono resi conto che il cervello del robot (un Modello Visione-Linguaggio) è già un maestro nel comprendere le immagini; solo che non gli è mai stato chiesto di riassumerle in modo efficiente prima d'ora. Invece di costruire un nuovo strumento o cancellare ciecamente gli appunti, VisCo tratta il cervello del robot come una macchina di compressione autonoma. Introducono un piccolo set di "token di memoria" — pensa a loro come a pochi post-it su cui il robot può scrivere — e chiedono al robot di leggere l'intera immagine e condensare tutte quelle informazioni su quei pochi appunti. La magia avviene perché il robot usa la propria "attenzione" interna (come si concentra su diverse parti di un'immagine) per capire cosa sia importante, strato dopo strato, dalle texture semplici ai significati complessi.

Il documento afferma che questo approccio è un vero punto di svolta. Mentre altri metodi falliscono miseramente quando si forza l'uso di pochissimi appunti (come cercare di descrivere un'intera città con una sola parola), VisCo rimane sorprendentemente forte. Nei loro test, anche quando hanno compresso l'immagine fino a un singolo token, VisCo ha mantenuto circa l'85% della sua intelligenza originale, superando di gran lunga altri metodi che scendevano intorno al 35-50%. Ancora più interessante, i ricercatori hanno scoperto che questi "appunti di memoria" non sono solo una versione ridotta dell'immagine originale; essi catturano effettivamente nuovi modi di vedere l'immagine che possono talvolta rendere il robot ancora più intelligente di prima. È un modo leggero ed efficiente per permettere al robot di fare di più con meno, senza dover riaddestrare tutto il suo cervello da zero.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →