← Ultimi articoli
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

Il documento introduce INSET, un modello unificato di generazione visiva che incorpora le immagini come token di vocabolario nativo all'interno delle istruzioni testuali e sfrutta un motore di dati scalabile composto da 15 milioni di campioni intercalati per superare significativamente i metodi esistenti nella coerenza multi-immagine e nel seguire istruzioni complesse.

Autori originali: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Pubblicato 2026-05-13
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover dare a un artista un ordine molto specifico e complesso.

Il Vecchio Metodo (Il Problema della "Scheda")
Attualmente, la maggior parte dei generatori di immagini AI funziona come un bibliotecario che comprende solo i numeri. Se desideri un'immagine con un cane specifico da una foto, un cappello specifico da un'altra e uno sfondo specifico da una terza, devi dire: "Disegna un'immagine usando il Cane dall'Immagine #1, il Cappello dall'Immagine #2 e lo Sfondo dall'Immagine #3."

L'AI deve ricordare quale numero corrisponde a quale immagine mentre cerca di dipingere. Man mano che aggiungi più immagini, l'AI si confonde. Dimentica quale cappello corrisponde a quale cane, oppure ignora completamente le immagini extra. È come cercare di fare giocoleria con cinque palline bendati; prima o poi le farai cadere.

Il Nuovo Metodo: "Immagini nelle Frasi" (Inset)
Il documento introduce un nuovo modello chiamato Inset (Immagini nelle Frasi). Invece di trattare le immagini come file separati con numeri, Inset tratta le immagini come parole in una frase.

Immagina di scrivere una storia, ma invece di scrivere la parola "cane", incolli una piccola, perfetta immagine di quel cane specifico direttamente nella frase.

  • Vecchio metodo: "Metti il cane dall'Immagine 1 sulla sedia."
  • Metodo Inset: "Metti [Immagine del Cane] sulla sedia."

Poiché l'immagine è proprio accanto alla parola "sedia" nella frase, l'AI non deve indovinare o ricordare un numero. Il significato è lì, in primo piano. Questo permette all'AI di gestire istruzioni complesse con molte immagini diverse senza confondersi.

Come Hanno Addestrato l'AI (La "Fabbrica di Dati")
Per insegnare all'AI a farlo, i ricercatori non potevano semplicemente trovare abbastanza esempi su Internet perché sono rari. Quindi, hanno costruito un motore di dati scalabile (una fabbrica robotizzata per i dati).

  1. Per le Foto: Hanno preso milioni di foto e utilizzato altre AI intelligenti per scomporle. Hanno identificato ogni oggetto (come un "vaso rosso" o un "gatto blu"), scritto una frase al riguardo e poi inserito l'immagine reale di quell'oggetto direttamente nella frase al posto della descrizione.
  2. Per i Video: Hanno analizzato i video per insegnare all'AI come le cose cambiano. Se un video mostra un gatto che salta, hanno creato istruzioni che dicono: "Prendi il gatto dall'inizio [Immagine del gatto seduto] e fallo saltare [Immagine del gatto che salta]". Questo insegna all'AI a comprendere il movimento e la trasformazione, non solo la copia statica.

Hanno creato 15 milioni di queste "frasi-immagine" per addestrare il modello.

I Risultati
Hanno testato questo nuovo modello su una sfida difficile chiamata InterleaveBench, che consiste nel mescolare molte immagini diverse in una singola richiesta complessa.

  • Il Punteggio: Quando richiesto di utilizzare 2 immagini, Inset ha funzionato bene. Ma quando richiesto di utilizzare 5 immagini, i vecchi modelli si sono disintegrati, mentre Inset continuava a migliorare. È stato significativamente più preciso nel mantenere gli oggetti simili agli originali e nel seguire le istruzioni testuali.
  • Il Bonus: Poiché l'AI ha imparato a trattare le immagini come parte dell'istruzione, può anche eseguire modifiche. Puoi mostrargli un'immagine di una camicia specifica e dire: "Metti questa camicia sulla persona nella foto", e copierà il design esatto di quella camicia, invece di indovinare semplicemente come appare una "camicia".

In Sintesi
Il documento afferma che, smettendo di far usare all'AI i "numeri" per fare riferimento alle immagini e permettendole invece di "leggere" le immagini come se fossero parole, possiamo creare strumenti molto più potenti per generare e modificare immagini complesse. Lo hanno dimostrato costruendo una vasta libreria di esempi pratici e mostrando che il loro nuovo modello supera tutti i concorrenti open-source attuali, specialmente quando i compiti diventano complicati.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →