← Nieuwste papers
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

Het artikel introduceert INSET, een geïntegreerd visueel generatiemodel dat afbeeldingen als native vocabulaire-tokens in tekstuele instructies verwerkt en gebruikmaakt van een schaalbare data-engine met 15 miljoen verweven samples om bestaande methoden aanzienlijk te overtreffen op het gebied van consistentie bij meerdere afbeeldingen en het volgen van complexe instructies.

Oorspronkelijke auteurs: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Gepubliceerd 2026-05-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer specifieke, complexe opdracht geeft aan een kunstenaar.

De Oude Manier (Het "Indexkaart"-Probleem)
Momenteel werken de meeste AI-afbeeldingsgeneratoren als een bibliothecaris die alleen getallen begrijpt. Als je een afbeelding wilt met een specifieke hond uit één foto, een specifieke hoed uit een andere, en een specifieke achtergrond uit een derde, moet je zeggen: "Teken een plaatje met de Hond uit Afbeelding #1, de Hoed uit Afbeelding #2, en de Achtergrond uit Afbeelding #3."

De AI moet onthouden welk nummer overeenkomt met welke afbeelding terwijl het probeert te schilderen. Naarmate je meer afbeeldingen toevoegt, raakt de AI in de war. Het vergeet welke hoed bij welke hond hoort, of het negeert de extra afbeeldingen volledig. Het is alsof je probeert vijf ballen te jongleren terwijl je blinddoek draagt; uiteindelijk laat je ze vallen.

De Nieuwe Manier: "Afbeeldingen in Zinnen" (Inset)
Het artikel introduceert een nieuw model genaamd Inset (Afbeeldingen in Zinnen). In plaats van afbeeldingen te behandelen als aparte bestanden met nummers, behandelt Inset afbeeldingen als woorden in een zin.

Stel je voor dat je een verhaal schrijft, maar in plaats van het woord "hond" te schrijven, plak je een klein, perfect plaatje van die specifieke hond direct in de zin.

  • Oude manier: "Zet de hond uit Afbeelding 1 op de stoel."
  • Inset-methode: "Zet [Plaatje van Hond] op de stoel."

Omdat het plaatje direct naast het woord "stoel" in de zin staat, hoeft de AI niet te raden of een nummer te onthouden. De betekenis staat daar, centraal en duidelijk. Dit stelt de AI in staat complexe instructies met veel verschillende afbeeldingen te verwerken zonder in de war te raken.

Hoe Ze de AI Trainden (De "Datafabriek")
Om de AI dit te leren, konden de onderzoekers niet gewoon genoeg voorbeelden op internet vinden omdat deze zeldzaam zijn. Dus bouwden ze een schaalbare data-engine (een robotfabriek voor data).

  1. Voor Foto's: Ze namen miljoenen foto's en gebruikten andere slimme AIs om ze te ontleden. Ze identificeerden elk object (zoals een "rode vaas" of een "blauwe kat"), schreven een zin erover, en plaatsten vervolgens het daadwerkelijke plaatje van dat object direct in de zin waar de beschrijving stond.
  2. Voor Video's: Ze keken naar video's om de AI te leren hoe dingen veranderen. Als een video een kat laat springen, creëerden ze instructies die zeggen: "Neem de kat van het begin [Plaatje van zittende kat] en laat het springen [Plaatje van springende kat]." Dit leert de AI beweging en transformatie te begrijpen, niet alleen statisch kopiëren.

Ze creëerden 15 miljoen van deze "plaatje-zinnen" om het model te trainen.

De Resultaten
Ze testten dit nieuwe model op een moeilijke uitdaging genaamd InterleaveBench, waarbij veel verschillende afbeeldingen in één complexe aanvraag worden gemengd.

  • De Score: Toen gevraagd werd om 2 afbeeldingen te gebruiken, deed Inset het goed. Maar toen gevraagd werd om 5 afbeeldingen te gebruiken, vielen de oude modellen uiteen, terwijl Inset bleef verbeteren. Het was aanzienlijk accurater in het behouden van de objecten die eruit zagen als de originelen en het volgen van de tekstinstructies.
  • De Bonus: Omdat de AI leerde om afbeeldingen als onderdeel van de instructie te behandelen, kan het ook bewerken. Je kunt het een plaatje van een specifiek overhemd laten zien en zeggen: "Zet dit overhemd op de persoon in de foto", en het zal het exacte ontwerp van dat overhemd kopiëren, in plaats van alleen maar te raden hoe een "overhemd" eruit ziet.

Samenvattend
Het artikel beweert dat door de AI te stoppen met het gebruik van "nummers" om naar afbeeldingen te verwijzen en het in plaats daarvan afbeeldingen te laten "lezen" alsof het woorden zijn, we veel krachtigere tools kunnen creëren voor het genereren en bewerken van complexe afbeeldingen. Ze bewezen dit door een enorme bibliotheek met oefenvoorbeelden te bouwen en te tonen dat hun nieuwe model alle huidige open-source concurrenten verslaat, vooral wanneer de taken complexer worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →