← Nieuwste papers
💻 computer science

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

Deze paper introduceert MACRO, een aanpak die het probleem van prestatiedaling bij multi-referentiebeeldgeneratie oplost door middel van de nieuwe MacroData-dataset met 400.000 gestructureerde voorbeelden en het MacroBench-evaluatiekader, wat leidt tot aanzienlijke verbeteringen in het genereren van beelden op basis van meerdere visuele referenties.

Oorspronkelijke auteurs: Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

Gepubliceerd 2026-03-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een kunstenaar bent die een verhaal moet vertellen, maar in plaats van één foto te gebruiken, moet je tien verschillende foto's tegelijk in je hoofd houden om één nieuwe, perfecte afbeelding te maken.

Dat is precies wat dit paper, getiteld MACRO, probeert op te lossen. Hier is de uitleg in simpele taal, met een paar verhelderende vergelijkingen.

1. Het Probleem: De "Korte Aandacht" van AI

Huidige AI-kunstenaars (zoals Bagel of OmniGen) zijn geweldig in het maken van plaatjes op basis van één of twee foto's. Maar als je ze vraagt om een plaatje te maken dat gebaseerd is op tien verschillende foto's (bijvoorbeeld: "Maak een foto van deze man, in deze kleding, op deze plek, met dit object, in deze stijl..."), raken ze in de war.

  • De Analogie: Het is alsof je een vriend vraagt om een verslag te schrijven over een film die je net hebt gezien. Als je de film in één keer laat zien, kan hij het vertellen. Maar als je de film in 10 losse, willekeurige fragmenten van 1 seconde laat zien, en vraagt om een samenvatting, zal hij waarschijnlijk de draad kwijtraken. De AI "vergeet" de eerdere foto's zodra ze te veel worden.

2. De Oplossing: MACRO (De Grote Bibliotheek)

De onderzoekers zeggen: "Het probleem is niet dat de AI dom is, maar dat we haar niet hebben getraind met genoeg moeilijke voorbeelden."

Ze hebben daarom MacroData gemaakt. Dit is een gigantische verzameling van 400.000 voorbeelden.

  • Wat zit erin? In elk voorbeeld moet de AI werken met tot wel 10 input-foto's.

  • De 4 Spelregels (Categorieën):

    1. Aanpassen (Customization): "Neem dit gezicht, deze jas en deze achtergrond en maak er één plaatje van."
    2. Illustreren: "Hier is een verhaal met 5 foto's ertussen; maak de volgende plaatje dat bij het verhaal past."
    3. Ruimtelijk (Spatial): "Hier zijn foto's van een object van voren, achteren, links en rechts. Nu maak jij de foto van de zijkant die we niet hebben." (Alsof je een 3D-robot bouwt uit 2D-plaatjes).
    4. Tijdelijk (Temporal): "Hier zijn 5 frames van een video. Wat gebeurt er in het 6e frame?"
  • De Vergelijking: Stel je voor dat je een student wilt leren voor een examen. Tot nu toe kregen ze alleen oefeningen met 1 vraag. MACRO is als een oefenboek met 400.000 vragen, waarbij de moeilijkste vragen 10 verschillende hints vereisen om het antwoord te vinden.

3. De Test: MACROBench (De Examencommissie)

Omdat niemand wist hoe je dit soort moeilijke taken goed kunt beoordelen, hebben ze ook MACROBench gemaakt.

  • Dit is een test met 4.000 vragen.
  • Ze gebruiken een slimme "rechter" (een andere AI, genaamd Gemini) om te kijken of de nieuwe plaatjes logisch zijn.
  • De Analogie: Het is alsof je een nieuwe student laat examen doen bij een strenge commissie die niet alleen kijkt of het antwoord klopt, maar ook of de student alle hints uit de vraag heeft gebruikt.

4. De Resultaten: Van "Nieuweling" naar "Meester"

Toen ze de AI-modellen trainden met deze nieuwe "oefenboeken" (MacroData), gebeurde er iets wonderlijks:

  • De AI werd plotseling heel goed in het onthouden van 6, 7, 8, 9 of zelfs 10 foto's tegelijk.
  • Ze presteerden bijna net zo goed als de duurste, gesloten systemen van grote tech-bedrijven (zoals GPT-4 of Nano Banana Pro).
  • De Metafoor: Het was alsof je een kind dat alleen maar 1+1 kon rekenen, een jaar lang liet oefenen met complexe puzzels. Plotseling kon het niet alleen 1+1, maar ook 10+10+10... zonder de draad kwijt te raken.

5. Waarom is dit belangrijk?

Vroeger kon AI alleen simpele dingen doen, zoals "maak een hond in een hoed". Met MACRO kunnen we nu complexe dingen doen:

  • Een film maken waarbij personages consistent blijven door 10 verschillende scènes.
  • Een architectonisch ontwerp maken waarbij je het gebouw van alle kanten kunt bekijken.
  • Een verhaal illustreren waarbij de karakters er in elke afbeelding hetzelfde uitzien, maar in verschillende situaties.

Kortom:
De onderzoekers hebben een gigantische trainingsset (MacroData) en een nieuwe test (MacroBench) gemaakt om AI-modellen te leren hoe ze met veel informatie tegelijk moeten omgaan. Hierdoor kunnen ze nu complexe, realistische plaatjes maken die gebaseerd zijn op een heel verhaal of veel verschillende bronnen, in plaats van maar één foto. Ze hebben de "korte aandacht" van de AI opgeheven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →