← Nieuwste papers
💬 NLP

OmniGen2: Towards Instruction-Aligned Multimodal Generation

In dit werk wordt OmniGen2 voorgesteld, een open-source generatief model dat door middel van een decoupled architectuur en een nieuw reflectiemechanisme state-of-the-art prestaties behaalt op diverse multimodale taken, waaronder tekst-naar-afbeelding, beeldbewerking en contextgestuurde generatie.

Oorspronkelijke auteurs: Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu
Gepubliceerd 2026-04-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu Lian, Xinlong Wang, Zhongyuan Wang, Tiejun Huang, Zheng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een magische kunstenaar hebt die niet alleen schilderijen maakt, maar ook foto's kan bewerken, verhaaltjes kan illustreren en zelfs personages uit één foto kan "plukken" en in een nieuwe scène kan zetten. Dat is wat OmniGen2 doet.

In dit artikel presenteren de onderzoekers een nieuwe, slimme AI die beter is dan ooit tevoren in het begrijpen van wat mensen willen, zelfs als de instructies ingewikkeld zijn. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De "Vreemde" Kunstenaar

Vroeger waren AI-kunstenaars als gespecialiseerde vakmensen. De ene kon alleen prachtige landschappen maken, de andere kon alleen tekst op een bordje schrijven, en weer een andere kon alleen een kat uit een foto verwijderen. Als je ze iets anders vroeg, faalden ze. Ze waren niet flexibel genoeg en begrepen niet altijd precies wat je bedoelde.

OmniGen2 is de oplossing: een universele meester. Hij kan alles doen: van het maken van een foto van nul af, tot het aanpassen van bestaande foto's, tot het combineren van verschillende beelden.

2. Hoe werkt het? De Twee-Fasen Opbouw

De onderzoekers hebben dit model niet zomaar "gegooid" in de computer. Ze hebben het opgebouwd in twee duidelijke stappen, net zoals het opleiden van een leerling:

  • Fase 1: De Basis (De "Wetenschapper")
    Eerst leren ze de AI over de wereld. Ze geven hem miljoenen boeken, foto's en video's te zien. Hij leert wat een "hond" is, hoe een "zonsondergang" eruitziet, en hoe kleuren werken. Dit is de fundamentele kennis. Zonder deze basis zou de AI maar gekkigheden maken. Ze zorgen ervoor dat hij een sterke, flexibele basis heeft, zonder dat hij te veel op één ding gefocust raakt (zodat hij niet "stijf" wordt).

  • Fase 2: De Training (De "Trainer")
    Nu de AI de wereld kent, moet hij leren luisteren naar jouw specifieke wensen. Dit is het lastigste deel. Stel je voor dat je een trainer bent. Als je zegt: "Maak de hond blauw", moet hij dat doen, maar de hond moet nog steeds op een hond lijken.
    De onderzoekers gebruiken een slimme methode genaamd versterkende leerling (reinforcement learning). Het is alsof de AI een spelletje speelt:

    1. Hij maakt een plaatje.
    2. De trainer kijkt: "Ja, dat is goed!" of "Nee, de hoed ontbreekt, probeer het opnieuw."
    3. De AI leert van de fouten en wordt steeds beter.
      Ze doen dit stap voor stap: eerst leren ze hem simpele dingen, dan moeilijke dingen, en uiteindelijk heel complexe instructies.

3. De Slimme Trucs (De "Magische Gereedschappen")

Om dit allemaal soepel te laten verlopen, hebben ze twee nieuwe hulpmiddelen bedacht:

  • De "Talen- en Beeld-Brug" (Decoupled Architecture):
    Stel je voor dat de AI twee hersenen heeft die perfect samenwerken. De ene hersen (een taal-expert) leest wat je zegt en begrijpt de betekenis. De andere hersen (een beeld-expert) tekent het plaatje. Ze praten niet door een smalle tunnel, maar via een brede snelweg. Hierdoor kan de AI complexe instructies begrijpen zonder dat de details verloren gaan.

  • De "Locatie-Code" (Omni-RoPE):
    Dit is misschien wel het coolste stukje. Als je een foto wilt bewerken (bijvoorbeeld: "verplaats de stoel naar links"), moet de AI precies weten waar de stoel zat en waar hij nu moet zijn.
    Normale AI's raken hier vaak de weg kwijt. OmniGen2 gebruikt een nieuw systeem van coördinaten. Het is alsof elke pixel op een kaartje een eigen adres krijgt: "Ik ben in foto A, op rij 3, kolom 5." Dankzij dit systeem weet de AI precies welk deel van de foto hij moet aanpassen en welk deel hij met rust moet laten. Hij verwart nooit meer twee verschillende foto's met elkaar.

4. De Nieuwe Test (OmniContext)

Omdat er geen goede manier was om te testen of deze AI echt goed is in het combineren van beelden (bijvoorbeeld: "Neem de kat uit foto 1 en zet hem in de kamer uit foto 2"), hebben de onderzoekers een nieuwe test ontwikkeld: OmniContext.

Het is als een examen voor de AI. Ze geven hem een set foto's en een opdracht, en kijken of hij de persoon of het object herkenbaar houdt terwijl hij de omgeving verandert. OmniGen2 scoort hierop extreem goed, beter dan veel andere bekende modellen.

Samenvatting in één zin

OmniGen2 is als een meesterkunstenaar met een perfect geheugen en een luisterend oor: hij kent de wereld, begrijpt precies wat je wilt, en kan foto's maken, aanpassen en combineren alsof het niets is, zonder dat hij de details verliest.

De onderzoekers hebben de code en de modellen vrijgegeven, zodat iedereen kan zien hoe deze nieuwe generatie van slimme beeldmakers werkt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →