MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration
Dit artikel introduceert MUSE, een multi-agent framework dat de uitdagingen van het genereren van langdurige audiovisuele verhalen aanpakt door een gesloten cognitief orchestratieproces te hanteren om inhoud iteratief te plannen, uit te voeren, te verifiëren en te herzien, waardoor narratieve coherentie en identiteitsconsistentie over uitgebreide sequenties worden gewaarborgd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een lang, complex verhaal aan een vriend wilt vertellen, maar je hebt slechts één zin om mee te beginnen: "Een jongen gaat op avontuur in een bos."
Als je een standaard AI vraagt om die zin in een film te veranderen, kan het een prachtige eerste scène maken. Maar tegen de tijd dat het bij de vijfde of tiende scène komt, ziet het gezicht van de jongen er misschien uit als een heel ander persoon, is het bos plotseling veranderd in een woestijn, of is de AI vergeten wat er in de eerste scène is gebeurd. De AI raakt "dronken" van de onmiddellijke taak om de volgende afbeelding te maken en verliest het grote plaatje van het hele verhaal.
MUSE is een nieuw systeem dat is ontworast om dit op te lossen. Zie MUSE niet als één enkele kunstenaar, maar als een zeer georganiseerde filmploeg die samenwerkt om ervoor te zorgen dat het verhaal consistent blijft van het eerste frame tot het laatste.
Hier is hoe MUSE werkt, onderverdeeld in eenvoudige onderdelen:
1. Het Probleem: De "Dronken Kunstenaar"
Huidige AI-videogeneratoren zijn als een getalenteerde maar kortzichtige kunstenaar. Ze zijn geweldig in het schilderen van één prachtig beeld op basis van een prompt. Maar als je ze vraagt om een hele film te schilderen, vergeten ze de regels. Het hoofdpersonage kan van kleding veranderen, de belichting kan willekeurig omslaan van dag naar nacht, of de stem van het personage kan in de volgende scène klinken als een ander persoon. Dit wordt "semantische drift" genoemd.
2. De Oplossing: Een "Closed-Loop" Filmploeg
MUSE lost dit op door storytelling te behandelen als een closed-loop fabriek in plaats van een eenrichtingsweg. Het gebruikt een team van gespecialiseerde AI-agenten (digitale werkers) die elkaar constant controleren en corrigeren.
Het proces vindt plaats in drie hoofdfasen, zoals een echte filmproductie:
Pre-productie (De Casting Director & Scenarist):
Voordat er een video wordt gemaakt, creëert MUSE een "Character Bible". Het legt vast hoe het hoofdpersonage er precies uitziet (leeftijd, kleding, stijl) en hoe hij klinkt (stemhoogte, toon). Het maakt een digitale "ID-kaart" voor het personage. Deze ID-kaart is het regelboek dat gedurende de hele film gevolgd moet worden.- Analogie: Stel je een casting director voor die een perfecte foto en een stemopname van een acteur neemt en zegt: "Dit is wie we gebruiken. Verander niets."
Productie (De Regisseur & Set Designer):
Nu begint het systeem met het genereren van de scènes. Maar het raadt niet zomaar wat. Het gebruikt de "ID-kaart" om te garanderen dat het personage er hetzelfde uitziet. Als het script zegt dat het personage een zwaard vasthoudt, controleert MUSE de lay-out om er zeker van te zijn dat het zwaard daadwerkelijk aanwezig is en niet in de lucht zweeft.- Analogie: De regisseur roept constant: "Wacht! Die acteur ziet er anders uit! Fix het!" voordat de camera zelfs maar draait.
Post-productie (De Editor & Continuity Supervisor):
Zodra de scènes zijn gemaakt, controleert MUSE de "naden" tussen hen. Bewoog de hand van het personage vloeiend van de vorige shot naar deze? Voldeed het verhaal aan de logica? Als de AI per ongeluk het personage door een muur liet lopen of als de stem te vrolijk klinkt voor een droevige scène, vangt MUSE dit op.- Analogie: Een editor die de film bekijkt en zegt: "Deze scène komt niet overeen met de vorige. Laten we de overgang oplossen voordat we het aan het publiek laten zien."
3. De "Plan-Execute-Verify-Revise" Loop
Het geheime ingrediënt van MUSE is dat het niet alleen genereert en hoopt op het beste. Het volgt een strikte cyclus:
- Plan: Beslissen wat er als volgende moet gebeuren.
- Execute: De video/audio genereren.
- Verify: Een "criticus"-agent controleert of het resultaat overeenkomt met het plan en de karakter-ID.
- Revise: Als er iets mis is (bijv. de hoed van het personage ontbreekt), repareert MUSE alleen dat specifieke deel, in plaats van de hele scène weg te gooien en opnieuw te beginnen.
4. De Nieuwe Test: MUSEBench
Hoe weet je of een verhaal goed is als er geen "correct" antwoord bestaat? De auteurs hebben een nieuwe testomgeving gecreëerd genaamd MUSEBench.
In plaats van de output van de AI te vergelijken met een perfecte referentievideo (die niet bestaat voor creatieve verhalen), gebruikt MUSEBench een slimme AI-rechter om het verhaal te beoordelen op zaken als:
- Consistentie: Bleef het personage hetzelfde?
- Verhalende Flow: Was de plot logisch?
- Audio-Visuele Harmonie: Paste de stem bij de stemming van de scène?
Het Resultaat
De paper laat zien dat MUSE veel beter is in het behouden van de coherentie van lange verhalen dan eerdere methoden. Het zorgt ervoor dat personages er hetzelfde uitzien en klinken, behoudt de juiste stemming en zorgt ervoor dat het verhaal niet uit elkaar valt naarmate het langer wordt.
Kortom: MUSE is als een zeer georganiseerde filmploeg die weigert het verhaal rommelig te laten worden. Het plant vooruit, controleert voortdurend het werk en herstelt fouten onmiddellijk, waardoor een eenvoudige prompt kan veranderen in een lange, meeslepende en consistente film.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.