← Nieuwste papers
💻 computer science

InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

Dit artikel introduceert InstructAV2AV, het eerste end-to-end framework voor instructiegeleide gezamenlijke bewerking van audio en video, dat gebruikmaakt van een nieuw samengestelde grote dataset (InsAVE-80K) en een gespecialiseerde tweestaps trainingsstrategie om bestaande methoden te overtreffen bij het genereren van gesynchroniseerde, hoogwaardige bewerkte content.

Oorspronkelijke auteurs: Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

Gepubliceerd 2026-05-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een thuisvideo hebt van een vriend die een toespraak houdt. Stel je nu voor dat je wilt veranderen wat ze zeggen, of ze zelfs volledig wilt vervangen door een andere persoon, maar dat je wilt dat de achtergrondgeluiden, de belichting en het tijdsverloop perfect natuurlijk blijven.

Meestal zijn het bewerken van video en het bewerken van audio twee aparte taken. Als je de video verandert, loopt de audio vaak niet meer synchroon of klinkt het vreemd (zoals een voice-over die niet past bij de lippen). Dit artikel introduceert InstructAV2AV, een nieuw hulpmiddel dat video en audio behandelt als één onlosmakelijk pakket. Je geeft een eenvoudige tekstopdracht, en het herschrijft zowel het beeld als het geluid tegelijkertijd, direct.

Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

1. Het "Magische Recept" (Het Data-probleem)

Om een computer dit te leren, heb je duizenden voorbeelden van "Voor" en "Na" video's nodig. Maar niemand heeft een bibliotheek met video's waarin iemand "Hallo" zegt en vervolgens magisch verandert in "Tot ziens" terwijl de achtergrond hetzelfde blijft.

De auteurs bouwden een datafabriek (genaamd InsAVE-80K). Denk hierbij aan een high-tech keuken:

  • Ze namen ruwe video's van internet.
  • Ze gebruikten een "masker-gestuurde" robotchef om specifieke delen uit te knippen (zoals het gezicht van een persoon of een auto).
  • Ze gebruikten AI om nieuwe audio en video voor die specifieke delen te genereren op basis van tekstopdrachten (bijvoorbeeld: "Verander de man in een vrouw").
  • Vervolgens plaatsten ze deze nieuwe delen terug in de originele video, waarbij de achtergrond onaangetast bleef.
  • Tot slot lieten ze mensen en slimme computers de resultaten proefnemen om ervoor te zorgen dat ze er echt uitzagen en klonken. Dit creëerde een enorme kookboek van 80.000 trainingsvoorbeelden.

2. De "Slimme Redacteur" (Het Model)

De kern van het systeem is een Dubbelstroom-brein. Stel je een dirigent voor die tegelijkertijd twee orkesten leidt: één voor het visuele tafereel (video) en één voor het geluid (audio).

  • Het Anker: Wanneer je om een bewerking vraagt, raadt het systeem niet zomaar. Het kijkt naar de originele video en audio als een "veiligheidsanker" om ervoor te zorgen dat het niet per ongeluk de lucht, de bomen of de achtergrondgeluiden verandert.
  • De Opdracht: Je typt een commando zoals: "Verander de man in een jonge vrouw met bruin haar die zegt 'Ik denk dat we het nog eens moeten proberen'."
  • De Gated Attention (SIGA): Dit is het geheime ingrediënt van het artikel. Stel je een dimmer of een verkeerslicht voor voor elk enkel moment in de video.
    • Als het licht Rood is, zegt het systeem: "Houd de originele video/audio precies zoals hij is" (de achtergrond behouden).
    • Als het licht Groen is, zegt het: "Verander dit deel om te passen bij de opdracht."
    • Deze schakelaar past zich automatisch aan, zodat het systeem precies weet wat het moet veranderen en wat het moet laten zoals het is, waardoor de nieuwe stem perfect past bij het nieuwe gezicht.

3. De "Tweestapsdans" (Trainingsstrategie)

Het is moeilijk om een computer te leren video en audio tegelijkertijd te bewerken. Als je probeert het alles in één keer te leren, raakt het in de war.

De auteurs gebruiken een Tweefasige Trainingsstrategie:

  1. Stap 1 (Solo-oefening): Eerst leren ze het videogedeelte hoe te bewerken, en het audiogedeelte hoe te bewerken, afzonderlijk. Ze leren hun eigen bewegingen zonder zich zorgen te maken over de ander.
  2. Stap 2 (Het Duet): Zodra ze goed zijn in solo's, leren ze om samen te dansen. Ze leren perfect te synchroniseren, zodat wanneer de video een motorgeluid laat zien dat start, de audio het motorgrommen op exact hetzelfde milliseconde afspeelt.

Wat Kan Het?

Het artikel demonstreert vier hoofd-"bewegingen" met alleen tekstopdrachten:

  • Identiteitswissel: Verander een man in een vrouw (of omgekeerd) terwijl de stem en lipbewegingen gesynchroniseerd blijven.
  • Spraak herschrijven: Houd het gezicht en de stem van de persoon, maar verander de woorden die ze zeggen in iets nieuws.
  • Invoegen: Voeg een nieuw object toe (zoals een vintage auto die voorbijrijdt) en genereer het bijpassende motorgeluid.
  • Verwijderen: Wis een object (zoals een eekhoorn op een rots) en demp het piepen, zodat het eruitziet alsof het er nooit was.

De Conclusie

Kortom, InstructAV2AV is het eerste systeem waarmee je het verhaal van een video en zijn soundtrack tegelijkertijd kunt bewerken met slechts een tekstprompt. Het plakt niet zomaar een nieuw geluid over een oude video; het begrijpt dat als je het visuele verandert, het geluid ook moet veranderen, en als je het geluid verandert, het visuele moet matchen. Dit doet het door te leren van een enorme, zelfgemaakte bibliotheek met voorbeelden en door een slimme "dimmer" te gebruiken om precies te beslissen wat behouden moet blijven en wat moet veranderen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →