← Nieuwste papers
⚡ electrical engineering

Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

Dit artikel stelt een stapsgewijze video-naar-audio synthesemethode voor die gebruikmaakt van negatieve audiosturing om incrementeel onderscheidende, realistische geluidsevenementen te genereren zonder dat daarvoor kostbare multi-referentie datasets nodig zijn, waardoor de geluidsscheidbaarheid en de algehele audiokwaliteit worden verbeterd.

Oorspronkelijke auteurs: Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een filmscène bekijkt waarin een eland door een bos loopt, in een vijver klatst en snuit. In de oude dagen van filmmaken zou een "Foley-artiest" in een studio handmatig de geluiden één voor één toevoegen: eerst de voetstappen, dan het waterspatten, dan de snuif, en tot slot het ritselen van de bladeren door de wind. Ze bouwden het uiteindelijke audiotrack op als een sandwich, waarbij ze laag voor laag een heerlijke nieuwe laag toevoegden om het echt te laten voelen.

Tegenwoordig kunnen computers proberen dit automatisch te doen. Ze kijken naar een video en raden welk geluid erbij hoort. Maar de meeste huidige AI-modellen zijn als een onhandige chef die probeert de hele sandwich in één enorme hap te nemen. Ze spugen één audiotrack uit die alles tegelijk probeert te doen. Als de AI het geluid van het water vergeet, of als hij per ongeluk de voetstappen te hard herhaalt, moet de maker de hele track weggooien en opnieuw beginnen. Er is geen manier om simpelweg het ontbrekende watergeluid toe te voegen zonder de rest te verpesten.

Dit artikel introduceert een nieuwe methode genaamd Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance. Hier is hoe het werkt, met behulp van eenvoudige analogieën:

1. Het Probleen: Het "Echo Chamber"-effect

Huidige AI-modellen zijn erg goed in het bekijken van een video en zeggen: "Ik zie een eland, dus ik zal elandgeluiden maken." Maar als je ze vraagt om een tweede geluid te maken, zoals "vogels die fluiten", raken ze vaak in de war. Ze blijven denken: "Oh, er is nog steeds een eland!" en ze voegen per ongeluk weer elandvoetstappen toe aan de vogelgeluiden. Het is alsof je een schilder vraagt om een blauwe lucht toe te voegen aan een schilderij van een bos, maar de schilder blijft per ongeluk de bomen blauw verven omdat hij zo gefocust is op het bos.

2. De Oplossing: "Negative Audio Guidance" (NAG)

De auteurs hebben een slimme truc bedacht genaamd Negative Audio Guidance. Zie dit als een "Niet Herhalen"-bord voor de AI.

Hier is het stapsgewijze proces dat ze voorstellen:

  • Stap 1: De AI kije naar de video en genereert het eerste geluid (bijv. de voetstappen van de eland).
  • Stap 2: Nu moet de AI het volgende geluid toevoegen (bijv. het waterspatten). Voordat de AI begint, luistert hij naar het eerste geluid dat hij zojuist heeft gemaakt.
  • De Magische Truc: In plaats van het eerste geluid gewoon te negeren, gebruikt de AI het als een "negatieve gids". De AI zegt in feite: "Ik weet hoe de voetstappen van de eland klinken. Nu ga ik het waterspatten genereren, maar ik zal me actief afzetten tegen het geluid van de voetstappen."

Het is als een muzikant die een nieuw instrument bespeelt. Ze luisteren naar de drumbeat die al speelt en spelen bewust een melodie die rondom de drums past, waarbij ze ervoor zorgen dat ze niet per ongeluk hetzelfde ritme spelen. De AI gebruikt deze "afstotende kracht" om ervoor te zorgen dat het nieuwe geluid onderscheidend is en niet overlapt met wat er al is.

3. Hoe ze de AI hebben getraind (Zonder dure data)

Normaal gesproken heb je om een AI hiervoor te leren een enorme bibliotheek nodig van video's waar iemand al de voetstappen, het water en de wind als aparte tracks heeft opgenomen. Dit is erg moeilijk en duur om te vinden.

De auteurs vonden een slimme workaround. Ze hebben de AI getraind met een "splitsingsspel":

  • Ze namen een normale video met één lange audiotrack.
  • Ze sneden de audio in twee stukken die elkaar niet overlappen (bijv. de eerste 4 seconden en de volgende 4 seconden).
  • Ze leerden de AI: "Hier is de video en de eerste 4 seconden audio. Voorspel nu hoe de volgende 4 seconden klinken, maar zorg ervoor dat het niet precies hetzelfde klinkt als de eerste 4 seconden."

Door te trainen op deze niet-overlappende fragmenten van dezelfde video, leerde de AI de "vibe" van de omgeving (zoals het bos of het weer) te herkennen zonder simpelweg de exacte geluiden te kopiëren. Hierdoor konden ze het systeem trainen met standaard, gemakkelijk te vinden video-datasets.

4. Het Resultaat: Een Betere "Audio Sandwich"

Toen ze deze methode testten, waren de resultaten indrukwekkend:

  • Separatie: De geluiden waren veel duidelijker. De voetstappen lekten niet door in de vogelgeluiden, en het water klonk niet als voetstappen.
  • Kwaliteit: De uiteindelijke mix van alle geluiden samen klonk realistischer en van hogere kwaliteit dan wanneer de AI alles in één keer had geprobeerd te maken.
  • Controle: Het bootst de workflow van echte Foley-artiesten na, waardoor gebruikers een complex geluidslandschap laag voor laag kunnen opbouwen, waarbij ze specifieke geluiden kunnen toevoegen of verfijnen zonder de hele track te verpesten.

Kortom, dit artikel geeft AI een manier om een betere sound designer te zijn. In plaats van de hele soundtrack van een film in één keer te raden, kan het deze nu stukje bij beetje opbouwen, wetend wat het al heeft gecreëerd en wat het moet vermijden om herhaling te voorkomen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →