← Nieuwste papers
💻 computer science

VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?

Het artikel introduceert VideoASMR-Bench, een nieuw benchmark dat fijnmazige ASMR-content gebruikt om aan te tonen dat, hoewel state-of-the-art videogeneratiemodellen synthetische video's kunnen maken die huidige video-interpretatiemodellen voor de gek houden, mensen aanzienlijk beter zijn in het onderscheiden van deze door AI gegenereerde video's van echte video's.

Oorspronkelijke auteurs: Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin

Gepubliceerd 2026-05-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer gevoelige "zintuiglijke test" in je handen houdt. De meeste videogames vandaag de dag lijken op het controleren of een schilderij van veraf weg op een landschap lijkt – ze vragen: "Is er een boom? Is er een lucht?" Maar dit nieuwe paper, VideoASMR-Bench, stelt een veel moeilijkere vraag: "Klopt het geluid van de regen echt met de beweging van de bladeren? Voelt de textuur van het water echt aan als je er naar kijkt?"

Hier is de uitleg van wat de onderzoekers hebben gedaan, met behulp van eenvoudige analogieën:

1. De "ASMR"-test: Een microscoop voor realiteit

De onderzoekers besloten om AI-video's te testen met behulp van ASMR (Autonomous Sensory Meridian Response). Denk aan ASMR-video's als de "high-definition, slow-motion" van de videowereld. Ze tonen close-ups van dingen zoals tikken op glas, fruit snijden of fluisteren.

  • Waarom dit belangrijk is: In normale video's kan een kleine glitch onopgemerkt blijven. In een ASMR-video, als een mes niet perfect een tomaat snijdt of het geluid van het kraken net iets afwijkt, breekt dit direct de "toverij". Het is alsof je probeert een nepdiamant te spotten onder een vergrootglas; de fouten zijn klein maar duidelijk als je weet waar je naar moet kijken.

2. Het spel: De vervalser versus de detective

Het paper zet een groot spel op van "kat en muis" tussen twee soorten AI:

  • De vervalser (Video Generation Models): Dit zijn de AI-artiesten die proberen nep-ASMR-video's te maken die er zo echt uitzien en klinken dat ze iedereen kunnen bedriegen.
  • De detectives (Video Understanding Models): Dit zijn de AI-"politieagenten" die proberen de video's te bekijken en te zeggen: "Dit is echt!" of "Dit is nep!"

De onderzoekers creëerden een enorme bibliotheek van 1.500 echte ASMR-video's (gehaald van sociale media) en gebruikten de "vervalser" om 2.235 nepversies daarvan te maken. Vervolgens lieten ze de "detectives" proberen de neppen te spotten.

3. De schokkende resultaten

De resultaten waren verrassend, alsof je ontdekt dat een meestervervalser een high-tech beveiligingscamera kan bedriegen, maar dat een gewone mens de nep nog steeds kan herkennen.

  • De AI-detectives falen: Zelfs de slimste AI-detectives (zoals de nieuwste versies van Gemini en GPT) zijn slecht in het spotten van deze nep-ASMR-video's. Ze raden vaak willekeurig of laten zich makkelijk bedriegen. In feite zijn ze op deze specifieke taak veel slechter dan mensen.
  • De AI-vervalser worden eng goed: De AI-artiesten (zoals Veo3 en Sora2) maken video's die zo overtuigend zijn dat de AI-detectives het verschil niet kunnen zien. De video's zien er perfect uit en klinken perfect voor de machines.
  • Mensen winnen nog (voorlopig): Terwijl de AI-detectives in de war zijn, kunnen gewone mensen de nepvideo's meestal nog wel uit elkaar houden. Mensen zijn beter in het opmerken van de kleine, subtiele "uncanny valley"-gevoelens die de AI mist.

4. De "cheatcodes" die de AI gebruikte (en waarom ze faalden)

De onderzoekers ontdekten waarom de AI-detectives faalden:

  • De watermerk-korte weg: Sommige AI-modellen keken gewoon naar een klein "Sora"-watermerk op de video. Als ze het zagen, zeiden ze "Nep!" Als ze het niet zagen, zeiden ze "Echt!" Ze keken niet echt naar de video; ze zochten alleen naar een label. Toen de onderzoekers de watermerken verwijderden, raakten de AI-detectives in de war en faalden.
  • Het geluid negeren: De AI-detectives negeerden het geluid grotendeels. Maar bij ASMR is het geluid de helft van de strijd. Toen de onderzoekers de AI dwongen naar het geluid te luisteren, werden ze iets beter in het spotten van neppen, maar nog steeds niet geweldig.
  • De "Echt"-bias: De AI-detectives hadden de rare gewoonte om aan te nemen dat alles echt was. Ze waren zo bang om een echte video "nep" te noemen, dat ze uiteindelijk bijna alles "echt" noemden, zelfs de voor de hand liggende neppen.

5. Het grote plaatje

Het paper concludeert dat, terwijl AI steeds beter wordt in het maken van realistische zintuiglijke video's, de AI-tools die we gebruiken om te controleren of die video's echt zijn, achterblijven.

Denk hieraan: De AI-artiesten hebben geleerd om een perfecte zonsondergang te schilderen waar zelfs de zon zelf jaloers op zou zijn, maar de AI-beveiligingswachten die de schilderijen controleren, gebruiken nog steeds een vergrootglas uit de jaren 90. Ze kunnen de kleine penseelstreken niet zien die het schilderij verraadt.

De kernboodschap:
We hebben een nieuwe benchmark (VideoASMR-Bench) die fungeert als een stress-test. Het toont aan dat AI momenteel video's kan maken die andere AIs bedriegen, maar dat mensen nog steeds de beste rechters zijn van wat echt voelt. Het paper belooft niet dat deze video's voor iets specifieks zullen worden gebruikt; het zegt gewoon: "Kijk hoe goed de vervalser worden, en kijk hoe slecht onze opsporingsdiensten zijn in het vangen van hen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →