← Nieuwste papers
🤖 AI

CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection

Dit artikel introduceert CoCoVideo-26K, een hoogwaardige dataset met semantisch uitgelijnde echt-nep videopaartjes van 13 commerciële generatoren, en stelt CoCoDetect voor, een nieuw detectiekader dat contrastief leren combineert met confidence-gated multimodale redenering om de state-of-the-art prestaties te bereiken bij het identificeren van hoogwaardige door AI gegenereerde video's.

Oorspronkelijke auteurs: Huidong Feng, Wentao Chen, Jie Chen, Xinqi Cai, Ruolong Ma, Yinglin Zheng, Yuxin Lin, Ming Zeng

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Huidong Feng, Wentao Chen, Jie Chen, Xinqi Cai, Ruolong Ma, Yinglin Zheng, Yuxin Lin, Ming Zeng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat het internet een gigantische bibliotheek is. Lange tijd waren de "nepboeken" in deze bibliotheek gemakkelijk te herkennen omdat ze gedrukt waren op goedkoop, gekruld papier met wazige afbeeldingen. Het detecteren ervan was als het opsporen van een typefout in een handgeschreven briefje.

Maar onlangs is er een nieuwe generatie "nepboeken" gearriveerd. Deze zijn gedrukt op hoogwaardig, glanzend papier met foto's die zo scherp zijn en verhalen die zo logisch zijn, dat zelfs een menselijke bibliothecaris erdoor in de war zou kunnen raken. Dit is de wereld van AI-gegenereerde video (AIGC). Het probleem is dat de oude "typefoutdetectors" (bestaande AI-tools) getraind waren op dat goedkope, gekrulde papier. Ze weten de subtiele imperfecties van de nieuwe, hoogwaardige neptitels niet te herkennen.

Hier legt dit artikel uit hoe zij dit oplossen, in eenvoudige termen:

1. De Nieuwe "Trainingsgrond": CoCoVideo

De auteurs beseften dat ze hun nieuwe detector niet konden trainen met de oude, kwalitatief minderwaardige nepvideo's. Ze hadden een sportschool nodig met hoogwaardige apparatuur.

  • Het Probleem met Oude Data: Eerdere datasets gebruikten open-source AI-modellen die video's maakten die er een beetje "vreemd" uitzagen (zoals een cartoonkarakter dat vreemd knippert). Commerciële AI in de echte wereld (het soort dat door grote bedrijven wordt gebruikt) maakt video's die bijna perfect lijken.
  • De Oplossing (CoCoVideo-26K): Het team heeft een enorme nieuwe dataset gebouwd genaamd CoCoVideo.
    • De "Tweelingstrategie": Stel je voor dat je een echte foto hebt van een bos. Je vraagt aan 13 verschillende hoogwaardige AI-kunstenaars om een nepversie van dat exactzelfde bos te schilderen, uitgaande van exact hetzelfde eerste frame.
    • Het Resultaat: Je hebt nu "Echt vs. Nep"-paren die identiek zijn in verhaal en startpunt, maar de één is echt en de ander is AI. Dit dwingt de detector om te zoeken naar de minuscule verschillen in textuur en fysica, in plaats van alleen te gokken op basis van het verhaal.

2. De Nieuwe Detective: CoCoDetect

Zodra ze deze hoogwaardige trainingsgrond hadden, bouwden ze een nieuw detectiesysteem genaamd CoCoDetect. Zie deze detective als een tweemans-team dat samenwerkt:

Teamlid A: De "Textuurverkenner" (Contrastive Learning)

  • Wat het doet: Dit deel van het systeem is als een forensisch expert die naar de korrel van het papier kijkt. Het gebruikt een standaard video-AI (R3D-18) om de video te scannen op minuscule, onzichtbare foutjes—zoals een schaduw die niet goed beweegt of een huidtextuur die er te glad uitziet.
  • Hoe het leert: Omdat het getraind is op die "Tweeling"-paren uit CoCoVideo, heeft het geleerd om de specifieke "vingerafdruk" van commerciële AI te herkennen, en niet alleen de overduidelijke fouten van oude AI.

Teamlid B: De "Logica-rechter" (MLLM)

  • Wat het doet: Soms ziet de video er perfect uit voor de Textuurverkenner. Misschien zijn de schaduwen juist, en ziet de huid er echt uit. Maar is het verhaal wel logisch?
  • De "Vertrouwenspoort": Dit is het slimme gedeelte. De Textuurverkenner geeft een "vertrouwensscore".
    • Hoge Vertrouwensscore: Als de Verkenner voor 95% zeker is dat het nep (of echt) is, neemt hij direct een beslissing. Snel en efficiënt.
    • Lage Vertrouwensscore (De "Misschien-zone"): Als de Verkenner onzeker is (bijv. "Ik denk dat het nep is, maar ik ben slechts voor 60% zeker"), dan gokt hij niet. In plaats daarvan draagt hij de zaak over aan de Logica-rechter.
  • De Taak van de Logica-rechter: Dit is een krachtige AI die taal en fysica begrijpt. Hij kijkt naar de video en vraagt zich af: "Wacht eens even. In de video vliegt een vogel achteruit terwijl de wind naar voren blaast. Dat is fysiek onmogelijk. Dit moet nep zijn."

3. Hoe Ze Samenwerken

Het systeem werkt als een controlepost:

  1. Scan: De Textuurverkenner controleert de video.
  2. Poort: Als de video duidelijk nep of duidelijk echt is, gaat de poort open en wordt de beslissing genomen.
  3. Redenering: Als de video lastig is en de Verkenner het niet zeker weet, stuurt de poort de video door naar de Logica-rechter. De Rechter leest de scène, controleert de wetten van de fysica en geeft een definitief oordeel.
  4. Fusie: De uiteindelijke beslissing combineert het "textuur-onderbuikgevoel" van de Verkenner met de "logische redenering" van de Rechter.

Waarom Dit Belangrijk Is (Volgens het Papier)

De auteurs hebben hun nieuwe detective getest tegen de oude detectives met behulp van hun nieuwe hoogwaardige dataset.

  • Het Resultaat: De oude detectoren (getraind op kwalitatief minderwaardige nepvideo's) faalden jammerlijk wanneer ze geconfronteerd werden met de nieuwe video's van commerciële kwaliteit. Ze waren als het proberen te vinden van een naald in een hooiberg met een magneet die alleen werkt op ijzer, niet op staal.
  • De Winnaar: CoCoDetect, met zijn "Verkenner + Rechter"-team, presteerde aanzienlijk beter. Het bewees dat je om hoogwaardige nepseries te vangen, een systeem nodig hebt dat kijkt naar zowel de minuscule details (textuur) als het grotere plaatje (logica/fysica).

Kortom: Het artikel heeft een betere "trainingsschool" gebouwd met behulp van hoogwaardige commerciële AI-nepvideo's en heeft een detective gecreëerd die een "onderbuikcheck" gebruikt voor overduidelijke nepseries en een "logica-check" voor de lastige gevallen, waardoor het veel moeilijker wordt voor hoogwaardige AI-video's om ons te misleiden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →