← Nieuwste papers
🧬 biology

YAPAT — An Open-Source Platform for Active and Weakly Supervised Annotation of Passive Acoustic Monitoring Data

YAPAT is een open-source, webgebaseerd platform dat de grootschalige annotatie van passieve akoestische monitoringsgegevens stroomlijnt door ontologie-gegronde labeling, multi-label active learning en dubbele cold-start mechanismen te integreren om de inspanning van experts te verminderen en hoogwaardige, interoperabele datasets te produceren.

Oorspronkelijke auteurs: Thiago S. Gouvêa, Rida Saghir, Prathmesh P. Doddanawar, Novruz Mammadli, Pratik P. Sitapara, Hannes Kath, Daniel Sonntag

Gepubliceerd 2026-07-31
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Thiago S. Gouvêa, Rida Saghir, Prathmesh P. Doddanawar, Novruz Mammadli, Pratik P. Sitapara, Hannes Kath, Daniel Sonntag

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Stel je de natuurlijke wereld voor als een gigantische, 24-uurs radiozender die nooit stopt met uitzenden. In plaats van muziek speelt de zender de liederen van kikkers, vogels, insecten en walvissen. Wetenschappers gebruiken speciale microfoons, genaamd Passive Acoustic Monitoring (PAM) units, om deze geluiden dagen, weken of zelfs jaren lang op te nemen. Dit is een superkracht voor het begrijpen van de natuur, omdat het onderzoekers in staat stelt om naar hele ecosystemen te luisteren zonder er ooit een voet in te zetten of de dieren weg te jagen. Echter, er is een enorm probleem: deze microfoons nemen zoveel audio op dat de bestanden zich opstapelen tot een berg die te groot is voor een mens om naar te luisteren en op te schrijven wat hij hoort. Het is alsof je probeert elk boek in een bibliotheek ter grootte van een stad te lezen, maar de boeken zijn gemaakt van geluid.

Om dit op te lossen, gebruiken wetenschappers computers om te helpen luisteren. Maar computers zijn slechts zo slim als de voorbeelden waarmee ze worden onderwezen. Om een computer te leren een specifieke kikkerroep te herkennen, moet een menselijke expert eerst duizenden opnames beluisteren en labelen, waarbij hij zegt: "Ja, dit is een kikker," of "Nee, dit is alleen de wind." Dit proces is traag, saai en duur. Als experts te druk zijn met labelen, kunnen de computers niet leren, en blijven de bergen audio-data nutteloos liggen. De grote vraag in dit vakgebied is: Hoe kunnen we computers laten leren van deze enorme geluidsarchieven zonder dat een mens eerst naar elke seconde hoeft te luisteren?

Hier komt een nieuw hulpmiddel genaamd YAPAT (Yet Another PAM Annotation Tool) in beeld. Zie YAPAT als een hoogtechnologisch, interactief detectiespel voor natuurgeluiden. In plaats van een mens te dwingen om elke opname één voor één te beluisteren, gebruikt YAPAT een slimme mix van computertrucs om het zware werk te doen. Het begint door de lange audiobestanden op te delen in kleine fragmenten van 3 seconden. Vervolgens gebruikt het een vooraf getraind "brein" (genaamd BirdNET) om elk fragment in een unieke digitale vingerafdruk te veranderen.

De magie gebeurt in hoe YAPAT de menselijke expert helpt. Stel je voor dat je naar een enorme kaart van al deze geluidsvingerafdrukken kij.kt. YAPAT laat je niet zoma van een willekeurige lijst zien; het werkt als een slimme gids. Het heeft drie manieren om je op weg te helpen, zelfs als je helemaal geen gelabelde data hebt om mee te beginnen:

  1. De "Lijkt-erop"-zoekopdracht: Als je één duidelijke opname hebt van een specifiek dier, kun je deze uploaden. YAPAT vindt onmiddellijk alle andere 3-seconden fragmenten in je enorme archief die qua geluid lijken op deze opname, waardoor je een heleboel van hen tegelijk kunt labelen.
  2. De "Bestandsniveau"-gok: Als je een map hebt met opnames waarvan je alleen weet welk dier in het bestand zat (maar niet precies wanneer), kan YAPAT een techniek genaamd "weak supervision" gebruiken om te raden waar in het bestand het dier zingt. Het is als het kijken naar een foto van een feestje en proberen te raden wie er danst op basis van de energie van de menigte, zelfs als je de dansvloer niet rechtstreeks hebt gefilmd.
  3. De "Slimme Sortering": Zodra de computer begint te leren, stopt hij met het tonen van willekeurige fragmenten. In plaats daarvan gebruikt het een speciaal scoresysteem om je de fragmenten te laten zien waar de computer het meest verward over is, of de fragmenten die het meest verschillen van wat hij al weet. Dit zorgt ervoor dat de menselijke expert zijn tijd besteedt aan de fragmenten die de computer het meeste zullen leren, in plaats van tijd te verspillen aan gemakkelijke of saaie voorbeelden.

YAPAT koppelt deze geluidslabels ook aan officiële wetenschappelijke woordenboeken (ontologieën), zodat wanneer een wetenschapper "boomkikker" zegt, dit voor iedereen ter wereld exact hetzelfde betekent, wat de data herbruikbaar maakt voor toekomstig onderzoek.

Het artikel presenteert YAPAT als een webgebaseerd platform dat al deze functies op één plek samenbrengt. De auteurs hebben het systeem getest op een echte dataset genaamd AnuraSet, die meer dan 30.000 geluidsfragmenten van kikkers bevat. Ze kwamen tot de conclusie dat het systeem snel genoeg werkt om interactief te zijn. Zo duurt het zoeken naar vergelijkbare geluiden bijvoorbeeld minder dan een seconde, zelfs met duizenden fragmenten. Het trainen van de computer om nieuwe patronen te herkennen duurt slechts enkele seconden op een standaardcomputer, of zelfs sneller op een krachtige machine. Het systeem is ontworpen als open-source, wat betekent dat iedereen het kan downloaden, op de eigen server kan installen en zijn eigen geluidsarchieven kan gaan organiseren.

De auteurs merken er zorgvuldig bij op dat hoewel YAPAT een krachtig hulpmiddel is, het geen toverstaf is die alles direct oplost. Het vertrouwt op het "BirdNET"-brein, dat oorspronkelijk op vogels is getraind, dus het is misschien niet perfect voor elk type dier (zoals vleermuizen of walvissen) zonder wat extra aanpassingen. Ook knipt het systeem geluiden momenteel in vaste blokken van 3 seconden, wat betekent dat het niet de exacte milliseconde kan aanwijzen waarop een geluid begint of stopt als dat toevallig op de rand van een knip valt. Maar door slim zoeken, zwakke supervisie en actief leren te combineren, slaagt YAPAT erin de kloof te overbruggen tussen enorme, onbeheersbare audio-archieven en de hoogwaardige, gelabelde data die wetenschappers nodig hebben om de biodiversiteit van onze planeet te begrijpen. Het verandert de onmogelijke taak om naar alles te luisteren in een beheersbaar, collaboratief spel waarbij mensen en computers samenwerken om de liederen van de natuur te ontcijferen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →