← Nieuwste papers
💻 bioinformatics

A learned fungal ITS embedding does not outperform correctly configured alignment in open-world evaluation

Deze studie toont aan dat een doelgericht getrainde fungale ITS-embedding niet beter presteert dan een correct geconfigureerde alignment-gebaseerde benadering in een open-wereld evaluatie, wat onthult dat methodologische gebreken zoals heuristische standaardinstellingen, ontbrekende dekkingfilters en datalekken — en niet de representatie zelf — verantwoordelijk waren voor de eerder gerapporteerde voordelen van geleerde embeddings.

Oorspronkelijke auteurs: O'Brien, A., Gardette, A.

Gepubliceerd 2026-09-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: O'Brien, A., Gardette, A.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

In de verborgen wereld onder onze voeten zijn schimmels overal aanwezig, maar ze blijven grotendeels onzichtbaar voor het blote oog. Om dit enorme koninkrijk van het leven te begrijpen, vertrouwen wetenschappers op een specifiek stukje genetische code dat bekend staat als de ITS-regio. Beschouw deze code als een unieke barcode die op elke schimmelsoort is gedrukt. Wanneer onderzoekers een monster verzamelen uit de bodem of de lucht, sequensen zij deze barcode en proberen ze deze te matchen met een enorme bibliotheek van bekende schimmels om te identificeren wat ze hebben gevonden. De natuur zit echter vol verrassingen. Vaak is de schimmel in het monster zo nieuw of zo ver verwijderd van bekende verwanten dat deze niet overeenkomt met een vermelding in de bibliotheek. De uitdaging voor wetenschappers is tweeledig: ze moeten beslissen wanneer een schimmel werkelijk nieuw is en onbenoemd moet blijven, en ze moeten deze zo nauwkeurig mogelijk binnen de stamboom van het leven plaatsen, zelfs als de exacte soort onbekend is.

Jarenlang was de standaardmanier om dit matchingsprobleem op te lossen het uitlijnen van de nieuwe genetische sequentie tegen elke bekende sequentie in de bibliotheek, op zoek naar de beste overeenkomst. Deze methode, genaamd alignment (uitlijning), is als het controleren van elke pagina van een woordenboek om het woord te vinden dat het meest lijkt op het woord dat je probeert te spellen. Onlangs is er een nieuwere, meer hoogtechnologische aanpak opgekomen. In plaats van elke pagina te controleren, zijn wetenschappers begonnen met het gebruik van kunstmatige intelligentie om de genetische code te vertalen naar een wiskundig punt in een enorme, meerdimensionale ruimte. In dit nieuwe systeem worden vergelijkbare schimmels dicht bij elkaar geplaatst en verschillende schimmels van elkaar weggeduwd. De hoop was dat dit geleerde systeem nieuwe schimmels sneller en nauwkeuriger zou kunnen herkennen en in de juiste familie zou kunnen plaatsen dan de oude, trage methode van het controleren van elke pagina.

Een team van onderzoekers zette zich in om te testen of deze nieuwe methode met kunstmatige intelligentie werkelijk beter presteerde dan de traditionele aanpak. Ze bouwden een op maat gemaakt AI-model dat specifiek getraind was om de genetica van schimmels te begrijpen, gebruikmakend van een enorme, actuele collectie van schimmelsequenties. Om een eerlijke test te garanderen, ontwierpen ze een strikt experiment waarbij de AI en de traditionele methode werden beoordeeld op exact dezelfde set onbekende monsters. Ze namen ook buitengewone zorg om hun testdata te verzegelen voordat het experiment begon, zodat ervoor werd gezorgd dat geen deel van de test per ongeluk de training van de AI kon beïnvloeden. Deze "firewall" betekende dat wanneer de resultaten eindelijk werden onthuld, dit een ware maatstaf zou zijn voor hoe goed de methoden werkten op volledig nieuwe data.

De onderzoekers ontdekten dat de uitkomst van de test volledig afhing van hoe de regels werden ingesteld. Wanneer ze de traditionele alignment-methode draaiden met de standaard, gebruikelijke instellingen, leek het nieuwe AI-model beter te presteren. De onderzoekers realiseerden zich echter dat de standaardinstellingen niet daadwerkelijk waren ingesteld om de best mogelijke prestatie te leveren. De traditionele methode had enkele potentiële matches overgeslagen en de zoektocht te vroeg gestopt. Wanneer het team de traditionele methode herconfigureerde om uitputtend en zorgvuldig te zoeken, waarbij elke mogelijkheid zonder afkortingen werd gecontroleerd, veranderden de resultaten volledig. De oude methode, nu draaiend op haar volledige potentieel, werd nauwkeuriger dan de AI in het identificeren van bekende schimmels en het plaatsen van nieuwe schimmels in de juiste familiegroepen.

De studie onthulde dat de AI-methode een verborgen zwakte had: de prestaties veranderden afhankelijk van hoeveel monsters er tegelijkertijd aan de AI werden gevoerd. Wanneer de AI monsters in grote groepen verwerkte, waren de resultaten iets anders dan wanneer deze ze één voor één verwerkte. Deze inconsistentie betekende dat de AI niet echt stabiel was. In tegenstelling hiertoe gaf de traditionele methode elke keer hetzelfde resultaat, ongeacht hoe de data gegroepeerd was. Bovendien vonden de onderzoekers dat het vermogen van de AI om nieuwe schimmels te detecteren niet werkelijk beter was dan de traditionele methode, wanneer gemeten op de specifieke punten waar een wetenschapper in de echte wereld een beslissing neemt. De AI vond niet meer nieuwe schimmels, noch maakte zij minder fouten. Sterker nog, de traditionele methode vond meer nieuwe schimmels terwijl zij minder fouten maakte.

Misschien wel het meest verrassend was dat de onderzoekers ontdekten dat het succes van de AI in eerdere tests deels te wijten was aan een fout in de opzet van de test. Sommige van de "nieuwe" schimmels in de test waren de AI feitelijk al tegengekomen tijdens de training, ook al hadden ze verborgen moeten blijven. Toen de onderzoekers dit oplosten door die specifieke schimmels uit de trainingsdata te verwijderen en de AI opnieuw te trainen, werd de kloof tussen de twee methoden groter. De traditionele methode nam nog verder afstand en toonde een duidelijk en statistisch significant voordeel. Het vermogen van de AI om verschillende delen van de genetische code te vergelijken, een kenmerk dat bedoeld was als haar superkracht, bleek niet beter te zijn dan wat de traditionele methode simpelweg kon doen door direct naar de gedeelde delen van de code te kijken.

De uiteindelijke conclusie was duidelijk: een zorgvuldig geconfigureerde traditionele methode kwam in elk belangrijk aspect overeen met of overtrof de prestaties van het nieuwe kunstmatige intelligentiemodel. De AI presteerde niet beter dan de oude methode; het was de manier waarop de oude methode werd getest die het erdoor had doen uitzien alsof zij zwakker was. De studie toonde aan dat de keuze van de evaluatieregels, zoals hoe strikt de zoektocht werd uitgevoerd en hoe de data werd gegroepeerd, de winnaar bepaalde. De onderzoekers benadrukten dat deze controles eenvoudig en goedkoop toe te passen zijn op elke nieuwe methode. Zij voerden aan dat voordat men een nieuw kunstmatig intelligentiesysteem als superieur verklaart, wetenschappers moeten waarborgen dat de traditionele baseline op haar best draait, dat de data werkelijk nieuw is voor het systeem, en dat de resultaten stabiel zijn onder verschillende omstandigheden. Uiteindelijk bleef het meest betrouwbare instrument voor het identificeren van de onzichtbare wereld van schimmels datgene wat al decennia wordt gebruikt, mits het correct wordt toegepast.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →