← Nieuwste papers
🤖 AI

BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents

BioMedArena is een open-source toolkit die is ontworpen om de uitdagingen op het gebied van reproduceerbaarheid bij biomedische deep research agents aan te pakken door evaluatielagen te ontkoppelen, een uitgebreide bibliotheek van benchmarks en tools te bieden, en modulaire componenten aan te bieden die de prestaties van modellen aanzienlijk verbeteren ten opzichte van de huidige state-of-the-art resultaten.

Oorspronkelijke auteurs: Jinge Wu, Hongjian Zhou, Mingde Zeng, Jiayuan Zhu, Junde Wu, Jiazhen Pan, Ayush Noori, Sean Wu, Honghan Wu, Fenglin Liu, David A. Clifton

Gepubliceerd 2026-06-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jinge Wu, Hongjian Zhou, Mingde Zeng, Jiayuan Zhu, Junde Wu, Jiazhen Pan, Ayush Noori, Sean Wu, Honghan Wu, Fenglin Liu, David A. Clifton

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de vaardigheden van verschillende chefs probeert te vergelijken om te zien wie het beste een complex gerecht kan bereiden. Op dit moment, als je Chef A vraagt om een gerecht te maken, gebruikt deze zijn eigen keuken, zijn eigen set messen en zijn eigen receptenboek. Als je Chef B vraagt om exact hetzelfde gerecht te maken, gebruikt deze een compleet andere keuken, een andere set gereedschappen en een andere manier om het eten te proeven.

Omdat de keukens en gereedschappen zo verschillend zijn, is het onmogelijk om te zeggen of Chef A eigenlijk beter is, of dat hij gewoon een betere set messen had. Dit is het probleem waar de auteurs van dit artikel een oplossing voor bieden voor AI-onderzoekers.

Hier is een eenvoudige analyse van wat zij hebben gebouwd, gebruikmakend van de eigen beweringen uit het artikel:

1. Het Probleem: Een Rommelige Keuken

Momenteel, als een onderzoeker een nieuwe AI "onderzoeker" (een agent die tools gebruikt om antwoorden te vinden) wil testen, moet hij vanaf nul een aangepaste testomgeving bouwen.

  • Verschillende Keukens: Elk AI-systeem gebruikt een andere "harness" (de lus van denken en handelen).
  • Verschillende Tools: Het ene systeem heeft misschien toegang tot een medische database, terwijl een ander een andere heeft.
  • Verschillende Rechters: Het ene systeem beoordeelt zijn eigen werk met een simpele regel, terwijl een ander systeem een andere AI gebruikt om te beoordelen.

Dit betekent dat het vergelijken van twee AI's vergelijkbaar is met het vergelijken van een racewagenchauffeur op een onverhard circuit met een chauffeur op een Formule 1-circuit. De resultaten zijn oneerlijk, en het bouwen van een nieuwe test kost weken aan engineeringwerk.

2. De Oplossing: BioMedArena (De Universele Keuken)

De auteurs hebben BioMedArena gebouwd, een open-source toolkit die fungeert als een universele, gestandaardiseerde keuken.

  • Eén Standaard Werkblad: Welke AI (de "backbone") je ook aansluit, deze krijgt exact dezelfde set van 166 biomedische tests (zoals medische quizzen of chemieproblemen).
  • Eén Gereedschapskist: Elke AI krijgt toegang tot dezelfde 75 tools (zoals het doorzoeken van medische literatuur, het analyseren van genen of het controleren van interacties tussen medicijnen).
  • Eén Rechter: Elk antwoord wordt beoordeeld door dezelfde strikte regels of door dezelfde AI-rechter, zodat de scores eerlijk zijn.

Nu hoeven onderzoekers, in plaats van voor elke nieuwe AI een nieuwe keuken te bouvn, hun AI simpelweg met een kleine adapter (enkele regels code) in BioMedArena te pluggen. Het is alsof je een nieuwe chef aansluit op een standaard keuken om te zien hoe hij presteert.

3. Het Geheimwapen: "Mutual-Evolve"

Het artikel introduceert een speciale manier waarop de AI denkt, genaamd MUTUAL-EVOLVE. Stel je een team van vier detectives voor die werken aan een cold case.

  • De Oude Manier: Elke detective werkt alleen in een aparte kamer om eigen ideeën te bedenken zonder beïnvloed te worden door anderen. Aan het einde roepen ze allemaal hun definitieve gok, en de groep kiest de meest populaire optie. Als één detective vroeg in het proces een cruciale aanwijzing vond maar deze niet hardop riep, mist de groep dit.
  • De Mutual-Evolve Manier:
    1. Private Fase: De detectives werken een tijdje alleen om hun eigen ideeën te formulere_n zonder beïnvloed te worden door anderen.
    2. Het Gedeelde Schoolbord: Ze gaan naar een gedeelde ruimte met een groot whiteboard dat is verdeeld in vier secties: Fouten, Vaardigheden, Gebruikte Tools en Feiten.
    3. Delen: Ze wisselen elkaar af om hun bevindingen op het bord te schrijven. Als Detective A beseft dat een bepaald pad een doodlopende weg is, schrijft deze "Fout" op het bord. Als Detective B een belangrijk feit vindt, schrijft deze dit onder "Feiten".
    4. De Definitieve Stemming: Voordat ze het definitieve antwoord geven, lezen ze allemaal het volledige whiteboard door. De definitieve stemming is niet zomaar een simpele telling; detectives die meer nuttige informatie aan het bord hebben bijgedragen, krijgen een iets zwaardere stem.

Deze methode stelt het AI-team in staat om te leren van elkaars fouten en ontdekkingen, in plaats van alleen te stemmen op het eindresultaat.

4. De Resultaten: Een Grote Boost

De auteurs hebben 12 verschillende AI-modellen (zowel open-source als bekende commerciële modellen) getest met behulp van deze nieuwe toolkit.

  • De Magie: Wanneer ze deze AI's de standaard tools en de "Mutual-Evolve" denkstijl gaven, steeg hun prestatie aanzienlijk.
  • De Score: Gemiddeld verbeterden de AI's met 15 procentpunten over 8 verschillende medische en wetenschappelijke benchmarks.
  • Het Record: In elke enkele test versloeg de AI die uitgerust was met BioMedArena het vorige "best in class" record. Bijvoorbeeld, op een zeer moeilijk medisch examen ging een AI van ongeveer 46% goed naar 56% goed, waarmee het vorige beste record werd verbroken.

Samenvatting

Het artikel beweert niet dat deze AI's nu ziekten genezen of patiënten diagnosticeren in ziekenhuizen. In plaats daarvan beweren ze de eerste eerlijke speelveld te hebben gebouwd waar we eindelijk kunnen vergelijken hoe goed verschillende AI-onderzoekers zijn in het oplossen van biomedische problemen. Ze hebben ook aangetoond dat het geven van een betere manier om samen te werken (Mutual-Evolve) en een betere set tools deze AI's aanzienlijk slimmer maakt bij deze specifieke taken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →