From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b
Dit artikel introduceert een vraagtypebewust framework voor grote taalmodellen voor BioASQ 14b Taak B dat op maat gemaakte inferentiestrategieën gebruikt — zoals snippet shuffling voor ja/nee-vragen, chain-of-thought voor factoids en multi-agent samenwerking voor lijsten — om competitieve prestaties en de eerste plaats in de factoid-subtaak van Batch 4 te behalen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van deskundige detectives bent die een enorme medische puzzel proberen op te lossen. De aanwijzingen (wetenschappelijke artikelen) liggen verspreid over duizenden pagina's, soms spreken ze elkaar tegen, en ze zijn geschreven in zeer specifieke, lastige taal. Je doel is om drie specifieke soorten vragen te beantwoorden: "Is het waar?" (Ja/Nee), "Wat is de specifieke naam?" (Feitje), of "Lijst alle betrokken namen op" (Lijst).
Dit artikel beschrijft een nieuw detective-team genaamd ku_dmis dat deelnam aan een wedstrijd (BioASQ 14b) om te zien hoe goed zij deze puzzels konden oplossen met behulp van Kunstmatige Intelligentie (AI). In plaats van één "één-maat-voor-alleen" detective voor elke zaak te gebruiken, bouwden zij een gespecialiseerd team waarbij verschillende AI-modellen fungeren als verschillende soorten experts, afhankelijk van de vraag.
Hier is hoe hun systeem werkt, onderverdeeld in eenvoudige analogieën:
1. De "Ja/Nee" Detectives: Het Schudden en Stemmen
Het Probleem: Soms, als je een lijst met aanwijzingen in een andere volgorde leest, kan een detective in de war raken en van mening veranderen. Als de aanwijzingen rommelig of tegenstrijdig zijn, kan een enkele AI het fout hebben, simpelweg omdat de bewijzen op een vreemde manier werden gepresenteerd.
De Oplossing: Het team gebruikt een "Schud en Stem"-strategie.
- Het Schudden: Ze nemen dezelfde set aanwijzingen en rangschikken deze willekeurig, zoals het schudden van een kaartspel.
- Het Stemmen: Ze vragen vier verschillende AI-detectives om deze geschudde dekken te lezen en een "Ja" of "Nee" antwoord te geven.
- De Beslissende Stem: Als alle vier overeenstemmen, geweldig! Als ze van mening verschillen, stapt er een speciale "Supervisor"-detective in. Deze supervisor organiseert de aanwijzingen in "Voor Ja"-stapels, "Voor Nee"-stapels en "Misschien"-stapels om een definitieve, kalme beslissing te nemen.
- Het Resultaat: Dit maakte hun "Ja/Nee" antwoorden zeer stabiel en accuraat; ze veranderden zelden van gedachten, zelfs niet wanneer de aanwijzingen rommelig waren.
2. De "Feitje" Detectives: De Bibliotheek van Voorbeelden
Het Probleem: Deze vragen vragen om een specifieke naam, zoals "Wat is de meest voorkomende gen?". De AI moet de exacte juiste naam vinden. Als de AI "Gen X" zegt terwijl het officiële antwoord "Gen X-Alfa" is, kan het als fout worden gemarkeerd.
De Oplossing: Ze gebruiken een "Laat het zien, vertel het niet alleen"-aanpak.
- De Bibliotheek: Voordat er wordt geantwoord, zoekt het systeem door een bibliotheek van eerder opgeloste gevallen om voorbeelden te vinden die erg lijken op de huidige vraag.
- De Gids: Het toont deze voorbeelden aan de AI, met de tekst: "Kijk, wanneer we eerder een vraag als deze zagen, is dit precies hoe we het antwoord vonden en hoe we het opschreven."
- De Consensus: Net als bij de Ja/Nee-vragen gebruiken ze meerdere AI-modellen. Als drie van de vier modellen het eens zijn over de specifieke naam, houden ze die aan.
- Het Resultaat: Dit hielp hen om vaker de juiste namen te vinden, vooral in de laatste ronde van de wedstrijd, waarin ze de eerste plaats belegden voor dit specifieke type vraag.
3. De "Lijst" Detectives: De Lopende Band
Het Probleem: Deze vragen vragen om een hele lijst met items (bijv. "Lijst alle medicijnen op die interageren met dit eiwit"). De AI heeft moeite hiermee: het kan enkele items missen (lage recall) of nep-items verzinnen die echt lijken maar dat niet zijn (hallucinaties).
De Oplossing: Ze bouwden een vierpersoons lopende band waarbij elk persoon een specifieke taak heeft:
- Agent 1 (De Zoeker): Leest alle aanwijzingen en haalt een grote stapel potentiële namen naar voren, zonder zich nog zorgen te maken of ze wel perfect zijn.
- Agent 2 (De Redeneerder): Bekijkt de stapel en de oorspronkelijke aanwijzingen om een conceptlijst op te stellen.
- Agent 3 (De Auditor): Controleert de conceptlijst. "Staat deze naam daadwerkelijk in de aanwijzingen? Is het een duplicaat? Is het nep?" Zij verwijderen de slechte zaken.
- Agent 4 (De Supervisor): De baas die het werk controleert. Als de Auditor een probleem heeft gevonden, gaat de Supervisor terug naar de aanwijzingen om het te herstellen.
- Het Resultaat: Dit teamwork hielp hen om meer correcte items te vinden terwijl ze verdere nep-items vermeden, wat hun scores aanzienlijk verbeterde naarmate de wedstrijd vorderde.
Het Grotere Plaatje
De hoofdbgedachte van dit artikel is dat verschillende vragen verschillende denkstijlen vereisen.
- Voor eenvoudige "Ja/Nee" vragen gebruikten ze stemmen om verwarring te voorkomen.
- Voor specifieke "Naam"-vragen gebruikten ze voorbeelden om de juiste format te leren.
- Voor complexe "Lijst"-vragen gebruikten ze een team van specialisten om het werk te controleren en dubbel te controleren.
Door de AI te behandelen als een flexibel team van experts in plaats van een enkele robot, konden ze de rommelige, tegenstrijdige aard van medisch onderzoek veel beter aan dan voorheen. In de officiële wedstrijd presteerde hun systeem zeer goed, met name uitblinkend in het vinden van de juiste specifieke namen (Feitje-vragen) in de laatste batch.
Belangrijke Opmerking: Het artikel richt zich volledig op hoe men het juiste antwoord uit de verstrekte tekst krijgt. Het beweert niet dat dit systeem patiënten kan diagnosticeren, medicijnen kan voorschrijven of artsen in een ziekenhuis kan vervangen; het is strikt een hulpmiddel voor het beantwoorden van vragen op basis van geschreven wetenschappelijk bewijs.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.