← Nieuwste papers
💬 NLP

Capabilities of Claude Fable 5 on Biomedical Challenge Problems

Dit artikel onthult dat hoewel Anthropic's Claude Fable 5 topniveau nauwkeurigheid bereikt op biomedische benchmarks wanneer het participeert, de praktische bruikbaarheid ernstig wordt beperkt door een unieke en wijdverbreide neiging om een aanzienlijk deel van de vragen te weigeren — een patroon dat afwezig is bij zowel de voorgangers als GPT-5.

Oorspronkelijke auteurs: Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robotbibliothecaris hebt genaamd Fable 5. Deze robot is de nieuwste, krachtigste creatie van Anthropic, ontworpen om medische tekstboeken te lezen, naar röntgenfoto's te kijken en ingewikkelde biologie-puzzels op te lossen. Maar hier komt de twist: wanneer je hem een vraag stelt, houdt hij soms zijn handen over zijn oren en zegt hij: "Ik kan die vraag niet beantwoorden," in plaats van een foutief antwoord te geven.

Dit artikel is als een detectiveverhaal waarin onderzoekers probeerden uit te zoeken: Wordt deze robot echt dommer, of is hij gewoon super kieskeurig over waar hij wel of niet over praat?

Het Grote "Ik Kan Niet"-Mysterie

De onderzoekers testten Fable 5 tegen drie andere robots (twee oudere versies van zichzelf en een rivaal genaamd GPT-5) op acht verschillende medische uitdagingen. Deze uitdagingen varieerden van meerkeuzevragen over USMLE-examens tot het bekijken van afbeeldingen van tumoren en het diagnosticeren van zeldzame ziekten.

De Grote Verrassing:
Op het eerste gezicht leek Fable 5 de verliezer. Op veel tests lag zijn ruwe score lager dan die van de anderen. Maar de onderzoekers realiseerden zich dat er iets vreemds gebeurde. Ze ontdekten dat Fable 5 een enorm deel van de vragen weigerde te beantwoorden.

  • Op een test genaamd RareBench (over zeldzame ziekten) weigerde Fable 5 99,4% van de vragen. Hij zei in feite bijna tegen alles "Nee".
  • Op andere tests weigerde hij ergens tussen de 8,0% en 42% van de tijd.

De andere robots? Die weigerden bijna niets (minder dan 0,4%). Ze probeerden gewoon alles te beantwoorden, zelfs als ze het fout hadden.

De "Gescoord" Scorebord

Dit is de magische truc die de onderzoekers gebruikten. Ze besloten de "Ik kan niet"-antwoorden niet te tellen als "foute" antwoorden. In plaats daarvan keken ze alleen naar de vragen die F�able 5 daadwerkelijk probeerde te beantwoorden.

Toen ze dit deden, draaide het verhaal volledig om:

  • MedQA (Medisch Examen): De "echte" nauwkeurigheid van Fable 5 sprong naar 96,6%, waarmee hij iedereen versloeg.
  • PubMedQA: Hij bereikte 81,3%, en versloeg daarmee ook de anderen.
  • RareBench: Dit is het meest bizarre deel. Omdat hij 99,4% van de vragen weigerde, beantwoordde hij er slechts 6. Maar op die 6 had hij een score van 0,36%. Wacht, dat klinkt slecht, toch? Maar de onderzoekers wijzen erop dat dit kleine getal geen maatstaf is voor zijn hersenkracht; het is slechts een maatstaf voor hoe vaak hij niet de mond opende. Toen ze een andere, minder "arts-achtige" manier probeerden om de vragen te stellen, beantwoordde Fable 5 er meer, en op die nieuwe antwoorden behaalde hij 39,4%, wat beter was dan de score van de andere robots op de oorspronkelijke vragen!

De Belangrijkste Bevinding: Het artikel concludeert dat Fable 5 niet minder capabel is. Sterker nog, waar hij ook besluit te spreken, is hij vaak de slimste robot in de kamer. Het probleem is niet zijn brein; het is zijn bereidheid om deel te nemen. Het is als een genie in de klas die weigert een toets te maken, tenzij de vraag op een heel specifieke manier wordt gesteld.

De Twee "Geen Antwoord"-Patronen

De onderzoekers groeven diep om erachter te komen waarom Fable 5 "Nee" zei. Ze vonden twee duidelijke patronen, als twee verschillende soorten filters:

  1. De "Basiswetenschap"-filter: Op standaard medische examens (MedQA en MedXpertQA MM) weigerde Fable 5 vooral vragen over basiswetenschappen en mechanismen (zoals hoe een medicijn werkt of hoe een hart klopt). Hij was blij met vragen over het diagnosticeren van een patiënt, maar als de vraag over de onderliggende biologie ging, sloot hij vaak zijn mond.
  2. De "Zeldzame Ziekte"-filter: Op de RareBench-test ging de weigering niet over het type wetenschap. Het ging over de ziekte.
    • Hij weigerde bijna alle vragen over inborn metabolic diseases (zeldzame aandoeningen waarmee baby's worden geboren, zoals PKU).
    • Hij was veel eerder bereid om vragen over volwassen auto-immuunziekten (zoals lupus) te beantwoorden.
    • De onderzoekers probeerden de prompt te veranderen zodat deze minder als een "klinisch beslissingsondersteunend systeem" klonk en meer als een neutrale lijst, maar dat hielp niet veel. Zelfs met een neutrale prompt werden nog steeds 90,7% van de vragen over zeldzame ziekten geweigerd.

Wat Ze Uitgesloten Hebben (De "Niet Het"-Lijst)

Het artikel is zeer voorzichtig in het benoemen van wat NIET de oorzaak van deze weigeringen is:

  • Het is niet omdat de vragen te moeilijk zijn. De onderzoekers controleerden dit, en Fable 5 weigerde vragen die de andere robots correct beantwoordden.
  • Het is niet omdat de vragen open zijn. Hij weigerde meerkeuzevragen net zo vaak als open vragen.
  • Het is niet omdat de prompt te "gezaghebbend" klonk. Het veranderen van de prompt van "Je bent een arts" naar "Hier is een patiënt" verbeterde de weigeringsratio slechts een klein beetje (van 99,4% naar 90,7%).
  • Het is niet een "terugval" naar een ouder model. Soms verbergen bedrijven een weigering door stiekem over te schakelen naar een ouder, veiliger model. De onderzoekers controleerden de logs, en het was absoluut nog steeds Fable 5 toen hij "Nee" zei.

Het Eindoordeel

Het artikel beweert niet te weten waarom Fable 5 deze specifieke filters heeft. De auteurs geven toe dat ze niet in de hersenen van de robot kunnen kijken om te weten of het een veiligheidsfunctie is die te ver is doorgevoerd of een foutje (glitch).

Ze zijn echter zeer zeker over één ding: Als je Fable 5 erin slaagt om te antwoorden, is hij ongelooflijk nauwkeurig. Het gat tussen zijn ruwe scores en zijn werkelijke vermogen komt volledig door zijn weigering om mee te doen, en niet omdat hij de vaardigheden mist.

Dus, als je een arts of onderzoeker bent die deze tool gebruikt, suggereert het artikel: Ga er niet vanuit dat hij dom is, alleen omdat hij zegt "Ik kan niet." Hij is misschien gewoon voorzichtig. De uitdaging is niet om hem meer geneeskunde te leren; de uitdaging is om te ontdekken hoe je de vraag moet stellen zodat hij zijn mond opent.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →