← Nieuwste papers
🤖 AI

AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation

Dit artikel toont aan dat bij de waardering van geneesmiddelen-activa, hoewel redeneerstructuren de kalibratie en discipline van een AI-agent verbeteren, de beschikbaarheid van propriëtaire bewijsvoering de definitieve beperkende factor is die de bovengrens bepaalt voor feitelijke nauwkeurigheid en beslissingsnut.

Oorspronkelijke auteurs: Yinan Wang

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yinan Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van detectives inhuurt om een complexe zaak op te lossen: Is een nieuw idee voor een medicijn miljoenen dollars waard om in te investeren?

Om dit te beantwoorden, moet de detective drie dingen weten:

  1. De Wetenschap: Is de biologie logisch?
  2. De Concurrentie: Wie probeert dit nog meer?
  3. De Geschiedenis: Zijn vergelijkbare medicijnen eerder geslaagd of gefaald?

Het papier dat je hebt verstrekt is een "stress-test" van drie verschillende soorten AI-detectives om te zien welke er werkelijk het beste is in het oplossen van deze zaak. De onderzoekers wilden weten: Is de intelligentie van de detective (het AI-model) het belangrijkste, of is de kwaliteit van het bewijsmateriaal dat ze mogen lezen de echte flessenhals?

Hier is de uitsplitsing van het experiment en wat zij vonden, met behulp van eenvoudige analogieën.

De Drie Detectives (Het Experiment)

De onderzoekers stelden drie versies van een AI-agent op, die allemaal exact hetzelfde "brein" gebruikten (hetzelfde onderliggende AI-model). Het enige verschil was welke tools en informatie ze mochten gebruiken.

  • Detective A (De "Websurfer"):
    • Tools: Kan alleen een standaard webzoekopdracht gebruiken (zoals Google) en heeft geen speciale training.
    • Analogie: Dit is een slimme stagiair die naar de openbare bibliotheek gaat en de boeken leest die op de open planken staan. Ze zijn slim, maar ze kunnen alleen vinden wat iedereen ook kan vinden.
  • Detective B (De "Getrainde Analist"):
    • Tools: Heeft dezelfde toegang tot het web, maar heeft een strikt playbook (een checklist met regels) gekregen, een "red team" (een criticus om het werk te controleren) en toegang tot publieke databases (zoals klinische trial-registers).
    • Analogie: Dit is dezelfde stagiair, maar nu met een senior mentor die een checklist geeft, een regelboek over hoe rapporten geschreven moeten worden, en toegang tot openbare overheidsarchieven. Ze zijn meer gedisciplineerd en georganiseerd, maar ze kunnen de "geheime dossiers" nog steeds niet zien.
  • Detective C (De "Insider"):
    • Tools: Heeft alles wat Detective B heeft, PLUS toegang tot een enorme, private, betaalde database (Noah AI) die gecureerde records bevat van medicijnproeven, deals en concurrenten die verborgen zijn voor het publieke web.
    • Analogie: Dit is de senior onderzoeker die een sleutel heeft tot de geheime kluis. Ze kunnen de privé-e-mails zien, de ongepubliceerde resultaten van proeven en de "long-tail" deals die nooit het nieuws hebben gehaald.

De Resultaten: Wat Hebben Ze Gevonden?

De onderzoekers testten deze detectives op 13 verschillende medicijngevallen. Dit is het eindoordeel:

1. Het "Playbook" Helpt, Maar Slechts Beperkt (Detective B vs. A)

Toen Detective B (de getrainde analist) werd vergeleken met Detective A (de websurfer), waren de resultaten interessant:

  • Betere Discipline: Detective B schreef betere rapporten. Ze waren minder geneigd tot wilde gokken en volgden de regels beter op.
  • Het Probleen: Detective B mistte nog steeds 60% tot 75% van de belangrijke concurrenten en deals.
  • De Analogie: Stel je voor dat Detective B een zeer beleefde, goed georganiseerde bibliothecaris is die elke regel volgt. Maar als het boek dat ze moeten vinden in een private kluis zit, zal geen enkele mate van goede organisatie hen helpen dat boek te vinden. Ze zijn "gekalibreerd" (denken helder) maar "blind" (missen feiten).

2. De "Private Kluis" Verandert Alles (Detective C)

Toen Detective C (de insider) werd ingezet, veranderden de resultaten drastisch:

  • Volledigheid: Detective C vond 96% van de cruciale informatie. Detective A en B vonden slechts ongeveer 25% tot 38%.
  • Het "Long-Tail" Effect: De grootste kloof zat in het vinden van "long-tail" data—kleine, obscure of regionale medicijnproeven die nooit op het openbare web verschijnen. Detective C vond bijna al deze gegevens; de anderen vonden er bijna geen.
  • De Analogie: Detective C schreef niet alleen een beter rapport; ze zagen het hele speelveld. Terwijl de anderen schaak speelden met slechts de helft van de stukken, zag Detective C het hele spel.

3. De "Informed Decision" Score

Dit is de belangrijkste bevinding.

  • Ruwe Kwaliteit: Als je alleen het definitieve rapport zou lezen zonder te weten welke feiten ontbraken, klonken de rapporten van Detective A en B bijna net zo goed als die van Detective C. Ze klonken zelfverzekerd en logisch.
  • Echte Kwaliteit: Maar omdat A en B veel feiten misten, waren hun beslissingen gebaseerd op onvolledige informatie.
  • De Rekensom: De onderzoekers creëerden een score genaamd "Informed Decision Quality".
    • Score Detective A/B: ~2.0 (Ze klonken goed, maar misten 75% van de feiten).
    • Score Detective C: ~7.4 (Ze klonken goed EN hadden alle feiten).
  • Het Plafond: Het papier betoogt dat zelfs als je Detective B een "perfect" brein en een perfect rapport zou geven, ze nog steeds beperkt zouden blijven tot een lage score omdat ze fysiek niet in staat waren de ontbrekende informatie te bereiken. Je kunt niet redeneren naar een waarheid die je niet kunt zien.

De Belangrijkste Conclusie

Het papier concludeert met een eenvoudige les voor het bouwen van AI-wetenschappers:

"Vaardigheden en data zijn beide nuttig, maar data is de limiet."

  • Redeneervaardigheden (Het Playbook): Deze zijn noodzakelijk. Ze voorkomen dat de AI roekeloos wordt, helpen de AI om gedachten te ordenen en zorgen ervoor dat regels worden gevolgd. Ze maken de AI een betere schrijver en een gedisciplineerdere denker.
  • Evidence Substrate (De Data): Dit is de beperkende factor. Als de AI geen toegang heeft tot de private, gecureerde long-tail data, kan de AI simpelweg de volledige waarheid niet kennen. Geen enkele slimme prompting of redeneertruc kan de gaten van ontbrekende informatie opvullen.

Kortom: Je kunt de slimste detective ter wereld hebben met het beste regelboek, maar als ze niet in de bewijskamer worden toegelaten, zullen ze de zaak nooit correct oplossen. Voor AI om echt nuttig te zijn in hoogwaardige velden zoals medicijnontdekking, heeft het toegang nodig tot de private, gecureerde bewijslast, en niet alleen tot het openbare internet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →