AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents
Dit artikel introduceert AssayBench, een nieuwe benchmark bestaande uit 1.920 CRISPR-screens die zijn ontworpen om het vermogen van grote taalmodellen en agents te evalueren om cellulaire fenotypische uitkomsten te voorspellen, waarbij wordt aangetoond dat zero-shot generalistische LLM's momenteel gespecialiseerde biologiemodellen overtreffen, terwijl er tegelijkertijd aanzienlijke ruimte voor verbetering wordt benadrukt om robuuste virtuele celmodellen te realiseren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een enorm biologisch mysterie probeert op te lossen. In een echt laboratorium voeren wetenschappers duizenden experimenten uit waarbij ze specifieke genen in cellen "uitschakelen" om te zien wat er gebeurt. Stopt de cel met groeien? Wordt hij ziek? Wordt hij resistent tegen een medicijn? Deze experimenten worden CRISPR-screens genoemd, en ze genereren enorme lijsten van genen, gerangschikt op basis van hoe belangrijk ze zijn voor het resultaat.
Het probleem is dat het uitvoeren van deze experimenten in het echte leven traag, duur en rommelig is. Wetenschappers wensen dat ze een "Virtuele Cel" hadden—een superintelligente computerprogramma dat de resultaten van deze experimenten kan voorspellen voordat ze ooit een petrischaal aanraken.
Dit artikel introduceert AssayBench, een nieuw "eindexamen" dat is ontworpen om te testen of onze huidige kunstmatige intelligentie (KI)-modellen slim genoeg zijn om die Virtuele Cel te zijn.
Hier is hoe het artikel dit uitlegt, met behulp van eenvoudige analogieën:
1. Het nieuwe examen: AssayBench
Voordat dit artikel verscheen, werden KI-modellen voornamelijk getest op smalle taken, zoals het voorspellen van hoe een enkel molecuul van vorm verandert. Maar echte medicijnontwikkeling is meer als een filmplot: je moet de personages (genen), de setting (het celtype) en de plotwending (de medicijngenezing) begrijpen om het einde (het fenotype) te raden.
De auteurs bouwden AssayBench met behulp van 1.920 realistische experimenten die al eerder zijn gepubliceerd.
- De Taak: De KI krijgt een tekstuele beschrijving van een experiment (bijvoorbeeld: "We schakelden genen uit in leukemiecellen en voegden een medicijn genaamd Etoposide toe om te zien welke cellen overleefden").
- Het Doel: De KI moet een gerangschikte lijst van de top 100 genen uitvoeren die volgens haar de oorzaak van het effect waren, van "meest waarschijnlijk" tot "minst waarschijnlijk".
- De Wending: De KI moet dit doen voor nieuwe experimenten die ze nog nooit heeft gezien, net als een student die een toets maakt over een onderwerp dat ze heeft bestudeerd maar waar ze niet specifiek op heeft geoefend.
2. Het beoordelingssysteem: De "Aangepaste Score"
Hoe beoordeel je een KI op een lijst van 1.000 genen? Als je alleen vraagt: "Heeft hij de nummer één goed?", is dat te streng. Als je vraagt: "Heeft hij er wel één goed?", is dat te makkelijk.
De auteurs creëerden een speciale beoordelingsmetriek genaamd Adjusted nDCG. Denk hierbij aan een golfhandicap:
- Sommige experimenten zijn makkelijk (zoals een vlakke golfbaan); sommige zijn moeilijk (zoals een baan met zandbunkers).
- De metriek past de score aan zodat een KI krediet krijgt voor het verslaan van de "willekeurige gok"-basislijn, maar krijgt geen perfecte score alleen omdat het experiment makkelijk was.
- Het straft de KI ook af als hij "slechte" genen (genen die het probleem eigenlijk verergeren) bovenaan de lijst zet.
3. De deelnemers: Wie speelde mee?
De auteurs testten drie soorten "studenten":
- De Algemene Geniussen (Frontier LLM's): Dit zijn enorme, algemene KI-modellen (zoals Gemini 3 Pro of GPT-5.4) die bijna alles op internet hebben gelezen. Ze zijn niet specifiek getraind voor biologie; ze weten gewoon veel over alles.
- De Biologie-specialisten: Dit zijn KI-modellen die specifiek zijn getraind op biologische data of zijn ontworpen om te fungeren als medische agenten.
- De "Spiekbrief"-basislijnen: Eenvoudige methoden die gewoon op zoek gaan naar patronen, zoals "Welke genen zijn meestal belangrijk in dit type experiment?"
4. De resultaten: De generalisten wonnen (voorlopig)
Verrassend genoeg presteerden de Algemene Geniussen (de grote, algemene KI-modellen) het beste.
- De Specialist-modellen deden het eigenlijk slechter dan de algemene modellen.
- De "Spiekbrief"-basislijnen waren verrassend concurrerend, vooral voor veelvoorkomende celtypen, wat suggereert dat soms simpele patronen voldoende zijn.
- Het oordeel: Zelfs de beste KI-modellen zijn nog lang niet perfect. Het artikel toont aan dat de huidige beste KI-scores ongeveer halverwege zitten ten opzichte van wat theoretisch mogelijk is (het "prestatieplafond"). Als je twee echte wetenschappers zou vragen om hetzelfde experiment te voorspellen, zouden ze waarschijnlijk veel meer met elkaar overeenkomen dan de KI doet.
5. De "Memoriseren"-valstrik
De auteurs merkten iets interessants op: de KI deed het veel beter bij oudere experimenten (gepubliceerd voor 2021) dan bij zeer recente (gepubliceerd eind 2025).
- De Analogie: Het is alsof een student de antwoorden heeft gememoriseerd van de oefentoetsen van vorig jaar, maar worstelt met de nieuwe vragen op het examen van vandaag.
- De Conclusie: De KI "memoriseert" waarschijnlijk feiten die ze in haar trainingsdata heeft gelezen, in plaats van de biologische logica echt te begrijpen. Ze presteerde echter nog steeds beter dan specialisten op de nieuwe tests, wat suggereert dat ze een zekere echte redeneervermogen heeft, niet alleen geheugen.
6. Hoe word je beter?
Het artikel testte een paar manieren om de prestaties van de KI te verbeteren:
- Fine-tuning: Het specifiek leren van de KI op dit soort problemen hielp een beetje.
- Ensembling: Vragen aan drie verschillende KI's om te stemmen over het antwoord en hun resultaten te combineren, werkte het beste. Dit is alsof je een panel van experts vraagt in plaats van slechts één.
De bottom line
AssayBench is een nieuwe, realistische test om te zien of KI kan voorspellen hoe cellen zich zullen gedragen wanneer we hun genen aanpassen.
- Huidige status: KI wordt hier goed in, maar het is er nog niet. De beste modellen maken nog steeds fouten die echte wetenschappers niet zouden maken.
- De toekomst: Het artikel suggereert dat we, om een echte "Virtuele Cel" te bouwen, modellen nodig hebben die door de biologie kunnen redeneren in plaats van alleen feiten te memoriseren, en dat we meer data nodig hebben om ze te leren.
Het artikel beweert niet dat deze modellen klaar zijn om vandaag in ziekenhuizen te worden gebruikt of om ziektes te genezen. Het zegt simpelweg: "Hier is een liniaal om te meten hoe ver we nog moeten gaan voordat KI het laboratoriumwerk echt kan vervangen."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.