AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents
Dieser Beitrag stellt AssayBench vor, einen neuen Benchmark, der 1.920 CRISPR-Screens umfasst, um die Fähigkeit großer Sprachmodelle und Agenten zur Vorhersage zellulärer phänotypischer Ergebnisse zu bewerten, und zeigt auf, dass zero-shot-fähige Generalisten-LLMs derzeit spezialisierte biologische Modelle übertreffen, gleichzeitig aber erheblichen Verbesserungsbedarf für die Entwicklung robuster virtueller Zellmodelle aufzeigen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Detektiv, der versucht, ein massives biologisches Rätsel zu lösen. In einem echten Labor führen Wissenschaftler Tausende von Experimenten durch, bei denen sie spezifische Gene in Zellen „ausschalten", um zu sehen, was passiert. Hört die Zelle auf zu wachsen? Wird sie krank? Wird sie resistent gegen ein Medikament? Diese Experimente werden CRISPR-Screens genannt, und sie erzeugen riesige Listen von Genen, die nach ihrer Wichtigkeit für das Ergebnis sortiert sind.
Das Problem ist, dass das Durchführen dieser Experimente im echten Leben langsam, teuer und chaotisch ist. Wissenschaftler wünschen sich eine „Virtuelle Zelle" – ein superintelligentes Computerprogramm, das die Ergebnisse dieser Experimente vorhersagen könnte, bevor sie jemals eine Petrischale berühren.
Diese Arbeit stellt AssayBench vor, eine neue „Abschlussprüfung", die entwickelt wurde, um zu testen, ob unsere aktuellen Modelle der Künstlichen Intelligenz (KI) intelligent genug sind, um diese Virtuelle Zelle zu sein.
Hier ist, wie die Arbeit dies unter Verwendung einfacher Analogien aufschlüsselt:
1. Die neue Prüfung: AssayBench
Vor dieser Arbeit wurden KI-Modelle hauptsächlich an engen Aufgaben getestet, wie etwa der Vorhersage, wie sich die Form eines einzelnen Moleküls verändert. Aber die echte Wirkstoffentwicklung ist eher wie eine Filmhandlung: Man muss die Charaktere (Gene), die Kulisse (den Zelltyp) und die Wendung (die Medikamentenbehandlung) verstehen, um das Ende (den Phänotyp) zu erraten.
Die Autoren haben AssayBench mit 1.920 realen Experimenten erstellt, die bereits veröffentlicht wurden.
- Die Aufgabe: Die KI erhält eine Textbeschreibung eines Experiments (z. B. „Wir haben Gene in Leukämiezellen ausgeschaltet und ein Medikament namens Etoposid hinzugefügt, um zu sehen, welche Zellen überlebt haben").
- Das Ziel: Die KI muss eine sortierte Liste der Top 100 Gene ausgeben, von denen sie glaubt, dass sie den Effekt verursacht haben, von „am wahrscheinlichsten" bis „am unwahrscheinlichsten".
- Die Wendung: Die KI muss dies für neue Experimente tun, die sie noch nie gesehen hat, genau wie ein Schüler, der eine Prüfung zu einem Thema schreibt, das er studiert hat, aber an dem er nicht spezifisch geübt hat.
2. Das Benotungssystem: Der „adjustierte Score"
Wie bewertet man eine KI bei einer Liste von 1.000 Genen? Wenn man nur fragt: „Hat sie die Nummer eins richtig?", ist das zu hart. Wenn man fragt: „Hat sie irgendeines richtig?", ist es zu einfach.
Die Autoren haben eine spezielle Bewertungsmetrik namens Adjusted nDCG erstellt. Denken Sie daran wie an einen Golf-Handicap:
- Manche Experimente sind einfach (wie ein flacher Golfplatz); manche sind schwer (wie ein Platz mit Sandbunkern).
- Die Metrik passt den Score so an, dass eine KI Gutschrift erhält, wenn sie die „zufällige Rat"-Basislinie schlägt, aber sie erhält keinen perfekten Score, nur weil das Experiment einfach war.
- Sie bestraft die KI auch, wenn sie „schlechte" Gene (Gene, die das Problem tatsächlich verschlimmern) an den Anfang der Liste setzt.
3. Die Teilnehmer: Wer hat mitgespielt?
Die Autoren testeten drei Arten von „Schülern":
- Die allgemeinen Genies (Frontier LLMs): Dies sind massive, allgemeine KI-Modelle (wie Gemini 3 Pro oder GPT-5.4), die fast alles im Internet gelesen haben. Sie wurden nicht speziell für die Biologie trainiert; sie wissen einfach nur viel über alles.
- Die Biologie-Spezialisten: Dies sind KI-Modelle, die speziell auf biologischen Daten trainiert wurden oder als medizinische Agenten fungieren sollen.
- Die „Spickzettel"-Basislinien: Einfache Methoden, die einfach nach Mustern suchen, wie etwa: „Welche Gene sind bei dieser Art von Experiment normalerweise wichtig?"
4. Die Ergebnisse: Die Generalisten gewannen (vorläufig)
Überraschenderweise schnitten die allgemeinen Genies (die großen, allgemeinen KI-Modelle) am besten ab.
- Die Spezialisten-Modelle schafften es tatsächlich schlechter als die allgemeinen.
- Die „Spickzettel"-Basislinien waren überraschend wettbewerbsfähig, besonders bei gängigen Zelltypen, was darauf hindeutet, dass manchmal einfache Muster ausreichen.
- Das Urteil: Selbst die besten KI-Modelle sind noch weit von Perfektion entfernt. Die Arbeit zeigt, dass die aktuellen besten KI-Scores ungefähr halbwegs zu dem liegen, was theoretisch möglich ist (die „Leistungsdecke"). Wenn man zwei echte Wissenschaftler nehmen und sie bitten würde, dasselbe Experiment vorherzusagen, würden sie wahrscheinlich viel stärker übereinstimmen als die KI.
5. Die „Auswendiglernen"-Falle
Die Autoren bemerkten etwas Interessantes: Die KI schnitt bei älteren Experimenten (veröffentlicht vor 2021) viel besser ab als bei sehr neuen (veröffentlicht Ende 2025).
- Die Analogie: Es ist wie ein Schüler, der die Antworten auf die Übungstests des letzten Jahres auswendig gelernt hat, aber mit den neuen Fragen auf der heutigen Prüfung kämpft.
- Die Schlussfolgerung: Die KI „lernt" wahrscheinlich Fakten auswendig, die sie in ihren Trainingsdaten gelesen hat, anstatt die biologische Logik wirklich zu verstehen. Dennoch schnitt sie bei den neuen Tests besser ab als die Spezialisten, was darauf hindeutet, dass sie über eine gewisse echte Schlussfolgerungsfähigkeit verfügt und nicht nur über Gedächtnis.
6. Wie kann man besser werden?
Die Arbeit testete einige Möglichkeiten, um die Leistung der KI zu steigern:
- Fine-Tuning: Das spezifische Unterrichten der KI an diesen Arten von Problemen half ein wenig.
- Ensembling: Drei verschiedene KIs zu bitten, über die Antwort abzustimmen und ihre Ergebnisse zu kombinieren, funktionierte am besten. Das ist wie das Befragen eines Expertengremiums statt nur eines.
Das Fazit
AssayBench ist ein neuer, realistischer Test, um zu sehen, ob KI vorhersagen kann, wie sich Zellen verhalten werden, wenn wir ihre Gene manipulieren.
- Aktueller Status: KI wird gut darin, aber sie ist noch nicht soweit. Die besten Modelle machen immer noch Fehler, die echte Wissenschaftler nicht machen würden.
- Die Zukunft: Die Arbeit schlägt vor, dass wir, um eine echte „Virtuelle Zelle" zu bauen, Modelle benötigen, die durch die Biologie schlussfolgern können, anstatt nur Fakten auswendig zu lernen, und dass wir mehr Daten benötigen, um sie zu unterrichten.
Die Arbeit behauptet nicht, dass diese Modelle bereit sind, heute in Krankenhäusern eingesetzt zu werden oder Krankheiten zu heilen. Sie sagt einfach: „Hier ist ein Lineal, um zu messen, wie weit wir noch gehen müssen, bevor die KI das Labor wirklich ersetzen kann."
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.