← Neueste Arbeiten
📄 chemistry

JURY: A Comprehensive Training-Free to Fully-Supervised Framework for Evaluating Chemical Language Models

Das Paper stellt JURY vor, ein umfassendes Framework, das vier verschiedene Probes nutzt, die von trainingsfreien bis hin zu voll überwachten Methoden reichen, um chemische Sprachmodelle rigoros zu evaluieren, wobei aufgedeckt wird, dass deren wahre chemische Kodierungsfähigkeiten oft durch leistungsstarke Prediction Heads verschleiert werden und eher mit traditionellen Fingerprints vergleichbar sind, als bisher angenommen wurde.

Ursprüngliche Autoren: Daanish Uddin Khan, Naafey Aamer, Muhammad Sajjad, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

Veröffentlicht 2026-08-19
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Daanish Uddin Khan, Naafey Aamer, Muhammad Sajjad, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Im Wettlauf um die Entdeckung neuer Medikamente stehen Wissenschaftler vor einem Engpass, der jeden Durchbruch verlangsamt: Bevor eine neue chemische Verbindung zu einem Arzneimittel werden kann, muss sie eine Reihe strenger Sicherheitsprüfungen durchlaufen. Forscher müssen wissen, ob der Körper sie aufnimmt, wie sie durch das Blut transportiert wird, ob die Leber sie abbaut und ob sie toxisch sein könnte. Diese Prüfungen, bekannt als Absorption, Verteilung, Metabolisierung, Exkretion und Toxizität, sind in einem Labor teuer und zeitaufwendig durchzuführen. Um dies zu beschleunigen, haben sich Wissenschaftler der Computer zugewandt und nutzen künstliche Intelligenz, um diese Eigenschaften allein durch den Blick auf die Struktur eines Moleküls vorherzusagen. Jahrelang waren die erfolgreichsten Werkzeuge „Sprachmodelle“, die auf Millionen von chemischen Formeln trainiert wurden, die als Textzeichenfolgen geschrieben sind. Diese Modelle lernen, ein komplexes Molekül in eine einzige, feste Liste von Zahlen zu komprimieren – einen digitalen Fingerabdruck, der seine chemische Essenz einfängt. Die Standardmethode, um zu beurteilen, wie gut diese Modelle sind, besteht darin, ihnen ein einfaches Vorhersagewerkzeug anzuhsten, dieses Werkzeug mit einem kleinen Satz experimenteller Daten zu trainieren und zu sehen, wie gut es die Antwort errät. Wenn die Vermutung gut ist, erhält das Modell eine hohe Punktzahl.

Eine neue Studie deutet jedoch darauf an, dass diese Standardmethode eine entscheidende Wahrheit verborgen hat. Die Forscher fanden heraus, dass das Vorhersagewerkzeug selbst oft so viel der schweren Arbeit leistet, dass es verschleiert, was das zugrunde liegende Modell tatsächlich gelernt hat. Ein leistungsstarkes Werkzeug kann viel allein aus den Antworten lernen, die ihm gegeben werden, selbst wenn der digitale Fingerabdruck, den es liest, schwach oder wenig hilfreich ist. Um dies zu lösen, entwickelte ein Team von Forschern aus Deutschland eine neue Art, diese Modelle zu testen, genannt JURY. Anstatt sich auf ein einzelnes trainiertes Werkzeug zu verlassen, verwendeten sie vier verschiedene Methoden, um die digitalen Fingerabdrücke der Modelle zu lesen. Zwei dieser Methoden erforderten überhaupt kein Training und betrachteten lediglich, wie nah Moleküle im digitalen Raum beieinander liegen. Die anderen beiden Methoden nutzten ein einfaches Training, das von einer einfachen linearen Berechnung bis hin zu einem kleinen, flexiblen Netzwerk reichte. Durch die Anwendung dieser vier Methoden auf zehn verschiedene chemische Modelle über dreiundsiebzig verschiedene Sicherheitstests hinweg entdeckte das Team, dass sich die Modelle viel ähnlicher sind, als man bisher glaubte. Kein einzelnes Modell war in allem am besten. Tatsächlich schnitt eine jahrzehntealte, handgefertigte Methode zur Beschreibung von Molekülen in vielen Fällen genauso gut ab wie die fortschrittlichste moderne KI.

Die überraschendste Entdeckung war, dass sich die Modelle nicht darin unterscheiden, wie viel chemisches Wissen sie besitzen, sondern darin, wie sie dieses Wissen organisieren. Einige Modelle ordnen ihre digitalen Fingerabdrücke so an, dass Moleküle mit ähnlichen Eigenschaften von Natur aus nah beieinander liegen, was sie ohne zusätzliches Training leicht auffindbar macht. Andere Modelle verbergen dasselbe chemische Wissen auf eine Weise, die erst sichtbar wird, nachdem ein Prädiktor trainiert wurde, um die Daten neu anzuordnen. Es ist wie der Blick in eine Bibliothek, in der ein Bibliothekar die Bücher bereits nach Genre sortiert hat, während ein anderer sie wahllos gestapelt hat, aber genau weiß, wo er ein bestimmtes Buch findet, wenn man die richtige Frage stellt. Die Studie zeigte, dass ein Modell, das bei dem ersten Ansatz exzelliert, beim zweiten scheitern kann und umgekehrt. Dies bedeutet, dass ein einzelner Wert nicht aussagen kann, ob ein Modell gut ist; man muss sein Profil über verschiedene Testmethoden hinweg betrachten, um zu verstehen, wo seine Stärken liegen.

Die Forscher testeten zehn verschiedene chemische Sprachmodelle, darunter mehrere, die drei verschiedene Transformer-Familien verwenden, sowie eine traditionelle, handgefertigte Methode, die als Extended-Connectivity-Fingerprint bekannt ist. Sie wandten ihre vier Testmethoden auf dreiundsiebzig verschiedene Aufgaben an, die alles von der Aufnahme eines Wirkstoffs bis hin zu seiner potenziellen Toxizität abdeckten. Als sie die Ergebnisse betrachteten, stellten sie fest, dass sich das Ranking der Modelle je nach verwendeter Testmethode komplett änderte. Ein Modell, das bei einer Methode, die kein Training erforderte, an erster Stelle stand, fiel oft an das Ende der Liste zurück, wenn es mit einer Methode getestet wurde, die ein Training eines Prädiktors beinhaltete. Umgekehrt stieg ein Modell, das ohne Training Schwierigkeiten hatte, nach Hinzufügen eines einfachen Prädiktors an die Spitze auf. Diese Inkonsistenz bewies, dass die Modelle nicht einfach „besser“ oder „schlechter“ waren, sondern dass sie ihr chemisches Wissen auf grundlegend unterschiedliche Weise speicherten.

Ein Modell namens MoLFormer-XL demonstrierte, dass es seinen digitalen Raum so klar angeordnet hatte, dass Moleküle mit ähnlichem Verhalten bereits gruppiert waren. Es schnitt außergewöhnlich gut ab, wenn die Forscher einfach die nächsten Nachbarn im digitalen Raum betrachteten, ohne zusätzliche Werkzeuge zu trainieren. Im Gegensatz dazu schnitt ein anderes Modell, MolEncoder, schlecht ab, wenn die Forscher die rohe Anordnung des Raums betrachteten. Sobald jedoch ein einfacher Prädiktor auf seinen Daten trainiert wurde, sprang MolEncoder an die Spitze der Rangliste. Dies zeigte, dass MolEncoder über das gleiche Maß an chemischem Wissen verfügte, dieses aber in einem Format verborgen hatte, das ein trainiertes Werkzeug benötigte, um es zu erschließen. Die Studie fand auch heraus, dass die traditionelle, handgefertigte Fingerprint-Methode, die der modernen KI vorausgeht, oft die fortschrittlichsten Modelle übertraf, wenn kein Training zulässig war, insbesondere bei der Vorhersage, wie Chemikalien im Körper reagieren. Dies deutet darauf an, dass für bestimmte Aufgaben die alte Art der Organisation chemischer Daten immer noch hocheffektiv ist.

Das Team kam zu dem Schluss, dass sich das Feld darauf verlassen hat, komplexe Systeme anhand einer einzigen Zahl zu beurteilen, was so ist, als würde man einen Musiker nur nach einem einzigen Lied bewerten. Ein Modell kann bei einer Art von Vorhersage exzellent sein, bei einer anderen jedoch schlecht, abhängig davon, wie seine internen Daten strukturiert sind. Der neue Rahmen JURY ersetzt diesen einzelnen Wert durch ein detailliertes Profil, das zeigt, wie ein Modell über verschiedene Ebenen der Überwachung hinweg abschneidet. Dies ermöglicht es Wissenschaftlern, das richtige Werkzeug für die jeweilige Aufgabe zu wählen. Wenn ein Forscher eine Bibliothek von Chemikalien schnell screenen möchte, ohne Zeit für das Training eines neuen Werkzeugs aufzuwenden, sollte er ein Modell wählen, das bei den unüberwachten Tests gut abschneidet. Wenn er über reichlich Daten verfügt und einen spezifischen Prädiktor für eine hochsensible Aufgabe trainieren möchte, kann er ein Modell wählen, das erst nach dem Training exzelliert. Indem man versteht, wo ein Modells Wissen liegt und wie es organisiert ist, können Wissenschaftler bessere Entscheidungen darüber treffen, welche Werkzeuge sie verwenden – und so über einfache Rankings hinaus zu einem tieferen Verständnis dessen gelangen, was diese künstlichen Intelligenzen tatsächlich gelernt haben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →