← Neueste Arbeiten
💻 computer science

From Traditional Scientists to Agentic AI Research: Unequivocal Diagram-as-Code in Scientific Publications

Dieses Paper plädiert für die Einführung von „Diagrams-as-Code“ in wissenschaftlichen Publikationen, um interpretative Mehrdeutigkeit zu eliminieren und dadurch zuverlässige Informationsübergaben zwischen Wissenschaftlern, großen Sprachmodellen und autonomen KI-Agenten für zukünftige wissenschaftliche Entdeckungen zu ermöglichen.

Ursprüngliche Autoren: Mila Glavaški, Lazar Velicki

Veröffentlicht 2026-09-16
📖 8 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mila Glavaški, Lazar Velicki

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die Wissenschaft hat sich schon immer auf zwei Sprachen verlassen, um ihre Entdeckungen zu teilen: das geschriebene Wort und das Bild. Ein Forscher kann einen komplexen biologischen Prozess in einem Textabsatz beschreiben oder ihn mit einem Diagramm illustrieren, das zeigt, wie verschiedene Teile einer Zelle interagieren. Jahrzehntelang haben diese Methoden menschlichen Lesern gut gedient und es Wissenschaftlern ermöglicht, auf der Arbeit der jeweils anderen aufzubauen. Doch sowohl die Sprache als auch die Bilder bergen einen verborgenen Makel: Sie sind interpretationsbedürftig. Ein Satz kann je nach Hintergrund des Lesers leicht unterschiedlich interpretiert werden, und eine Zeichnung kann je nach Interpretation der Formen und Pfeile durch den Betrachter verschieden verstanden werden. Diese Mehrdeutigkeit ist für Menschen handhabbar, stellt aber ein erhebliches Problem für die neue Generation von Systemen der künstlichen Intelligenz dar, die darauf ausgelegt sind, wissenschaftliche Literatur zu lesen und eigenständig Entdeckungen zu machen. Diese Systeme, bekannt als KI-Agenten, benötigen Informationen, die präzise und eindeutig sind und keinen Raum für Vermutungen lassen. Wenn eine KI ein Diagramm oder eine Beschreibung falsch interpretiert, kann dies Fehler verursachen, die sich durch ihre gesamte Arbeit fortpflanzen und zu falschen Schlussfolgerungen führen.

In einer kürzlich durchgeführten Studie schlugen die Forscher Mila Glavaški und Lazar Velicki von der Universität Novi Sad in Serbien eine Lösung für dieses Problem vor. Sie schlagen vor, dass wissenschaftliche Arbeiten „Diagramme-als-Code“ (diagrams-as-code) enthalten sollten. Anstatt nur eine statische Bilddatei hochzuladen, würden Autoren den eigentlichen Computercode bereitstellen, der verwendet wurde, um dieses Bild zu erzeugen. Dieser Code fungiert als strikter, mathematischer Befehlssatz, der einem Computer exakt vorgibt, wie jeder Strich, jede Form und jede Verbindung zu zeichnen ist. Da Code eine Sprache der Logik und nicht der Kunst ist, eliminiert er das Rätselraten. Wenn ein Computer den Code liest, sieht er exakt dieselbe Struktur, die der Autor beabsichtigt hat, ohne Variation in der Bedeutung. Die Forscher testeten diesen Ansatz, indem sie drei gängige Arten wissenschaftlicher Inhalte über Herzinsuffizienz nahmen – textliche Beschreibungen von Ursachen, Erklärungen biologischer Mechanismen und klinische Pfade für die Patientenversorgung – und diese in dieses Codeformat umwandelten. Sie fanden heraus, dass der Ansatz funktioniert und eine Brücke schlägt, die es sowohl menschlichen Wissenschaftlern als als auch KI-Agenten ermöglicht, wissenschaftliche Prozesse mit absoluter Klarheit zu verstehen.

Die Forscher begannen damit, sich anzusehen, wie wissenschaftliche Informationen derzeit geteilt werden. Sie stellten fest, dass die natürliche Sprache zwar eine endlose Vielfalt im Ausdruck ermöglicht, aber auch eine endlose Vielfalt in der Interpretation. Ein Wissenschaftler könnte schreiben, dass eine Herzerkrankung durch Bluthochdruck verursacht wird, während ein anderer sie als Folge eines Ventilfehlers beschreibt. Beides ist wahr, aber die spezifische Wortwahl kann dazu führen, dass eine KI die Verbindung zwischen beiden übersieht. Ähnlich verhält es sich mit einem visuellen Diagramm, das Pfeile zeigt, die verschiedene Teile eines Systems verbinden; ohne eine strikte Definition weiß eine KI jedoch vielleicht nicht, ob diese Pfeile eine Ursache, eine Nebenwirkung oder lediglich eine einfache Assoziation darstellen. Das Ziel der modernen KI-Entwicklung ist es, Systeme zu schaffen, die autonom wissenschaftliche Entdeckungen tätigen können, indem sie als unabhängige Forscher fungieren, die tausende von Papieren lesen und neues Wissen synthetisieren können. Um dies zu erreichen, müssen diese KI-Agenten Informationen mit perfekter Genauigkeit aneinander weitergeben. Wenn ein Agent eine Aufgabe basierend auf einem missverstandenen Diagramm an einen anderen übergibt, kann die gesamte Forschungskette scheitern.

Um ihre Idee zu testen, wählten Glavaški und Velicki drei unterschiedliche Beispiele aus dem Bereich der Kardiologie, der Lehre vom Herzen. Das erste Beispiel war ein Absatz, der die verschiedenen Wege beschreibt, auf denen eine Herzinsuffizienz entsteht, wobei Ursachen wie ischämische Verletzungen, Drucküberlastung und Stoffwechselerkrankungen aufgeführt wurden. Das zweite war eine Definition der Herzinsuffizienz als klinisches Syndrom, die detailliert beschreibt, wie strukturelle Probleme im Herzen zu Symptomen führen. Das dritte war ein Schritt-für-Schritt-Leitfaden für Ärzte zur Untersuchung eines Patienten, bei dem der Verdacht auf eine Herzinsuffizienz besteht, und deckte alles von der Krankengeschichte bis hin zur körperlichen Untersuchung ab. Neben diesen Texten verwendeten sie drei entsprechende Diagramme, die dieselben Konzepte visuell darstellten. Diese Eingaben dienten als Rohmaterial für ihr Experiment.

Das Team verwendete dann eine kostenlose Version eines Large Language Models, eines Typs von KI-Chatbot, um diese Eingaben in Code umzuwandeln. Sie baten die KI, Code für zwei verschiedene Diagramm-Werkzeuge zu generieren, nämlich Mermaid und D2, welche Programme sind, die Textanweisungen in visuelle Diagramme umwandeln. Für die Textbeschreibungen war der Prompt einfach: „Erstelle Code für ein Mermaid-Diagramm für dies.“ Für die bestehenden Bilder war der Prompt etwas spezifischer: „Erstelle Code für ein Mermaid-Diagramm für diese Abbildung. Füge selbst nichts hinzu.“ Die Forscher wollten sehen, ob die KI in der Lage ist, einen Textabsatz oder ein statisches Bild in eine Reihe logischer Anweisungen zu übersetzen, die ein anderer Computer lesen kann.

Die Ergebnisse zeigten, dass der Ansatz machbar war. Für jede Textbeschreibung und jedes getestete Bild generierte die KI erfolgreich Code, der, wenn er durch einen Standard-Editor ausgeführt wurde, ein Diagramm erzeugte, das der ursprünglichen Bedeutung entsprach. Für den Text über die gemeinsamen Mechanismen der Herzinsuffizienz erstellte der Code ein Flussdiagramm, das zeigte, wie verschiedene Pfade zum gleichen Ergebnis führen. Für den Text, der die Krankheit definierte, produzierte der Code ein Diagramm, das verschiedene Ursachen mit der Erkrankung verknüpfte. Für den klinischen Pfad bildete der Code die Schritte ab, die ein Arzt unternehmen sollte, vom ersten Besuch bis zur körperlichen Untersuchung. Die Forscher konvertierten auch die ursprünglichen statischen Bilder in Code, indem sie die KI anwiesen, Code basierend auf den Abbildungen zu generieren. Die KI gelang es, Code-Anweisungen zu erstellen, die, wenn sie gerendert wurden, die visuelle Struktur der molekularen Mechanismen, der pathophysiologischen Kaskade und des klinischen Pfades rekonstruierten.

Nachdem der Code generiert worden war, akzeptierten die Forscher ihn nicht einfach blind. Sie überprüften den Output manuell in den Online-Editoren für Mermaid und D2. Sie stellten fest, dass die KI zwar die allgemeine Struktur richtig hinbekam, aber manchmal kleine Anpassungen nötig waren. Beispielsweise musste eventuell die Richtung eines Pfeils umgekehrt oder eine Verbindung zwischen zwei Blöcken an eine andere Stelle verschoben werden, um die Wissenschaft korrekt widerzuspiegeln. Diese kleinen Edits waren notwendig, um sicherzustellen, dass der Code die beabsichtigte Darstellung perfekt widerspiegelte. Die Tatsache, dass jedoch die Kernstruktur automatisch generiert werden konnte, war die entscheidende Erkenntnis. Der Code diente als unveränderliches, präzises Protokoll der Information, während das visuelle Diagramm lediglich eine Möglichkeit für Menschen war, um zu bestätigen, dass der Code korrekt war.

Die Forscher betonen, dass diese Methode nicht die Notwendigkeit menschlicher Aufsicht ersetzt. Wenn eine KI Code basierend auf einer Halluzination – einem von der KI erfundenen falschen Fakt – generiert, wird das resultierende Diagramm falsch sein. Das von ihnen vorgeschlagene System enthält jedoch eine eingebaute Prüfung. Da der Code für Menschen lesbar ist und sofort gerendert werden kann, kann ein Wissenschaftler das generierte Diagramm betrachten und sofort sehen, ob es dem Text oder dem Originalbild entspricht. Wenn nicht, kann er den Code korrigieren. Dieser Prozess stellt sicher, dass die endgültige Darstellung korrekt ist. Die Studie legt nahe, dass wissenschaftliche Arbeiten in Zukunft diese Code-Schnipsel neben traditionellem Text und Bildern enthalten könnten. Dies würde es KI-Agenten ermöglichen, die Arbeit zu lesen und die exakte Logik der Forschung zu extrahieren, ohne visuelle oder textliche Hinweise misszuinterpretieren.

Die Auswirkungen dieser Arbeit gehen über die Herzinsuffizienz hinaus. Die Forscher argumentieren, dass dieser Ansatz auf jedes wissenschaftliche Gebiet anwendbar ist, in dem Prozesse beschrieben werden. Ob es sich um den Fluss von Chemikalien in einem Labor, die Schritte einer medizinischen Behandlung oder die Verbindungen in einem Ökosystem handelt – die Darstellung dieser Prozesse als Code würde sie universell verständlich machen. Es würde es einem menschlichen Wissenschaftler ermöglichen, ein Projekt an einen KI-Agenten zu übergeben, und dieser Agent könnte es wiederum an einen anderen KI-Agenten weitergeben, mit der Garantie, dass die Bedeutung der Arbeit bei jedem Schritt unverändert bleibt. Der Code fungiert als universeller Übersetzer, der die Mehrdeutigkeit der natürlichen Sprache und die Subjektivität statischer Bilder entfernt.

In ihrer Diskussion räumen die Autoren ein, dass diese Methode Grenzen hat. Sie kann nur das darstellen, was bereits bekannt ist. Wenn ein wissenschaftlicher Prozess unbekannte Elemente oder Beziehungen beinhaltet, die noch nicht entdeckt wurden, können diese Lücken nicht durch Code gefüllt werden. Darüber hinaus hängt die Qualität des Codes von der Qualität der generierenden KI ab. Die Verwendung komplexerer Prompts könnte bessere Ergebnisse liefern, aber die Forscher zeigten, dass das System selbst mit einfachen Anweisungen gut genug funktioniert, um nützlich zu sein. Sie merkten auch an, dass sie zwar Mermaid und D2 verwendeten, andere Werkzeuge wie PlantUML oder Graphviz jedoch denselben Zweck erfüllen könnten. Das spezifische Werkzeug ist weniger wichtig als das Konzept einer codebasierten Repräsentation.

Die Studie kommt zu dem Schluss, dass die Zeit gekommen ist, die Art und Weise, wie wissenschaftliche Informationen geteilt werden, zu standardisieren. Durch die Einführung von „Diagrammen-als-Code“ kann die wissenschaftliche Gemeinschaft sicherstellen, dass die von ihr produzierten Erkenntnisse nicht nur für Menschen lesbar, sondern auch für Maschinen ausführbar sind. Dieser Wandel würde die wissenschaftliche Literatur von einer Sammlung statischer Dokumente in eine dynamische, maschinenlesbare Ressource verwandeln. Er würde einen nahtlosen Wissenstransfer zwischen menschlichen Forschern und künstlicher Intelligenz ermöglichen und den Weg für eine Zukunft ebnen, in der KI-Agenten mit Wissenschaftlern zusammenarbeiten können, um komplexe Probleme mit einer Präzision zu lösen, die zuvor unmöglich war. Die Forscher haben demonstriert, dass dies nicht nur eine theoretische Idee ist, sondern eine praktische Realität, die heute mit bestehenden Werkzeugen implementiert werden kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →