From Traditional Scientists to Agentic AI Research: Unequivocal Diagram-as-Code in Scientific Publications
Dit artikel pleit voor het adopteren van "diagrammen-als-code" in wetenschappelijke publicaties om interpretatieve ambiguïteit te elimineren, waardoor betrouwbare informatieoverdrachten tussen wetenschappers, grote taalmodellen en autonome AI-agenten mogelijk worden voor toekomstige wetenschappelijke ontdekkingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Wetenschap heeft altijd vertrouwd op twee talen om ontdekkingen te delen: het geschreven woord en de afbeelding. Een onderzoeker kan een complex biologisch proces beschrijven in een paragraaf tekst, of het illustreren met een diagram dat laat zien hoe verschillende delen van een cel met elkaar interageren. Decennialang hebben deze methoden menselijke lezers goed gediend, waardoor wetenschappers voort kunnen bouwen op elkaars werk. Toch dragen zowel taal als afbeeldingen een verborgen gebrek: ze zijn vatbaar voor interpretatie. Een zin kan op licht verschillende manieren worden gelezen, afhankelijk van de achtergrond van de lezer, en een tekening kan verschillend worden begrepen op basis van hoe een kijker de vormen en pijlen interpreteert. Deze ambiguïteit is beheersbaar voor mensen, maar creëert een aanzienlijk probleem voor de nieuwe generatie kunstmatige intelligentiesystemen die ontworpen zijn om wetenschappelijke literatuur te lezen en zelfstandig ontdekkingen te doen. Deze systemen, bekend als AI-agenten, hebben informatie nodig die precies en ondubbelzinnig is, zonder ruimte voor gissingen. Als een AI een diagram of een beschrijving verkeerd interpreteert, kan dit fouten veroorzaken die doorwerken in het werk, wat leidt tot onjuiste conclusies.
In een recente studie stelden onderzoekers Mila Glavaški en Lazar Velicki van de Universiteit van Novi Sad in Servië een oplossing voor dit probleem voor. Zij stellen voor dat wetenschappelijke artikelen "diagrammen-als-code" moeten bevatten. In plaats van alleen een statisch afbeeldingsbestand te uploaden, zouden auteurs de eigenlijke computercode leveren die wordt gebruikt om die afbeelding te generen. Deze code fungeert als een strikte, wiskundige instructieset die een computer precies vertelt hoe hij elke lijn, vorm en verbinding moet tekenen. Omdat code een taal van logica is in plaats van kunst, elimineert het de gokwerk. Wanneer een computer de code leest, ziet hij exact dezelfde structuur als de auteur bedoelde, zonder variatie in betekenis. De onderzoekers testten dit idee door drie veelvoorkomende soorten wetenschappelijke inhoud over hartfalen — tekstuele beschrijvingen van oorzaken, verklaringen van biologische mechanismen en klinische trajecten voor patiëntenzorg — om te zetten in dit codeformaat. Ze kwamen tot de conclusie dat deze aanpak werkt en een brug slaat waardoor zowel menselijke wetenschappers als AI-agenten wetenschappelijke processen met totale helderheid kunnen begrijpen.
De onderzoekers begonnen door te kijken naar hoe wetenschappelijke informatie momenteel wordt gedeeld. Ze merkten op dat hoewel natuurlijke taal zorgt voor een eindeloze variëteit in expressie, het ook zorgt voor een eindeloze variëteit in interpretatie. Een wetenschapper kan schrijven dat een hartconditie wordt veroorzaakt door een hoge bloeddruk, terwijl een ander het kan beschrijven als een gevolg van klepschade. Beiden zijn waar, maar de specifieke bewoording kan een AI ertoe brengen de connectie tussen de twee te missen. Op dezelfde manier kan een visueel diagram pijlen tonen die verschillende delen van een systeem verbinden, maar zonder een strikte definitie weet een AI misschien niet of die pijlen een oorzaak, een bijwerking of een eenvoudige associatie vertegenwoordigen. Het doel van moderne AI-ontwikkeling is om systemen te creëren die autonoom wetenschappelijke ontdekkingen kunnen doen, optredend als onafhankelijke onderzoekers die duizenden papers kunnen lezen en nieuwe kennis kunnen synthetiseren. Om dit te doen, moeten deze AI-agenten informatie met perfecte nauwkeurigheid aan elkaar doorgeven. Als één agent een taak aan een andere doorgeeft op basis van een verkeerd begrepen diagram, kan de hele keten van onderzoek falen.
Om hun idee te testen, selecteerden Glavaški en Velicki drie verschillende voorbeelden uit de cardiologie, de studie van het hart. Het eerste voorbeeld was een paragraaf die de verschillende manieren beschreef waarop hartfalen zich ontwikkelt, waarbij oorzaken zoals ischemische schade, drukoverbelasting en metabole ziekte werden opgesomd. Het tweede was een definitie van hartfalen als een klinisch syndroom, waarin werd uitgelegd hoe structurele problemen in het hart leiden tot symptomen. Het derde was een stapsgewijze handleiding voor artsen over hoe zij een patiënt moeten evalueren die wordt vermoed aan hartfalen te lijden, variërend van de medische geschiedenis tot lichamelijk onderzoek. Naast deze teksten gebruikten ze drie bijbehorende diagrammen die deze zelfde concepten visueel weergaven. Deze inputs dienden als het ruwe materiaal voor hun experiment.
Het team gebruikte vervolgens een gratis versie van een groot taalmodel, een type AI-chatbot, om deze inputs om te zetten in code. Ze vroegen de AI om code te genereren voor twee verschillende diagramtools, Mermaid en D2, wat programma's zijn die tekstinstructies omzetten in visuele grafieken. Voor de tekstbeschrijvingen was de prompt simpel: "Maak code voor een Mermaid-diagram voor dit." Voor de bestaande afbeeldingen was de prompt iets specifieker: "Maak code voor een Mermaid-diagram voor deze figuur. Voeg zelf niets toe." De onderzoekers wilden zien of de AI een paragraaf tekst of een statische afbeelding kon vertalen naar een reeks logische instructies die een andere computer kon lezen.
De resultaten toonden aan dat de aanpak haalbaar was. Voor elke tekstbeschrijving en elke afbeelding die ze testten, genereerde de AI succesvol code die, wanneer uitgevoerd door een standaard editor, een diagram produceerde dat overeenkwam met de oorspronkelijke betekenis. Voor de tekst over de gedeelde mechanismen van hartfalen creëerde de code een stroomdiagram dat liet zien hoe verschillende paden naar dezelfde uitkomst leiden. Voor de tekst die de ziekte definieerde, produceerde de code een diagram dat diverse oorzaken aan de conditie koppelde. Voor het klinische traject bracht de code de stappen in kaart die een arts moet volgen, van het eerste bezoek tot het lichamelijk onderzoek. De onderzoekers zetten ook de oorspronkelijke statische afbeeldingen om in code door de AI te vragen code te genereren op basis van de figuren. De AI slaagde erin om code-instructies te produceren die, wanneer gerenderd, de visuele structuur van de moleculaire mechanismen, de pathofysiologische cascade en het klinische traject recreëerden.
Zodra de code was gegenereerd, accepteerden de onderzoekers deze niet blindelings. Ze controleerden de output handmatig in de online editors voor Mermaid en D2. Ze ontdekten dat hoewel de AI de algemene structuur goed kreeg, er soms kleine aanpassingen nodig waren. Bijvoorbeeld, de richting van een pijl moest misschien worden omgedraaid, of een verbinding tussen twee blokken moest naar een andere plek worden verplaatst om de wetenschap accuraat te reflecteren. Deze kleine bewerkingen waren noodzakelijk om ervoor te zorgen dat de code de beoogde representatie perfect weerspiegelde. Echter, het feit dat de kernstructuur automatisch gegenereerd kon worden, was de belangrijkste bevinding. De code diende als het onveranderlijke, precieze verslag van de informatie, terwijl het visuele diagram slechts een manier was voor mensen om te bevestigen dat de code correct was.
De onderzoekers benadrukken dat deze methode de noodzaak voor menselijk toezicht niet vervangt. Als een AI code genereert op basis van een hallucinatie — een onwaar feit dat de AI verzint — dan zal de resulterende diagram onjuist zijn. De voorgestelde methode bevat echter een ingebouwde controle. Omdat de code voor mensen leesbaar is en direct gerenderd kan worden, kan een wetenschapper naar de gegenereerde diagram kijken en onmiddellijk zien of deze overeenkomt met de tekst of de oorspronkelijke afbeelding. Als dat niet het geval is, kan men de code aanpassen. Dit proces zorgt ervoor dat de uiteindelijke representatie accuraat is. De studie suggereert dat wetenschappelijke artikelen in de toekomst deze codesnippets naast traditionele tekst en afbeeldingen kunnen bevatten. Dit zou AI-agenten in staat stellen om het artikel te lezen en de exacte logica van het onderzoek te extraheren zonder de visuele of tekstuele aanwijzingen verkeerd te interpreteren.
De implicaties van dit werk reiken verder dan alleen hartfalen. De onderzoekers betogen dat deze aanpak kan worden toegepast op elk wetenschappelijk gebied waar processen worden beschreven. Of het nu gaat om de stroom van chemicaliën in een laboratorium, de stappen in een medische behandeling of de verbindingen in een ecologisch systeem; het representeren van deze processen als code zou ze universeel begrijpelijk maken. Het zou een menselijke wetenschapper in staat stellen om een project aan een AI-agent te overhandigen, en die agent het vervolgens aan een andere AI door te geven, met de garantie dat de betekenis van het werk in elke stap ongewijzigd blijft. De code fungeert als een universele vertaler die de ambiguïteit van natuurlijke taal en de subjectiviteit van statische afbeeldingen wegneemt.
In hun discussie erkennen de auteurs dat deze methode beperkingen heeft. Het kan alleen representeren wat al bekend is. Als een wetenschappelijk proces onbekende elementen of relaties bevat die nog niet zijn ontdekt, kunnen die hiaten niet door code worden opgevuld. Bovendien hangt de kwaliteit van de code af van de kwaliteit van de AI die het genereert. Het gebruik van complexere prompts kan betere resultaten opleveren, maar de onderzoekers lieten zien dat zelfs met eenvoudige instructies het systeem goed genoeg werkt om nuttig te zijn. Ze merkten ook op dat hoewel ze Mermaid en D2 gebruikten, andere tools zoals PlantUML of Graphviz hetzelfde doel kunnen dienen. Het specifieke instrument doet er minder toe dan het concept van een code-gebaseerde representatie.
De studie concludeert dat de tijd gekomen is om te standaardiseren hoe wetenschappelijke informatie wordt gedeeld in het tijdperk van AI. Door te kiezen voor diagrammen-als-code, kan de wetenschappelijke gemeenschap ervoor zorgen dat de kennis die zij produceren niet alleen leesbaar is voor mensen, maar ook uitvoerbaar door machines. Deze verschuiving zou wetenschappelijke literatuur transformeren van een verzameling statische documenten naar een dynamische, machine-leesbare bron. Het zou een naadloze overdracht van kennis mogelijk maken tussen menselijke onderzoekers en kunstmatige intelligentie, wat de weg vrijmaakt voor een toekomst waarin AI-agenten samenwerken met wetenschappers om complexe problemen op te lossen met een niveau van precisie dat voorheen onmogelijk was. De onderzoekers hebben aangetoond dat dit niet alleen een theoretisch idee is, maar een praktische realiteit die vandaag de dag met bestaande tools geïmplementeerd kan worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.