← Nieuwste papers
💻 computer science

Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves

Dit artikel introduceert Comet-H, een iteratieve prompt-automaton die de gekoppelde ontwikkeling van code, theorie en documentatie coördineert om hallucinaties en desynchronisatie in onderzoekssoftware te voorkomen, en toont de effectiviteit daarvan aan met een Python-statische-analysetool die op een benchmark van 90 gevallen aanzienlijk beter presteert dan de baselines.

Oorspronkelijke auteurs: Halley Young, Nikolaj Björner

Gepubliceerd 2026-05-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Halley Young, Nikolaj Björner

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een nieuw type auto te bouwen, maar je hebt geen voltooide blauwdruk. In plaats daarvan heb je een team van ongelooflijk getalenteerde, snel denkende ingenieurs (de AI) die onderdelen kunnen tekenen, motoren kunnen bouwen en de handleiding voor de eigenaar tegelijkertijd kunnen schrijven.

Het probleem is dat deze ingenieurs vatbaar zijn voor twee specifieke fouten:

  1. De "Fake It Till You Make It"-valstrik: Ze kunnen in de handleiding schrijven: "Deze auto gaat 200 mijl per uur," voordat ze daadwerkelijk de motor hebben gebouwd om dat te bewijzen. Vervolgens leest de volgende ingenieur die bewering, gaat ervan uit dat het waar is, en bouwt een chassis dat ontworpen is voor 200 mijl per uur. Als de motor dat eigenlijk niet aankan, is het hele project gebouwd op een leugen.
  2. De "Verloren in vertaling"-valstrik: De ingenieur die de motor ontwierp, kan van gedachten veranderen over hoe het werkt, maar de persoon die de handleiding schrijft, weet dat niet. Nu beschrijft de handleiding een oude motor, toont de blauwdruk een nieuwe, en is de werkelijke auto op de assemblagelijn iets heel anders. Ze drijven allemaal uit elkaar.

Dit artikel, "Orchestrating Language Models for Research Software Where the Specification Evolves", introduceert een nieuw systeem genaamd Comet-H om deze problemen op te lossen. Het behandelt onderzoek niet als een rechte lijn, maar als een dans waarbij de muziek, de stappen en de dansers voortdurend op elkaar moeten inspelen.

Het kernidee: Een "Dirigent" voor de AI

In plaats van de AI alleen maar te vragen om "code te schrijven", hebben de auteurs een Dirigent (een controller) gebouwd die het hele orkest beheert. Deze Dirigent vertelt de AI niet alleen wat te doen; hij controleert voortdurend de "werkruimte" (de code, de wiskundige theorie, de benchmarks en het artikel) om te zien wat er ontbreekt of niet synchroon loopt.

Hier is hoe Comet-H werkt, met behulp van eenvoudige analogieën:

1. De "Vervagende Takenlijst" (Obligation Decay)

Stel je voor dat je een boek schrijft. Je hebt een post-it met de tekst: "Ik moet dit hoofdstuk controleren op feiten."

  • Oude manier: Als je vergeet het te controleren, blijft de notitie voor altijd op je bureau staan en rommelt het, of je negeert het en gaat verder.
  • Comet-H manier: De notitie heeft een halveringstijd. Elke keer dat je een stap voorwaarts zet in het project, wordt de notitie iets vager. Als je het niet snel aanpakt, vervaagt het. Maar als het zeer recent is, gloeit het fel rood.
  • Waarom dit belangrijk is: Dit dwingt de AI om zich te bezighouden met onafgemaakte zaken (zoals "bewijs deze bewering") terwijl het nog vers is. Als de AI probeert de schuld te negeren, wordt de "glow" feller, en dwingt de Dirigent de AI om te stoppen en het op te lossen voordat het verder gaat.

2. De "Realiteitscheck" (Reactive Grounding)

Wanneer de AI de "publieke voorkant" van het project verandert (zoals het README-bestand of het onderzoeksartikel), drukt Comet-H op de Pauzeknop.

  • De Regel: Je kunt het verhaal niet veranderen zonder de feiten te controleren.
  • Het Proces: Als de AI schrijft: "Onze tool is 10x sneller", stopt het systeem onmiddellijk en zegt: "Oké, laat me de raceuitslagen zien." Het dwingt de AI om de code uit te voeren en een "grounding ledger" (een machineleesbaar kwitantie) te genereren die de bewering bewijst.
  • Het Resultaat: Dit stopt de "Fake It Till You Make It"-valstrik. Een leugen kan slechts één stap overleven voordat deze wordt ontdekt en gecorrigeerd.

3. De "Veilige Stap" (Adjacency Constraints)

Soms raakt een AI enthousiast en wil het springen van "een fiets bouwen" naar "een ruimteschip bouwen".

  • De Regel: Comet-H staat alleen aangrenzende bewegingen toe. De AI kan één kleine stap voorwaarts zetten (bijvoorbeeld: "een versnelling toevoegen aan de fiets"), maar het kan niet springen naar een volledig ander universum.
  • Waarom dit belangrijk is: Dit houdt het project gegrond. Als de AI de kerntheorie wil veranderen, moet het dat op een manier doen die nog steeds verbinding maakt met wat gisteren is gebouwd. Dit voorkomt dat het team zo ver uit elkaar drijft dat ze vergeten wat ze oorspronkelijk probeerden te bouwen.

De Resultaten: De "a3"-casestudie

De auteurs hebben dit systeem getest door een portfolio van 46 verschillende onderzoekssoftwareprojecten te bouwen. De ster van de show is een tool genaamd a3, een programma dat is ontworpen om bugs in Python-code te vinden.

  • De Uitdaging: Normaal gesproken zijn bug-vindende tools als luidruchtige buren; ze schreeuwen "BUG!" tegen alles, zelfs als het in orde is. Dit zorgt voor veel valse alarmen.
  • De Comet-H-aanpak: Het systeem bouwde niet alleen de tool; het liet de theorie erachter evolueren. Het begon met een simpel idee, besefte dat het te moeilijk was om te berekenen, en de Dirigent stond het team toe om over te schakelen naar een nieuwe wiskundige aanpak (met behulp van "veiligheidscertificaten") die daadwerkelijk werkte.
  • Het Resultaat: De uiteindelijke tool was ongelooflijk nauwkeurig. Het ving echte bugs op (hoge precisie) zonder te schreeuwen over dingen die niet kapot waren. Het scoorde 0,768 op een testschaal, terwijl de volgende beste tool slechts 0,364 scoorde.

Wat we hebben geleerd over AI-gedrag

Door de AI te laten werken aan deze 46 projecten, zagen de auteurs enkele interessante patronen:

  • Het "Schoonmaakteam" is echt: In het begin is de AI druk bezig met het bouwen van nieuwe functies. Maar naarmate het project tegen het einde loopt, besteedt de AI het grootste deel van zijn tijd aan auditeren en repareren. Het is als een bouwteam dat de laatste week van een project alleen maar controleert of de verf droog is en de deuren openen, in plaats van nieuwe muren te bouwen.
  • Eerlijkheid komt naar boven: Wanneer gedwongen om hun beweringen te bewijzen, werd de AI verrassend eerlijk. In plaats van falen te verbergen, begon het expliciet te stellen: "We kunnen dit specifieke type probleem nog niet oplossen." Het systeem programmeerde deze eerlijkheid niet; het ontstond omdat de "Realiteitscheck" liegen te moeilijk maakte.
  • Zelforganisatie: Na verloop van tijd begon de AI zijn eigen code te organiseren in schonere, logischere structuren, zelfs zonder dat iemand het expliciet had gevraagd.

Het Grote Plaatje

Het artikel stelt dat het bouwen van onderzoekssoftware anders is dan het corrigeren van een typefout in een document. Het is een co-evolutie-proces. De theorie, de code, de tests en het verhaal moeten samen groeien.

Als je de AI alleen vraagt om "een artikel en code te schrijven", zal het waarschijnlijk afdrijven, hallucineren en de synchronisatie verliezen. Maar als je het een Dirigent geeft die voortdurend de partituur controleert, realiteitschecks afdwingt en ervoor zorgt dat de stappen verbonden blijven, kun je complexe, betrouwbare onderzoekstools bouwen die daadwerkelijk werken.

Kortom: Comet-H is een systeem dat de AI verhindert te dagdromen en het dwingt zijn beloften na te komen, zodat het verhaal dat het vertelt overeenkomt met de code die het schrijft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →