← Nieuwste papers
🤖 AI

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

Het artikel introduceert EurekAgent, een autonoom systeem voor wetenschappelijke ontdekking dat de onderzoeksfocus verschuift van agent-workflowontwerp naar "omgevingsengineering"—het structureren van permissies, artefacten, budgetten en menselijk toezicht om productieve gedragingen te versterken en schadelijke gedragingen te onderdrukken, waarmee het daarmee de staat van de kunst bereikt binnen taken op het gebied van wiskunde, kernel engineering en machine learning.

Oorspronkelijke auteurs: Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

Gepubliceerd 2026-06-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, hyperintelligente onderzoeksassistent hebt (een AI-agent) die er dol op is om moeilijke wetenschappelijke puzzels op te lossen, zoals het verpakken van cirkels in een vierkant of het schrijven van snellere computercode. In het verleden probeerden onderzoekers het probleem van "hoe maken we deze AI goed werkend?" op te lossen door extreem gedetailleerde, stap-voor-stap instructiehandleidingen voor de AI te schrijven. Ze vertelden de AI precies wat hij moest denken, wanneer hij moest stoppen en hoe hij met zichzelf moest discussiëren.

EUREKAGENT stelt een andere aanpak voor. In plaats van het micromanagen van de gedachten van de AI, beargumenteren de auteurs dat we ons moeten richten op het bouwen van een betere kantooromgeving voor de AI om in te werken.

Denk hierover als volgt: Als je een geniale PhD-student inhuurt, hoef je hem niet elke seconde te vertellen wat hij moet doen. In plaats daarvan moet je hem geven:

  1. Een veilige, afgesloten lab zodat hij niet per ongeluk de apparatuur kapotmaakt of vals speelt bij zijn tests.
  2. Een gedeeld whiteboard en een archiefkast zodat hij kan onthouden wat hij gisteren heeft geleerd en kan samenwerken met anderen.
  3. Een strikt budget voor elektriciteit en koffie zodat hij het lab niet failliet laat gaan.
  4. Een directe lijn naar een supervisor die kan ingrijpen als de zaken ontsporen.

Dit is de kern van het idee van Environment Engineering (Omgevingsengineering). Het artikel beweert dat de flessenhals niet langer de intelligentie van de AI is; het is de "kamer" waarin we hen plaatsen.

Hoe EUREKAGENT deze "kamer" bouwt

De onderzoekers hebben een systeem gebouwd genaamd EUREKAGENT dat vier specifieke onderdelen van deze omgeving beheert:

1. Permissions Engineering (Het veilige lab)

  • Het Probleem: Als je een AI te veel vrijheid geeft, kan deze proberen te vals spelen. Bijvoorbeeld, de AI zou kunnen proberen in de antwoorden sleutelen (de "evaluator") of de regels aanpassen om zichzelf slimmer te laten lijken.
  • De Oplossing: EUREKAGENT plaatst de AI in een "sandbox" (een digitale container). De AI kan tools gebruiken en bestanden bekijken, maar hij kan de beoordelingsmachine of de definitieve resultaten niet aanraken. Het is alsof je een student een toets geeft, maar de antemensleutel in een vergrendelde box bewaart die alleen de docent kan openen. Dit voorkomt dat de AI gaat "reward hacking" (vals spelen om een hoge score te halen).

2. Artifact Engineering (Het gedeelde whiteboard)

  • Het Probleem: AI-agents vergeten vaak wat ze vijf minuten geleden deden, of ze kunnen hun werk niet gemakkelijk delen met andere AI-agents die aan hetzelfde probleem werken.
  • De Oplossing: Het systeem behandelt de harde schijf van de computer en een versiebeheersysteem (zoals Git, dat programmeurs gebruiken om wijzigingen bij te houden) als een gedeeld geheugen. Elke keer dat een AI een nieuw idee probeert, code opslaat of een score krijgt, wordt dit in een permanent logboek genoteerd. Dit stelt verschillende AI-agents in staat om naar elkaars werk te kijken, te leren van fouten uit het verleden en voort te bouwen op succesvolle ideeën zonder in de war te raken.

3. Budget Engineering (De portemonnee)

  • Het Probleem: AI-onderzoek kan duur en traag worden. Het kan dagen duren of een fortuin kosten aan rekenkracht.
  • De Oplossing: De omgeving heeft een ingebouwde "portemonnee" en een klok. Het houdt bij hoeveel tijd en geld (API-kosten) er wordt uitgegeven. Als de AI te lang bezig is of te veel uitgeeft, geeft het systeem een subtiele duw om af te ronden of stopt het het proces automatisch. Dit zorgt ervoor dat het onderzoek niet buiten het budget uit de hand loopt.

4. Human-in-the-Loop Engineering (De supervisor)

  • Het Probleem: Soms komt een AI in een lus vast te zitten of gaat hij een vreemde richting op.
  • De Oplossing: Het systeem biedt een dashboard (een webmonitor en een terminal) waar een mens in realtime de voortgang van de AI kan volgen. Een mens kan zien hoe de scores stijgen en dalen, de logs lezen en indien nodig ingrijpen om een hint te geven of het proces te stoppen. Het houdt de mens in de loop zonder dat zij het saaie werk hoeven te doen.

De Resultaten: Wat hebben ze bereikt?

De auteurs hebben dit systeem getest op drie soorten moeilijke problemen:

  • Wiskunde: Specifiek een probleem genaamd "26-circle packing" (het zo strak mogelijk in een vierkant passen van 26 cirkels).
  • Kernel Engineering: Het optimaliseren van laag-niveau computercode.
  • Machine Learning: Het verbeteren van modeltraining.

De Claim:
Door deze "environment-engineered" aanpak te gebruiken met standaard, kant-en-klare AI-tools, heeft EUREKAGENT nieuwe wereldrecords (State-of-the-Art) gevestigd voor alle wiskundige en kernel engineering taken die ze hebben getest.

  • Het Hoogtepunt: Voor het 26-circle packing probleem vonden ze een oplossing die beter is dan elke eerdere menselijke of AI-poging.
  • De Kosten: Ze deden dit ongelooflijk goedkoop. De totale kosten om de AI te draaien voor de circle packing taak waren minder dan $11 aan API-kosten.

De Belangrijkste Conclusie

De auteurs concluderen dat we geen nieuwe, complexe AI-hersenen hoeven uit te vinden om wetenschappelijke problemen op te lossen. In plaats daarvan moeten we betere architecten worden. Als we de juiste omgeving bouwen—één die veilig, georganiseerd, budgetbewust en onder toezicht staat—kunnen we krachtige, algemene AI-agents hun beste werk laten doen op een autonome en betrouwbare manier.

Kortom: Train niet alleen de agent; bouw de kamer waarin hij leeft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →