← Nieuwste papers
🤖 AI

Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1

Dit artikel demonstreert dat een kosteneffectief, niet-gefine-tund open-weight model (DeepSeek V3.2), uitgerust met gespecialiseerde agentische harnassen — specifiek een Explorer-Definer Pipeline en een Reflective Orchestrator — de ARC-AGI-1 prestaties aanzienlijk kan verhogen van een baseline van 15,50% naar 67,25% pass@2 door patroonontdekking expliciet te scheiden van programmasynthese en transformaties adaptief opnieuw te verkennen, alles zonder zware test-time compute of benchmark-specifieke training.

Oorspronkelijke auteurs: Kabir Moghe, Peter Chin

Gepubliceerd 2026-07-09
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kabir Moghe, Peter Chin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, complexe puzzel probeert op te lossen waarbij de regels veranderen elke keer dat je een nieuw stukje oppakt. Dit is wat de ARC-AGI benchmark is: een test die ontworpen is om te zien of een computer abstracte patronen en logica kan begrijpen zonder die specifieke puzzel eerder te hebben gezien.

Lama een tijd heeft het oplossen van deze puzzels een van de twee dure benaderingen vereist:

  1. De "Brute Force" Methode: Een superintelligente (en zeer dure) AI inhuren om miljoenen willekeurige gokjes te proberen totdat het geluk heeft. Dit kost veel geld en computerkracht.
  2. De "Specialist" Methode: Een kleine AI nemen en deze alleen leren hoe hij deze specifieke puzzels moet oplossen door hem duizenden voorbeelden te laten zien. Dit werkt goed, maar de AI wordt een specialist die niets anders kan.

Het Grote Idee van Dit Papier
De auteurs, Kabir Moghe en Peter Chin van Dartmouth College, stelden een andere vraag: Kunnen we een "generalist" AI (één die niet specifiek op deze puzzels is getraind) deze goed laten oplossen, door gebruik te maken van een slimme teamstructuur in plaats van brute kracht of speciale training?

Ze bouwden een kosteneffectieve "agent harness"—eigenlijk een managementsysteem dat organiseert hoe de AI denkt. Ze testten dit op een standaard, open-source AI-model (DeepSeek V3.2) dat niet specifiek op deze puzzels is getraind.

Zo werkt hun systeem, met behulp van een eenvoudige analogie:

De Analogie: Het Detectbureautje

Stel je voor dat je een detective bent die een plaats delict probeert op te lossen (de puzzel). Je hebt een team van agenten met verschillende taken.

1. De Oude Manier (One-Shot Baseline)

Je belt één detective, laat hem de plaats delict zien en vraagt: "Wie heeft het gedaan?" Hij gokt direct.

  • Resultaat: Hij heeft het slechts in 15,5% van de gevallen goed. Hij gokt in het donker.

2. De "Denk Voordat Je Spreekt" Manier (Chain-of-Thought)

Je belt de detective opnieuw, maar dit keer dwing je hem om zijn redenering op te schrijven voordat hij het antwoord geeft.

  • Resultaat: De nauwkeurigheid springt naar 30%. Alleen het opschrijven van het denkproces helpt al.

3. De Nieuwe Manier: De "Explorer-Definer Pipeline"

In plaats van één detective, huur je een team.

  • De Explorers (De Patroonjagers): Je stuurt 5 verschillende agenten uit die de plaats delict onafhankelijk van elkaar onderzoeken. Ze proberen het nog niet op te lossen; ze zoeken alleen naar aanwijzingen, patronen en vreemde symmetrieën. Ze schrijven gedetailleerde rapporten over wat ze zien.
  • De Definer (De Architect): Een meester-architect leest alle 5 de rapporten. Hij neemt de beste ideeën, combineert ze en schrijft een specifiek "recept" (een computerprogramma) om de puzzel op te lossen.
  • De Check: Ze testen dit recept op de bekende aanwijzingen. Als het faalt, passen ze het recept aan.
  • Resultaat: Deze team-aanpak krijgt 57,5% van de puzzels goed, tegen een kosten van slechts $0,25 per puzzel. Ze hadden geen superdure AI nodig of speciale training; ze organiseerden het werk gewoon beter.

4. De "Reflective Orchestrator" (De Baas met een Tweede Kans)

De auteurs merkten een probleem op met de Pipeline: Soms missen de Explorers het grote plaatje volledig. De Architect probeert dan het recept aan te passen, maar zit vast in een poging om een kapotte fundering te repareren. Het is alsof je probeert een meesterwerk te schilderen op een gebarsten canvas.

Dus voegden ze een Baas (De Orchestrator) toe.

  • Als het recept van de Architect faalt, vraagt de Baas niet alleen om een aanpassing. De Baas zegt: "Oké, deze aanpak is fout. Laten we een nieuw, kleiner team van Explorers uitsturen die specifiek kijken naar de aanwijzingen die we gemist hebben."
  • Dit stelt het systeem in staat om de problemen te herontdekken vanuit een nieuwe invalshoek wanneer het vastloopt.
  • Resultaat: Deze slimme lus krijgt 67,25% van de puzzels goed, voor ongeveer $0,62 per puzzel.

Wat Hebben Ze Ontdekt?

Het papier maakt een aantal belangrijke ontdekkingen over waarom dit werkt:

  1. Het gaat over "Generatie", niet "Selectie":
    Het team ontdekte dat de belangrijkste reden voor hun falen niet was dat ze het juiste antwoord niet konden kiezen uit een lijst. Het was dat ze in eerste instantie niet genoeg verschillende soorten ideeën konden genereren.

    • Analogie: Het is niet dat het team slecht is in het kiezen van de juiste sleutel; het is dat ze niet genoeg verschillende sleutels bij de deur hebben gebracht.
    • De "Orchestrator" loste dit op door het team te dwingen nieuwe sleutels (nieuwe ideeën) te genereren wanneer de oude niet werkten.
  2. Het "Denk"-instrument is Cruciaal:
    Ze testten wat er gebeurt als je het "Denk"-instrument verwijdert (een privé kladblok waar de AI aantekeningen kan maken voordat hij spreekt).

    • Resultaat: De nauwkeurigheid daalde met bijna 6%.
    • Analogie: Het is alsof je een detective dwingt om de zaak hardop op te lossen zonder dat hij aantekeningen mag maken. Ze raken in de war en maken fouten. De private "denkruimte" is essentieel voor complexe redenering.
  3. Kosten vs. Prestaties:
    Ze behaalden deze hoge scores zonder duizenden dollars per puzzel uit te geven (zoals de "Brute Force" methoden) en zonder een nieuwe AI vanaf nul te trainen (zoals de "Specialist" methoden). Ze deden dit door een slimmere workflow te bouwen voor een bestaande, betaalbare AI.

De Kern van de Zaak

Dit papier bewijst dat je niet altijd een grotere, slimmere of duurdere AI nodig hebt om moeilijke logische puzzels op te lossen. Soms heb je gewoon een betere manager nodig om te organiseren hoe de AI denkt. Door het probleem op te splitsen in stappen (kijken naar patronen, en dan een oplossing bouwen) en het systeem te laten "opnieuw nadenken" wanneer het vastloopt, hebben ze de prestaties verhoogd van 15% naar bijna 67% met een zeer klein budget.

Noot: De auteurs hebben dit specifiek getest op een publieke set van 400 puzzels. Ze beweren niet dat dit werkt voor medische diagnoses, zelfrijdende auto's of andere real-world toepassingen; ze hebben alleen bewezen dat het werkt voor deze specifieke test van abstract redeneren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →