← Nieuwste papers
🤖 AI

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

Dit artikel introduceert HALO, een hybride agent-geleerde orchestrator die door middel van door verifiers gecertificeerde verfijnings-trajecten een kleine, kostenefficiënte policy traint voor end-to-end PDDL-planning, waarbij succespercentages worden behaald die vergelijkbaar zijn met die van grensverleggende LLM's, terwijl de orchestratiekosten met meer dan een orde van grootte worden verminderd.

Oorspronkelijke auteurs: Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Vertaler"-bottleneck

Stel je voor dat je een complex meubelstuk wilt bouwen. Je hebt een ruwe schets en een lijst met ideeën geschreven in gewone mensentaal (Natuurlijke Taal). Echter, de machine die het meubelstuk daadwerkelijk bouwt (de Klassieke Planner), begrijpt alleen een zeer strikte, robotische code genaamd PDDL.

Als je een gewone AI (een Large Language Model of LLM) vraagt om die code te schrijven, maakt deze vaak fouten. Het kan onderdelen verzinnen die niet bestaan, vergeten schroeven op te sommen, of instructies schrijven die de machine niet kan lezen.

Om dit op te lossen, hebben onderzoekers een "reparatieteam" gecreëerd. Ze hebben een Manager (de Orchestrator) die naar de kapotte code kijkt en een team van Specialisten (Agents) inhuurt om specifieke fouten te herstellen. Eén specialist repareert de grammatica, een ander de logica, en een andere controleert of de onderdelen wel in elkaar passen.

Het Nadeel: In het oude systeem was de Manager een superdure, hoogwaardige AI (zoals GPT-5 of Gemini). Elke keer dat het team een fout moest herstellen, moest je de Manager een enorme vergoeding betalen om over het probleem na te denken en de volgende specialist te kiezen. Als een project 10 stappen nodig had om te worden gerepareerd, betaalde je de Manager 10 keer. Dit maakte het hele proces te duur voor kleine laboratoria of lokale computers.

De Oplossing: HALO (De Stage-Manager)

De auteurs van dit artikel, Rajesh Mangannavar en zijn team, vroegen zich af: "Hebben we echt voor elke stap een peperdure Manager nodig? Kunnen we een goedkope, lokale stagiair trainen om de klus te klaren?"

Ze creëerden HALO (Hybrid Agent-Learned Orchestrator). Dit is hoe het werkt, met drie belangrijke trucs:

1. Leren van "Winnende" Speelboeken

Normaal gesproken is het trainen van een AI moeilijk omdat je niet voor elke stap het "juiste" antwoord weet. Maar in dit systeem is er een Scheidsrechter (een Verifier) die het uiteindelijke meubelstuk controleert.

  • Als het uiteindelijke plan werkt, zegt de Scheidsrechter: "Goed gedaan!"
  • Het team realiseerde zich: Elke keer dat de Scheidsrechter zei "Goed gedaan!", was de opeenvolging van Managers en Specialisten die zij gebruikten een winnende strategie.

Ze namen duizenden van deze "winnende speelboeken", haalden de stem van de dure Manager weg en hielden alleen het verslag over van: "Toen de code er zo uitzag als X, koos het winnende team Specialist Y." Ze gebruikten deze data om een kleine, goedkope AI (HALO) te trainen om die winnende beslissingen na te bootsen.

2. De "Regelboek"-afkorting

HALO is niet alleen een brein; het is een brein met een spiekbriefje. De auteurs realiseerden zich dat sommige beslissingen zo voor de hand liggend zijn dat zelfs een mens er niet over na hoeft te denken.

  • Voorbeeld: Als de code leeg is, is de regel: "Roep de Emergency Agent aan."
  • Voorbeeld: Als de code een spelfout bevat, is de regel: "Roep de Syntax Agent aan."
  • Voorbeeld: Als het plan perfect is, is de regel: "Stop."

HALO controleert eerst deze eenvoudige regels. Als een regel van toepassing is, handelt het direct zonder zijn "brein" (het AI-model) te gebruiken. Dit bespaart tijd en geld. Alleen wanneer het probleem echt verwarrend is, gebruikt HALO zijn getrainde AI om een beslissing te nemen.

3. Een Grotere Gereedschapskist

Het team heeft ook het team van Specialisten uitgebreid. Ze voegden 8 nieuwe experts toe aan de oorspronkelijke 13, waardoor het totaal op 21 kwam. Sommige van deze nieuwe experts zijn "deterministisch", wat betekent dat het eenvoudige computerscripts zijn die direct draaien en niets kosten, in plaats van dure AI-modellen. Dit gaf HALO meer hulpmiddelen om problemen snel op te lossen.

De Resultaten: Sneller, Goedkoper en Net zo Goed

Het team testte HALO tegen de dure, hoogwaardige AI-Managers op 11 verschillende soorten planningsproblemen (zoals logistiek, robotbeweging en planning).

  • Succespercentage: HALO was net zo goed als, of soms zelfs beter dan, de dure AI. Het loste de problemen op met hetzelfde succespercentage.
  • Snelheid: Omdat HALO eenvoudige regels gebruikt voor makkelijke problemen en een klein lokaal model voor moeilijke problemen, neemt het veel sneller beslissingen.
  • Kosten: Dit is de grootste winst.
    • De oude manier (met gebruik van GPT-5) kostte ongeveer $0,18 per taak.
    • HALO kost ongeveer $0,004 per taak.
    • Dat is ongeveer 45 keer goedkoper. Het is also option om van het inhuren van een sterrenchef voor elke maaltijd over te stappen naar het hebben van een zeer goed getrainde lokale kok die een receptenboek gebruikt voor eenvoudige gerechten.

De Kern van het Verhaal

Het artikel bewijst dat je geen "superintelligente" AI nodig hebt om een team van reparatie-agents aan te sturen. Als je een strikte scheidsrechter hebt (de Verifier) die je vertelt wanneer een plan succesvol is, kun je een kleine, goedkope AI trainen om van die successen te leren.

Dit maakt het mogelijk om complexe planningssystemen lokaal op één computer in een lab (of zelfs op een laptop) te draaien, zonder dat je telkens moet betalen voor dure cloud-API's voor elke beslissing die ze nemen. Het verandert een luxe dienst in iets dat iedereen lokaal kan draaien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →