← Nieuwste papers
🤖 machine learning

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

PlanningBench is een nieuw raamwerk dat het creëren van planningsdata omvormt van vaste verzamelingen naar een beheersbaar, schaalbaar generatieproces met behulp van een gestructureerde taxonomie en door beperkingen gedreven synthese, waardoor zowel een rigoureuze evaluatie van de huidige beperkingen van LLM's mogelijk wordt als effectieve training via versterkend leren om generaliseerbare planningsvaardigheden te verbeteren.

Oorspronkelijke auteurs: Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou

Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar onervaren leerling wilt leren tot een meesterkok te worden. Je zou hen een enkel, vast receptenboek kunnen geven (de oude manier van AI-testen), maar dat vertelt je alleen of ze dat specifieke boek kunnen volgen. Het vertelt je niet of ze kunnen omgaan met een plotselinge schaarste aan ingrediënten, een kapotte oven, of een klant die halverwege zijn bestelling wijzigt.

PlanningBench is een nieuwe "keukensimulator" die is ontworpen om Large Language Models (LLM's) te testen en te trainen in de complexe kunst van planning. In plaats van de AI gewoon een statische lijst met problemen te geven, bouwden de onderzoekers een machine die onbeperkt, unieke en verifieerbare planningsuitdagingen kan genereren, ter plekke.

Hieronder wordt de paper uiteengezet, met behulp van eenvoudige analogieën:

1. Het Probleem: De Beperking van het "Vaste Menu"

Voordat deze paper verscheen, was het testen van AI-planning vergelijkbaar met het geven van een vast menu van 50 wiskundeproblemen aan een student. Als ze ze goed hadden, slaagden ze. Maar:

  • Beperkte Variatie: Het menu bevatte slechts 50 problemen. Zodra de student ze uit het hoofd had geleerd, was de test nutteloos.
  • Valse Moeilijkheidsgraad: De "moeilijke" problemen waren gewoon langer of bevatten meer getallen, niet per se logischer complexer.
  • Geen Feedbacklus: Als de student het fout had, vertelde de test je niet waarom of hielp het hen om voor de volgende keer te leren.

2. De Oplossing: De "Oneindige Receptengenerator" (PlanningBench)

De auteurs creëerden een raamwerk genaamd PlanningBench. Denk hierbij aan een meesterkok (de onderzoekers) die een "Kookboek van Beperkingen" schreef in plaats van een lijst met recepten.

  • De Taxonomie (Het Kookboek): Ze organiseerden realistische planningsopgaven (zoals vergaderingen plannen, een bruiloft regelen of een elektriciteitsnet beheren) in 6 hoofdcategorieën en meer dan 30 specifieke types.
  • De Beperkingen (De Ingrediënten): Ze definieerden regels zoals "Tijdsvensters" (je kunt niet vóór 17:00 uur diner koken), "Capaciteitslimieten" (de oven past slechts 4 pizza's) en "Afhankelijkheden" (je kunt de taart niet serveren voordat de maaltijd is opgegeten).
  • De Generator (De Machine): Deze machine neemt een "recepttype" (bijvoorbeeld "Vergaderplanning") en mixt willekeurig verschillende beperkingen erin (bijvoorbeeld "Zaal A is kapot", "De CEO is alleen dinsdag vrij). Het creëert elke keer een uniek, zelfstandig probleem.

3. De "Gesloten-Lus" Keuken

Het systeem spitst niet alleen problemen uit; het voert een team van drie personen uit om kwaliteit te waarborgen:

  1. De Generator: Creëert een nieuw, lastig planningsprobleem.
  2. De Respondent (De Leerling): De AI probeert het op te lossen.
  3. De Criticus (De Inspecteur): Een gespecialiseerde AI controleert het antwoord tegen een strikte "Checklist".
    • Hebben ze de juiste ruimte gebruikt?
    • Zijn ze het budget te boven gegaan?
    • Vergeten ze de vegetarische optie?

Als de Respondent het te makkelijk oplost, geeft de Criticus het sein aan de Generator om het volgende probleem moeilijker te maken (bijvoorbeeld: "Voeg een scenario met een brandalarm toe"). Als de Respondent faalt, houdt het systeem het probleem vast maar noteert het waar de AI fout ging. Dit creëert een moeilijkheidscurve die zich aanpast aan het vaardigheidsniveau van de AI.

4. De "Gouden Standaard" Regel

Een cruciale bevinding in de paper gaat over Deterministische Oplossingen.

  • De Analogie: Stel je voor dat je de AI vraagt "een goed verhaal te schrijven". Er zijn een miljoen manieren om dat te doen, en het is moeilijk om te zeggen welke het "beste" is.
  • De Oplossing: PlanningBench dwingt de AI om problemen op te lossen met één duidelijk, optimaal antwoord (zoals een wiskundeprobleem of een specifiek schema).
  • Waarom het belangrijk is: De paper vond dat wanneer de AI traint op problemen met één "correct" antwoord, het beter leert. Het is als het trainen van een hardloper op een baan met een duidelijke finishlijn, in plaats van hen te vragen ergens "leuks" te gaan rennen. Deze duidelijkheid geeft de AI een sterker signaal over hoe het kan verbeteren.

5. De Resultaten: Testen en Trainen

De onderzoekers gebruikten dit systeem op twee manieren:

A. Het Examen (Evaluatie)
Ze testten top-AI-modellen (zoals GPT-5.4 en anderen) op deze gegenereerde problemen.

  • Het Resultaat: Zelfs de slimste modellen hadden moeite. Het beste model loste slechts ongeveer 63% van de problemen perfect op.
  • De Inzicht: De AI is goed in het voldoen aan lokale regels (bijvoorbeeld: "Ik heb de vergadering gepland"), maar slecht in globale consistentie (bijvoorbeeld: "Maar die vergadering overlapt met de vlucht van de CEO"). De grootste fout was niet opmaak; het waren rekenfouten en het vergeten van beperkingen (zoals het opraken van tijd of geld).

B. Het Trainingskamp (Versterkend Leren)
Ze namen een model en trainden het met de geverifieerde data van PlanningBench.

  • Het Resultaat: Het model werd niet alleen beter in de specifieke problemen die het zag; het werd beter in ongeziene planningsopgaven (zoals reizen plannen) en zelfs in algemene instructie-volgtaken.
  • De Les: Trainen op deze "strenge, verifieerbare" planningsproblemen leerde de AI hoe het meerdere regels tegelijkertijd moet hanteren, een vaardigheid die overdraagbaar was naar andere gebieden.

Samenvatting

PlanningBench is een tool die planning verandert van een "gokspel" in een "meetbare wetenschap".

  • Het beweegt weg van vaste testbanken naar oneindige, gegenereerde scenario's.
  • Het gebruikt een gesloten-lus systeem (Generator -> Oplosser -> Criticus) om ervoor te zorgen dat problemen oplosbaar maar uitdagend zijn.
  • Het bewijst dat duidelijke, enkelvoudige antwoorden de beste manier zijn om AI te trainen in plannen.
  • Het onthult dat huidige AI-modellen nog steeds vrij slecht zijn in het houden van alle ballen in de lucht wanneer beperkingen strak worden, maar dat ze kunnen leren om beter te worden met het juiste soort trainingsdata.

De paper concludeert dat we om AI echt "slim" te maken in plannen, data nodig hebben die schaalbaar is (oneindig kan groeien), divers is (veel realistische situaties bestrijkt) en verifieerbaar is (we wiskundig kunnen bewijzen dat het antwoord goed is). PlanningBench biedt precies dat.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →