A complementary study on PlanGPT: Evaluation with defined Performance Metrics and comparison with a planner
Dit artikel presenteert een aanvullende evaluatie van het grote taalmodel PlanGPT met behulp van gedefinieerde prestatieparameters, waaruit blijkt dat het geen voordeel biedt ten opzichte van traditionele planners en niet beter presteert dan een eenvoudige Greedy-zoekstrategie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te laten een rommelige kamer opruimen. Je hebt een lijst met regels (zoals "pak de sok op," "doe de sok in de wasmand"), een beginfoto van de kamer en een doelafbeelding van een schone kamer. De robot moet de exacte volgorde van stappen uitzoeken om van de rommelige staat naar de schone staat te komen.
In de wereld van Kunstmatige Intelligentie wordt dit Automated Planning genoemd. Meestal gebruiken we speciale, zeer logische computerprogramma's genaamd Planners om deze puzzels op te lossen. Zij zijn als meester schakers die elke mogelijke zet berekenen om het perfecte pad te vinden.
Onlangs werd een nieuw type AI genaamd PlanGPT geïntroduceerd. Denk aan PlanGPT niet als een logische machine, maar als een supercreatieve schrijver (een Large Language Model) die getraind is om deze stapsgewijze instructies te "schrijven" in plaats van ze te berekenen. De grote vraag was: Kan deze creatieve schrijver het werk van een meester logische machine daadwerkelijk doen, of is hij gewoon aan het gokken?
Dit artikel is een "complementaire studie", wat betekent dat de auteurs besloten besloten om het werk van PlanGPT te controleren omdat het oorspronkelijke rapport niet het hele verhaal vertelde.
Het Experiment: Een Race tussen Drie hardlopers
Om te zien of PlanGPT goed is in wat hij doet, zetten de auteurs een race op met drie hardlopers op een baan van 7 verschillende "kamers" (domeinen) variërend van het stapelen van blokken tot het verplaatsen van vrachtwagens:
- PlanGPT (De Creatieve Schrijver): De nieuwe AI die probeert het plan te raden op basis van patronen die hij heeft geleerd.
- A (De Perfectionist):* Een traditionele planner die de tijd neemt om het absolute beste en kortste pad te vinden, maar soms vastloopt als de kamer te rommelig is.
- Greedy (De Sprinter): Een traditionele planner die simpelweg het eerste geldige pad pakt dat hij ziet. Het is niet altijd het beste pad, maar het is ongelooflijk snel.
De auteurs maten twee dingen:
- Plan Cost (Plan-kosten): Hoeveel stappen moest de robot zetten? (Minder stappen = beter).
- Planning Time (Plannings-tijd): Hoe lang duurde het de computer om het plan te bedenken?
De Resultaten: De Schrijver versus de Sprinter
Dit is wat de auteurs ontdekten, gebruikmakend van enkele eenvoudige analogieën:
- Het "Perfecte" Pad: PlanGPT was soms in staat om een pad te vinden dat net zo goed was als dat van de Perfectionist (A*), maar vaak was dat niet het geval.
- De Snelheidstest: De Sprinter (Greedy) was bijna altijd de snelste in het bedenken van een plan. PlanGPT was soms sneller dan de Perfectionist, maar vaak langzamer dan de Sprinter.
- De Grote Verrassing: Wanneer ze naar de algemene score keken, presteerde PlanGPT niet beter dan de Sprinter (Greedy). In veel gevallen was de Sprinter zelfs beter in het vinden van goede, korte plannen.
Het "Niet-voor-iedereen-geschikte" Probleem:
De auteurs wezen op een groot gebrek in het ontwerp van PlanGPT. Om te werken, heeft PlanGPT een ander "brein" (model) nodig voor elk type kamer.
- Als je blokken wilt stapelen, heb je Model A nodig.
- Als je vrachtwagens wilt verplaatsen, heb je Model B nodig.
- Als je satellieten wilt laten vliegen, heb je Model C nodig.
Het is alsof je een andere specialist inhuurt voor elke enkele klus in je huis. Eén persoon is geweldig in koken, een ander in schoonmaken, maar je moet 8 verschillende mensen inhuren voor 8 verschillende taken. Dit verbruikt een enorme hoeveelheid computerkracht (bronnen). De auteurs vroegen zich af: Is het de moeite waard om een heel team van dure specialisten in te huren voor dezelfde taak die een enkele, snelle "Sprinter" kan doen?
De Conclusie
Het artikel concludeert dat hoewel PlanGPT een interessant experiment is, het momenteel geen "competente" planner is.
- Het vindt niet consistent betere plannen dan eenvoudige, snelle methoden.
- Het vereist een enorme hoeveelheid middelen (8 verschillende modellen, veel rekenkracht).
- Het kan geen complexe problemen aan die meer objecten vereisen dan waarvoor het getraind is.
De auteurs suggereren dat Large Language Models (zoals PlanGPT) misschien niet het juiste instrument zijn voor deze specifieke taak. Ze zijn misschien beter geschikt voor het schrijven van verhalen of het chatten, terwijl traditionele logische programma's de beste keuze blijven voor planning. Ze hinten erop dat wellicht een ander soort AI, één die ontworpen is voor "redeneren" in plaats van alleen maar "woorden voorspellen", de toekomst zal zijn, maar voor nu heeft de creatieve schrijver de logische machine niet verslagen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.