From Feasibility to Desirability: Plan, Learn, Adapt (PLA) Framework for Personalized On-Device Itinerary Generation
Het artikel introduceert het Plan, Learn, Adapt (PLA) framework, een driefasig on-device systeem dat een ensemble van lichtgewicht planners combineert met een compact beloningsmodel om haalbare en zeer gewenste gepersonaliseerde reisschema's te genereren, waarbij het zowel enkele planners als frontier LLM's overtreft in menselijke evaluatieses terwijl het productiewaardige latentie en haalbaarheid bereikt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de kapitein van een ruimteschip bent, maar in plaats van door de sterren te navigeren, navigeer je door een bruisende stad om de perfecte vakantie te plannen. Dit is de wereld van reisplanning, een puzzel die zich op het kruispunt bevindt van twee zeer verschillende wetenschappelijke werelden. Aan de ene kant heb je combinatorische optimalisatie, wat lijkt op een strenge wiskundeleraar die ervoor zorgt dat je de regels niet overtreedt: het museum sluit om 17:00 uur, de trein vertrekt om 18:00 uur en je kunt niet twee keer hetzelfde씩 bezoeken. Aan de andere kant heb je voorkeur-leren (preference learning), wat lijkt op een helderziende die probeert te raden wat je écht wilt voelen—wil je een ontspannen dag of een volgepakt avontuur? Het lastige is dat deze twee werelden vaak met elkaar in botsing komen. Een wiskundig perfect schema kan saai aanvoelen, en een dromerig, leuk schema kan in de praktijk onmogelijk uit te voeren zijn. De grote vraag voor iedereen die ooit een reis heeft geprobeerd te plannen is: Hoe bouwen we een reisgids die zowel juridisch uitvoerbaar is om te volgen als oprecht plezierig om te ervaren, terwijl deze op je telefoon draait zonder dat er internet nodig is?
Dit artikel introduceert een slim nieuw systeem genaamd PLA (Plan, Learn, Adapt) dat probeert dit exacte probleem op te lossen. De auteurs, werkend met een reisapp genaamd FlyEnJoy, realiseerden zich dat bestaande methoden op twee specifieke manieren faalden. Sommige ouderwetse planners waren geweldig in het volgen van de regels, maar waren slecht in het begrijpen van menselijke smaak, waardoor ze vaak routes creëerden die robotachtig aanvoelden. Ondertien waren de nieuwste, meest flitsende AI-tools (zoals de enorme taalmodellen waar iedereen het over heeft) geweldig in het klinken als behulpzaam, maar faalden volledig in de basiswiskunde van het reizen; in hun tests produceerden deze AI-modellen schema's die strikt onuitvoerbaar waren (0% succespercentage), met een statistische bovengrens die suggereerde dat ze minder dan 4% van de tijd geldig waren, waarbij ze de openingstijden en reistijden overtraden.
Om dit op te lossen, bouwde het team een driestaps "fabriek" die volledig op je telefoon draait:
- Plan (De Ideeënfabriek): In plaats van te vertrouwen op slechts één manier om een schema te maken, bouwden ze een team van vijf verschillende "planners" (zoals een enthousiaste chef, een voorzichtige boekhouder en een creatieve kunstenaar). Elk van hen probeert vanaf nul een geldige reis op te zetten. Omdat zij anders denken, komen ze met zeer verschillende lijsten van plaatsen om te bezoeken, wat zorgt voor een diverse poel van "haalbare" (regel-overeenkomstige) opties om uit te kiezen.
- Learn (De Smaaktester): Het team heeft niet alleen geraden wat mensen leuk vonden; ze hebben mensen gevraagd om paren van volledige dagprogramma's met elkaar te vergelijken. Ze verzamelden meer dan 2.500 van deze vergelijkingen. Met behulp van deze data trainden ze een piepklein, supersnel "beloningsmodel" (een digitale smaaktester) dat leerde om de onzichtbare kwaliteiten van een geweldige reis te herkennen, zoals een goed tempo en een mooie balans tussen activiteiten, in plaats van alleen te tellen hoeveel musea er werden bezocht.
- Adapt (De Lokale Verfijner): Zodra het beste schema is gekozen, zorgt deze fase voor kleine, veilige aanpassingen aan het plan. Het is also[t] een chef die een soep proeft en er een snufje zout aan toevoegt, maar met een strikte regel: elke enkele wijziging moet de receptuur geldig houden. Als een aanpassing het schema verbreekt (zoals wanneer je bij een gesloten winkel aankomt), wordt deze direct weggegooid. Dit gebeurt zo snel dat het gemiddeld slechts 109,9 milliseconden duurt, wat betekent dat je direct een perfect, gepersonaliseerd plan krijgt, zelfs als je in een vliegtuig zit zonder wifi, aangezien het systeem is ontworpen voor offline gebruik.
De resultaten zijn indrukwekkend. Wanneer ze hun systeem testten tegen de beste individuele planner, won het "Plan, Learn, Adapt"-team 67,8% van de keren tegen menselijke beoordelaars. In contrast hiermee, toen ze drie van de meest geavanceerde AI-modellen (GPT-5, Claude Opus 4.5 en Gemini 3 Pro) vroegen om schema's te maken onder dezelfde strikte regels, produceerde geen van hen (0%) een enkele geldige reis. Het nieuwe systeem generaliseerde ook goed en werkte nauwkeurig in meer dan 100 verschillende Amerikaanse steden die het nog nooit eerder had gezien.
In de echte wereld, toen ze dit systeem implementeerden in de FlyEnJoy-app, waren de resultaten tastbaar. Gebruikers begonnen hun reisplanning 83% vaker en 91% meer mensen voltooiden daadwerkelijk hun schema's. Het systeem maakte niet alleen de plannen; het maakte de hele ervaring soepeler, wat bewees dat je een reisgids kunt hebben die zowel wiskundig perfect als perfect leuk is, terwijl deze gewoon in je broekzak leeft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.