← Nieuwste papers
🤖 AI

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

PRISM is een volledig automatisch framework dat de kloof tussen perceptie, redeneren en besluitvorming bij belichaamde agenten overbrugt door een dynamische vraag-antwoord-pijplijn te hanteren waarbij een LLM actief een Vision-Language Model bekritiseert en ondervraagt om taakgestuurde scène-begrip te genereren, waarmee het state-of-the-art modellen op benchmarks zoals ALFWorld en Room-to-Room significant overtreft.

Oorspronkelijke auteurs: Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

Gepubliceerd 2026-06-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een complexe puzzel probeert op te lossen in een donkere kamer, maar je kunt slechts één keer tegelijk een klein straaltje licht zien. Je hebt een Fotograaf (het Visiemodel) die een foto kan maken en beschrijft wat hij ziet, en een Detective (het Taalmodel) die briljant is in logica en planning, maar blind is.

In de meeste huidige robotsystemen werpt de Fotograaf een snelle blik, schrijft een generieke beschrijving zoals "Ik zie een tafel en een stoel," en overhandigt deze aan de Detective. De Detective probeert vervolgens uit te vogelen hoe hij een ei moet pakken en opwarmen. Het probleem? De Fotograaf heeft gemist dat het ei onder een servet verborgen is, of dat de magnetron eigenlijk een broodrooster is. De Detective, werkend met onvolledige informatie, maakt een fout.

PRISM verandert de regels van het spel door dit om te zetten in een dynamische conversatie in plaats van een eenrichtingsverkeer-overdracht.

De PRISM-aanpak: Een Detective en een Fotograaf in gesprek

In plaats van alleen een statisch rapport te overhandigen, zet PRISM een gesloten lus-conversatie op tussen de Fotograaf en de Detective:

  1. De Eerste Blik: De Fotograaf kijkt naar de scène en geeft een ruwe beschrijving.
  2. De Kritiek van de Detective: De Detective leest de beschrijving en het doel (bijv. "Verwarm een ei"). Hij ziet direct de hiaten: "Wacht, je hebt me niet verteld waar het ei is, of of er een magnetron is!"
  3. De Gerichte Vraag: In plaats van de Fotograaf te vragen de hele kamer opnieuw te beschrijven, stelt de Detective een specifieke, doelgerichte vraag: "Zie je een magnetron?" of "Ligt er een ei op het aanrecht?"
  4. Het Specifieke Antwoord: De Fotograaf zoomt mentaal in en beantwoordt alleen die specifieke vraag.
  5. De Laatste Briefing: De Detective neemt de oorspronkelijke beschrijving, voegt de nieuwe antwoorden toe en schrijft een perfect, beknopt samenvatting die precies bevat wat nodig is om de taak te volbrengen.

Waarom dit ertoe doet (De "Magie" van PRISM)

Het artikel beweert dat deze methode drie grote problemen oplost:

  • Het stopt de "Hallucinatie"-valstrik: Als je de Fotograaf gewoon zegt: "Zoek naar een magnetron," kan hij er een gaan verzinnen die er niet is omdat hij te hard probeert de opdracht te vervullen. PRISM vermijdt dit door de Detective vragen te laten stellen nadat hij de initiële realiteit heeft gezien, waardoor de feiten geworteld blijven in de werkelijkheid.
  • Het elimineert de "Ruis": Stel je voor dat je een roman probeert te lezen waarbij de auteur telkens wanneer je een vraag stelt, het hele boek opnieuw plakt met het antwoord gemarkeerd. Dat is wat andere methoden doen. PRISM is als een bekwame redacteur die de nieuwe informatie pakt en deze in een kort, helder verhaal weeft. Dit maakt het voor de robot veel gemakkelijker om de juiste beslissing te nemen.
  • Het leert uit zichzelf: Het systeem heeft geen mens nodig om een lijst met vragen te schrijven zoals "Controleer de koelkast" of "Controleer het fornuis". De Detective (de AI) ontdekt zelf welke vragen hij moet stellen op basis van de specifieke situatie.

De Resultaten: Beter in het spel

De onderzoekers hebben dit "Detective-Fotograaf"-team getest in twee videogames-achtige werelden:

  1. ALFWorld: Een huis waar je klusjes moet doen zoals schoonmaken, eten opwarmen of dingen oppakken.
  2. Room-to-Room: Een navigatietaak waarbij je door een huis moet lopen om een specifieke kamer te vinden.

Het artikel beweert:

  • PRISM presteerde aanzienlijk beter dan robots die simpelweg een camera en een brein gebruiken zonder met elkaar te praten.
  • Het versloeg zelfs robots die toegang hadden tot "cheat codes" (perfecte tekstuele beschrijvingen van de kamer) in sommige gevallen, simpelweg omdat het zo goed was in het vinden van de juiste details.
  • Het werkt volledig automatisch. Geen mens hoefde de vragen te schrijven; de AI bedacht zelf ter plekke wat hij moest vragen.

De Kernboodschap

Beschouw PRISM als het verschil tussen een blind date waarbij je er gewoon zit en hoopt dat de ander het juiste zegt, versus een goed gesprek waarbij je doorvragen om de ander perfect te begrijpen. Door het "brein" van de robot actief te laten vragen stellen aan de "ogen", stopt de robot met gokken en begint hij precies te begrijpen wat hij moet doen om te slagen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →