← Nieuwste papers
💬 NLP

Think Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM Agents

Dit paper introduceert CogRouter, een framework dat LLM-agenten in staat stelt om de cognitieve diepte dynamisch aan te passen aan elke stap van een taak, wat leidt tot state-of-the-art prestaties en aanzienlijke efficiëntiewinst.

Oorspronkelijke auteurs: Ruihan Yang, Fanghua Ye, Xiang We, Ruoqing Zhao, Kang Luo, Xinbo Xu, Bo Zhao, Ruotian Ma, Shanyi Wang, Zhaopeng Tu, Xiaolong Li, Deqing Yang, Linus

Gepubliceerd 2026-02-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ruihan Yang, Fanghua Ye, Xiang We, Ruoqing Zhao, Kang Luo, Xinbo Xu, Bo Zhao, Ruotian Ma, Shanyi Wang, Zhaopeng Tu, Xiaolong Li, Deqing Yang, Linus

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een slimme robot hebt die een hele dag lang taken moet uitvoeren, zoals het opruimen van een huis of het oplossen van een wetenschappelijk raadsel.

Tot nu toe hadden we twee soorten robots:

  1. De "Snel-Reagerende" robot: Deze doet alles op de automatische piloot. Hij is supersnel, maar als hij een lastig probleem tegenkomt, denkt hij niet na en maakt hij een fout.
  2. De "Diep-Denker" robot: Deze denkt bij elke stap urenlang na, zelfs als het gewoon gaat om "de deur openen". Hij is heel slim, maar hij is traag, duur (want denken kost veel energie) en vervelend om mee te werken.

De onderzoekers van dit paper zeggen: "Waarom kiezen we? Waarom kan de robot niet slim zijn op het moment dat het nodig is, en snel zijn als het simpel is?"

Ze hebben een nieuw systeem bedacht, genaamd COGROUTER. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De "Eén Grootte Past Alles" Fout

Stel je voor dat je een pakketje moet bezorgen.

  • Bij het adres zoeken moet je een kaart raadplegen, routes plannen en nadenken (dit is Strategisch Plannen).
  • Maar als je bij de deur staat en de deur opent, hoef je niet na te denken over de universele wetten van de natuurkunde. Je doet het gewoon.

Huidige AI's doen echter alsof ze bij het openen van de deur net zo diep nadenken als bij het plannen van de route. Dat is zonde van tijd en energie. Of ze doen bij het plannen van de route net zo weinig moeite als bij het openen van de deur, en dan mislukken ze.

2. De Oplossing: Vier "Denk-Niveaus"

COGROUTER leert de robot om te schakelen tussen vier verschillende manieren van denken, gebaseerd op hoe moeilijk de situatie is:

  • Niveau 1: De Reflex (Instinctief)
    • Vergelijking: Je hand trekt zich terug als je iets heets aanraakt.
    • Wanneer: Als je een deur opent of een object pakt. Geen gedoe, gewoon doen.
  • Niveau 2: De Situatie (Waarneming)
    • Vergelijking: Je kijkt om je heen voordat je overstekt.
    • Wanneer: Je ziet een nieuwe kamer en moet beslissen welke deur je kiest. Even kijken wat er mogelijk is.
  • Niveau 3: De Ervaring (Reflectie)
    • Vergelijking: "Hé, gisteren deed ik dit zo en het mislukte. Laten we het anders proberen."
    • Wanneer: Je loopt vast of maakt een fout. Dan moet je terugkijken en je plan aanpassen.
  • Niveau 4: De Strateg (Diep Plannen)
    • Vergelijking: Een schakenpartij spelen waarbij je 10 zetten vooruit denkt.
    • Wanneer: Je moet een complex doel bereiken en moet een heel stappenplan maken.

3. Hoe leren ze dit? (De "Twee-Fasen" Training)

De onderzoekers hebben de robot niet zomaar losgelaten. Ze hebben hem in twee stappen getraind:

  • Fase 1: De "Klaslokaal" (Supervised Fine-Tuning)
    De robot krijgt een boekje met voorbeelden. Als de leraar (een super-slimme AI) een deur opent, zegt de robot: "Ik gebruik Niveau 1". Als de leraar een plan maakt, zegt de robot: "Ik gebruik Niveau 4". Zo leert de robot dat deze niveaus bestaan en hoe ze eruitzien.
  • Fase 2: De "Spel" (Reinforcement Learning)
    Nu gaat de robot zelf spelen. Hier komt het slimme deel: COPO (de nieuwe leermethode).
    • Als de robot een stap goed doet, krijgt hij een punt.
    • Maar de onderzoekers kijken niet alleen of hij het goed deed, maar ook hoe zeker hij was.
    • De magische regel: Als de robot een simpele stap (zoals een deur openen) doet met Niveau 4 (diep nadenken), is hij vaak niet zekerder dan met Niveau 1. De robot leert dan: "Oh, ik heb hier niet zo hard nodig om na te denken. Laten we de volgende keer Niveau 1 gebruiken om tijd te besparen."
    • Als hij een lastige stap doet met Niveau 1 en faalt, leert hij: "Oeps, hier had ik echt diep moeten nadenken."

4. Het Resultaat: Sneller, Slimmer en Goedkoper

Het resultaat is verbazingwekkend.

  • De robot van dit paper (COGROUTER) is slimmer dan de duurste robots van bedrijven zoals OpenAI en DeepSeek.
  • Maar het belangrijkste: hij is 62% sneller en goedkoper in gebruik.
  • Hij gebruikt minder "woorden" (tokens) omdat hij niet overal diep over nadenkt. Hij bespaart zijn energie voor de momenten dat het echt nodig is.

Samenvattend

Stel je voor dat je een auto hebt met een versnellingsbak.

  • Oude AI's reden ofwel altijd in de eerste versnelling (te traag, te veel brandstof) of altijd in de vijfde versnelling (te snel, kan niet schakelen).
  • COGROUTER is de auto die automatisch schakelt: hij rijdt in de eerste versnelling door de stad (simpele taken) en schakelt pas naar de vijfde versnelling als hij op de snelweg moet inhalen (complexe taken).

Hierdoor is hij niet alleen slimmer, maar ook veel efficiënter.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →