← Nieuwste papers
🤖 AI

Mull-Tokens: Modality-Agnostic Latent Thinking

Het artikel introduceert Mull-Tokens, een modality-agnostisch latente token-framework dat multimodale modellen in staat stelt vrije vorm tussenstapredenering uit te voeren over tekst- en beeldmodaliteiten heen, waardoor de prestaties op complexe ruimtelijke en puzzeloplossende taken aanzienlijk worden verbeterd zonder te vertrouwen op breekbare tool-aanroepen of kostbare beeldgeneratie.

Oorspronkelijke auteurs: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

Gepubliceerd 2026-05-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Denken in Één Dimensie

Stel je voor dat je een complex 3D-puzzel probeert op te lossen, zoals een Rubiks kubus of een legpuzzel. Als je probeert dit op te lossen met alleen woorden, zou je kunnen zeggen: "Verplaats het rode stuk naar links, draai dan het blauwe stuk." Maar woorden zijn traag en onhandig hiervoor; ze kunnen de vorm, de diepte of hoe de stukken in de ruimte passen niet gemakkelijk beschrijven.

Huidige AI-modellen zijn geweldig in praten (tekst) en geweldig in zien (afbeeldingen), maar wanneer ze proberen te redeneren over ruimte, tijd of hoe objecten bewegen, struikelen ze vaak.

  • De Oude Manier (Alleen Tekst): De AI probeert de puzzel met woorden te beschrijven. Het raakt verdwaald in de details en maakt fouten.
  • De "Te Veel" Manier (Afbeelding + Tekst): Sommige onderzoekers probeerden de AI te laten "tekenen" van zijn gedachten. Maar dit is alsof je een chef vraagt om te stoppen met koken, een recept op te schrijven, een tekening van het gerecht te maken, nog een recept te schrijven, en pas dan het eten op te dienen. Het is duur, traag, en de AI raakt vaak in de war over welke afbeelding bij welke zin hoort.

De Oplossing: De "Mult-Token" (Het Magische Schrijfblok)

De auteurs stellen een eenvoudiger, slimmer hulpmiddel voor dat Mult-Tokens heet.

Stel je het brein van de AI voor als een keuken.

  • Tekst-tokens zijn als de mondelinge instructies van de chef.
  • Afbeelding-tokens zijn als de chef die daadwerkelijk een tekening maakt op een notitieblok.
  • Mult-Tokens zijn als een magisch, onzichtbaar schrijfblok.

Wanneer de AI een moeilijk probleem tegenkomt (zoals een ruimtelijke puzzel), schreeuwt het in plaats van een lange alinea woorden of een volledige tekening, even pauze en schrijft het op dit onzichtbare schrijfblok.

Waarom is dit magisch?

  1. Het is Modality-Agnostic: Dit is de chique term voor "het maakt niet uit welke vorm de gedachte aanneemt." Het schrijfblok kan een mentale afbeelding van een roterende kubus bevatten of een symbolische kaart van een route. Het hoeft geen woord te zijn, en het hoeft geen volledige afbeelding te zijn. Het is gewoon pure "denkdata".
  2. Het is Compact: Een typische tekstuele uitleg kan 200 woorden in beslag nemen. Een volledige afbeelding kan honderden pixels in beslag nemen. De Mult-Token-benadering lost het probleem op met slechts 20 tot 40 tokens. Het is als het verschil tussen het schrijven van een 10-pagina's tellend essay om een wiskundeprobleem uit te leggen versus gewoon de belangrijkste formule krabbelen op een servet.

Hoe Ze Het Trainden: De Drie-Staps Gymroutine

De onderzoekers gaven de AI niet zomaar het schrijfblok; ze moesten het leren hoe het te gebruiken. Ze gebruikten een trainingsproces in drie stappen:

  1. De Opwarming (Het Leren van de Taal van Denken):
    Eerst lieten ze de AI voorbeelden zien van mensen die puzzels oplossen. Soms betrof de oplossing een tekening, soms een zin. Ze leerden de Mult-Tokens om deze stappen na te bootsen.

    • Analogie: Het is alsof een student een leraar ziet een wiskundeprobleem oplossen, soms ziet de student de leraar cijfers schrijven, soms ziet hij ze een grafiek tekenen. De student leert dat het "schrijfblok" beide kan bevatten.
  2. De Vrije Oefening (Loslaten):
    Vervolgens stopten ze met het tonen aan de AI hoe het probleem opgelost moest worden. Ze toonden alleen het eindantwoord. De AI kreeg te horen: "Hier is de puzzel. Gebruik je schrijfblok om het op te lossen, maar ik zal je niet vertellen wat je erop moet schrijven. Gewoon het juiste antwoord krijgen."

    • Analogie: De leraar stopt met het geven van hints en zegt gewoon: "Los dit op." De student leert het schrijfblok op de manier te gebruiken die het beste voor hem werkt, niet alleen het kopiëren van de leraar.
  3. De Versterking (Belonen van Goed Denken):
    Tenslotte gebruikten ze een techniek genaamd GRPO (Versterkend Leren). Als de AI zijn schrijfblok gebruikte om het juiste antwoord te krijgen, kreeg hij een "gouden ster". Als het gokte zonder na te denken, kreeg hij niets. Dit moedigde de AI aan om het schrijfblok daadwerkelijk te gebruiken voor redenering, in plaats van gewoon te gokken.

De Resultaten: Sneller en Slimmer

Het paper testte deze nieuwe methode uit op vier moeilijke benchmarks die puzzels, 3D ruimtelijk redeneren en video-analyse omvatten.

  • De Win: De AI met Mult-Tokens scoorde 3% beter gemiddeld dan de beste bestaande methoden. Op de moeilijkste puzzeltests verbeterde het met 16%.
  • De Snelheid: Omdat het slechts ongeveer 20 "denktokens" gebruikt in plaats van honderden woorden of afbeeldingen, is het veel sneller en goedkoper om uit te voeren.
  • De Flexibiliteit: De AI leerde beslissen wanneer het schrijfblok te gebruiken. Voor sommige makkelijke vragen slaakte het het schrijfblok over. Voor moeilijke ruimtelijke puzzels gebruikte het het intensief.

De Conclusie

Het paper betoogt dat we AI niet hoeven te dwingen om te "praten" of te "tekenen" om diep na te denken. In plaats daarvan kunnen we het een modality-agnostic latent space geven—een privé, interne "denkkamer" waar het afbeeldingen en concepten vrij kan mengen zonder de overhead van het genereren van volledige zinnen of afbeeldingen.

Het is alsof je een mens een stil, intern monoloog geeft dat een 3D-object kan visualiseren zonder het hardop te hoeven beschrijven. Het resultaat is een AI die beter is in ruimtelijke puzzels, sneller en efficiënter.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →