← Nieuwste papers
🤖 AI

Agentic Learner with Grow-and-Refine Multimodal Semantic Memory

Dit artikel introduceert ViLoMem, een tweestromen-geheugenframework dat een groeien-en-verfijnen-principe toepast om visuele afleidingspatronen en logische redeneerfouten afzonderlijk te coderen, waardoor multimodale grote taalmodellen de beperkingen van trajectgebaseerd geheugen kunnen overwinnen en verbeterde nauwkeurigheid met verminderde herhaling van fouten bereiken op diverse benchmarks.

Oorspronkelijke auteurs: Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar iets onhandige robot leert puzzels op te lossen die zowel afbeeldingen als wiskundeproblemen bevatten.

Op dit moment zijn de meeste van deze robots (Multimodale Grootte Taalmodellen genoemd) als studenten die een toets maken, een vraag verkeerd beantwoorden en de fout vervolgens direct vergeten. Wanneer ze op de volgende toets een vergelijkbare vraag zien, maken ze exact dezelfde fout opnieuw. Ze lossen elk probleem vanaf nul op, alsof ze nog nooit een puzzel hebben gezien.

Sommige onderzoekers probeerden dit op te lossen door de robot een "notitieboek" te geven om eerdere fouten in op te schrijven. Maar deze notitieboeken waren gebrekkig. Ze schreven alleen de logica van de fout op (bijvoorbeeld: "Ik heb het verkeerde formule gebruikt") en negeerden het visuele deel (bijvoorbeeld: "Ik keek naar het verkeerde getal in de afbeelding"). Het is alsof een leerling tegen een student zegt: "Je hebt de wiskunde verkeerd gedaan", maar nooit aangeeft dat de student naar de verkeerde regel op de grafiek keek.

ViLoMem: Het "Twee-Hersenen" Geheugensysteem van de Robot

Het artikel introduceert ViLoMem, een nieuw systeem dat de robot een slimmer, tweeledig geheugen geeft, geïnspireerd op hoe menselijke hersenen werken. In plaats van één rommelig notitieboek, gebruikt ViLoMem twee distincte, gespecialiseerde "stromen" van geheugen die samenwerken maar gescheiden blijven.

1. De Twee Stromen van Geheugen

Stel je het brein van de robot voor met twee verschillende bibliothecarissen:

  • De Visuele Bibliothecaris (Visueel Geheugen): Deze bibliothecaris geeft alleen om wat de robot ziet. Als de robot een glanzende metalen bol verward met een rubberen bal, of een klein getal op een grafiek verkeerd leest, schrijft deze bibliothecaris een regel op zoals: "Wanneer je een glanzend object ziet, controleer of het licht reflecteert als metaal, niet als rubber." Hij tekent ook een kleine "warmtekaart" (zoals een schijnwerper) op toekomstige afbeeldingen om de robot precies te laten zien waar hij moet kijken, zodat hij de belangrijke details niet mist.
  • De Logische Bibliothecaris (Logisch Geheugen): Deze bibliothecaris geeft alleen om het denken. Als de robot de verkeerde wiskundige formule gebruikt of getallen verkeerd optelt, schrijft deze bibliothecaris een regel op zoals: "Vergeet niet, de oppervlakte van een driehoek is ½ × basis × hoogte, niet gewoon de zijden bij elkaar optellen."

2. Hoe het Leert: De "Groeien en Verfijnen" Cyclus

Het systeem werkt als een continue lus van oefening en correctie:

  1. De Poging: De robot probeert een probleem op te lossen met behulp van zijn huidige geheugen.
  2. De Controle: Een "Verificator" (zoals een strenge leraar) controleert het antwoord.
  3. De Diagnose: Als de robot het verkeerd heeft, vraagt het systeem: "Was dit een kijkfout of een denkfout?"
    • Als het een kijkfout was, actualiseert de Visuele Bibliothecaris zijn regels en tekent een nieuwe schijnwerper voor de volgende keer.
    • Als het een denkfout was, actualiseert de Logische Bibliothecaris zijn regels.
  4. De Opruiming: Het systeem is slim genoeg om rommel te vermijden. Als de robot twee keer dezelfde fout maakt, schrijft het geen twee nieuwe notities; het verfijnt de bestaande notitie om deze duidelijker te maken. Dit voorkomt dat het geheugen te groot en verwarrend wordt (een probleem dat "catastrofische vergetelheid" wordt genoemd).

3. Waarom dit Belangrijk is (De Resultaten)

De onderzoekers testten dit systeem op zes verschillende soorten moeilijke puzzels die wiskunde, wetenschap en realistische afbeeldingen omvatten.

  • Het Resultaat: Robots die ViLoMem gebruikten, werden aanzienlijk beter in het oplossen van deze problemen. Ze stopten met het herhalen van dezelfde visuele fouten (zoals het verkeerd lezen van een diagram) en dezelfde logische fouten (zoals het gebruik van de verkeerde formule).
  • De Analogie: Stel je een robot voor die de oppervlakte van een driehoek probeert te berekenen.
    • Zonder ViLoMem: Het kijkt misschien naar de verkeerde zijde van de driehoek (Visuele fout) en gebruikt vervolgens de verkeerde formule (Logische fout). Het faalt, vergeet en faalt opnieuw.
    • Met ViLoMem: Na één keer falen zegt de Visuele Bibliothecaris: "Volgende keer, kijk naar de zijde met het label '12', niet '5'." De Logische Bibliothecaris zegt: "Volgende keer, vergeet niet te vermenigvuldigen met ½." Bij de volgende poging kijkt de robot naar de juiste plek en gebruikt de juiste wiskunde, waardoor het antwoord correct is.

4. De "Cross-Training" Bonus

Een van de coolste bevindingen is dat dit geheugensysteem verplaatsbaar is. De onderzoekers lieten zien dat een kleinere, minder krachtige robot kon leren van de "notitieboeken" van een veel grotere, slimmere robot. Het is alsof een juniorstudent de studienotities van een topstudent leest en direct slimmer wordt zonder zelf de harde arbeid van het maken van fouten te hoeven doorlopen.

Samenvattend:
ViLoMem is een systeem dat AI leert van zijn fouten door "wat ik zag" te scheiden van "wat ik dacht". Door deze twee soorten leren in aparte, georganiseerde bestanden te houden, stopt de AI met het steeds opnieuw maken van dezelfde domme fouten en wordt het een betrouwbaarder en accurater probleemoplosser.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →