← Nieuwste papers
💻 computer science

CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

Het artikel introduceert CASHEW, een framework voor tijdens de inferentie, en CASHEW-RL, een geleerde variant getraind met Group Sequence Policy Optimization, om multimodale redenering te stabiliseren door iteratief kandidaat-trajecten te aggregeren en hallucinaties te filteren via visuele verificatie, waarmee significante prestatiewinsten wordt behaald over 13 benchmarks voor beeld- en video-begrip.

Oorspronkelijke auteurs: Chaoyu Li, Deeparghya Dutta Barua, Fei Tao, Pooyan Fazli

Gepubliceerd 2026-06-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chaoyu Li, Deeparghya Dutta Barua, Fei Tao, Pooyan Fazli

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een lastige puzzel probeert op te lossen, zoals precies uit te vogelen wat een kopje water aan het doen is in een schilderijvideo. Als je een standaard AI (een Vision-Language Model) er slechts één keer naar vraagt, kan hij gokken: "Misschien gebruikt de kunstenaar het om de penseel in te bewaren?" Hij is zelfverzekerd, maar hij heeft het mis. Als je hem nog een keer vraagt, kan hij gokken: "Misschien is het om de penseel in te laten rusten?" Hij blijft aan het gokken en zijn antwoorden blijven veranderen. Dit is het probleem dat het artikel onstabiele redenering (unstable reasoning) noemt.

De auteurs van dit artikel, van Arizona State University en NewsBreak, hebben een oplossing ontwikkeld genaamd CASHEW (en een slimmere versie genaamd CASHEW-RL) om dit op te lossen. Hier is hoe het werkt, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Eenzame Denker"

Huidige AI-modellen zijn als een enkel persoon die een puzzel probeert op te lossen in een donkere kamer. Ze kunnen over hun eigen voeten struikelen (een fout maken) en in de verkeerde richting blijven lopen omdat ze het hele plaatje niet duidelijk kunnen zien. Ze "hallucineren" vaak, wat betekent dat ze feiten verzinnen die er niet zijn, zoals beweren dat een kopje bedoeld is voor opslag terwijl het eigenlijk bedoeld is voor het schoonmaken.

2. De Oplossing: De "Studiegroep" (CASHEW)

In plaats van de AI alleen te laten nadenken, verandert CASHEW de AI in een studiegroep.

  • Het Proces: Wanneer de AI een vraag krijgt, geeft hij niet zomaar één antwoord. Hij genereert een hele reeks verschillende "denkpaden" (trajecten). Stel je 8 verschillende studenten voor in een kamer, die elk proberen de puzzel op hun eigen manier op te lossen.
  • De Realiteitscontrole (Visuele Verificatie): Dit is het geheime ingrediënt. Voordat de groep het eens wordt over een antwoord, controleert een "scheidsrechter" (een visuele verificatietool) hun werk aan de hand van de werkelijke afbeelding of video. Als een student zegt: "Het kopje is voor opslag," kijkt de scheidsrechter naar de video en zegt: "Nee, ik zie geen opslagplank. Ik zie de kunstenaar de penseel erin dopen om hem schoon te maken."
  • De Synthese: De AI neemt vervolgens de beste onderdelen van de ideeën van alle 8 de studenten, filtert de leugens (hallucinaties) eruit met behulp van de aantekeningen van de scheidsrechter, en combineert ze tot één supernauwkeurig, op bewijs gebaseerd antwoord.

Het is alsof je een rommelige brainstormsessie neemt en deze verandert in een gepolijst, gecontroleerd rapport.

3. De Upgrade: De "Interne Expert" (CASHEW-RL)

De eerste versie (CASHEW) is geweldig, maar het vereist dat de computer het "studiegroep"-proces elke keer opnieuw uitvoert wanneer hij een vraag beantwoordt, wat traag kan zijn.

De auteurs hebben ook CASHEW-RL ontwikkeld. Zie dit als het nemen van die studiegroep en de AI leren om zelf de groepsleider te worden.

  • Ze hebben de AI getraind met een speciaal beloningssysteem (zoals een score in een videogame) dat punten gaf voor:
    1. Het geven van het juiste antwoord.
    2. Het citeren van het juiste visuele bewijs (zoals naar het kopje wijzen).
    3. Niet verspillen van tijd aan makkelijke vragen (efficiënt zijn).
  • Na deze training leerde de AI om het "groepsdenken" en de "factchecking" allemaal zelf te doen, binnen zijn eigen brein, veel sneller en efficiënter.

Wat hebben ze ontdekt?

Het artikel testte dit op 13 verschillende benchmarks die betrekking hebben op afbeeldingen en video's. De resultaten waren als het vinden van een toverstaf voor AI-redenering:

  • Grote sprongen in nauwkeurigheid: Op een wetenschapstoets genaamd ScienceQA steeg de score van de AI met 26,2 procentpunt. Op een video-redeneringstest genaamd EgoSchema steeg het met 9,1 procentpunt.
  • Minder hallucinaties: De AI stopte met het verzinnen van feiten. Hij begon zich te houden aan wat hij daadwerkelijk kon zien in de afbeelding.
  • Beter dan de concurrentie: Wanneer de AI werd vergeleken met andere methoden die proberen AI-redenering te verbeteren (zoals de AI simpelweg 8 keer dezelfde vraag stellen en het meest voorkomende antwoord kiezen), won CASHEW het elke keer.

In een notendop

Het artikel beweert dat door AI te dwingen om in groepen te denken, zijn werk te controleren tegen het visuele bewijs en te leren van zijn fouten, we het veel betrouwbaarder kunnen maken. Het stopt de AI met zelfverzekerd gokken en zet hem op een pad van zorgvuldige, op bewijs gebaseerde redenering.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →