← Nieuwste papers
💻 computer science

Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization

Dit paper introduceert C3PO, een trainingsframework dat hallucinaties in multimodale redeneringsmodellen vermindert door keten van gedachten te comprimeren en contrastieve voorkeuroptimalisatie toe te passen om de afhankelijkheid van taalkennis te verminderen en visuele input beter te benutten.

Oorspronkelijke auteurs: Hao Fang, Jinyu Li, Jiawei Kong, Tianqu Zhuang, Kuofeng Gao, Bin Chen, Shu-Tao Xia

Gepubliceerd 2026-04-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hao Fang, Jinyu Li, Jiawei Kong, Tianqu Zhuang, Kuofeng Gao, Bin Chen, Shu-Tao Xia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat dromerige kunstenaar hebt die je een foto laat zien en vraagt: "Wat zie je hier?"

Deze kunstenaar is een Multimodaal Redenerend Model (een AI die zowel plaatjes als tekst begrijpt). Om een goed antwoord te geven, denkt deze kunstenaar hard na en schrijft hij eerst een lang stukje gedachten op papier (de "Chain of Thought" of CoT) voordat hij zijn definitieve antwoord geeft.

Het probleem? Soms begint deze kunstenaar te hallucineren. Hij ziet dingen die er niet zijn, zoals een vork in een salade die er niet bij ligt, of hij verzonnen details in zijn gedachtenproces. Wat nog erger is: hoe meer deze kunstenaar "nadenkt" (meer tekst schrijft), hoe meer hij lijkt te vergeten wat er écht op de foto staat en hoe meer hij gaat vertrouwen op wat hij al eerder heeft gelezen in boeken.

De auteurs van dit papier hebben een oplossing bedacht, genaamd C3PO (geen robot, maar een slimme methode). Ze noemen het "Seeing Through the Chain" (Door de keten heen kijken). Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: Te veel praten, te weinig kijken

Wanneer de AI begint na te denken, schrijft hij vaak een heel lang verhaal. Maar veel van dat verhaal is "opvulsel" of herhaling. Het is alsof iemand die een foto bekijkt, eerst 10 minuten over de lucht en de kleuren van de hemel praat, terwijl hij de belangrijkste details van het onderwerp over het hoofd ziet.

  • De ontdekking: De onderzoekers zagen dat door dit lange nadenken, de AI zijn aandacht verlegt van de foto naar zijn eigen gedachtes. Hij gaat meer vertrouwen op wat hij "weet" (taal) dan op wat hij "ziet" (de foto).

2. Oplossing Deel 1: De "Prunemethode" (Knippen en Schaven)

Stel je voor dat de AI een lange, rommelige schets maakt. C3PO werkt als een strenge redacteur die zegt: "Stop met die lange, saaie zinnen. Wees kort en krachtig."

  • Hoe het werkt: Het systeem kijkt naar elke zin in het gedachteproces en vraagt zich af: "Is dit echt belangrijk om het antwoord te geven?" Als het antwoord "nee" is (bijvoorbeeld: "En toen dacht ik aan een vork..."), wordt die zin weggehaald.
  • Het resultaat: De AI leert om met minder woorden, maar met meer kracht, te denken. Het is als het verschil tussen een rommelige krabbel en een strakke, duidelijke schets. Door minder "ruis" te hebben, kijkt de AI weer scherper naar de foto zelf.

3. Oplossing Deel 2: De "Twee-Zijde Spel" (Goed vs. Slecht)

Nu de AI korter denkt, moeten we hem ook leren om niet te liegen. Hiervoor gebruiken ze een trucje dat lijkt op een spelletje "Vind de fout".

  • De Goede Voorbeelden: Ze laten een super-slimme AI (een expert) de gedachten van de gewone AI verbeteren. Als de gewone AI droomt over een vork, corrigeert de expert: "Nee, kijk goed, er is geen vork." Dit wordt het "goede voorbeeld".
  • De Slechte Voorbeelden (De Truc): Dit is het slimme deel. Ze bedachten een manier om de AI expres te laten hallucineren. Ze geven de AI een foto met een stukje zwart (alsof er iets ontbreekt) of een verwarrende vraag. Hierdoor "dwingen" ze de AI om te zeggen wat hij niet zou moeten zeggen.
  • Het Doel: De AI krijgt nu een lijst met "Goede antwoorden" (gebaseerd op de foto) en "Slechte antwoorden" (de hallucinaties die we expres hebben opgewekt). Hij leert hierdoor het verschil tussen "wat er echt is" en "wat ik droomde". Hij leert om de slechte antwoorden te vermijden.

Waarom werkt dit zo goed?

Stel je voor dat je een student leert een examen te doen.

  1. Eerst leer je hem kort en bondig te denken (niet te veel kletsen), zodat hij zich focust op de vraag.
  2. Vervolgens laat je hem oefenen met fouten: "Kijk eens wat er gebeurt als je raadt in plaats van kijkt."
  3. Uiteindelijk leert hij dat het juiste antwoord altijd gebaseerd moet zijn op wat hij werkelijk ziet, niet op wat hij denkt dat er zou moeten zijn.

De Conclusie

Deze methode, C3PO, zorgt ervoor dat deze slimme AI's minder dromerig worden en meer realistisch. Ze kijken weer beter naar de foto's in plaats van in hun eigen hoofd te verdwalen. Het is een manier om de "bril" van de AI schoon te maken, zodat hij de wereld ziet zoals hij echt is, en niet zoals hij denkt dat hij is.

Kortom: Minder praten, beter kijken, en niet dromen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →