← Nieuwste papers
💬 NLP

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

Het artikel introduceert EASE (Evidence-Anchored Spatial Attention), een methode die Reinforcement Learning met Verifieerbare Beloningen (RLVR) voor visie-taalmodellen verbetert door geannoteerd visueel bewijs te gebruiken om ruimtelijke aandacht te sturen tijdens trajecten met hoge beloningen, waardoor de prestaties op perceptie-, redeneer- en hallucinatiebenchmarks worden verbeterd zonder dat er extra inputs nodig zijn tijdens de inferentie.

Oorspronkelijke auteurs: Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Geluksvogels"-student

Stel je een student voor die een moeilijke toets maakt die foto's bevat. De leraar (de computer) controleert alleen het eindantwoord.

  • Vraag: "Hoeveel giraffen zijn er op deze foto te zien?"
  • Antwoord van de student: "Drie."
  • Feedback van de leraar: "Correct! +1 punt."

Het probleem is dat de leraar niet weet hoe de student tot het antwoord kwam. Heeft de student echt de giraffen in de foto geteld? Of heeft de student gewoon gegokt omdat hij weet dat giraffen vaak voorkomen in dit soort toetsen? Of heeft de student misschien naar het verkeerde deel van de foto gekeken?

In de wereld van AI (specifiek Vision-Language Modellen) wordt dit Outcome-Only Reward genoemd. De AI krijgt een punt omdat hij het goed heeft, maar leert niet waar hij in de afbeelding moet kijken om het goed te hebben. Dit leidt tot "hallucinaties", waarbij de AI vol vertrouwen feiten verzint omdat hij vertrouwt op tekstpatronen in plaats van daadwerkelijk naar de afbeelding te kijken.

De Oplossing: EASE (De "Spotlight"-leraar)

De auteurs hebben een nieuwe trainingsmethode ontwikkeld genaamd EASE (Evidence-Anchored Spatial Attention).

Zie EASE als een leraar die niet alleen het eindantwoord beoordeelt, maar ook kijkt naar waar de student naar kijkt terwijl hij de opdracht oplost.

  1. Het "Spiekbriefje" (Alleen tijdens de training): Tijdens de training heeft de leraar een speciaal "spiekbriefje" (geannoteerde kaders) dat precies de delen van de foto markeert waar het antwoord te vinden is.
    • Voorbeeld: Als het antwoord "drie giraffen" is, tekent het spiekbriefje een kader rond elke giraffe.
  2. De Spotlight: De AI heeft een mentale "spotlight" (aandacht) die hij gebruikt om de afbeelding te scannen. EASE leert de AI om zijn spotlight direct op de kaders in het spiekbriefje te richten.
  3. De Gouden Regel: De leraar geeft dit "kijk hier"-advies alleen wanneer de student het antwoord goed heeft.
    • Als de student het fout heeft, zegt de leraar: "We weten niet waar je naar keek, dus laten we niet gokken."
    • Als de student het goed heeft én naar de juiste plekken heeft gekeken, zegt de leraar: "Goed gedaan! Je hebt het bewijs gevonden. Onthoud om de volgende keer daar te kijken."

Hoe het werkt (De Metafoor)

Stel je voor dat je een hond leert om een bal in een veld te vinden.

  • De Oude Manier (Standaard RL): Je gooit de bal. De hond rent rond, snuffelt in de lucht en vindt uiteindelijk de bal. Je geeft hem een beloning. De hond leert: "Rondrennen en snuffelen leidt tot beloningen." Hij kan de bal hebben gevonden door geluk, niet door er specifiek naar te zoeken.
  • De EASE-manier: Je hebt een verborgen kaart die precies laat zien waar de bal ligt. Wanneer de hond de bal vindt, controleer je de kaart.
    • Als de hond snuffelde op de exacte plek waar de bal verstopt was, geef je hem een superbeloning en zeg je: "Goed zo, je hebt op de juiste plek gezocht!"
    • Als de hond de bal vond maar op een compleet ander deel van het veld aan het snuffelen was, geef je hem geen superbeloning. Je leert de hond dat het vinden van de bal niet genoeg is; hij moet ook naar de juiste plek kijken.

Wat gebeurde er toen ze het probeerden?

De onderzoekers testten dit op verschillende slimme AI-modellen (Qwen2.5 en Qwen3). Ze vergeleken de nieuwe methode met de oude "geluksvogels"-methode.

  • Beter in Wiskunde en Logica: De AI werd aanzienlijk beter in wiskundige problemen met afbeeldingen en logische puzzels. De AI stopte met gokken en begon daadwerkelijk de visuele aanwijzingen te analyseren.
  • Minder Hallucinaties: De AI verzon minder nepfeiten. De AI werd eerlijker over wat hij wel en niet kon zien.
  • Geen Extra Werk voor de Gebruiker: Dit is een cruciaal punt. Het "spiekbriefje" (de kaders) wordt alleen gebruikt terwijl de AI aan het leren is. Wanneer je de AI later daadwerkelijk gebruikt, geef je hem gewoon een foto en een vraag. Hij heeft de kaders niet nodig om te werken; hij werkt gewoon beter omdat hij getraind is om goed te kijken.

De Kernboodschap

EASE leert AI-modellen om eerlijke waarnemers te zijn. In plaats van alleen het juiste antwoord te onthouden, leert de AI het antwoord te koppelen aan het specifieke visuele bewijs dat het ondersteunt. Het is alsof je een detective leert om eerst naar de aanwijzingen op de plaats delict te kijken voordat hij het rapport schrijft, in plaats van de dader simpelweg te raden op basis van een onderbuikgevoel.

Belangrijkste les: Door de AI te dwingen om "zijn werk te laten zien" (door naar de juiste plekken te kijken) tijdens de training, wordt de AI veel betrouwbaarder en nauwkeuriger wanneer hij later vragen beantwoordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →