← Nieuwste papers
🤖 AI

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol is een iteratief framework dat multimodale wiskundige redenering schaalt door de moeilijkheidsgraad van prompts te vergroten via type-bewuste evolutie-operatoren en de betrouwbaarheid van antwoorden af te dwingen door middel van multi-bron hypothese-test falsificatie, waardoor hoogwaardige geverifieerde data wordt gegenereerd die de prestaties van modellen op visuele-wiskundige benchmarks aanzienlijk verbetert.

Oorspronkelijke auteurs: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer slimme, maar licht naïeve student te leren hoe hij complexe wiskundige problemen moet oplossen met behulp van plaatjes (zoals diagrammen, grafieken en schema's).

In het verleden probeerden onderzoekers deze student slimmer te maken door hem simpelweg meer huiswerk te geven. Ze genereerden duizenden nieuwe vragen. Maar er was een addertje onder het gras: ze maakten de vragen vaak alleen langer of iets moeilijker zonder daadwerkelijk te controleren of de antwoorden wel klopten. Het was alsof een leraar een toets uitdeelde waarbij de antwoordsleutel fouten bevatte. Als de student de foute antwoorden zou bestuderen, zou hij niet beter worden, maar juist slechter.

VeriEvol is een nieuw systeem dat de manier waarop we dit huiswerk maken, verandert. In plaats van alleen maar "meer" vragen, focust het op "betere" vragen en "geverifieerde" antwoorden. De auteurs noemen dit een "Verifiable Evol-Instruct" framework.

Zo werkt het, opgedeeld in eenvoudige stappen:

1. De "Evolution" Gym (Vragen moeilijker maken)

Stel je een eenvoudige oefening voor: "Kijk naar deze afbeelding van een driehoek en vertel me hoeveel zijden hij heeft." Dat is te makkelijk voor een slimme student.

VeriEvol heeft een speciale coach (de Evolution Module) die naar de afbeelding en de vraag kijkt, en vervolgens de opdracht herschrijft om deze veel moeilijker te maken, maar waarbij het nog steeds vereist is om naar de afbeelding te kijken.

  • De Metafoor: In plaats van te vragen "Hoeveel zijden heeft hij?", herschrijft de coach het naar: "Als je deze driehoek doormidden snijdt en draait, hoe verandert het oppervlak dan ten opzichte van een vierkant met dezelfde omtrek?"
  • De Truc: De coach is slim genoeg om te weten wat voor soort afbeelding het is. Als het een grafiek is, maakt hij een vraag gebaseerd op een grafiek. Als het een geometrische tekening is, maakt hij een geometrische vraag. Hij gooit niet zomaar willekeurige woorden naar de student; hij bouwt een specifieke uitdaging die de student dwingt om daadwerkelijk naar de afbeelding te kijken om het probleem op te lossen.

2. De "Skeptic" Detective (Antwoorden controleren)

Dit is het belangrijkste deel. Normaal gesproken, wanneer een computer een antwoord genereert, gaan we ervan uit dat het juist is. VeriEvol zegt: "Nee, zo niet. Laten we eerst proberen te bewijzen dat het fout is."

Ze hebben een detectiesysteem gebouwd genaamd HTV-Agent.

  • De Metafoor: Stel je een rechtszaal voor. De computer genereert een antwoord (de "Hypothese"). De HTV-Agent is een team van sceptische advocaten wiens enige taak het is om bewijs te vinden dat het antwoord onjuist is.
  • Hoe ze vechten:
    • Ze gebruiken verschillende "getuigen" (verschillende AI-solvers) om te zien of ze het allemaal met elkaar eens zijn.
    • Ze gebruiken een "rekenmachine" (code-executie) om de wiskunde te controleren.
    • Ze gebruiken "ogen" (visuele tools) om te controleren of de getallen in het antwoord daadwerkelijk overeenkomen met de pixels in de afbeelding.
  • Het Vonnis: Als de detectives enig bewijs kunnen vinden dat het antwoord fout is, wordt het huiswerk in de prullenbak gegooid. Het antwoord wordt pas geaccepteerd als de detectives hun uiterste best hebben gedaan om het te breken en dat niet zijn gelukt. Alleen dan wordt het een "Geverifieerd" antwoord.

3. Het Resultaat: Een Superbetrouwbaar Handboek

Het systeem neemt deze twee stappen en herhaalt deze in een lus:

  1. Neem een simpele vraag.
  2. Evolueer deze tot een moeilijke, op afbeeldingen gebaseerde uitdaging.
  3. Genereer een antwoord.
  4. Stuur het naar de Sceptische Detectives.
  5. Als de detectives het niet kunnen breken, houd het dan. Als dat wel zo is, gooi het weg en probeer het opnieuw.

Het resultaat is een enorme bibliotheek van meer dan 250.000+ wiskundige problemen waarbij elk antwoord is getest en geverifieerd.

Wat gebeurde er toen ze het gebruikten?

De onderzoekers testten dit op een "student" AI (een model met 7 miljard parameters).

  • Zonder VeriEvol: De student was oké, maar raakte vaak in de war door plaatjes of gokte op basis van tekstpatronen.
  • Met VeriEvol: De student werd aanzienlijk beter.
    • Wanneer ze alleen de "geëvolueerde" vragen gebruikten (zonder de strikte verifieerder), verbeterde de student.
    • Wanneer ze de "Sceptische Detective" toevoegden om te garanderen dat de antwoorden perfect waren, verbeterde de student zelfs nog meer.
    • De Schaal: Ze lieten zien dat naarmate ze meer van deze geverifieerde vragen toevoegden (van 10.000 naar 250.000), de student steeds slimmer werd, wat bewees dat de kwaliteit van de data belangrijker is dan alleen de kwantiteit.

Waarom dit ertoe doet (in eenvoudige termen)

De meeste AI-onderzoekers proberen de "leraar" (de AI-optimizer) slimmer te maken. VeriEvol zegt: "Laten we eerst het handboek repareren."

Door het proces van "vragen moeilijker maken" te scheiden van het "controleren of antwoorden juist zijn", creëerden ze een systeem waarbij de data zelf betrouwbaar is. Ze hebben niet alleen een betere student gebouwd; ze hebben een beter curriculum gebouwd. Ze hebben zelfs al hun "detectierapporten" (de sporen van hoe ze elk antwoord hebben geverifieerd) vrijgegeven, zodat andere onderzoekers hun werk kunnen controleren en er zeker van zijn dat niemand vals speelt met het huiswerk.

Kortom: VeriEvol is een systeem dat automatisch moeilijkere wiskundeproblemen schrijft op basis van afbeeldingen en vervolgens een team van digitale detectives gebruikt om te controleren of de antwoorden 100% correct zijn voordat een AI ervan kan leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →