← Neueste Arbeiten
🤖 AI

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol ist ein iteratives Framework, das multimodale mathematische Argumentation skaliert, indem es die Erweiterung der Prompt-Schwierigkeit durch typenbewusste Evolutionsoperatoren von der Durchsetzung der Antwortzuverlässigkeit durch mehrquellenbasierte Hypothesen-Test-Falsifizierung entkoppelt und dadurch hochwertige verifizierte Daten generiert, die die Modellleistung auf visuellen-mathematischen Benchmarks signifikant steigern.

Ursprüngliche Autoren: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

Veröffentlicht 2026-06-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem sehr klugen, aber etwas naiven Schüler beizubringen, wie man komplexe mathematische Probleme mithilfe von Bildern (wie Diagrammen, Tabellen und Grafiken) löst.

In der Vergangenheit versuchten Forscher, diesen Schüler schlauer zu machen, indem sie ihm einfach mehr Hausaufgaben gaben. Sie erstellten tausende neue Aufgaben. Aber es gab einen Haken: Sie machten die Fragen oft nur länger oder ein wenig schwieriger, ohne jedoch zu prüfen, ob die Antworten auch richtig waren. Es war so, als würde ein Lehrer einen Test ausgeben, bei dem der Lösungsschlüssel Fehler enthielt. Wenn der Schüler die falschen Antworten lernte, wurde er nicht besser, sondern schlechter.

VeriEvol ist ein neues System, das die Art und Weise, wie wir diese Hausaufgaben erstellen, verändert. Anstatt nur „mehr“ Fragen zu generieren, konzentriert es sich auf „bessere“ Fragen und „verifizierte“ Antworten. Die Autoren nennen dies ein „Verifiable Evol-Instruct“-Framework.

So funktioniert es, unterteilt in einfache Schritte:

1. Das „Evolution“-Fitnessstudio (Fragen schwieriger machen)

Stellen Sie sich eine einfache Übung vor: „Schau dir dieses Bild eines Dreiecks an und sag mir, wie viele Seiten es hat.“ Das ist viel zu einfach für einen klugen Schüler.

VeriEvol hat einen speziellen Coach (das Evolution Module), der sich das Bild und die Frage ansieht und dann die Hausaufgabe umschreibt, um sie viel schwieriger zu machen, wobei man aber weiterhin das Bild betrachten muss.

  • Die Metapher: Anstatt nur zu fragen „Wie viele Seiten?“, schreibt der Coach es um zu: „Wenn du dieses Dreieck in der Mitte durchschneidest und drehst, wie würde sich die Fläche im Vergleich zu einem Quadrat mit demseltem Umfang verändern?“
  • Der Trick: Der Coach ist klug genug zu wissen, welche Art von Bild es ist. Wenn es eine Grafik ist, erstellt er eine grafikbasierte Frage. Wenn es eine geometrische Zeichnung ist, erstellt er eine Geometrie-Frage. Er wirft dem Schüler nicht einfach nur wahllos Wörter zu; er baut eine spezifische Herausforderung auf, die den Schüler dazu zwingt, tatsächlich auf das Bild zu schauen, um es zu lösen.

2. Der „Skeptiker“-Detektiv (Die Antworten prüfen)

Das ist der wichtigste Teil. Normalerweise nehmen wir einfach an, dass eine Antwort richtig ist, wenn ein Computer sie generiert. VeriEvol sagt: „Auf keinen Fall. Versuchen wir erst einmal zu beweisen, dass sie falsch ist.“

Sie haben ein Detektivsystem namens HTV-Agent entwickelt.

  • Die Metapher: Stellen Sie sich einen Gerichtssaal vor. Der Computer generiert eine Antwort (die „Hypothese“). Der HTV-Agent ist ein Team aus skeptischen Anwälten, deren einzige Aufgabe es ist, Beweise zu finden, dass die Antwort falsch ist.
  • So kämpfen sie:
    • Sie nutzen verschiedene „Zeugen“ (unterschiedliche KI-Solver), um zu sehen, ob diese sich alle einig sind.
    • Sie nutzen einen „Taschenrechner“ (Code-Ausführung), um die Mathematik zu überprüfen.
    • Sie nutzen „Augen“ (visuelle Werkzeuge), um zu prüfen, ob die Zahlen in der Antwort tatsächlich mit den Pixeln im Bild übereinstimmen.
  • Das Urteil: Wenn die Detektive irgendeinen Beweis finden können, dass die Antwort falsch ist, fliegt die Hausaufgabe in den Müll. Die Antwort wird nur akzeptiert, wenn die Detektive ihr Bestes gegeben haben, um sie zu widerlegen, und dabei gescheitert sind. Erst dann wird sie zu einer „verifizierten“ Antwort.

3. Das Ergebnis: Ein superzuverlässiges Lehrbuch

Das System nimmt diese zwei Schritte und lässt sie in einer Schleife laufen:

  1. Nimm eine einfache Frage.
  2. Entwickle sie zu einer schwierigen, bildbasierten Herausforderung weiter.
  3. Generiere eine Antwort.
  4. Schicke sie an die skeptischen Detektive.
  5. Wenn die Detektive sie nicht widerlegen können, behalte sie. Wenn doch, wirf sie weg und versuche es erneut.

Das Ergebnis ist eine riesige Bibliothek von über 250.000 mathematischen Problemen, bei denen jede einzelne Antwort streng geprüft und verifiziert wurde.

Was passierte, als sie es verwendeten?

Die Forscher testeten dies an einem „Schüler“-KI-Modell (einem Modell mit 7 Milliarden Parametern).

  • Ohne VeriEvol: Der Schüler war ganz okay, wurde aber oft durch Bilder verwirrt oder rät basierend auf Textmustern.
  • Mit VeriEvol: Der Schüler wurde signifikant besser.
    • Als sie nur die „entwickelten“ Fragen verwendeten (oh ohne den strengen Verifizierer), verbesserte sich der Schüler.
    • Als sie zusätzlich den „skeptischen Detektiv“ hinzufügten, um sicherzustellen, dass die Antworten perfekt sind, verbesserte sich der Schüler noch mehr.
    • Die Skalierung: Sie zeigten, dass der Schüler immer schlauer wurde, je mehr dieser verifizierten Fragen man hinzufügte (von 10.000 auf 250.000), was beweist, dass die Qualität der Daten wichtiger ist als nur die Quantität.

Warum das wichtig ist (in einfachen Worten)

Die meisten KI-Forschungen versuchen, den „Lehrer“ (den KI-Optimierer) schlauer zu machen. VeriEvol sagt: „Lass uns zuerst das Lehrbuch korrigieren.“

Indem sie den Prozess des „Fragen schwieriger machen“ vom „Prüfen, ob Antworten richtig sind“ trennten, schufen sie ein System, in dem die Daten selbst vertrauenswürdig sind. Sie haben nicht nur einen besseren Schüler gebaut, sondern ein besseres Curriculum. Sie haben sogar alle ihre „Detektivberichte“ (die Spuren, wie sie jede Antwort verifiziert haben) veröffentlicht, damit andere Forscher ihre Arbeit prüfen können, um sicherzustellen, dass niemand beim Hausaufgabenlernen schummelt.

Kurz gesagt: VeriEvol ist ein System, das automatisch schwierigere mathematische Probleme basierend auf Bildern schreibt und dann ein Team von digitalen Detektiven einsetzt, um sicherzustellen, dass die Antworten zu 100 % korrekt sind, bevor es eine KI davon lernen lässt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →