← Neueste Arbeiten
🤖 machine learning

DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

Das Papier stellt DeltaPrompts vor, einen Datensatz mit 200.000 synthetischen Schlussfolgerungsproblemen, die durch eine gestufte Pipeline generiert wurden und auf „Zero-Delta"-Prompts abzielen, bei denen Lehrer- und Schülermodelle übereinstimmen, wodurch die Lernsignale maximiert und in verschiedenen multimodalen Distillierungsszenarien relative Leistungsverbesserungen von bis zu 15 % erzielt werden.

Ursprüngliche Autoren: Jaehun Jung, Hyunwoo Kim, Brandon Cui, Ximing Lu, David Acuna, Prithviraj Ammanabrolu, Yejin Choi

Veröffentlicht 2026-05-18
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jaehun Jung, Hyunwoo Kim, Brandon Cui, Ximing Lu, David Acuna, Prithviraj Ammanabrolu, Yejin Choi

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die „Zero-Delta"-Falle

Stellen Sie sich vor, Sie sind ein Schüler, der versucht, komplexe Mathematikaufgaben von einem genialen Lehrer zu lernen. Sie möchten lernen, indem Sie beobachten, wie der Lehrer Aufgaben löst, und diese dann selbst versuchen. Dieser Prozess wird Distillation genannt.

Normalerweise greifen Forscher einfach auf einen großen Haufen bestehender Mathematikaufgaben (wie aus einem Lehrbuch) zurück und nutzen diese für dieses Training. Doch die Autoren dieses Papiers entdeckten einen versteckten Fehler in diesem Ansatz: Die meisten dieser Aufgaben sind für den Schüler zu einfach.

Sie nennen dies die „Zero-Delta-Falle".

  • Das Szenario: Sie geben eine Aufgabe dem Lehrer. Der Lehrer löst sie. Dann geben Sie die exakt gleiche Aufgabe dem Schüler.
  • Die Falle: Der Schüler weiß die Lösung bereits perfekt. Er erhält genau dieselbe Antwort wie der Lehrer.
  • Das Ergebnis: Da Schüler und Lehrer zu 100 % übereinstimmen, lernt der Schüler nichts. Es ist, als würde ein Lehrer einem Schüler einen Begriff erklären, den dieser bereits gestern gemeistert hat. Das Gehirn des Schülers leuchtet nicht auf; es werden keine neuen Verbindungen geknüpft.

Das Papier stellt fest, dass in Standard-Datensätzen, die für die reasoning von Diagrammen und Dokumenten verwendet werden, bis zu 69 % der Aufgaben „Zero-Delta" sind. Schüler und Lehrer sind bereits auf derselben Seite, daher ist das Training mit ihnen eine Zeitverschwendung. Selbst wenn Sie dem Schüler das 100-fache dieser leichten Aufgaben geben, wird er nicht intelligenter.

Die Lösung: Messen der „Lücke" (Delta)

Um dies zu beheben, entwickelten die Autoren eine neue Regel: Eine Aufgabe ist nur dann nützlich, wenn Lehrer und Schüler unterschiedliche Antworten geben.

Sie nennen diese Meinungsverschiedenheit „Antwortdivergenz" (oder Delta, Δ\Delta).

  • Hohes Delta: Der Lehrer löst es auf eine Weise, und der Schüler liegt falsch (oder rät anders). Dies ist eine Lerngelegenheit. Der Schüler erkennt: „Ah, ich habe diesen Schritt übersehen!" und lernt aus der Korrektur des Lehrers.
  • Zero Delta: Beide liegen richtig. Es findet kein Lernen statt.

Das Papier argumentiert, dass man für eine intelligente KI nicht mehr Daten benötigt, sondern bessere Daten – speziell Daten, bei denen die KI tatsächlich Schwierigkeiten hat.

Die Korrektur: Aufbau eines „Delta"-Datensatzes

Da bestehende Lehrbücher voller „Zero-Delta"-Aufgaben sind, bauten die Autoren ein neues System, um ihre eigenen Aufgaben zu erstellen. Sie nennen diesen neuen Datensatz DELTAPROMPTS.

Hier ist, wie sie ihn mit einem dreistufigen Rezept erstellten:

  1. Seed-Gesteuerte Generierung (Die Skizze): Sie nahmen bestehende Aufgaben und baten eine leistungsstarke KI (den „Lehrer"), neue, schwierigere Versionen davon zu erstellen. Denken Sie daran wie an einen Lehrer, der eine Mathematikaufgabe betrachtet und sagt: „Okay, machen wir das etwas kniffliger."
  2. Fertigkeitsgesteuerte Generierung (Das Ziel): Dies ist das Geheimnis. Das System schaut, wo die Schüler-KI in der Vergangenheit gescheitert ist. Es fragt den Lehrer: „Welche spezifische Fertigkeit hat der Schüler verpasst?" (z. B. „Der Schüler konnte die winzigen Zahlen im Diagramm nicht lesen"). Dann generiert der Lehrer eine neue Aufgabe, die speziell darauf ausgelegt ist, genau diese schwache Fertigkeit zu testen.
  3. Der Ablehnungsfilter (Der Türsteher): Sie generieren Tausende neuer Aufgaben. Aber bevor sie sie behalten, führen sie einen Test durch: „Kriegt der Schüler das falsch hin, während der Lehrer es richtig hat?"
    • Wenn Ja (Hohes Delta): Behalten.
    • Wenn Nein (Zero Delta): Wegwerfen.

Das Ergebnis ist ein Datensatz mit 200.000 maßgeschneiderten Aufgaben, bei denen garantiert ist, dass der Schüler Schwierigkeiten hat, was ein maximales Lernen sicherstellt.

Die Ergebnisse: Der Schüler wird supercharged

Die Autoren testeten diesen neuen Datensatz an verschiedenen KI-Modellen. Die Ergebnisse waren beeindruckend:

  • Massive Gewinne: Selbst beim Training eines bereits sehr klugen KI-Modells verbesserte die Verwendung von DELTAPROMPTS die Leistung im Vergleich zur Verwendung von Standard-Datensätzen um bis zu 15 %.
  • Es funktioniert bei neuen Schülern: Sie nahmen die Aufgaben, die für eine Art KI erstellt wurden, und gaben sie einer komplett anderen Art von KI. Es funktionierte immer noch! Dies beweist, dass die Aufgaben nicht nur spezifische Antworten auswendig lernen; sie lehren allgemeine reasoning-Fähigkeiten.
  • Besser in allem: Die KI wurde nicht nur besser im Umgang mit Diagrammen; sie wurde auch besser im Lesen von Dokumenten und im Verständnis realer Bilder.

Das Fazit

Das Papier kommt zu dem Schluss, dass die Engpassstelle beim Unterrichten von KI nicht das Vorhandensein von mehr Daten ist, sondern das Vorhandensein der richtigen Daten.

Die Analogie:
Wenn Sie fit werden wollen, hilft Laufen auf einem Laufband mit 1,6 km/h (Zero-Delta) nicht weiter, selbst wenn Sie 10 Stunden laufen. Sie müssen in einem Tempo laufen, bei dem Sie sich anstrengen, aber dennoch fertig werden (High-Delta). DELTAPROMPTS ist der Personal Trainer, der das Tempo ständig anpasst, um sicherzustellen, dass Sie sich immer in diesem „Sweet Spot" des Lernens befinden, anstatt Sie bei leichten Aufgaben dahingleiten zu lassen.

Indem sich die Autoren auf die Lücke zwischen dem, was die KI weiß, und dem, was sie lernen muss, konzentrierten, schufen sie einen viel effizienteren Weg, um intelligentere, kleinere KI-Modelle zu trainieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →