← Neueste Arbeiten
🤖 machine learning

Wisdom of Committee: Diverse Distillation from Large Foundation Models and Domain Experts

Das Papier schlägt DiverseDistill vor, ein interaktives Destillations-Framework, das einen lernbaren Frage-Antwort-Mechanismus nutzt, um die Ausgaben aus diversen Fundamentmodellen und Domänenexperten effektiv in ein kompaktes Studentenmodell zu überführen, wodurch eine überlegene Leistungsrekonstruktion ohne die Notwendigkeit einer Lehrer-Kooptimierung oder zusätzliche Inferenz-Overheads erreicht wird.

Ursprüngliche Autoren: Zichang Liu, Qingyun Liu, Yuening Li, Liang Liu, Anshumali Shrivastava, Shuchao Bi, Lichan Hong, Ed H. Chi, Zhe Zhao

Veröffentlicht 2026-06-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zichang Liu, Qingyun Liu, Yuening Li, Liang Liu, Anshumali Shrivastava, Shuchao Bi, Lichan Hong, Ed H. Chi, Zhe Zhao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem brillanten, aber winzigen Lehrling (einem kleinen, effizienten Computermodell) eine spezifische Aufgabe beizubringen, wie zum Beispiel Filme zu empfehlen oder Katzen auf Fotos zu identifizieren. Sie haben Zugriff auf zwei Arten von Mentoren:

  1. Der „Super-Genie“ (Foundation Model): Dieser Mentor ist unglaublich klug, weiß alles über die Welt und hat jedes Buch im Internet gelesen. Er ist jedoch riesig, langsam und spricht eine sehr komplexe Sprache, die der winzige Lehrling kaum versteht.
  2. Der „Spezialist“ (Domain Expert): Dieser Mentor ist kleiner, schneller und spricht die Sprache des Lehrlings perfekt. Er ist großartig in seinem spezifischen Job, weiß aber nicht viel über die breitere Welt.

Das Problem:
Wenn Sie versuchen, den Lehrling direkt vom Super-Genie lernen zu lassen, ist die Kluft zu groß. Der Lehrling wird überfordert und lernt nur sehr wenig. Wenn Sie nur den Spezialisten verwenden, lernt der Lehrling zwar den Job gut, verpasst aber die umfassendere Weisheit des Super-Genies.

Wenn Sie versuchen, beide Mentoren in denselben Raum zu stellen und sie einfach bitten, ihren Rat zu „mitteln“ (eine gängige Methode), schlägt dies oft fehl. Der komplexe, verwirrende Rat des Super-Genies kollidiert mit dem einfachen Rat des Spezialisten, und der Lehrling schneidet am Ende schlechter ab, als wenn er nur dem Spezialisten zugehört hätte.

Die Lösung: „DiverseDistill“ (Der interaktive Übersetzer)
Die Autoren dieses Papers schlagen eine neue Art des Lehrens vor: DiverseDistill. Anstatt die Mentoren einfach nur raten zu lassen, führen sie einen smarten Übersetzer (den Distillation Module) ein, der zwischen dem Lehrling und den Mentoren sitzt.

So funktioniert es, unter Verwendung einer kreativen Analogie:

1. Das „Frage-und-Antwort-Spiel“

Stellen Sie sich vor, der Lehrling befindet sich mitten in einem Quiz.

  • Der Übersetzer betrachtet das aktuelle Verständnis des Lehrlings und stellt dem Super-Genie eine sehr spezifische Frage, die auf dessen Denkweise zugeschnitten ist. Er stellt dem Spezialisten eine andere Frage, die auf dessen Denkweise zugeschnitten ist.
  • Die Mentoren beantworten diese Fragen. Da die Fragen in einer Weise formuliert sind, die jeder Mentor am besten versteht, geben sie qualitativ hochwertige Antworten.
  • Der Übersetzer nimmt diese Antworten und „übersetzt“ sie zurück in die Muttersprache des Lehrlings, damit der Lehrling tatsächlich daraus lernen kann.

2. Der „Smart Filter“ (Energie sparen)

Der Super-Genie ist teuer in der Kommunikation (es verbraucht viel Rechenleistung). Der Übersetzer ist klug genug zu wissen: „Für diese spezifische Frage ist der Spezialist der perfekte Experte; das Super-Genie wird hierfür nicht benötigt.“
So überspringt der Übersetcher das Fragen des Super-Genies für diese spezifische Frage. Dies spart etwa 30 % der Rechenzeit während des Trainings, ohne die Qualität zu mindern.

3. Der „Geister“-Übersetzer

Sobald der Lehrling das Lernen abgeschlossen hat, werden der Übersetzer und die Mentoren weggeworfen. Der Lehrling bleibt allein zurück, ist aber nun unglaublich klug. Er ist genauso groß und schnell wie zuvor, hat aber das Beste aus beiden Welten in sich aufgenommen. Es entstehen keine zusätzlichen Kosten, wenn der Lehrling später die eigentliche Arbeit verrichtet.

Was das Paper herausfand

Die Forscher testeten dies an zwei Hauptaufgaben:

  • Film-Empfehlungen: Sie versuchten, einen kleinen Film-Empfehler mithilfe eines massiven Sprachmodells (dem Super-Genie) und eines größeren Film-Empfehlers (dem Spezialisten) zu trainieren.
    • Ergebnis: Standardmethoden scheiterten oder verschlechterten das Ergebnis sogar. DiverseDistill ermöglichte es dem kleinen Modell, 114 % der Lücke zwischen einem schlechten Schüler und dem besten Lehrer zu schließen. Es lernte tatsächlich mehr, als der beste einzelne Lehrer allein hätte lehren können.
  • Bilderkennung: Sie versuchten, einen kleinen Bilderkennungs-Algorithmus mithilfe eines massiven Vision-Modells und eines Spezialisten zu trainieren.
    • Ergebnis: Auch hier hatten Standardmethoden Schwierigkeiten. DiverseDistill stellte 73 % bis 90 % der Leistungsdifferenz wieder her und schlug konsequent alle anderen Methoden.

Das Fazit

Das Paper behauptet, dass man nicht einfach eine Gruppe verschiedener Experten in einen Raum werfen kann und erwarten kann, dass sie einen kleinen Schüler effektiv unterrichten. Man benötigt ein interaktives System, das weiß, wie man die richtigen Fragen an den richtigen Experten stellt und die Antworten übersetzt.

Auf diese Weise gelang es ihnen, ein massives 76-Millionen-Parameter-Modell auf ein winziges 2-Millionen-Parameter-Modell zu komprimieren (38-fache Kompression), während sie fast die gesamte Intelligenz beibehielten, ohne die großen Modelle ändern oder sie gemeinsam trainieren zu müssen. Der „Übersetzer“ wird nur während der Lernphase verwendet und verschwindet danach – was einen schlanken, leistungsstarken Schüler hinterlässt, der bereit für die reale Welt ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →