← Neueste Arbeiten
🤖 machine learning

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

Das Paper schlägt DUET vor, eine token-selektive On-Policy-Distillationsmethode, die die pro-Token-Diskrepanz zwischen zwei Lehrern mit identischen Gewichten (einer mit und einer ohne Verbotskontext) nutzt, um ein klares Aufsichtssignal zu generieren, welches Modelle darauf trainiert, dynamischen, anfragebezogenen Verboten zu entsprechen und gleichzeitig den allgemeinen Nutzen zu bewahren.

Ursprüngliche Autoren: Zihan Li, Feifei Li, Wenhui Que

Veröffentlicht 2026-08-18
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zihan Li, Feifei Li, Wenhui Que

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Große Sprachmodelle sind die Motoren hinter vielen modernen digitalen Assistenten und fähig, menschenähnliche Texte zu generieren, Probleme zu lösen und Fragen zu beantworten. In der realen Welt operieren diese Modelle jedoch oft unter strengen, sich ändernden Regeln, die nicht fest in ihr Gehirn einprogrammiert sind, sondern im Moment ihrer Nutzung in ihre Anweisungen injiziert werden. Ein Unternehmen könnte einem Modell sagen, niemals seine internen Werkzeuge preiszugeben, während ein Krankenhaus verlangen könnte, dass es niemals Patientennamen erwähnt. Diese Regeln ändern sich je nachdem, wer fragt und was die jeweilige Situation ist. Die Herausforderung für Entwickler besteht darin, dem Modell beizubringen, diesen spezifischen, temporären Verboten zu gehorchen, ohne es so vorsichtig zu machen, dass es harmlose Fragen verweigert, oder so selbstbewusst, dass es versehentlich gegen die Regeln verstößt. Wenn ein Modell diese Anweisungen nicht befolgt, kann dies zu Datenlecks oder Vorfällen bei der Markensicherheit führen; wenn es zu viel Angst hat zu sprechen, wird es nutzlos.

Forscher bei Tencent haben eine neue Methode namens DUET entwickelt, um dieses spezifische Problem der Vermittlung von Laufzeitregeln an Modelle zu lösen. Anstatt zu versuchen, das Modell von Grund auf neu zu trainieren oder ihm einfach nur Beispiele für gute und schlechte Antworten zu zeigen, haben sie ein System geschaffen, das wie ein Paar identischer Zwillinge agiert. Ein Zwilling sieht die verbotene Regel in seinen Anweisungen, während der andere Zwilling, der über exakt das gleiche Wissen und die gleichen Fähigkeiten verfügt, die Regel nicht sieht. Da diese beiden „Lehrer“ ansonsten identisch sind, muss jede Abweichung in dem, was sie sagen, allein durch das Vorhandensein oder Fehlen dieser spezifischen Regel verursacht worden sein. Die Forscher nutzen diese Uneinigkeit, um genau den Punkt zu bestimmen, an dem das Modell wahrscheinlich einen Fehler machen wird.

Der Prozess funktioniert dadurch, dass das Schüler-Modell eine Antwort generiert, während beide Lehrer-Zwillinge zusehen. Wenn die beiden Lehrer sich darüber einig sind, welches Wort als nächstes kommen sollte, ignoriert das System diesen Teil des Gesprächs und geht davon aus, dass er sicher und unwichtig ist. Wenn die Lehrer jedoch uneins sind – einer schlägt ein Wort vor, das ein Geheimnis verrät, und der andere schlägt eine sichere Alternative vor – markiert das System diesen spezifischen Moment als kritische Lerngelegenheit. Dies ermöglicht es dem Schüler-Modell, seine Aufmerksamkeit nur auf die wenigen Wörter zu richten, bei denen die Regel tatsächlich relevant ist, anstatt die Mühe in tausende Wörter zu investieren, die vollkommen in Ordnung sind. Der Schüler wird dann sanft von dem Lehrer weggeführt, der die Regel ignoriert, und hin zu dem Lehrer gezogen, der sie respektiert, wodurch er effektiv lernt, die Grenze zwischen Hilfsbereitschaft und Regeltreue zu navigieren.

Dieser Ansatz adressiert einen Mangel älterer Methoden, bei denen Modelle auf kompletten Konversationen trainiert wurden. In jenen älteren Systemen wurde, wenn ein Modell in einer langen Antwort einen einzigen Fehler machte, die gesamte Antwort oft als schlecht eingestuft, was das Modell darüber verwirrte, welche spezifischen Wörter das Problem waren. Durch die Isolierung der Uneinigkeit auf das exakte Token, oder das Worteinheit, an dem der Verstoß erfolgt, liefert die neue Methode ein viel klareres Signal. Die Forscher testeten dies bei einer Vielzahl von Aufgaben, einschließlich des Schutzes persönlicher Informationen, der Einhaltung von Sicherheitsrichtlinien und der Befolgung von geschäftlichen Werkzeugdefinitionen. Sie fanden heraus, dass die mit dieser Dual-Teacher-Methode trainierten Modelle signifikant besser darin waren, Regelverstößen zu begegnen, während sie gleichzeitig für legitime Fragen hilfreich blieben.

Die Ergebnisse zeigten, dass die neue Methode bestehende Techniken über verschiedene Modellgrößen hinweg übertraf, von kleineren Modellen mit 1,5 Milliarden Parametern bis hin zu größeren mit 8 Milliarden. In ihren Tests erreichten die Modelle eine Compliance-Rate von über 72 % bis 85 % bei verletzenden Anfragen, was bedeutet, dass sie erfolgreich weigerten, gegen die Regeln zu verstoßen, während sie gleichzeitig eine hohe Nützlichkeit für normale Fragen beibehielten und zwischen 88 % und 93 % ihrer Fähigkeit zur korrekten Beantwortung bewahrten. Entscheidend war, dass die Modelle ihre allgemeine Intelligenz nicht verloren; sie blieben in Mathematik und Logikrätseln genauso gut wie zuvor. Die Studie legt nahe, dass Entwickler durch den Einsatz zweier identischer Modelle, um die exakte Stelle zu finden, an der eine Regel relevant wird, KI-Assistenten erschaffen können, die sowohl sicher als auch nützlich sind und komplexe, wechselnde Anweisungen navigieren können, ohne massenhaft neue Daten zu benötigen oder ihre Kernfähigkeiten zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →