← Neueste Arbeiten
💬 NLP

Cross-Domain Hybrid OPD for Generalizable Search Agents

Dieses Paper stellt ein hybrides Trainingsframework für den Yuanbao-Suchagenten vor, das Cross-Domain Expert On-Policy Distillation nutzt, um spezialisierte Suchfähigkeiten zu erreichen, ohne die allgemeine Intelligenz zu opfern oder gar zu verbessern, wodurch die typische Alignment-Steuer (Alignment Tax) abgemildert wird, die mit der Optimierung durch Reinforcement Learning einhergeht.

Ursprüngliche Autoren: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Veröffentlicht 2026-08-04
📖 9 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Ihr Lieblings-KI-Assistent wie ein brillanter Student ist, der gerade gelernt hat, ein Meisterdetektiv zu werden. Dieser Student kann das Internet durchforsten, Verbindungen zwischen verschiedenen Nachrichtengeschichten herstellen und verborgene Fakten schneller finden als jeder andere. Aber es gibt einen Haken: Während er zum Super-Detektiv wurde, vergaß er, wie man ein lustiges Gedicht schreibt, ein kniffliges Matherätsel löst oder einfach nur ein normales Gespräch über seinen Tag führt. Dies ist das Problem der „Spezialisierung“ in der Welt der Künstlichen Intelligenz. Wissenschaftler nennen den Preis, den man zahlt, um in einer spezifischen Sache wirklich gut zu werden, die „Alignment Tax“ (Ausrichtungsteuer). Es ist so, als würde ein Koch so besessen davon werden, seine Suppe zu perfektionieren, dass er vergisst, wie man einen Kuchen backt. Die große Frage für Forscher ist: Können wir eine KI trainieren, eine Weltklasse-Suchexpertin zu sein, ohne dass sie vergisst, eine hilfreiche, vielseitige Freundin zu sein?

Genau das wollte das Team von Tencent Yuanbao in ihrem neuen technischen Bericht lösen. Sie entwickelten einen smarten KI-Agenten, der darauf ausgelegt ist, Informationen im Web aufzuspüren, aber sie waren besorgt, dass das Training, so intensiv zu suchen, ihn in anderen Bereichen „dumm“ machen würde. Um dies zu beheben, erfanden sie eine clevere zweistufige Trainingsmethode. Zuerst brachten sie der KI bei, eine Suchprofi zu sein, mithilfe einer Technik namens Reinforcement Learning (Bestärkendes Lernen), was so ähnlich ist, wie der KI ein Spiel zuzulassen, bei dem sie Punkte für das Finden der richtigen Antworten erhält. Dann, um zu verhindern, dass die KI ihre allgemeine Intelligenz verliert, nutzten sie eine Methode namens „Cross-Domain Hybrid On-Policy Distillation“. Stellen Sie sich das so vor, als würden Sie vier verschiedene Geniestudenten als Tutoren engagieren – einen für Mathe, einen für Coding, einen für Logik und einen für Naturwissenschaften –, um der Such-Experten-KI wieder beizubringen, wie man ein vielseitiger Schüler wird. Das Ergebnis? Eine KI, die Informationen im Web genauso gut finden kann wie die spezialisierte Version, und obwohl sie in keinem einzelnen Mathetest ein Mathegenie wurde, hat sie den Großteil ihres verlorenen Bodens zurückgewonnen und war in mehreren Schlüsselbereichen wie logischem Denken und Coding sogar besser als zuvor. Sie haben das Problem nicht nur gelöst; sie haben die KI in vielen Dingen gleichzeitig intelligenter gemacht, ohne ihre Suchfähigkeiten zu opfern.

Der Detektiv, der das Jonglieren vergaß

Tauchen wir ein in die Geschichte des Yuanbao-Suchagenten. Stellen Sie sich vor, Sie haben einen Roboter namens „Search-Bot“. Sie wollen, dass Search-Bot der Beste darin ist, Antworten im Internet zu finden. Also setzen Sie ihn in einen virtuellen Spielplatz, auf dem er Geheimnisse lösen muss, indem er auf Links klickt, Artikel liest und Fragen stellt. Dies nennt man Reinforcement Learning (RL). Es ist wie das Training eines Hundes: Jedes Mal, wenn Search-Bot die richtige Information findet, bekommt er eine Belohnung (ein Leckerli). Jedes Mal, wenn er sich verirrt, bekommt er ein sanftes „Nein“.

Nach einer Weile wird Search-Bot fantastisch darin, Dinge zu finden. Aber hier ist der seltsame Teil: Während er immer besser im Suchen wird, wird er in anderen Dingen schlechter. Er vergisst, wie man ein einfaches Matheproblem löst oder eine kreative Geschichte schreibt. Das Paper nennt dies die Alignment Tax. Es ist so, als würden Sie jeden Tag ausschließlich Fußballschüsse üben, bis Ihre Beine super stark sind, aber Sie vergessen, geradeaus zu laufen, weil Sie nie mehr geübt haben, wie man läuft. Die KI wurde so sehr auf das „Suchen“ spezialisiert, dass sie ihre „allgemeine“ Gehirnleistung verlor.

Die zweistufige Rettungsmission

Das Tencent-Team erkannte, dass es nicht die Lösung war, Search-Bot einfach nur noch härter suchen zu lassen. Sie brauchten einen Weg, um sowohl die Suchfähigkeiten zu behalten als auch die allgemeine Intelligenz zurückzubringen. Also entwarfen sie einen zweistufigen Trainingsplan.

Stufe 1: Das Such-Bootcamp
Zuerst nahmen sie ihr Basis-KI-Modell (ein smartes Modell namens Hunyuan3) und schickten es zum „Search Boot Camp“. Hier übte die KI ausschließlich das Suchen. Sie lernte, ihre Züge zu planen, Werkzeuge wie die Websuche und die Bildersuche zu nutzen und Informationen aus verschiedenen Quellen zusammenzufügen. Wie erwartet wurde sie sehr gut im Suchen. Aber, genau wie das Paper vorhersagte, verlor sie den Kontakt zu Mathe, Wissenschaft und Logik. Die „Alignment Tax“ schlug hart zu.

Stufe 2: Der „Super-Tutor“-Mix
Hier geschieht die Magie. Anstatt die KI einfach weiter bei Mathe scheitern zu lassen, holte das Team vier Experten-Lehrer hinzu. Dies waren nicht irgendwelche Lehrer; es waren hochspezialisierte KI-Modelle, die speziell trainiert wurden für:

  1. Mathe (Lösen komplexer Gleichungen)
  2. Coding (Schreiben von Computerprogrammen)
  3. Logik (Lösen von Rätseln und logisches Schließen)
  4. Wissenschaft (Verstehen der natürlichen Welt)

Das Team nutzte eine Technik namens On-Policy Distillation (OPD). Dies ist eine schicke Art zu sagen: „Lass den Schüler (Search-Bot) versuchen, ein Problem zu lösen, und lass dann den Experten-Lehrer zusehen und sagen: ‚Hey, du hast es so gemacht, aber hier ist ein besserer Weg, darüber nachzudenken.‘“

Das Coole daran ist, dass sie der KI nicht nur Mathe oder Suche beigebracht haben. Sie haben sie gemischt! In jeder einzelnen Trainingseinheit übte die KI, nach einem Fakt zu suchen, und praktizierte dann sofort, ein Matheproblem zu lösen oder Code zu schreiben, während sie von dem jeweils richtigen Experten-Lehrer geleitet wurde. Es war wie ein Schüler, der morgens zum Fußballtraining geht und nachmittags zum Klavierunterricht, wobei der Klavierlehrer auch beim Fußballtraining zuschaut, um sicherzustellen, dass der Schüler fokussiert und diszipliniert bleibt.

Die Ergebnisse: Das Beste aus beiden Welten

Das Team testete ihr neues „Hybrid“-KI gegen die alten Versionen. Hier ist, was sie fanden heraus:

  • Die Suchfähigkeiten: Die neue KI war genauso gut im Suchen wie diejenige, die nur das Suchen geübt hatte. Tatsächlich war sie in einigen schwierigen Suchtests sogar noch besser! Sie konnte immer noch Informationen im gesamten Web finden, komplexe Suchen planen und Anweisungen perfekt befolgen.
  • Die allgemeinen Fähigkeiten: Dies ist der große Sieg. Die KI, die nur das Suchen geübt hatte, war in Mathe und Logik schlechter geworden. Aber die Hybrid-KI? Sie hat nicht nur den Normalzustand wieder erreicht; sie hat in vielen Bereichen signifikante Fortschritte gemacht und sich verbessert.
    • Bei Tests zum logischen Denken verbesserte sich die Hybrid-KI massiv (ein Sprung von einem Wert von 33,95 auf 46,90).
    • Bei Coding-Aufgaben stieg sie von 67,74 auf 74,15 und schlug damit sogar das ursprüngliche „Basis“-Modell.
    • Bei Matheproblemen holte sie fast den gesamten verlorenen Boden zurück und übertraf das ursprüngliche Modell sogar bei einigen schwierigen Benchmarks (wie AIME25 und Math IMO AnswerBench). Bei einigen extrem anspruchsvollen Benchmarks wie Minerva Math und Frontier Science Olympiad blieb sie jedoch etwas unter der Leistung des ursprünglichen Basismodells.
    • Bei Wissenschafts-Benchmarks verzeichnete sie starke Zuwächse und erreichte die höchste Genauigkeit bei GPQA Diamond.

Das Paper zeigt, dass die „Alignment Tax“ kein permanenter Preis ist, den man zahlen muss. Indem sie diese Experten-Lehrer nutzten, um die KI beim Suchen zu leiten, gelang es ihnen, den Großteil des Schadens „rückgängig zu machen“. Die KI musste sich nicht zwischen Detektiv und Genie entscheiden; sie wurde zu einem Detektiv, der gleichzeitig auch ein sehr guter Schüler ist.

Warum das wichtig ist

Sie fragen sich vielleicht: „Und was? Warum ist es uns wichtig, ob eine KI besser in Mathe wird?“ Nun, stellen Sie sich vor, Sie fragen Ihren KI-Assistenten: „Ich besuche Paris für drei Tage. Ich möchte den Eiffelturm und Disneyland sehen, aber ich möchte nicht mehr als 30 Minuten zwischen den Orten reisen müssen.“

Wenn die KI nur das „Search-Only“-Training gehabt hätte, fände sie vielleicht die Orte, würde Ihnen aber einen schrecklichen Reiseplan erstellen, der keinen Sinn ergibt, oder sie würde vergessen, die Reisezeit korrekt zu berechnen, weil sie zu sehr darauf konzentriert war, nur die Namen der Orte zu finden.

Aber mit dem Hybrid-Training kann die KI:

  1. Suchen nach den Orten und Reisezeiten (unter Nutzung ihrer Suchfähigkeiten).
  2. Schlussfolgern über die Geografie und berechnen, ob der Plan in Ihre 30-Minuten-Regel passt (unter Nutzung ihrer Logik- und Mathekompetenz).
  3. Schreiben eines klaren, freundlichen und entspannten Reiseplans für Sie (unter Nutzung ihrer allgemeinen Sprachfähigkeiten).

Das Paper legt nahe, dass dieser „Hybrid“-Ansatz der Schlüssel zum Bau von KI-Assistenten ist, die im echten Leben wirklich nützlich sind. Sie müssen in der Lage sein, Informationen zu finden, ja, aber sie müssen auch klug genug sein, um diese Informationen zu nutzen, um Probleme zu lösen, Geschichten zu schreiben und uns bei unserem täglichen Leben zu helfen, ohne dabei den Verstand zu verlieren.

Das Geheimrezept: Wie sie es gemacht haben

Das Team hat nicht einfach alles in einen Mixer geworfen. Sie waren sehr vorsichtig damit, wie sie die Experten-Lehrer unterrichtet haben. Sie nutzten eine „Curriculum Learning“-Strategie. Das bedeutet, dass sie nicht mit den schwersten, unmöglichsten Matheaufgaben begannen. Stattdessen begannen sie mit Aufgaben mittlerer Schwierigkeit, um ein starkes Fundament zu bauen, und führten dann langsam die wirklich schweren Themen ein.

Sie fanden heraus, dass die Lehrer (und die Schüler-KI) nicht so gut lernten, wenn sie diesen Schritt übersprungen und einfach die schwersten Probleme auf die Lehrer geworfen hätten. Das „Curriculum“ half den Lehrern, besser darin zu werden, Dinge zu erklären, was wiederum dazu führte, dass die Schüler-KI schneller und intelligenter lernte.

Das Fazente

Das Tencent Yuanbao-Team hat uns gezeigt, dass man nicht die allgemeine Intelligenz opfern muss, um einen spezialisierten Suchagenten zu erhalten. Durch die Mischung von Reinforcement Learning (für die Suche) und On-Policy Distillation (das Lernen von Experten-Tutoren) haben sie eine KI geschaffen, die ein Meisterdetektiv und ein brillanter Allround-Schüler ist.

Sie haben bewiesen, dass die „Alignment Tax“ vermieden werden kann. Die KI wurde nicht nur nicht schlechter; sie wurde in den meisten Bereichen sogar besser, holte ihre verlorenen Fähigkeiten zurück und übertraf sogar ihr ursprüngliches Selbst in Bereichen wie Coding und logischem Denken. Auch wenn sie nicht jeden einzelnen Mathewettbewerb gewann, wurde sie insgesamt zu einer viel fähigeren und vielseitigeren Assistentin. Es ist ein bisschen so, als fände man einen Weg, einen Superhelden darin zu trainieren zu fliegen, ohne dass er vergisst, wie man geht. Und in einer Welt, in der wir wollen, dass unsere KI hilfreich, klug und vielseitig ist, ist das eine ziemlich große Sache.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →