← Neueste Arbeiten
🤖 AI

Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

Das Paper schlägt das Hybrid Open-Ended Tri-Evolution (HOTE) Framework vor, welches hybrides Reinforcement Learning nutzt, um einen Proposer, Solver und Judge kollaborativ zu entwickeln, wodurch ein 8B-Modell in der Lage ist, größere statische sowie hochmoderne Deep-Research-Modelle bei offen enden Aufgaben mit reduziertem Zeitaufwand zu übertreffen.

Ursprüngliche Autoren: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

Veröffentlicht 2026-06-15
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Einem Roboter beibringen, ein Super-Forscher zu sein

Stellen Sie sich vor, Sie möchten eine KI bauen, die wie ein Weltklasse-Forscher agieren kann. Sie muss Informationen im Internet finden, tausende von Artikeln lesen und einen langen, detaillierten Bericht über komplexe Themen schreiben (wie zum Beispiel: „Wie wirkt sich der Klimawandel auf die Kaffeeproduktion im Jahr 2050 aus?“).

Das Problem ist, dass die meisten KI-Modelle wie Schüler sind, die nur aus einem festen Lehrbuch lernen. Sob wenn sie das Lehrbuch fertig gelesen haben, hören sie auf zu lernen. Sie können nicht von selbst besser darin werden, neue Dinge zu erforschen.

Dieses Paper stellt ein neues System namens HOTE (Hybrid Open-Ended Tri-Evolution) vor. Betrachten Sie HOTE nicht als einen einzelnen Schüler, sondern als ein selbstverbesserndes Forschungsteam, das lernt, indem es ein Spiel gegen sich selbst spielt.

Die drei Charaktere im Team

Anstatt nur einer einzigen KI, die versucht, alles zu erledigen, nutzt HOTE drei spezialisierte Rollen, die sich gemeinsam entwickeln:

  1. Der Solver (Der Forscher):

    • Rolle: Dies ist die KI, die die eigentliche Arbeit leistet. Sie nimmt eine Frage entgegen, durchsucht das Web, liest Dokumente und schreibt einen langen Forschungsbericht.
    • Analogie: Denken Sie an den Solver als einen Detektiv, der versucht, ein Rätsel zu lösen.
  2. Der Judge (Der Kritiker):
    * Rolle: Diese KI liest die vom Solver geschriebenen Berichte. Anstatt nur „Gut“ oder „Schlecht“ zu sagen, erstellt sie eine maßgeschneiderte Checkliste (ein sogenanntes „Rubric“), um den Bericht zu bewerten. Sie sucht nach spezifischen Stärken und Schwächen.
    * Analogie: Der Judge ist wie ein strenger Editor oder ein Sport-Schiedsrichter. Wenn der Detektiv ein Indiz übersieht, pfeift der Schiedsrichter und sagt: „Du hast dieses spezifische Detail übersehen.“ Entscheidend ist, dass der Judge sein eigenes Regelwerk aktualisiert, sobald er neue Arten von Fehlern sieht, damit er nicht bei alten Regeln stecken bleibt.

  3. Der Proposer (Der Quizmaster):

    • Rolle: Diese KI schaut sich das Feedback des Judges und die Fehler des Detektivs an, um neue, schwierigere Fragen zu erstellen. Ihr Ziel ist es, die Schwachstellen des Detektivs zu finden und ihn herauszufordera.
    • Analogie: Der Proposer ist wie ein Fitnesstrainer, der beobachtet, wie ein Athlet bei einer bestimmten Übung scheitert, und dann eine neue, etwas schwierigere Übung entwirft, um genau diese Schwäche zu beheben.

Wie sie trainieren: Das „Tri-Evolution“-Spiel

Die Magie geschieht dadurch, dass diese drei in einer Schleife zusammenarbeiten und sich ständig verbessern:

  1. Der Quizmaster erstellt eine schwierige Forschungsfrage.
  2. Der Detektiv versucht, sie zu beantworten, sucht im Web und schreibt einen Bericht.
  3. Der Schiedsrichter bewertet den Bericht, erstellt eine neue Checkliste und zeigt genau auf, wo der Detektiv versagt hat.
  4. Der Detektiv lernt aus der Bewertung und versucht es erneut.
  5. Der Quizmaster sieht, worin der Detektiv noch schlecht ist, und erstellt für die nächste Runde eine noch schwierigere Frage.

Dieser Zyklus wiederholt sich tausende Male. Das Paper nennt dies „Tri-Evolution“, weil sich alle drei Charaktere gleichzeitig entwickeln (verbessern).

Das „Hybrid“-Geheimrezept

Das Paper erwähnt auch eine „Dual-Mode Hybrid“-Strategie. Das ist wie das Training eines Athleten auf zwei verschiedene Arten:

  • Modus A (Werkzeugnutzung): Der Detektiv darf das Internet nutzen (Suchwerkzeuge), um Antworten zu finden. Das ist realistisch, kann aber verrauscht und langsam sein.
  • Modus B (Ohne Werkzeuge): Der Detektiv muss allein aus dem Gedächtnis und der Logik antworten, ohne etwas nachzuschlagen. Das ist schneller, beruht aber darauf, was er bereits weiß.

Das HOTE-System trainiert den Detektiv in beiden Modi gleichzeitig.

  • Warum? Wenn man nur mit dem Internet trainiert, wird der Detektiv vielleicht faul und verlässt sich zu sehr auf Suchergebnisse. Wenn man nur ohne Internet trainiert, vergisst er vielleicht, das Internet effektiv zu nutzen. Durch die Mischung lernt der Detektiv, ein Meisterforscher zu sein, der weiß, wann er suchen muss und wie er tiefgründig ohne Werkzeuge denkt.

Die Ergebnisse: Warum es wichtig ist

Die Forscher haben dieses System an drei schwierigen Benchmarks getestet (Gesundheit, Wissenschaft und allgemeine Forschung).

  • Die Behauptung: Ein 8-Milliarden-Parameter-Modell (eine mittelgroße KI), das mit HOTE trainiert wurde, wurde intelligenter als viel größere Modelle (32B+) und andere hochmoderne Forschungs-KIs.
  • Effizienz: Es erreichte diese Ergebnisse in weniger Zeit und mit weniger Rechenleistung als andere Methoden.
  • Nachhaltigkeit: Im Gegensatz zu anderen Methoden, die nach einer Weile aufhören, sich zu verbessern, wurde das HOTE-Team über eine lange Zeit hinweg immer besser, da der „Quizmaster“ ständig neue, herausfordernde Probleme fand, die der „Detektiv“ noch nicht gelöst hatte.

Zusammenfassung in einem Satz

HOTE ist ein sich selbst verbesserndes KI-System, bei dem ein Forscher, ein Kritiker und ein Quizmaster ein kontinuierliches Spiel „Schach“ gegeneinander spielen, wobei sie eine Mischung aus Internetsuche und reinem Denken verwenden, um eine mittelgroße KI schneller und besser als jede andere in einen Weltklasse-Forscher zu verwandeln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →