← Neueste Arbeiten
🤖 AI

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

Dieser Beitrag stellt Budget-Efficient Thinking (BET) vor, ein zweistufiges Framework, das die Testzeit-Rechenleistung großer Reasoning-Modelle optimiert, indem es lernt, Budgets dynamisch basierend auf erwarteten Renditen statt wahrgenommener Schwierigkeit zuzuweisen, wodurch eine erhebliche Token-Reduktion bei gleichzeitiger Leistungsverbesserung durch adaptive „kurze Lösung", „freundliches Folden" und „heroisches Callen" erreicht wird.

Ursprüngliche Autoren: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

Veröffentlicht 2026-05-13
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen brillanten, aber leicht übermäßig eifrigen Assistenten, der versucht, einen riesigen Stapel Rätsel für Sie zu lösen. Dieser Assistent ist hervorragend im Denken, hat jedoch eine schlechte Angewohnheit: Manchmal starrt er stundenlang auf ein Rätsel, das unlösbar ist, und zu anderen Zeiten analysiert er ein einfaches Rätsel übermäßig, das in einer Minute hätte gelöst werden können. Dies verschwendet Ihre Zeit und Ihr Geld (in Form von Rechenleistung).

Diese Arbeit stellt eine neue Trainingsmethode namens BET (Budget-Efficient Thinking) vor, um diesem Assistenten beizubringen, klüger damit umzugehen, wie viel „Denkenergie" er für jedes Rätsel aufwendet.

So funktioniert BET, unter Verwendung einfacher Analogien:

Das Problem: Der „Überdenker" vs. der „Unterdenker"

Derzeit verhalten sich große KI-Modelle wie ein Schüler, der nicht weiß, wann er mit dem Lernen aufhören soll.

  • Das einfache Rätsel: Wenn Sie fragen: „Was ist 2+2?", schreibt der Schüler möglicherweise einen 10-seitigen Aufsatz, der beweist, warum 2+2 gleich 4 ist, und verschwendet dabei Zeit.
  • Das unmögliche Rätsel: Wenn Sie eine Frage stellen, die für den Schüler derzeit zu schwer ist (wie ein komplexes mathematisches Problem, das er noch nicht gelernt hat), versucht er möglicherweise stundenlang weiter, ohne voranzukommen, nur weil er nicht weiß, dass er es nicht lösen kann.
  • Das schwierige, aber lösbare Rätsel: Wenn das Rätsel schwierig, aber machbar ist, muss der Schüler weiterdenken. Doch aktuelle Methoden unterbrechen ihn manchmal zu früh, sodass er ein Rätsel aufgibt, das er hätte lösen können.

Die Lösung: BETs drei Superkräfte

Die Arbeit lehrt der KI drei spezifische Verhaltensweisen, die die Autoren „Short Solve", „Nice Fold" und „Hero Call" nennen. Betrachten Sie diese als Pokerstrategien:

  1. Short Solve (Der schnelle Gewinn):

    • Die Analogie: Sie sehen eine einfache Hand beim Poker. Sie wissen, dass Sie gewinnen werden, also müssen Sie nicht bluffen oder überanalysieren. Sie nehmen einfach die Chips und machen weiter.
    • Was BET tut: Wenn die KI eine einfache Frage sieht, antwortet sie schnell und prägnant. Sie verschwendet keine Energie mehr für Dinge, die sie bereits kennt.
  2. Nice Fold (Wissen, wann man aufhört):

    • Die Analogie: Sie spielen Poker und stellen fest, dass Ihre Hand schrecklich ist und die Chancen gegen Sie stehen. Ein kluger Spieler „foldet" (gibt auf) sofort, um sein Geld für bessere Hände zu sparen. Er wirft kein Geld mehr in ein verlierendes Spiel.
    • Was BET tut: Wenn die KI erkennt, dass eine Frage für ihre aktuelle Denkkraft zu schwer ist, sagt sie: „Ich kann das nicht lösen", und stoppt sofort. Sie verschwendet keine Zeit damit, zu versuchen, eine Antwort auf ein Problem zu erzwingen, das sie nicht knacken kann. Dies spart eine enorme Menge an Rechenleistung.
  3. Hero Call (All-In zum richtigen Zeitpunkt):

    • Die Analogie: Sie haben eine starke Hand beim Poker, aber sie ist noch nicht offensichtlich. Sie wissen, dass Sie mehr Geld investieren müssen, um den großen Pot zu gewinnen. Sie machen einen „Hero Call" und spielen weiter tief.
    • Was BET tut: Wenn die KI eine schwierige Frage sieht, die sie lösen kann, wenn sie genug nachdenkt, bewahrt sie ihre Energie und macht weiter. Sie schaltet sich nicht zu früh ab.

Wie sie die KI trainierten (Das zweistufige Training)

Die Forscher sagten der KI nicht einfach nur, sie solle „effizient sein". Sie lehrten sie in zwei Schritten:

  • Stufe 1: Der Lehrplan (Cold Start): Sie zeigten der KI Beispiele dafür, wie sie sich verhalten soll. Sie zeigten ihr: „Hier ist ein einfaches Problem; so beantworten Sie es schnell." „Hier ist ein unmögliches Problem; so sagen Sie 'Ich gebe auf'." „Hier ist ein schwieriges Problem; so denken Sie weiter."
  • Stufe 2: Das Übungsspiel (Reinforcement Learning): Sie ließen die KI das Spiel spielen. Jedes Mal, wenn die KI versuchte, ein Problem zu lösen, überprüfte das System: „Haben Sie Zeit auf einem unmöglichen Problem verschwendet? Haben Sie bei einem schwierigen zu früh aufgegeben?" Basierend auf den Ergebnissen gaben sie der KI eine Punktzahl (eine Belohnung). Wenn die KI bei unmöglichen Problemen Geld sparte, aber dennoch die schwierigen löste, erhielt sie eine hohe Punktzahl.

Die Ergebnisse

Als sie diese neue Methode an sieben verschiedenen Mathematik- und Logiktests testeten:

  • Sie sparte etwa 55 % der Denkzeit. Die KI verwendete ungefähr die Hälfte der Rechenleistung, die sie zuvor nutzte.
  • Sie wurde besser im Lösen von Problemen. Da sie keine Zeit mit unmöglichen Aufgaben verschwendete oder einfache Dinge überdachte, löste sie tatsächlich mehr schwierige Probleme korrekt.
  • Sie funktioniert bei neuen Arten von Rätseln. Obwohl sie nur in Mathematik trainiert wurde, wandte sie diese „klugen Ausgaben"-Gewohnheiten auf Wissenschaftsfragen und Logikrätsel an, die sie noch nie gesehen hatte.

Das Fazit

BET lehrt KI-Modelle, wie ein kluger Investor zu sein. Anstatt Geld (Rechenleistung) blind auszugeben, berechnet es die „Rendite" für jede Frage.

  • Wenn die Rendite gering ist (einfache Frage), geben Sie wenig aus.
  • Wenn die Rendite negativ ist (unmögliche Frage), geben Sie nichts aus.
  • Wenn die Rendite hoch ist (schwierig, aber lösbar), investieren Sie stark.

Dies macht KI schneller, kostengünstiger im Betrieb und überraschend besser im Lösen der schwierigen Dinge.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →