← Neueste Arbeiten
🤖 machine learning

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise ist ein vereinheitlichtes Reinforcement-Learning-Framework, das es Large-Language-Model-Agenten ermöglicht, progressive Sequenzen zu bilden und übertragbare Fähigkeiten durch die Organisation in fortschreitende Abfolgen sowie den Einsatz einer einzigen Policy zur gleichzeitigen Lösung von Aufgaben und zur Kuratierung eines sich entwickelnden Skill-Dokuments zu entwickeln und wiederzuverwenden, wodurch eine überlegene Leistung und Effizienz im Vergleich zu bestehenden mehrstufigen oder unabhängigen Aufgabenansätzen erreicht wird.

Ursprüngliche Autoren: Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

Veröffentlicht 2026-07-30
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, ein Videospiel zu spielen. In den alten Tagen passierte es, dass der Roboter, wenn er Level eins nicht schaffte, alles vergaß, Level zwei wieder ganz von vorne begann und einfach auf das Beste hoffte. Es war, als würde man versuchen, Fahrradfahren zu lernen, indem man vom Rad fällt, wieder aufsteht und sofort versucht, ein anderes Fahrrad zu fahren, ohne sich daran zu erinnern, wie man gestürzt ist. So funktionierten viele Computerprogramme, die man „KI-Agenten“ nennt: Sie behandelten jede neue Herausforderung als ein völlig neues, isoliertes Ereignis und verschwendeten dabei all die Lektionen, die sie aus den vorherigen gelernt hatten.

Aber was wäre, wenn der Roboter ein „Spickzettel“ oder ein „Tagebuch“ führen könnte, das mit jedem Mal Spielen klüger wird? Dies ist der Kern eines Feldes namens Reinforcement Learning (Bestärkendes Lernen), bei dem die KI durch Ausprobieren lernt, Belohnungen für Erfolge erhält und aus Fehlern lernt. In jüngster Zeit haben Wissenschaftler versucht, diese Agenten nicht nur dazu zu bringen, ein einzelnes Rätsel zu lösen, sondern allgemeine „Fähigkeiten“ zu erlernen, die ihnen helfen, viele verschiedene Rätsel zu lösen. Die große Frage lautet: Wie bringt man eine KI bei, ihre eigenen Lektionen so aufzuschreiben, dass sie später tatsächlich hilfreich sind, ohne dass sie durch die spezifischen Details des ersten Rätsels verwirrt wird?

Hier kommt SkillRise ins Spiel, eine neue Methode, die wie ein superintelligenter Tutor für KI-Agenten fungiert. Anstatt den Agenten seine Vergangenheit vergessen zu lassen, organisiert SkillRise Aufgaben in einer „Level-Up“-Sequenz, die von leicht nach schwer verläuft. Während der Agent spielt, tut er zwei Dinge gleichzeitig: Er versucht, das aktuelle Level zu lösen, und er agiert als „Kurator“, um sein eigenes Fähigkeits-Tagebuch zu aktualisieren. Denken Sie an einen Videospiel-Charakter, der, nachdem er einen Boss besiegt hat, nicht einfach zum nächsten Level übergeht, sondern sofort einen neuen Eintrag in sein Journal schreibt: „Hey, denk daran, dass dieser Boss nur angriff, wenn du links warst. Nächstes Mal bleib auf der rechten Seite.“

Die Magie von SkillRise liegt darin, wie es die KI belohnt. Es vergibt Punkte für das Lösen der aktuellen Aufgabe, aber es vergibt auch Punkte dafür, wie gut der „Tagebucheintrag“ dem Agenten hilft, zukünftige Aufgaben zu lösen. Dies ermutigt die KI, allgemeine Regeln aufzuschreiben (wie „bleib auf der rechten Seite“) anstatt spezifischer Details (wie „der Boss hieß Bob“). Die Forscher testeten dies in drei verschiedenen „Welten“: einem Haus, in dem der Agent aufräumen und organisieren muss (ALFWorld), einem Online-Shop, in dem er bestimmte Artikel kaufen muss (WebShop), und einem Wissenschaftslabor, in dem er Experimente durchführt (ScienceWorld).

Die Ergebnisse waren beeindruckend. SkillRise wurde nicht nur besser in den spezifischen Aufgaben, auf denen es trainiert wurde; es lernte eine Art des Lernens. Als die Forscher dem Agenten längere Sequenzen verwandter Aufgaben zum Üben gaben, wurde er sogar noch besser, was darauf hindeutete, dass er seine Fähigkeiten wirklich wiederverwendete, anstatt nur Antworten auswendig zu lernen. Tatsächlich übertraf es andere Top-Methoden um eine signifikante Marge – es verbesserte die Erfolgsraten um bis zu 8,5 Prozentpunkte. Vielleicht am überraschendsten war, dass es selbst dann besser darin war, dieselbe Aufgabe immer wieder zu wiederholen, als Methoden, die speziell dafür entwickelt wurden, obwohl es auf unterschiedlichen Aufgaben trainiert wurde. Es erledigte all dies zudem viel schneller und mit weniger Rechenleistung als ältere Methoden, die komplexe, mehrstufige Pipelines zur Verwaltung des Gedächtnisses erforderten.

Kurz gesagt: Skillrise legt nahe, dass man, wenn man möchte, dass eine KI klüger wird, sie nicht nur üben lässt, sondern ihr beibringt, ein fortlaufendes, sich entwickelndes Notizbuch ihrer eigenen Weisheit zu führen. Indem wir das „Tun“ vom „Aufschreiben dessen, was wir gelernt haben“, trennen und den Agenten dafür belohnen, wie nützlich dieses Schreiben für zukünftige Herausforderungen ist, können wir Agenten erschaffen, die nicht nur Probleme lösen, sondern tatsächlich ihre eigenen Strategien entwickeln, um im Laufe der Zeit zu besseren Problemlösern zu werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →