Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction
Dieses Paper führt den Constraint Saturation Evaluation (CSE) Benchmark ein, um zu demonstrieren, dass Large Language Models zwar einzelne Constraints kompetent befolgen können, ihre Fähigkeit, mehrere gleichzeitige Constraints zu erfüllen, jedoch über 5–6 Constraints hinaus aufgrund der unabhängigen Akkumulation von Fehlern multiplikativ zusammenbricht, was insbesondere das strukturelle Denken gegenüber lexikalischen Details beeinträchtigt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie möchten einen Kuchen backen, aber anstatt nur einem einzelnen Rezept zu folgen, erhalten Sie eine Liste von Regeln. „Verwenden Sie genau 200 Gramm Mehl“, „Verwenden Sie keinen Zucker“, „Der Kuchen muss blau sein“ und „Er muss die Form eines Sterns haben“. Wenn Sie nur eine Regel haben, ist es einfach. Wenn Sie zwei oder drei haben, können Sie es wahrscheinlich bewältigen. Aber was passiert, wenn Ihnen jemand eine Liste mit fünfzig Regeln auf einmal in die Hand drückt? Dies ist die Welt der Large Language Models (LLMs), jener superintelligenten Computerprogramme, die Geschichten schreiben, Fragen beantworten und Probleme lösen. Diese Modelle sind wie digitale Köche, die fast jedes Buch in der Bibliothek gelesen haben. Wissenschaftler wissen schon seit geraumer Zeit, dass diese Köche groß darin sind, einer einzelnen Anweisung zu folgen. Aber niemand war sicher, was passierte, wenn man sie bat, ein Dutzend Anweisungen gleichzeitig zu jonglieren. Sinkt ihre Leistung ein wenig, wie bei einem müden Läufer, der langsamer wird? Oder bricht sie plötzlich zusammen, wie ein Kartenhaus, wenn man hineinbläst? Diese Frage ist wichtig, denn während wir beginnen, diese KI-Köche einzusetzen, um reale Werkzeuge zu bauen – wie Sicherheitssysteme, juristische Dokumente oder komplexen Code –, müssen wir genau wissen, wie viele Regeln sie bewältigen können, bevor sie Fehler machen.
Hier kommt eine neue Studie ins Spiel, die diese KI-Modelle wie ein Experiment in einer riesigen Küche behandelt. Die Forscher unter der Leitung von Mariya Vasileva bauten einen speziellen Testplatz namens Constraint Saturation Evaluation (CSE) auf. Betrachten Sie dies als einen „Stresstest“ für das Gehirn der KI. Sie ließen die Modelle nicht einfach nur eine Geschichte schreiben; sie gaben ihnen eine spezifische Anzahl von Regeln, denen sie gleichzeitig folgen mussten, reichend von nur einer Regel bis hin zu zwölf. Diese Regeln waren streng und unveränderlich, wie zum Beispiel: „Ihre Antwort muss genau 3 Absätze haben“, „Kein Buchstabe 'e' erlaubt“ oder „Jeder Satz muss mit dem Buchstaben 'A' beginnen“. Die Forscher beobachteten dann, wie oft die KI es schaffte, jede einzelne Regel gleichzeitig korrekt umzusetzen.
Die Ergebnisse waren überraschend und ein wenig dramatisch. Die Studie fand heraus, dass KI-Modelle nicht einfach nur etwas müder werden, wenn man mehr Regeln hinzufügt; sie erreichen einen Kipppunkt. Stellen Sie sich vor, Sie stapeln Blöcke. Für die ersten paar Blöcke ist der Turm stabil. Aber sobald Sie eine bestimmte Höhe erreichen – etwa 5 oder 6 Regeln selbst für die klügsten Modelle – wackelt der Turm nicht nur; er stürzt plötzlich zusammen. Die Forscher entdeckten, dass eine KI zwar noch 40 % der einzelnen Regeln richtig ausführen kann, wenn es acht von ihnen gibt, die Chance jedoch, alle acht gleichzeitig richtig zu machen, auf weniger als 6 % sinkt. Es ist wie ein Musiker, der eine einzelne Note perfekt oder sogar zwei spielen kann, aber sobald man ihn bittet, eine komplexe Sinfonie mit zwölf verschiedenen Instrumenten gleichzeitig zu spielen, vergisst er die Melodie völlig.
Die Studie fand auch heraus, warum das passiert. Es stellt sich als folgend heraus, dass die Regeln nicht wie Feinde in einem Spiel gegeneinander kämpfen. Stattdessen wirken sie wie eine Kettenreaktion. Wenn die KI einen kleinen Teil der Antwort vermasselt – sagen wir, sie vergisst, die Sätze korrekt zu zählen –, dann versagt jede Regel, die von den Sätzen abhängt, gleichzeitig. Es liegt nicht daran, dass die Regeln sich gegenseitig verwirren; es ist vielmehr so, dass das „Arbeitsgedächtnis“ der KI überlastet wird. Die Forscher fanden heraus, dass Regeln, die von der KI verlangen, Dinge über einen Zeitraum hinweg im Auge zu behalten (wie das Zählen von Wörtern oder das Beibehalten eines Musters), doppelt so schnell zusammenbrechen wie einfache Regeln (wie „verwende kein bestimmtes Wort“).
Vielleicht ist der interessanteste Teil dessen, was die Forscher zu beheben versuchten. Sie fragten: „Können wir der KI helfen, indem wir sie dazu bringen, im Voraus zu planen? Oder indem wir ihr erlauben, ihre Fehler zu korrigieren?“ Sie versuchten, der KI einen „Schmierblock“ (Scratchpad) zum Planen ihrer Antwort zu geben oder ihr zu erlauben, ihre eigenen Fehler zu korrigieren. Das Ergebnis? Es half ein kleines bisschen, vielleicht ermöglichte es der KI, ein oder zwei zusätzliche Regeln zu bewältigen, aber es stoppte den Zusammenbruch nicht. Die einzige echte Lösung, so legt das Paper nahe, besteht darin, die KI von vornherein besser darin zu machen, jeder einzelnen Regel zu folgen. Kein Maß an Planung oder Wiederholung kann das ändern, dass die Mathematik des Jonglierens zu vieler Dinge gleichzeitig letztlich zu einem Leistungsabfall führt.
Am Ende zieht dieses Paper eine klare Linie in den Sand. Für die klügsten getesteten KI-Modelle liegt die Grenze für zuverlässiges Befolgen von Multi-Regel-Anweisungen bei etwa 5 bis 6 Constraints. Jenseits dessen wird das System unzuverlässig, nicht weil die KI „dumm“ ist, sondern weil die schiere Anzahl der Dinge, die sie gleichzeitig im Kopf behalten muss, einen mathematischen Kollaps erzeugt. Es ist eine Erinnerung daran, dass selbst die fortschrittlichsten digitalen Köche eine Grenze haben, wie viele Rezepte sie gleichzeitig befolgen können, und wenn wir wollen, dass sie mehr leisten, müssen wir sie stärker bauen, nicht nur mehr Anweisungen geben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.