← Neueste Arbeiten
💬 NLP

Conv-to-Bench: Evaluating Language Models Via User-Assistant Dialogues In Code Tasks

Conv-to-Bench ist ein skalierbares, mehrstufiges Framework, das authentische Mehr-Turn-Dialoge zwischen Benutzer und Assistent automatisch in strukturierte, überprüfbare Evaluierungsbenchmarks für Codierungsaufgaben umwandelt und dabei eine nahezu perfekte Übereinstimmung mit menschlich verfassten Standards erreicht, während die Abhängigkeit von arbeitsintensiver Expertenkuratierung erheblich verringert wird.

Ursprüngliche Autoren: Victor M. dos Santos, Andre C. Castro, Samuel L. de S. Toledo, Bruno M. L. Calura, Lisandra C. de M. Menezes, Raul C. R. Mata, Telma W. de L. Soares, Bryan L. M. de Oliveira

Veröffentlicht 2026-05-27
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Victor M. dos Santos, Andre C. Castro, Samuel L. de S. Toledo, Bruno M. L. Calura, Lisandra C. de M. Menezes, Raul C. R. Mata, Telma W. de L. Soares, Bryan L. M. de Oliveira

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, wie man Computercode schreibt. Um dies gut zu tun, benötigen Sie einen Test, um zu sehen, ob der Roboter besser wird. Traditionell ist das Erstellen dieser Tests wie die Einstellung eines Teams von Meisterköchen, die 1.000 einzigartige, perfekte Rezepte von Hand schreiben. Es ist teuer, langsam und schwer skalierbar. Wenn Sie einen neuen Test wünschen, müssen Sie warten, bis die Köche ihn erneut schreiben.

Dieser Artikel stellt eine neue Methode zur Erstellung dieser Tests vor, die Conv-to-Bench genannt wird. Anstatt Köche einzustellen, die neue Rezepte von Grund auf neu schreiben, entschieden sich die Forscher, die „Küchenprotokolle" echter Menschen zu untersuchen, die mit KI-Assistenten sprechen. Sie stellten die Frage: Können wir diese chaotischen, realen Gespräche in einen perfekten Test verwandeln?

So haben sie es getan, aufgeteilt in einfache Schritte:

1. Das Problem: Die „Köche"-Engpass

Derzeit werden die besten Tests für KI (wie BigCodeBench) von menschlichen Experten geschrieben. Es dauert ein Jahr, bis sie einen guten Test erstellen. Es ist wie der Versuch, eine neue Stadt zu bauen, indem jeder einzelne Ziegel von Hand gemeißelt wird. Die Qualität ist hoch, aber es ist zu langsam, um mit der Geschwindigkeit Schritt zu halten, mit der KI lernt.

2. Die Lösung: Gewinnung der „Küchenprotokolle"

Die Forscher erkannten, dass Millionen von Menschen jeden Tag mit KI sprechen und um Hilfe beim Code bitten. Diese Gespräche sind Goldminen.

  • Das Szenario: Ein Benutzer fragt: „Schreibe ein Python-Skript." Die KI schreibt etwas Falsches. Der Benutzer sagt: „Nein, es stürzt ab, wenn ich es ausführe. Korrigiere die Schleife." Die KI versucht es erneut. Der Benutzer sagt: „Toll, füge jetzt einen Kommentar hinzu."
  • Die Erkenntnis: Dieses Hin und Her ist nicht nur ein Chat; es ist ein Bauplan. Die endgültige Anfrage des Benutzers, kombiniert mit all seinen Korrekturen, ist tatsächlich ein sehr detaillierter, perfekter Satz von Anweisungen dafür, wie eine gute Code-Lösung aussieht.

3. Der Prozess: Chat in eine Checkliste verwandeln

Das Team entwickelte ein System (Conv-to-Bench), das wie ein superkluger Redakteur funktioniert. Es nimmt diese langen, chaotischen Gespräche und macht drei Dinge:

  • Filtert: Es wirft die Chats über Kochen oder Wetter weg und behält nur die über Programmieren.
  • Synthetisiert: Es liest das gesamte Gespräch und schreibt eine einzige, perfekte „Master-Anweisung" auf, die die ursprüngliche Anfrage mit allen Korrekturen kombiniert, die der Benutzer angefordert hat.
  • Erstellt eine Checkliste: Es verwandelt diese Anweisung in eine einfache „Ja/Nein"-Checkliste. Zum Beispiel: „Führt der Code ohne Fehler aus?" „Handhabt er die Schleife korrekt?" „Gibt es Kommentare?"

4. Das Experiment: Hat es funktioniert?

Sie testeten dieses neue System, indem sie sahen, ob es KI-Modelle auf die gleiche Weise rangieren konnte wie die teuren, von Menschen geschriebenen Tests.

  • Das Ergebnis: Es funktionierte unglaublich gut. Als sie ihre KI-generierten Tests mit dem von Menschen geschriebenen „Goldstandard" (BigCodeBench) verglichen, stimmten die Ranglisten fast perfekt überein. In einigen Fällen betrug die Korrelation 1,0 von 1,0 – was bedeutet, dass das neue System zu 100 % mit den menschlichen Experten übereinstimmte.
  • Die „Feedback"-Wendung: Sie testeten zwei Versionen. Eine verwendete nur die endgültigen Anweisungen, die andere verwendete die Anweisungen plus die Beschwerden und Korrekturen des Benutzers (das Feedback). Überraschenderweise war die Version mit nur den Anweisungen tatsächlich stabiler und zuverlässiger. Das Feedback des Benutzers fügte manchmal „Rauschen" (Verwirrung) hinzu, anstatt Klarheit zu schaffen, wie ein Kunde, der zu oft seine Meinung ändert.

5. Das Urteil

Der Artikel kommt zu dem Schluss, dass wir nicht warten müssen, bis menschliche Experten jeden neuen Test schreiben. Wir können die natürlichen, chaotischen Gespräche nutzen, die Menschen bereits mit KI führen, um automatisch hochwertige, zuverlässige Tests zu erstellen.

Kurz gesagt:
Denken Sie an traditionelles Testen als Handmalerei eines Meisterwerks (langsam, teuer, perfekt).
Conv-to-Bench ist wie die Verwendung eines High-Tech-Scanners, um Millionen von groben Skizzen, die von der Öffentlichkeit erstellt wurden, in ein perfektes, standardisiertes Gemälde zu verwandeln. Es ist schneller, billiger und überraschend genau, sofern Sie sich an die Hauptanweisungen halten und die chaotischen Kritzeleien am Rand ignorieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →