← Neueste Arbeiten
💬 NLP

CodeGENCAT: Generative Computerized Adaptive Testing for Open-ended Coding Problems

Das Papier schlägt CodeGENCAT vor, ein generatives computergestütztes adaptives Testframework, das ein generatives Item-Response-Theory-Modell nutzt, um Schülercode-Antworten vorherzusagen und Fragen basierend auf der Vielfalt des Programmierstils und der Unsicherheit der Antworten auszuwählen, wodurch es traditionelle Baselines bei der Bewertung von Programmierkenntnissen übertrifft.

Ursprüngliche Autoren: Wanyong Feng, Alexander Scarlatos, Ruochen Sun, Andrew Lan

Veröffentlicht 2026-05-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Wanyong Feng, Alexander Scarlatos, Ruochen Sun, Andrew Lan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind eine Lehrkraft, die herausfinden möchte, wie gut ein Schüler genau im Programmieren ist. Bei einer traditionellen Prüfung stellt die Lehrkraft eine Frage, der Schüler antwortet, und die Lehrkraft bewertet dies einfach als „Richtig" oder „Falsch". Basierend auf dieser einzelnen Bewertung wählt die Lehrkraft die nächste Frage aus: Wenn der Schüler sie richtig beantwortet hat, ist die nächste schwieriger; wenn falsch, ist sie leichter.

Das Problem mit dem alten Weg
Die Arbeit argumentiert, dass dieses „Richtig/Falsch"-System eine Menge nützlicher Informationen verwirft. Stellen Sie sich vor, zwei Schüler scheitern beide an einem Programmieraufgabe.

  • Schüler A machte einen winzigen Tippfehler (ein fehlendes Semikolon).
  • Schüler B schrieb Code, der völlig falscher Logik folgte.

Bei einer traditionellen Prüfung sind beide einfach nur „Falsch". Die Lehrkraft kann den Unterschied nicht erkennen und kann daher die nächste Frage nicht anpassen, um dem spezifischen Schüler zu helfen. Es ist wie bei einem Arzt, der einen gebrochenen Arm und einen Kopfschmerz mit exakt derselben Pille behandelt, nur weil der Patient sagte: „Ich fühle mich schlecht."

Die Lösung: CodeGENCAT
Die Autoren schlagen ein neues System namens CodeGENCAT vor. Anstatt nur darauf zu warten, dass ein Schüler antwortet, nutzt dieses System einen „Digitalen Zwilling" (eine KI), um vorherzusagen, was der Schüler schreiben würde, bevor der Schüler tatsächlich antwortet.

So funktioniert es, Schritt für Schritt, mit einer Koch-Analogie:

1. Der „Digitale Zwilling"-Koch (Das GIRT-Modell)

Stellen Sie sich vor, Sie möchten wissen, wie gut ein Schüler im Kochen ist. Anstatt ihn sofort zu bitten, eine ganze Mahlzeit zu kochen, haben Sie einen superklugen KI-Koch, der das aktuelle Können des Schülers kennt.

  • Wenn der Schüler ein Anfänger ist, sagt die KI voraus, dass er Gemüse ungleichmäßig schneiden oder vergessen würde, die Suppe zu salzen.
  • Wenn der Schüler ein Experte ist, sagt die KI voraus, dass er präzise Messerfertigkeiten und perfekte Würzung anwenden würde.

In der Arbeit wird diese KI als Generatives Item-Response-Theory-Modell (GIRT) bezeichnet. Sie nimmt das geschätzte Wissen des Schülers entgegen und generiert ein Code-Stück, das exakt so aussieht, wie es dieser spezifische Schüler schreiben würde. Sie rät nicht nur „Richtig" oder „Falsch"; sie generiert den tatsächlichen Code, einschließlich der spezifischen Fehler und Irrtümer, die der Schüler wahrscheinlich machen wird.

2. Die „Menüauswahl" (Frageauswahl)

Sobald die KI vorhergesagt hat, was der Schüler schreiben würde, muss das System entscheiden: „Welche Frage sollten wir dem Schüler als Nächstes stellen, um am meisten zu lernen?"

Die Arbeit stellt drei Möglichkeiten vor, die nächste Frage auszuwählen, wie ein Koch, der die nächste Zutat zum Testen auswählt:

  • Der Unsicherheits-Koch: Wählt eine Frage, bei der die KI am meisten verwirrt ist darüber, ob der Schüler sie richtig oder falsch beantworten wird (eine 50/50-Gewissheit). Dies ist die klassische „Goldilocks"-Zone – nicht zu einfach, nicht zu schwer.
  • Der Diversitäts-Koch: Wählt eine Frage, bei der die KI glaubt, dass der Schüler viele unterschiedliche Arten von Code schreiben könnte. Wenn die KI unsicher ist, wie der Schüler sie lösen wird, ist diese Frage sehr aussagekräftig.
  • Der Informations-Koch: Wählt die Frage, die, basierend auf dem vorhergesagten Code, dem Verständnis des Systems vom Schüler den größten „Schock" versetzt und hilft, die Fähigkeitsabschätzung am schnellsten zu verfeinern.

3. Das Training (Beibringen der KI)

Um sicherzustellen, dass dieser „Digitale Zwilling" genau ist, haben die Autoren ihn in zwei Phasen trainiert:

  1. Überwachtes Feinabstimmen (SFT): Sie lehrten die KI, die vergangenen Antworten eines Schülers zu betrachten und zu lernen, diese nachzuahmen.
  2. Direkte Präferenzoptimierung (DPO): Dies ist das Geheimrezept. Sie stellten fest, dass die KI manchmal faul wurde und auch für Anfänger denselben „perfekten" Code schrieb. Also lehrten sie die KI, ehrlich zu sein: „Wenn der Schüler ein Anfänger ist, müssen Sie Code mit Fehlern generieren." Dies stellt sicher, dass die Vorhersagen der KI realistisch und vielfältig sind.

Die Ergebnisse

Die Forscher testeten dies an realen Programmierdatensätzen (Java und Python). Sie stellten fest, dass CodeGENCAT viel besser darin war, das wahre Können eines Schülers herauszufinden als traditionelle Methoden, insbesondere in den ersten paar Fragen der Prüfung.

  • Die Analogie: Es ist wie der Unterschied zwischen einer Lehrkraft, die fragt: „Haben Sie es richtig bekommen?" und einer Lehrkraft, die sagt: „Lassen Sie mich raten, genau wie Sie versucht haben, es zu lösen, und dann werde ich die perfekte Folgefrage stellen, um Ihr spezifisches Missverständnis zu beheben."

Wichtige Erkenntnisse

  • Schauen Sie nicht nur auf die Punktzahl: Die Arbeit behauptet, dass das Betrachten des tatsächlichen Codes (selbst vorhergesagten Codes) viel reichhaltigere Informationen liefert als nur ein „Bestanden/Nicht bestanden"-Label.
  • Früherkennung ist wichtig: Das System ist zu Beginn einer Prüfung am mächtigsten und hilft, die Stärken und Schwächen eines Schülers viel schneller zu identifizieren als alte Methoden.
  • Sicherheit: Das System schafft es zudem, die Prüfung sicher zu halten und sicherzustellen, dass nicht alle Schüler exakt dieselben Fragen erhalten, was ein häufiges Problem bei adaptiven Prüfungen ist.

Kurz gesagt, nutzt CodeGENCAT KI, um den Geist eines Schülers zu simulieren, wodurch sich die Prüfung nicht nur daran anpasst, ob sie es richtig hatten, sondern wie sie denken, was zu einer viel genaueren und personalisierten Bewertung führt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →