← Neueste Arbeiten
🤖 AI

SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

Dieses Paper führt SEFORA ein, ein groß angelegtes Korpus von Schüleraufsätzen mit echtem Feedback von Lehrkräften, sowie UniMatch, ein neuartiges Evaluierungsframework, das zeigt, dass aktuelle LLMs Schwierigkeiten haben, Feedback zu generieren, das mit den Prioritäten menschlicher Lehrkräfte übereinstimmt, wobei in umfangreichen Experimenten ein maximaler F1-Score von nur 0,4 erreicht wurde.

Ursprüngliche Autoren: Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

Veröffentlicht 2026-07-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind eine Lehrkraft, die einen Stapel Schüleraufsätze korrigiert. Sie müssen jeden Satz lesen, die guten Stellen finden, auf die verwirrenden Teile hinweisen und spezifische Notizen in den Rand schreiben, um dem Schüler zu helfen, sich zu verbessern. Es ist harte Arbeit, und dies für hunderte von Schülern gleichzeitig zu tun, ist für einen Menschen nahezu unmöglich.

In letzter Zeit haben wir versucht, „KI-Lehrkräfte“ (Large Language Models) bei dieser Aufgabe einzusetzen. Aber es gibt ein Problem: Wir wissen nicht wirklich, ob die KI guten Rat gibt, und wir haben kein gutes Lineal, um dies zu messen.

Dieses Paper stellt zwei Dinge vor, um dieses Problem zu lösen: eine riesige Bibliothek mit echten Lehreranmerkungen namens SEFORA und ein neues Messwerkzeug namens UNIMATCH.

1. Die Bibliothek: SEFORA (Die „Goldstandard“-Sammlung)

Betrachten Sie SEFORA als ein riesiges, organisiertes Sammelalbum.

  • Was darin enthalten ist: Es enthält 564 Entwürfe von Schüleraufsätzen (einige wurden einmal geschrieben, andere mehrfach überarbeitet) aus echten College-Kursen.
  • Das Besondere: Neben jedem Schüleraufsatz befinden sich die tatsächlichen Anmerkungen, die von echten menschlichen Professoren geschrieben wurden. Dies sind nicht nur rote Markierungen, die „falsch“ sagen. Es sind Notizen und Hervorhebungen, die Dinge sagen wie: „Dieser Charakter wirkt echt“, oder „Worauf bezieht sich ‚das‘ hier genau?“
  • Warum es wichtig ist: Vorher enthielten die meisten KI-Datensätze nur Bewertungen (wie „85/100“) oder einfache Fehler-Tags. SEFORA ist besonders, weil es die Nuancen davon einfängt, wie echte Lehrer mit Schülern sprechen, einschließlich der spezifischen Textstellen, auf die sie sich beziehen.

2. Das Lineal: UNIMATCH (Der „Feedback-Detektiv“)

Stellen Sie sich nun vor, Sie bitten eine KI, Feedback zu einem Aufsatz eines Schülers zu schreiben. Woher wissen Sie, ob es gut ist?

  • Der alte Weg: Man könnte die Worte der KI mit den Worten des Lehrers vergleichen, um zu sehen, ob sie ähnlich aussehen. Aber das ist so, als würde man einen Koch danach beurteilen, ob er dieselben Worte wie das Rezept verwendet hat, anstatt ob das Essen schmeckt. Wenn der Lehrer sagt „Machen Sie es kürzer“ und die KI sagt „Schneiden Sie das Fett weg“, könnte eine einfache Wortzählung sagen, dass sie unterschiedlich sind, obwohl sie dasselbe meinen.
  • Der neue Weg (UNIMATCH): Dieses Werkzeug agiert wie ein Detektiv. Es zerlegt sowohl die Notizen des Lehrers als auch die Notizen der KI in winzige, individuelle „Feedback-Einheiten“ (ein spezifischer Gedanke pro Einheit).
    • Schritt 1: Es teilt die Notizen in Stücke auf.
    • Schritt 2: Es fragt: „Entspricht dieses Stück aus der KI der Bedeutung eines Stücks vom Lehrer?“ (z. B. Passt „Schneiden Sie das Fett weg“ zu „Machen Sie es kürzer“?).
    • Schritt 3: Es nutzt ein intelligentes Matchingsystem (wie das Paar von Socken), um zu sehen, wie viele der wichtigen Punkte des Lehrers die KI gefunden hat und wie viele zusätzliche, nutzlose Punkte die KI erfunden hat.

3. Die große Entdeckung: Das „Schwätzer“-Problem

Die Forscher testeten 74 verschiedene Möglichkeiten, wie man KI-Modelle dazu auffordern kann, Feedback zu schreiben. Die Ergebnisse waren überraschend und etwas enttäuschend:

  • Die Punktzahl: Selbst die klügsten KI-Modelle erreichten nur einen Wert von etwa 0,4 von 1,0. Das bedeutet, dass sie den Großteil des spezifischen, hochpriorisierten Feedbacks, das eine menschliche Lehrkraft geben würde, verpassen.
  • Der Hauptverursacher: Der größte Grund für die niedrigen Punktzahlen war die Verbosity (die Verschlagwortigkeit bzw. Redseligkeit).
    • Die Analogie: Stellen Sie sich vor, ein Schüler bittet um Hilfe bei einer Matheaufgabe. Ein guter Tutor gibt einen klaren Hinweis. Die KI hingegen agiert wie ein nervöser Schwätzer. Sie gibt den einen Hinweis, fügt dann aber fünf weitere Vorschläge hinzu, die der Lehrer niemals gemacht hätte, oder wiederholt denselben Punkt auf drei verschiedene Arten.
    • Das Ergebnis: Weil die KI so viel „zusätzliches“ Rauschen erzeugt, sinkt ihre Präzision. Es ist wie ein Schüler, der einen 10-seitigen Aufsatz schreibt, um eine einseitige Frage zu beantworten; er liefert zwar die richtige Antwort, hat sie aber unter so viel Geschwafel begraben, dass es nicht mehr hilfreich ist.

Zusammenfassung

Das Paper zeigt uns, dass KI zwar Texte generieren kann, aber derzeit Schwierigkeiten hat, wie eine durchdachte menschliche Lehrkraft zu agieren. Sie neigt dazu, zu viel zu erklären und die spezifischen, hochwertigen Punkte zu verpassen, die echte Lehrkräfte priorisieren.

Um dies zu beheben, benötigen wir:

  1. Bessere Daten: Reale Beispiele dafür, wie Lehrer tatsächlich sprechen (was SEFORA bietet).
  2. Bessere Messung: Eine Möglichkeit zu beurteilen, ob die KI die richtigen Punkte trifft, und nicht nur die richtigen Wörter verwendet (was UNIMATCH bietet).

Bis die KI lernt, prägnant zu sein und die richtigen Ziele zu treffen, ist sie nicht bereit, die menschliche Note im Klassenzimmer zu ersetzen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →