Can AI replace Teachers? Comparing AI and Human Teachers’ ratings and feedback on students’ essays
Diese Studie stellt fest, dass KI-Tools und menschliche Lehrkräfte zwar vergleichbare Gesamtbewertungen für ESL-Essays liefern, sie sich jedoch signifikant in der Bewertungskonsistenz und dem Feedback-Fokus unterscheiden, was zu dem Schluss führt, dass KI als ergänzendes Hilfsmittel und nicht als Ersatz für menschliche Pädagogen dienen sollte.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich ein Klassenzimmer vor, in dem zwei verschiedene „Richter“ denselben Stapel von Schüleraufsätzen bewerten. Ein Richter ist ein Team aus erfahrenen menschlichen Lehrkräften, und der andere ist ein Panel aus drei KI-Robotern (ChatGPT, Bing und CiCi). Die Forscher wollten herausfinden: Sind sich diese Richter bei den Bewertungen einig? Geben sie die gleiche Art von Ratschlägen? Und können die Roboter die Jobs der Lehrer übernehmen?
Hier ist das Ergebnis der Studie, einfach aufgeschlüsselt:
1. Die Bewertung: Ähnliche Zahlen, unterschiedliche Logik
Stellen Sie sich den Bewertungsprozess wie zwei Personen vor, die einen Kochwettbewerb bewerten.
- Das Ergebnis: Sowohl die menschlichen Richter als auch die KI-Richter gaben den Aufsätzen etwa die gleiche Durchschnittsbewertung (beide landeten in der Kategorie „Befriedigend“).
- Der Haken: Obwohl die Endzahlen ähnlich aussah, waren sich die Richter sich nicht wirklich einig darüber, welcher Aufsatz besser war. Wenn man sie nebeneinander stellen würde, passten ihre Bewertungen nicht gut zusammen. Es ist wie bei zwei Personen, die einen Film bewerten; beide geben vielleicht eine „7 von 10“ ab, aber die eine Person hat vielleicht die schauspielerische Leistung geliebt, während die andere die Handlung hasste.
- Das Urteil: Die KI war konsistent mit sich selbst (die drei KIs stimmten sehr gut untereinander überein), und die Menschen waren konsistent untereinander. Aber die Menschen und die KIs sprachen unterschiedliche „Bewertungssprachen“.
2. Das Feedback: Der „Strenge Coach“ vs. der „Höfliche Mentor“
Hier verhielten sich die beiden Gruppen sehr unterschiedlich. Stellen Sie sich das Feedback wie einen Coach vor, der mit einem Athleten spricht.
Die menschlichen Lehrkräfte (Die strengen Coaches):
- Fokus: Sie waren voll und ganz auf die Regeln konzentriert. Sie wiesen auf Grammatikfehler, Rechtschreibfehler und Formatierungsprobleme (wie Seitenränder oder Einrückungen) hin.
- Stil: Ihr Feedback war direkt und manchmal schroff. Sie sagten Dinge wie: „Falsche Zeitform“ oder „Du benötigst eine These“.
- Die Lücke: Manchmal, wenn ein Aufsatz „ganz okay“ war, gaben die menschlichen Lehrkräfte überhaupt kein Feedback. Sie waren vielleicht müde oder konzentrierten sich nur auf die größten Fehler.
Die KI-Tools (Die höflichen Mentoren):
- Fokus: Sie betrachteten das große Ganze. Sie sprachen über die Klarheit der Ideen, den Fluss der Geschichte und den allgemeinen Inhalt, zusätzlich zur Grammatik.
- Stil: Sie waren viel ausgewogener. Sie nutzten die „Sandwich-Methode“: Sie begannen mit Lob („Tolle Ideen!“), fügten die Kritik hinzu („Aber die Grammatik muss verbessert werden“) und endeten mit Ermutigung. Sie gaben niemals einen Aufsatz mit null Feedback zurück; jeder einzelne erhielt einen Kommentar.
- Der Unterschied: Die KI war wie ein Roboter, der immer daran dachte, nett zu sein und alle Bereiche abzudecken, während die menschliche Lehrkraft wie ein beschäftigter Experte war, der die kritischen Fehler korrigierte, aber den Smalltalk vielleicht wegließ.
3. Die große Frage: Kann KI Lehrer ersetzen?
Die Studie kommt zu einer klaren Antwort: Nein, aber sie sind großartige Assistenten.
- Warum nicht ersetzen? Die KI kann noch nicht die „Seele“ eines Aufsatzes oder den spezifischen Kontext im Leben eines Schülers verstehen. Die geringe Übereinstimmung bei den Bewertungen bedeutet, dass die KI noch zu unvorhersehbar ist, um allein der endgültige Richter zu sein. Sie braucht einen Menschen, der ihre Arbeit überprüft.
- Warum nutzen? Die KI ist hervorragend darin, die „schwere Arbeit“ zu erledigen. Sie kann schnell bewerten, konsistentes Feedback zur Struktur geben und immer höflich bleiben. Dies hilft Lehrkräften, Zeit zu sparen.
Das abschließende Fazit
Betrachten Sie die KI nicht als Ersatz für die Lehrkraft, sondern als eine superstarke Lehrassistenz.
Wenn eine Lehrkraft 100 Aufsätze bewertet, kann die KI als erster Filter fungieren, der Grammatikprobleme hervorhebt und Verbesserungen zur Organisation vorschlägt. Die menschliche Lehrkraft muss jedoch weiterhin der „Oberrichter“ sein, um sicherzustellen, dass das Feedback Sinn ergibt, um die einzigartige Situation des Schülers zu verstehen und um die menschliche Verbindung bereitzustellen, die ein Roboter nicht leisten kann.
Kurz gesagt: KI ist ein großartiges Werkzeug, um Lehrkräften zu helfen, aber sie sollte nicht dazu zugelassen werden, sie zu ersetzen. Die menschliche Note ist immer noch der wichtigste Teil der Gleichung.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.