AI-Assisted Grading in Biochemistry: Automated Long Answer Question Scoring with Expert-Level Accuracy
Diese Studie zeigt, dass ein KI-gestütztes Tool unter Verwendung von GPT-4 eine fachlich versierte Genauigkeit erreichen und konsistentes, auf Rubriken basierendes Feedback für die Bewertung von Langantwortfragen im Bereich der Biochemie im Grundstudium bereitstellen kann, wodurch die Herausforderungen durch große Klassengrößen und Lehrkräftemangel effektiv adressiert werden.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
In der Welt der medizinischen Ausbildung bedeutet das Lehren von Biochemie mehr als nur das Auswendiglernen von Fakten darüber, wie der Körper Energie verarbeitet. Es erfordert von den Studierenden, tiefgründig zu denken und komplexe Prozesse in ihren eigenen Worten zu erklären. Um dieses Verständnis zu messen, setzen Dozenten oft Langantwortfragen ein, bei denen ein Student eine detaillierte Erklärung eines biologischen Mechanismus niederschreiben muss. Diese Fragen sind kraftvolle Werkzeuge für das Lernen, da sie die Studierenden dazu zwingen, ihre Gedanken zu ordnen und wahre Meisterschaft zu demonstrieren. Das Korrigieren dieser Fragen ist jedoch eine schwere Last. Wenn eine Klasse groß wird, kann ein einzelner Lehrer nicht die notwendige Zeit aufbringen, um jeden Essay sorgfältig zu lesen, personalisiertes Feedback zu geben und sicherzustellen, dass jeder Student fair nach denselben Standards beurteilt wird. Die Herausforderung ist nicht nur das Arbeitsvolumen, sondern die Notwendigkeit der Konsistenz; ein Lehrer bewertet vielleicht ein bestimmtes Detail, das ein anderer übersieht, was zu unebenen Ergebnissen führt.
Ein Team von Forschern aus medizinischen Hochschulen in Indien setzte sich zum Ziel zu prüfen, ob eine neue Art von Computerprogramm dieses Problem lösen könnte. Sie wollten wissen, ob ein System der künstlichen Intelligenz in der Lage sei, diese langen Essays zu lesen, sie mit derselben Geschicklichkeit wie ein erfahrener menschlicher Professor zu bewerten und genau zu erklären, warum ein Student eine bestimmte Punktzahl erhalten hat. Die Forscher entwickelten ein Werkzeug, das wie ein digitaler Prüfer fungiert. Anstatt nur Wörter zu zählen oder nach Schlüsselwörtern zu suchen, wurde diesem System ein spezifischer Satz von Regeln vorgegeben, bekannt als Rubrik, der eine perfekte Antwort in kleinere Teile zerlegt. Dem Computer wurde angewiesen, nach diesen spezifischen Teilen in dem Text eines Studenten zu suchen, Punkte für das Gefundene zu vergeben und dann vorzuschlagen, wie die Antwort verbessert werden könnte. Das System nutzte ein hochentwickeltes Sprachmodell, eine Art von Computerprogramm, das auf riesigen Mengen an Text trainiert wurde, um die menschliche Sprache zu verstehen, um diese Aufgabe auszuführen.
Die Studie umfasste dreihundert Studenten, die Antworten auf zwei verschiedene biochemische Fragen geschrieben hatten. Die Forscher sammelten diese sechshundert Antworten und ließen sie zweimal bewerten: einmal durch den Computer und einmal durch zwei menschliche Experten, die über jahrelange Erfahrung in der Lehre des Fachgebiets verfügen. Die menschlichen Lehrer verwendeten denselben Satz von Regeln, um die Arbeiten zu bewerten. Um sicherzustellen, dass der Computer nicht nur rät, baten die Forscher ihn, jede Arbeit fünfmal mit leichten Variationen zu bewerten und anschließend den mittleren Wert als Endergebnis zu nehmen. Diese Methode half dabei, etwaige zufällige Fehler des Computers zu glätten. Das Team verglich dann die vom Computer vergebenen Punktzahlen mit den Punktzahlen der zwei menschlichen Lehrer, um zu sehen, wie eng sie übereinstimmten.
Die Ergebnisse zeigten ein erstaunliches Maß an Übereinstimmung zwischen der Maschine und den Menschen. Die vom System der künstlichen Intelligenz vergebenen Punktzahlen deckten sich fast perfekt mit den von den menschlichen Experten vergebenen Punktzahlen. Wenn die Forscher maßen, wie eng die Noten des Computers den Noten der Lehrer folgten, deuteten die Zahlen auf eine exzellente Übereinstimmung hin, die weit über dem liegt, was normalerweise beobachtet wird, wenn zwei verschiedene Menschen dieselben Arbeiten bewerten. Der Computer vergab nicht konsistent höhere oder niedrigere Punktzahlen als die Lehrer; sein Durchschnittswert war nahezu identisch mit dem menschlichen Durchschnitt. Tatsächlich war die Bewertung des Computers so konsistent mit den Experten, dass er als zuverlässiger Partner im Klassenzimmer betrachtet werden kann. Das System lieferte auch spezifische Kommentare dazu, wo die Antwort eines Studenten schwach war, und bot ein Detailniveau, das den Studenten hilft, aus ihren Fehlern zu lernen.
Diese Arbeit legt nahe, dass künstliche Intelligenz die schwierige Aufgabe bewältigen kann, komplexe schriftliche Antworten in den Naturwissenschaften zu bewerten, ohne die Nuancen zu verlieren, die menschliche Lehrer bieten. Die Forscher fanden heraus, dass der Computer, indem man ihm eine klare Anweisung gab, wonach er suchen sollte, die Arbeit der Studenten mit fachlicher Genauigkeit bewerten konnte. Dies bedeutet nicht, dass der Computer den Lehrer ersetzt, sondern vielmehr, dass er die schwere Arbeit der Korrektur übernehmen kann, wodurch menschliche Pädagogen entlastet werden, um sich auf das Lehren und Mentoring zu konzentrieren. Die Studie zeigt, dass dieser Ansatz bereit ist, in echten Klassenzimmern eingesetzt zu werden, um die Leistungsbewertung fairer und effizienter zu gestalten und sicherzustellen, dass jeder Student eine Note erhält, die sein Verständnis des Materials wirklich widerspiegelt.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.