Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment
Diese Studie zeigt, dass die Wahl des LLM und des konversationellen Kontextes die semantische Konsistenz der generierten Antworten signifikant beeinflusst, was darauf hindeutet, dass aktuelle Prompting-Strategien unzureichend sind, um stabile, vergleichbare Antworten über verschiedene Modelle hinweg in konversationsbasierten Beurteilungen zu gewährleisten.
Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der modernen Welt der Bildung stellt die Messung dessen, wie gut Menschen kommunizieren und zusammenarbeiten, seit langem ein hartnäckiges Problem dar. Im Gegensatz zu einem Mathematiktest, bei dem eine einzelne Zahl beweist, dass ein Schüler die Antwort kennt, geschehen Fähigkeiten wie Zusammenarbeit im unordentlichen, fließenden Hin und Her eines Gesprächs. Um dies fair zu messen, müssen Pädagogen sicherstellen, dass jeder Schüler vor einer ähnlichen Herausforderung steht, selbst wenn das Gespräch einen anderen Weg nimmt. Vor Kurzem hat die künstliche Intelligenz einen neuen Weg aufgezeigt, dieses Problem zu lösen. Durch den Einsatz von Computerprogrammen, die sprechen und zuhören können, können Schulen virtuelle Partner für Schüler schaffen, mit denen sie üben können. Diese Programme können sich an das anpassen, was ein Schüler sagt, und so ein natürliches Gespräch erzeugen, das offenlegt, wie gut der Schüler denkt und arbeitet. Es ist jedoch eine leise Sorge unter Experten gewachsen: Wenn sich das Computerprogramm ändert, ändert sich dann auch das Gespräch? Wenn ein Schüler heute einen Test mit einer Version der Software absolviert und ein anderer Schüler nächstes Jahr mit einer neueren Version, werden sie dann die gleichen Fragen auf die gleiche Weise beantworten? Diese Frage rührt an den Kern der Fairness. Wenn sich die Antworten des Computers je nach dem, welches Modell sie ausführt, stark verändern, könnte der Test aufhören, die Fähigkeit des Schülers zu messen, und stattden die Eigenheiten der Software messen.
Ein Forscher beim Educational Testing Service machte sich daran, genau dieses Problem zu untersuchen. Er wollte wissen, ob die Bedeutung der Antwort eines Computers gleich bleibt, wenn die zugrunde liegende Software sich ändert. Um dies herauszufinden, erfand er keine künstlichen Gespräche. Stattdessen nahm er echte Nachrichten aus vergangenen Online-Science-Projekten, bei denen zwei Personen zusammenarbeiteten, um Probleme zu lösen. Er wählte 61 spezifische Momente aus diesen Chats aus, in denen eine Person etwas Wichtiges gesagt hatte und die andere Person eine klare, hilfreiche Antwort gegeben hatte. Der Forscher bat vier verschiedene Versionen eines Large Language Model – einer Art künstlicher Intelligenz, die darauf ausgelegt ist, menschliche Sprache zu verstehen und zu erzeugen – dieselben 61 Nachrichten zu beantworten. Er führte dieses Experiment zweimal für jede Nachricht durch. Beim ersten Durchlauf sah der Computer nur die einzelne Nachricht, die er beantworten sollte. Beim zweiten Durchlauf sah er diese Nachricht plus die gesamte bisherige Gesprächshistorie. Für jede einzelne Nachricht generierte jedes Computermodell 100 verschiedene Antworten, um zu sehen, wie sehr die Antworten variierten.
Die Ergebnisse zeigten, dass sowohl die Wahl des Computermodells als auch der Gesprächskontext die Ähnlichkeit der Antworten beeinflussen. Als der Forscher die 100 Antworten eines einzelnen Modells verglich, stellte er fest, dass die Antworten einander recht ähnlich waren, wobei die Ähnlichkeitswerte zwischen 0,715 und 0,795 lagen. Aber als er die Antworten eines Modells mit den Antworten eines anderen Modells verglich, sank die Ähnlichkeit signifikant. Es war, als hätte jedes Modell seine eigene unverwechselbare Stimme und seine eigene Art zu denken. Der Effekt des Hinzufügens der Gesprächshistorie hing vom spezifischen verwendeten Modell ab; in einigen Fällen verbesserte das Einbeziehen der Chat-Historie die Übereinstimmung der Antworten mit menschlichen Antworten leicht, aber es führte nicht in allen Fällen dazu, dass die Modelle einander stärker zustimmten. Die Studie fand auch heraus, dass neuere Modelle aus derselben Softwarefamilie dazu neigten, untereinander ähnlichere Antworten zu produzieren als zu älteren, anderen Modellen. Dies deutet darauf hin, dass der „Stammbaum“ der Software eine signifikante Rolle dabei spielt, wie sie neben den spezifischen Anweisungen agiert, die ihr gegeben werden.
Vielleicht am wichtigsten ist die Erkenntnis des Forschers, dass es allein nicht ausreichen mag, sich auf Prompting und den Gesprächskontext zu verlassen, um ein hochgradig ähnliches Antwortverhalten zu gewährleisten, wenn sich das zugrunde liegende LLM ändert. Selbst wenn die Modelle mit demselben Prompt und derselben Gesprächshistorie gefütert wurden, führte die Wahl des Modells immer noch zu signifikanten Unterschieden im semantischen Inhalt der Antworten. Die Studie legt nahe, dass es riskant ist, sich auf die natürliche Flexibilität dieser künstlichen Intelligenzsysteme zu verlassen, wenn es um Hochleistungstests geht. Wenn ein Test darauf angewiesen ist, dass der Computer das Gespräch auf Kurs hält, und der Computer seinen Stil jedes Mal ändert, wenn er aktualisiert wird, könnten die Testergebnisse unzuverlässig werden. Der Forscher kam zu dem Schluss, dass man, um ein faires Testsystem aufzubauen, das Bestand hat, sich nicht einfach darauf verlassen kann, dass die Software von selbst das Richtige tut. Stattdessen müssen wir zusätzliche Kontrollschichten in das System einbauen – wie Regeln oder Vorlagen –, die sicherstellen, dass die Antworten des Computers innerhalb eines sicheren, konsistenten Bereichs bleiben, unabhängig davon, welche Version der Software darunter läuft. Ohrem diese Sicherheitsvorkehrungen fehlt, könnte die rasante Entwicklung der künstlichen Intelligenz genau die Fairness untergraben, die das Bildungswesen zu schützen vorgibt.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.