← Neueste Arbeiten
🤖 machine learning

"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification

Diese Arbeit untersucht die Divergenz zwischen Menschen und großen Sprachmodellen bei der verbalen Unsicherheitsquantifizierung durch die Einführung eines optimierungsbasierten Algorithmus, METHODNAME, der optimale Wahrscheinlichkeitsabbildungen für verbale Marker direkt aus den Modellausgaben lernt, um systematische Konfidenzdifferenzen aufzuzeigen, ohne auf wiederholtes Sampling angewiesen zu sein.

Ursprüngliche Autoren: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

Veröffentlicht 2026-10-02
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Wenn wir sprechen, sichern wir uns oft ab. Wir sagen, etwas sei „wahrscheinlich“, „möglich“ oder „fast sicher“, und nutzen diese Wörter, um zu signalisieren, wie viel wir wirklich wissen. Diese Fähigkeit, Zweifel auszudrücken, ist eine Form der Metakognition – eine mentale Überprüfung, bei der wir die Grenzen unseres eigenen Wissens anerkennen. Es ist ein entscheidender Teil der menschlichen Kommunikation, der es uns ermöglicht, Unsicherheit zu navigieren, ohne so zu tun, als hätten wir Antworten, die wir nicht besitzen. In der Welt der künstlichen Intelligenz, speziell bei großen Sprachmodellen, wird genau diese Fähigkeit zu einem kritischen Sicherheitsmerkmal. Diese Modelle können manchmal selbstbewusst klingende, aber faktisch falsche Informationen generieren, ein Phänomen, das als Halluzination bekannt ist. Um diesen Systemen zu vertrauen, insbesondere in sensiblen Bereichen wie der Medizin oder dem Recht, müssen wir wissen, wann sie sich unsicher sind. Die Herausforderung besteht darin, herauszufinden, ob die Wörter, die eine KI verwendet, um Zweifel auszudrücken, für einen menschlichen Zuhörer dasselbe bedeuten wie für die Maschine selbst.

Ein Team von Forschern unternahm den Versuch zu untersuchen, ob die verbale Unsicherheit, die große Sprachmodelle ausdrücken, mit dem menschlichen Verständnis übereinstimmt. Sie begannen damit, eine massive Sammlung darüber zu sammeln, wie Menschen Phrasen wie „sehr wahrscheinlich“ oder „unsicher“ interpretieren. Basierend auf Jahrzehnten der psychologischen und Entscheidungswissenschaften stellten sie einen Referenzleitfaden zusammen, der diese gängigen Phrasen spezifischen numerischen Wahrscheinlichkeiten zuordnet. Beispielsweise entspricht die Phrase „sehr wahrscheinlich“ im menschlichen Geist einem hohen Grad an Zuversicht, während „möglich“ irgendwo in der Mitte liegt. Die Forscher testeten dann mehrere fortgeschrittene Sprachmodelle, indem sie sie baten, Fragen zu beantworten und ihre Zuversicht unter Verwendung derselben natürlichen Sprachphrasen zu erklären. Sie verglichen die Antworten der Modelle mit dem menschlichen Referenzleitfaden, um zu sehen, ob die Maschinen dieselbe Sprache wie ihre Nutzer sprachen.

Die Ergebnisse zeigten eine signifikante Diskrepanz. Obwohl die Modelle die Wörter verwenden konnten, ordneten sie ihnen andere Grade an Gewissheit zu als Menschen. Wenn ein Mensch beispielsweise „sehr wahrscheinlich“ hört, interpretiert er dies als eine starke Wahrscheinlichkeit, aber die Modelle in der Studie nutzten diese Phrase oft, um Situationen zu beschreiben, in denen sie sich eigentlich recht unsicher waren. Umgekehrt könnten die Modelle ein hohes Maß an Zuversicht für Phrasen ausdrücken, die Menschen als bloße Vermutungen betrachten. Diese Diskrepanz bedeutet, dass es irreführend sein kann, einfach die Ausgabe eines Modells zu lesen und davon auszugehen, dass seine verbalen Signale seinen internen Zustand widerspiegeln. Die Studie zeigte, dass es nicht ausreichte, sich auf ein von Menschen gemachtes Wörterbuch für Unsicherheitswörter zu verlassen, um die Zuversicht einer Maschine genau zu erfassen; die Modelle hatten ihre eigene, ganz eigene interne Logik dafür, was diese Wörter bedeuteten.

Um diese Lücke zu schließen, entwickelten die Forscher eine neue Methode namens VOCAL. Anstatt die Modelle zu zwingen, sich menschlichen Definitionen anzupassen, lernt dieser Ansatz die spezifische Bedeutung von Unsicherheitswörtern direkt aus dem Verhalten des Modells selbst. Das System analysiert tausende der Antworten des Modells und stellt fest, welche Phrasen es verwendet, wenn es richtig liegt und welche es verwendet, wenn es falsch liegt. Es erstellt daraufhin eine maßgeschneiderte Karte, die die spezifischen verbalen Gewohnheiten des Modells in genaue Wahrscheinlichkeitswerte übersetzt. Dieser Prozess beinhaltet eine mathematische Optimierung, die die Daten glättet und sicherstellt, dass ähnlich klingende Phrasen ähnliche Werte erhalten, selbst wenn das Modell sie selten verwendet. Durch die Anpassung der Interpretation an die spezifische Maschine schafft die Methode einen wesentlich zuverlässigeren Weg, um zu erkennen, wann sich das Modell unsicher ist.

Die Experimente demonstrierten, dass dieser maßgeschneiderte Ansatz signifikant besser funktioniert, als zu versuchen, einen menschlichen Standard auf die Maschine zu übertragen. In Tests über verschiedene Datensätze hinweg, einschließlich komplexer mathematischer Probleme und medizinischer Fragen, war die neue Methode wesentlich genauer darin, vorherzusagen, ob die Antwort eines Modells korrekt oder inkorrekt war, im Vergleich zur alleinigen Verwendung des menschlichen Referenzleitfadens. In einigen Fällen war die Verbesserung erheblich und verwandelte eine Methode, die kaum besser als der Zufall performte, in eine, die Fehler zuverlässig erkennen konnte. Die Forscher fanden heraus, dass diese Technik Leistungsniveaus erreichen kann, die mit viel teureren Methoden vergleichbar sind, die erfordern, dass das Modell mehrere Antworten generiert und diese vergleicht, jedoch ohne den zusätzlichen Zeit- oder Rechenaufwand.

Die Studie kommt zu dem Schluss, dass große Sprachmodelle zwar menschliche Sprachmuster imitieren können, ihr internes Verständnis von Unsicherheit jedoch grundlegend anders ist als unseres. Eine Phrase wie „sehr wahrscheinlich“ besitzt für die Maschine nicht dasselbe Gewicht wie für einen Menschen. Um diese Systeme wirklich vertrauenswürdig zu machen, können wir sie nicht einfach nur bitten, wie Menschen zu sprechen, und erwarten, dass sie dasselbe meinen. Stattdessen müssen wir lernen, ihren spezifischen Dialekt der Unsicherheit zu lesen. Indem wir maßgeschneiderte Karten erstellen, die die einzigartigen verbalen Signale eines Modells in klare Signale der Zuversicht übersetzen, können wir besser zwischen einer korrekten Antwort und einer selbstbewussten Halluzination unterscheiden, was die Technologie sicherer und zuverlässiger für den realen Einsatz macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →