"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification
Cet article étudie la divergence entre les humains et les grands modèles de langage dans la quantification de l'incertitude verbale en introduisant un algorithme fondé sur l'optimisation, METHODNAME, qui apprend des correspondances de probabilités optimales pour les marqueurs verbaux directement à partir des sorties du modèle afin de révéler des disparités de confiance systématiques sans recourir à un échantillonnage répété.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Lorsque nous parlons, nous tempérons souvent nos propos. Nous disons qu'une chose est « probable », « possible » ou « presque certaine », en utilisant ces mots pour signaler l'étendue de ce que nous savons réellement. Cette capacité à exprimer le doute est une forme de métacognition, un auto-examen mental où nous reconnaissons les limites de notre propre savoir. C'est une partie cruciale de la communication humaine, qui nous permet de naviguer dans l'incertitude sans prétendre détenir des réponses que nous ne possédons pas. Dans le monde de l'intelligence artificielle, et plus particulièrement avec les grands modèles de langage, cette même capacité devient une caractéristique de sécurité essentielle. Ces modèles peuvent parfois générer des informations à l'allure convaincante mais factuellement incorrectes, un phénomène connu sous le nom d'hallucination. Pour faire confiance à ces systèmes, surtout dans des domaines sensibles comme la médecine ou le droit, nous avons besoin de savoir quand ils doutent. Le défi consiste à déterminer si les mots qu'une IA utilise pour exprimer le doute signifient la même chose pour un auditeur humain que pour la machine elle-même.
Une équipe de chercheurs s'est donné pour mission d'étudier si l'incertitude verbale exprimée par les grands modèles de langage s'aligne sur la compréhension humaine. Ils ont commencé par rassembler une vaste collection de la manière dont les gens interprètent des expressions telles que « très probable » ou « incertain ». En s'appuyant sur des décennies de recherche en psychologie et en sciences de la décision, ils ont compilé un guide de référence qui associe ces expressions courantes à des probabilités numériques spécifiques. Par exemple, dans l'esprit humain, l'expression « très probable » correspond à un haut degré de confiance, tandis que « possible » se situe quelque part au milieu. Les chercheurs ont ensuite testé plusieurs modèles de langage avancés, en leur demandant de répondre à des questions et d'expliquer leur niveau de confiance en utilisant ces mêmes expressions de langage naturel. Ils ont comparé les réponses des modèles au guide de référence humain pour voir si les machines parlaient la même langue que leurs utilisateurs.
Les résultats ont révélé un décalage significatif. Bien que les modèles puissent utiliser ces mots, ils attribuaient des niveaux de certitude différents de ceux des humains. Par exemple, lorsqu'un humain entend « très probable », il l'interprète comme une forte probabilité, mais les modèles de l'étude utilisaient souvent cette expression pour décrire des situations où ils étaient en réalité assez incertains. Inversement, les modèles pouvaient exprimer un haut degré de confiance pour des expressions que les humains considèrent comme de simples suppositions. Ce décalage signifie que le simple fait de lire la production d'un modèle et de supposer que ses indices verbaux reflètent son état interne peut être trompeur. L'étude a montré que s'appuyer sur un dictionnaire humain de mots d'incertitude ne suffisait pas à évaluer avec précision la confiance d'une machine ; les modèles possédaient leur propre logique interne distincte pour définir la signification de ces mots.
Pour combler ce fossé, les chercheurs ont développé une nouvelle méthode appelée VOCAL. Au lieu de forcer les modèles à se conformer aux définitions humaines, cette approche apprend la signification spécifique des mots d'incertitude directement à partir du comportement du modèle lui-même. Le système analyse des milliers de réponses du modèle, notant quelles expressions il utilise lorsqu'il a raison et lesquelles il utilise lorsqu'il a tort. Il construit ensuite une carte personnalisée qui traduit les habitudes verbales spécifiques du modèle en scores de probabilité précis. Ce processus implique une optimisation mathématique qui lisse les données, garantissant que des expressions aux sonorités similaires reçoivent des scores similaires, même si le modèle les utilise rarement. En adaptant l'interprétation à la machine spécifique, la méthode crée un moyen beaucoup plus fiable de détecter quand le modèle est incertain.
Les expériences ont démontré que cette approche personnalisée fonctionne nettement mieux que de tenter d'imposer un standard humain à la machine. Lors de tests sur divers ensembles de données, incluant des problèmes mathématiques complexes et des questions médicales, la nouvelle méthode s'est avérée bien plus précise pour prédire si la réponse d'un modèle était correcte ou incorrecte par rapport à l'utilisation du seul guide de référence humain. Dans certains cas, l'amélioration a été substantielle, transformant une méthode qui performait à peine mieux qu'un choix aléatoire en une méthode capable de détecter les erreurs de manière fiable. Les chercheurs ont constaté que cette technique pouvait atteindre des niveaux de performance comparables à des méthodes beaucoup plus coûteuses qui nécessitent de générer plusieurs réponses et de les comparer, mais sans le temps ou la puissance de calcul supplémentaires.
L'étude conclut que, bien que les grands modèles de langage puissent imiter les schémas de langage humain, leur compréhension interne de l'incertitude est fondamentalement différente de la nôtre. Une expression comme « très probable » n'a pas le même poids pour la machine que pour une personne. Pour rendre ces systèmes véritablement dignes de confiance, nous ne pouvons pas simplement leur demander de parler comme des humains et espérer qu'ils entendent la même chose. Au contraire, nous devons apprendre à lire leur dialecte spécifique de l'incertitude. En créant des cartes personnalisées qui traduisent les signaux verbaux uniques d'un modèle en signaux de confiance clairs, nous pouvons mieux distinguer une réponse correcte d'une hallucination confiante, rendant ainsi la technologie plus sûre et plus fiable pour une utilisation dans le monde réel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.