← 최신 논문
🤖 machine learning

"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification

이 논문은 모델의 출력으로부터 언어적 표식에 대한 최적의 확률 매핑을 직접 학습하여 반복적인 샘플링에 의존하지 않고도 체계적인 신뢰도 격차를 드러내는 최적화 기반 알고리즘인 METHODNAME을 도입함으로써, 인간과 거대 언어 모델 간의 언어적 불확실성 정량화에서의 괴리를 조사한다.

원저자: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

게시일 2026-10-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리는 말을 할 때 종종 확신을 줄이곤 합니다. 우리는 무언가가 "가능성이 높다", "가능하다", 또는 "거의 확실하다"라고 말하며, 이러한 단어들을 사용하여 우리가 실제로 얼마나 알고 있는지를 나타냅니다. 이러한 의구 doubt(의구심)를 표현하는 능력은 메타인지의 한 형태이며, 우리 지식의 경계를 인정하는 정신적 점검입니다. 이는 인간 의사소통의 핵심적인 부분으로, 우리가 답을 가지고 있지 않음에도 불구하고도 가진 것처럼 가장하지 않고 불확실성을 헤쳐 나갈 수 있게 해줍니다. 인공지능, 특히 거대 언어 모델의 세계에서 이러한 능력은 중요한 안전 기능이 되고 있습니다. 이러한 모델들은 때때로 자신감 넘치는 어조로 들리지만 사실과 다른 정보를 생성할 수 있는데, 이를 '환각(hallucination)' 현상이라고 합니다. 의료나 법률과 같은 민감한 분야에서 이 시스템들을 신뢰하기 위해서는, 모델이 언제 확신하지 못하는지를 우리가 알 필요가 있습니다. 문제는 AI가 불확실성을 표현하기 위해 사용하는 단어들이 인간 청자에게 전달하는 의미와 기계 자체에 전달하는 의미가 동일한지 파악하는 데 있습니다.

한 연구팀은 거대 언어 모델이 표현하는 언어적 불확실성이 인간의 이해와 일치하는지 조사하기 위해 연구를 시작했습니다. 그들은 먼저 사람들이 "매우 가능성이 높다"나 "불확실하다"와 같은 구절을 어떻게 해석하는지에 대한 방대한 자료를 수집했습니다. 수십 년간의 심리학 및 의사결정 과학 연구를 바탕으로, 그들은 이러한 일반적인 구절들을 특정 수치적 확률에 매핑하는 참조 가이드를 작성했습니다. 예를 들어, 인간의 마음속에서 "매우 가능성이 높다"라는 구절은 높은 정도의 확신에 대응하는 반면, "가능하다"는 중간 지점에 위치합니다. 연구진은 이후 몇몇 첨단 언어 모델들을 테스트하며, 질문에 답하고 동일한 자연어 구절을 사용하여 자신의 확신 정도를 설명하도록 요청했습니다. 그들은 모델의 답변을 인간의 참조 가이드와 비교하여, 기계가 사용자들과 같은 언어로 말하고 있는지 확인했습니다.

결과는 상당한 괴리를 드러냈습니다. 모델들은 그 단어들을 사용할 수는 있었지만, 인간과는 다른 수준의 확실성을 해당 단어들에 부여했습니다. 예를 들어, 인간이 "매우 가능성이 높다"라는 말을 들으면 높은 확률로 해석하지만, 연구에 사용된 모델들은 실제로는 꽤 불확실한 상황을 설명할 때 이 구절을 사용하는 경우가 많았습니다. 반대로, 모델들은 인간이 단순한 추측이라고 간주하는 구절에 대해 높은 수준의 확신을 표현하기도 했습니다. 이러한 불일치는 단순히 모델의 출력을 읽고 그 언어적 신호가 모델의 내부 상태를 반영한다고 가정하는 것이 오해를 불러일으킬 수 있음을 의미합니다. 이 연구는 불확실성 단어에 대한 인간이 만든 사전을 사용하는 것만으로는 기계의 확신 정도를 정확하게 측정하기에 충분하지 않다는 것을 보여주었습니다. 즉, 모델들은 그 단어들이 무엇을 의미하는지에 대해 자신들만의 독특한 내부 논리를 가지고 있었습니다.

이 격차를 메우기 위해 연구진은 VOCAL이라는 새로운 방법을 개발했습니다. 모델에게 인간의 정의를 따르도록 강요하는 대신, 이 방식은 모델 자신의 행동으로부터 불확실성 단어의 구체적인 의미를 학습합니다. 이 시스템은 모델의 수천 가지 응답을 분석하여, 모델이 정답을 말할 때와 오답을 말할 때 각각 어떤 구절을 사용하는지 기록합니다. 그런 다음, 모델 특유의 언어적 습관을 정확한 확률 점수로 번역하는 맞춤형 지도를 구축합니다. 이 과정에는 데이터를 매끄럽게 만드는 수학적 최적화가 포함되어, 설령 모델이 드물게 사용하는 구절이라 할지라도 유사한 느낌의 구절은 유사한 점수를 받도록 보장합니다. 기계에 맞춰 해석을 조정함으로써, 이 방법은 모델이 언제 확신하지 못하는지를 감지하는 훨씬 더 신뢰할 수 있는 방법을 만들어냅니다.

실험 결과, 이 맞춤형 접근 방식이 기계에 인간의 표준을 강요하려는 시도보다 훨씬 더 효과적임이 입증되었습니다. 복잡한 수학 문제와 의료 질문을 포함한 다양한 데이터셋을 대상으로 한 테스트에서, 이 새로운 방법은 인간의 참조 가이드만을 사용하는 것보다 모델의 답변이 정답인지 오답인지를 예측하는 데 훨씬 더 정확했습니다. 어떤 경우에는 그 개선 폭이 매우 커서, 무작위 추측보다 겨우 나은 수준이었던 방법을 신뢰할 수 있게 오류를 찾아내는 수준으로 바꾸어 놓았습니다. 연구진은 이 기술이 모델이 여러 개의 답변을 생성하고 서로 비교하도록 하는 훨씬 더 비용이 많이 드는 방법들과 대등한 성능 수준을 달성할 수 있으면서도, 추가적인 시간이나 컴퓨팅 자원을 소모하지 않는다는 것을 발견했습니다.

이 연구는 거대 언어 모델이 인간의 언어 패턴을 흉내 낼 수는 있지만, 불확실성에 대한 그들의 내부적 이해는 우리와 근본적으로 다르다는 결론을 내립니다. "매우 가능성이 높다"와 같은 구절은 인간에게와 같은 무게감을 기계에게는 갖지 않습니다. 이러한 시스템을 진정으로 신뢰할 수 있게 만들기 위해서, 우리는 단순히 모델에게 인간처럼 말하라고 요구하고 그것이 우리와 같은 의미를 담고 있기를 기대해서는 안 됩니다. 대신, 우리는 그들의 특정한 불확실성 방언을 읽는 법을 배워야 합니다. 모델의 고유한 언어 신호를 명확한 확신의 신호로 번역하는 맞춤형 지도를 만듦으로써, 우리는 정답과 자신감 있는 환각을 더 잘 구별할 수 있으며, 이를 통해 기술을 실생활에서 더욱 안전하고 신뢰할 수 있게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →