Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation
이 논문은 기계 번역에서 대규모 언어 모델로부터 토큰당 신뢰도를 추출하기 위한 다섯 가지 언어화된 방법을 소개하고 평가하며, 이 방법들이 내부 신호와 낮은 상관관계를 보임에도 불구하고 오류 탐지 및 교정 측면에서 내부 신호와 유사한 성능을 보인다는 것을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 매우 똑똑하고 다국어를 구사하는 로봇 번역기가 있다고 상상해 보세요. 당신이 문장을 번역해 달라고 요청하면, 로봇은 즉시 번역을 해냅니다. 하지만 로봇이 제대로 했는지 어떻게 알 수 있을까요? 로봇은 자신이 실수했다는 것을 알까요?
이 논문은 다음과 같은 구체적인 질문을 조사합니다: "우리가 로봇에게 '이 특정 단어에 대해 얼마나 확신하니?'라고 물었을 때, 그 대답을 믿을 수 있는가?"
연구진은 로봇의 '신뢰도 수준'을 얻는 두 가지 방법을 비교했습니다:
- "내부적" 방법: 로봇의 비밀스러운 수학적 계산(내부 확률)을 들여다보는 것입니다. 이것은 로봇이 단어를 선택하기 전에 얼마나 많은 선택지를 고려했는지 로봇의 뇌를 훔쳐보는 것과 같습니다.
- "언어화된" 방법: 단순히 로봇에게 "0에서 1 사이의 척도로, 이 단어에 대해 얼마나 확신하나요?"라고 묻고, 로봇이 그 답을 텍스트로 입력하게 하는 것입니다.
다음은 쉬운 비유를 사용한 연구 결과의 요약입니다:
1. "뇌를 훔쳐보는 것"의 문제점
보통 번역이 잘 되었는지 알고 싶을 때, 우리는 로봇의 내부 수학을 살펴봅니다. 만약 로봇이 적절한 단어를 선택할 확신이 99%라면, 우리는 그것이 정답이라고 가정합니다.
하지만 이 논문은 이 방식의 결함인 **"표면 형태 경쟁(Surface Form Competition)"**을 지적합니다.
- 비유: 당신이 "The cat sat on the mat"을 번역하고 있다고 가정해 봅시다. 당신은 "The feline sat on the rug"라고도 말할 수 있습니다. 둘 다 완벽한 번역입니다.
- 문제점: 만약 로봇이 "cat"과 "feline" 사이에서 고민하고 있다면, 로봇의 내부 수학은 "feline"도 고려하고 있기 때문에 "cat"에 대해 50%만 확신한다고 표시할 수 있습니다. 하지만 "cat"은 실제로 정확한 번상입니다!
- 결과: 로봇의 내부 수학은 "확신이 없다"라고 말하지만, 실제 출력값은 완벽합니다. 내부 신호는 '정확성'을 측정하는 것이 아니라 '선택지 간의 혼란'을 측정하기 때문에 오해의 소지가 있습니다.
2. 새로운 아이디어: 그냥 물어보기
로봇은 말을 할 수 있으므로, 연구진은 다른 접근 방식인 **"언어화된 신뢰도(Verbalized Confidence)"**를 시도했습니다. 내부 수학을 들여다보는 대신, 로봇에게 "나는 이 단어가 맞다고 90% 확신한다"라고 말하도록 유도하는 것입니다.
그들은 다섯 가지 질문 방식을 테스트했습니다:
- 리스트 방식: "문장의 어느 부분이 틀렸는지 말해줘."
- 단어 번호 방식: "모든 단어에 0에서 1 사이의 점수를 매겨줘."
- 단어 단어 방식: "모든 단어에 '매우 확실함' 또는 '확신 없음'과 같은 라벨을 붙여줘."
- 토큰 번호/단어 방식: 단어 전체가 아닌 아주 작은 단위(토큰)에 대해 동일하게 수행하기.
3. 큰 반전: 둘은 일치하지 않는다
연구진은 만약 로봇의 내부 수학이 "확신이 없다"라고 말하고, 우리가 로봇에게 "확신이 없니?"라고 물었을 때, 로봇이 "네"라고 대답할 것이라고 예상했습니다.
그들의 예상은 틀렸습니다.
- 비유: 이것은 복잡한 레이더 데이터를 보고 "비가 올 확률이 50%입니다"라고 말하는 기상 예보관이, 정작 당신이 직접 "비가 올 것 같나요?"라고 물었을 때 "비가 오지 않을 것이라고 90% 확신합니다"라고 말하는 것과 같습니다.
- 결과: 로봇의 내부 수학과 로봇이 입 밖으로 내뱉은 말 사이에는 상관관계가 거의 없었습니다. 그들은 서로 소통하지 않는 완전히 다른 두 가지 전략이었습니다.
4. 질문이 도움이 되었는가?
그렇다면 둘이 일치하지 않는다면, 어떤 방식이 실제 번역 오류를 찾아내는 데 더 효과적일까요?
- 결과: 놀랍게도, 로봇에게 물어보는 것(언어화된 방식)이 내부 수학을 들여다보는 것만큼이나, 혹은 때로는 더 잘 작동했습니다.
- 주의 사항: 사용하는 로봇 모델에 따라 다릅니다.
- 한 모델(Llama3)의 경우, 로봇에게 "리커트(Likert)" 점수(예: '매우 확실함')를 매기도록 하는 것이 가장 효과적이었습니다.
- 다른 모델(Aya23)의 경우, 내부 수학(엔트로피)을 보는 것이 가장 효과적이었습니다.
- 현실적인 점검: 가장 좋은 방법조차 완벽하지는 않았습니다. 로봇들은 여전히 자신의 실수를 찾아내는 데 있어 중간 정도의 능력만을 보여주었습니다. 이는 마치 시험을 치는 학생이 자신이 틀린 답이 무엇인지는 꽤 잘 알지만, 여전히 자신이 모른다는 사실을 인지하지 못하는 몇몇 실수를 저지르는 것과 같습니다.
5. 이 연구가 중요한 이유 (논문에 따르면)
이 논문은 우리가 로봇의 코드를 들여다보는 "해커"가 될 필요 없이 신뢰도를 얻을 수 있다고 결론짓습니다.
- 접근성: 로봇의 내부 "두뇌"(종종 폐쇄형 모델에서는 숨겨져 있음)에 접근할 필요가 없습니다. 그저 대화를 나누기만 하면 됩니다.
- 세밀함: 연구진은 로봇에게 정밀한 숫자(예: 0.83)를 요청하더라도, 로봇은 단순한 단계(예: 0.8 또는 0.9)로 답변을 반올림하는 경 tend가 있다는 것을 발견했습니다. 이는 로봇이 고정밀 계산기처럼 행동하기보다 단순한 체크리스트를 사용하는 것처럼 행동함을 의미합니다.
요약
이 논문은 거대 언어 모델(LLM)의 자신감에 대한 스스로의 말을 신뢰할 수 있는지에 대한 테스트입니다.
- 기존 방식: 수학을 들여다본다 (내부적).
- 새로운 방식: 모델에게 물어본다 (언어화된 방식).
- 결론: 두 방식은 완전히 다른 것이지만, 모델에게 물어보는 것이 번역 오류를 찾는 데 내부 수학을 보는 것만큼이나 효과적입니다. 이는 모델의 비밀 코드를 볼 필요 없이, 번역이 잘못되었을 가능성이 높다는 것을 확인하는 더 쉽고 접근하기 쉬운 방법입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.