Implicit Probabilistic Reasoning Does Not Reflect Explicit Answers in Large Language Models
이 논문은 다중 선택형 질문을 통한 명시적 확률 추론 평가가 모델의 실제 텍스트 생성 과정인 암시적 확률 추론 능력을 반영하지 못하며, 후자가 다양한 요인에 의해 왜곡되어 오류를 발생시킬 수 있음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🎲 핵심 비유: "시험지 vs. 실제 게임"
이 논문의 핵심은 두 가지 다른 상황을 비교하는 것입니다.
명시적 추론 (Explicit Reasoning): "시험지 풀기"
- 상황: 선생님 (사용자) 이 "주사위를 두 번 던졌을 때, 합이 7 이 될 확률은 얼마야? A) 1/6, B) 1/3..."이라고 물어봅니다.
- 모델의 반응: 모델은 머릿속에서 계산을 하거나 기억을 더듬어 정답을 고릅니다.
- 결과: 대부분의 최신 AI 는 이 시험에서 엄청나게 높은 점수를 받습니다. "저는 확률을 잘 계산해요!"라고 말하죠.
암묵적 추론 (Implicit Reasoning): "실제 게임 진행하기"
- 상황: 이번엔 시험지를 주지 않습니다. 대신 "주사위를 두 번 던졌는데, 첫 번째 결과가 3 이 나왔어. 이제 두 번째 주사위를 던져서 합이 7 이 되게 해줘."라고 말하며 문장을 이어가게 합니다.
- 모델의 반응: AI 는 다음에 나올 단어를 예측하며 문장을 완성합니다. 이때 AI 가 실제로 어떤 단어를 가장 확률 높게 선택하는지를 봅니다.
- 결과: 놀랍게도, 시험에서는 100 점인데, 실제 게임에서는 엉뚱한 결과를 선택합니다.
🔍 논문이 발견한 놀라운 사실들
이 연구는 여러 AI 모델 (Llama, Qwen, Mistral 등) 을 대상으로 실험했고, 다음과 같은 '기만적인' 모습을 발견했습니다.
1. "입으로는 잘 말하지만, 행동은 다르다" (시험 vs. 실제)
- 비유: 어떤 학생이 "수학 공식은 다 외웠어요!"라고 시험에서 완벽하게 풀지만, 막상 공장에서 기계를 돌릴 때는 공식을 잊어버리고 엉뚱한 버튼을 누릅니다.
- 현실: AI 는 확률 문제를 물어보면 정답을 맞히지만, 문장을 자연스럽게 이어갈 때는 그 확률 지식을 전혀 반영하지 못합니다. 예를 들어, 의학 진단에서 '질병 A'가 10% 확률이고 '질병 B'가 90% 확률인데, AI 는 문장을 이어갈 때 오히려 드문 '질병 A'를 선택하며 "아마도 A 일 거예요"라고 말해버립니다.
2. "전혀 상관없는 과거의 사건에 흔들린다" (주사위 비유)
- 비유: 공정한 주사위를 던질 때, "어제 던진 주사위가 1 이 나왔어"라고 말해주면, AI 는 "아, 어제 1 이 나왔으니 오늘도 1 이 나올 확률이 높겠지?"라고 착각합니다. 하지만 주사위는 독립적이라 어제 결과가 오늘에 영향을 주지 않죠.
- 현실: AI 는 무관한 과거 정보가 주어지면 그 정보에 너무 크게 반응합니다. "어제 1 이 나왔으니 오늘도 1 이 나올 거야"라고 편향된 예측을 합니다. 이는 AI 가 '관련 없는 정보'를 걸러내는 능력이 부족하다는 뜻입니다.
3. "순서와 이름에 너무 민감하다" (선호도 비유)
- 비유: "왼쪽과 오른쪽 중 하나를 고르세요. 둘 다 확률은 똑같아요"라고 했을 때, AI 는 문장에 먼저 나온 '왼쪽'을 무조건 더 좋아합니다. 혹은 'A'와 'B' 중 'A'를 더 선호합니다.
- 현실: 확률이 똑같아도, 단순히 문장 순서나 단어의 이름 때문에 AI 는 특정 결과를 불필요하게 더 자주 선택합니다.
🚨 왜 이것이 문제일까요?
지금까지 우리는 AI 가 "정답을 맞히면 똑똑한 거야"라고 생각했습니다. 하지만 이 논문은 "정답을 맞히는 것"과 "실제 상황을 판단하는 것"은 완전히 다르다고 경고합니다.
- 실제 위험: 만약 AI 가 의료 진단, 금융 예측, 혹은 자율 주행 같은 중요한 일을 할 때, "시험지에서는 확률을 잘 계산한다"고 해서 안심했다가, 실제 문장을 생성할 때 엉뚱한 확률을 적용한다면 큰 실수가 발생할 수 있습니다.
- 예: 희귀병을 100% 로 진단하고 치료법을 제시할 수 있습니다. (실제 확률은 1% 임)
💡 결론: 무엇을 배웠나요?
이 논문은 우리에게 새로운 안경을 씌워줍니다.
"AI 가 시험지 (객관식) 에서 정답을 맞히는 능력만 보면 안 됩니다. AI 가 실제로 글을 쓸 때, 그 안에 숨겨진 확률과 불확실성을 얼마나 올바르게 반영하는지 확인해야 합니다."
우리는 AI 를 단순히 '지식 테스트'용이 아니라, 불완전한 정보 속에서 올바른 판단을 내리는 파트너로 평가해야 한다는 것입니다. AI 가 "말로는 잘하지만, 행동은 엉망"일 수 있다는 사실을 인정하고, 더 안전한 AI 를 만들기 위해 노력해야 한다는 메시지가 담겨 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.