← 최신 논문
🤖 AI

Superficial Beliefs in LLM Decision-Making

이 논문은 거대 언어 모델이 의사결정 과정에서 '피상적 신념'을 보인다는 점을 입증하며, 즉 이들의 선택은 스스로 보고한 이유로는 부분적이고 불완전하게만 설명할 수 있는 기저의 속성 우선순위에 의해 체계적으로 유도된다는 점을 보여준다.

원저자: Gabriel Freedman, Francesca Toni

게시일 2026-06-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gabriel Freedman, Francesca Toni

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 약간은 신비로운 로봇이 어떻게 결정을 내리는지 알아내려 한다고 상상해 보세요. 당신은 로봇에게 "약물 A"와 "약물 B" 중 하나를 고르라는 것과 같은 선택지를 제시합니다. 로봇은 하나를 고른 뒤, 왜 그것을 골랐는지 이유를 말해줍니다.

이 논문이 던지는 핵심 질문은 이것입니다: 로봇이 실제로 자신이 말하는 이유에 대해 생각하고 있는 것일까요, 아니면 단지 사후에 이야기를 지어내고 있는 것일까요?

연구진이 수행한 실험과 그 결과를 일상적인 비유를 사용하여 쉽게 설명해 드리겠습니다.

실험: "맛 테스트"

연구진은 로봇이 두 가지 프로필(예: 두 명의 서로 다른 구직자 또는 두 종류의 약물) 중에서 선택해야 하는 게임을 설정했습니다. 각 프로필에는 네 가지 "수치"(예: 안전성, 비용, 속도, 품질)가 있으며, 각각 낮음, 중간, 높음으로 평가되었습니다.

연구진은 로봇에게 매 선택마다 다음 두 가지를 수행하도록 요청했습니다:

  1. 승자를 고를 것.
  2. 결정에 가장 중요했던 단 하나의 수치를 언급하며 자신의 선택을 설명할 것.

로봇이 진실을 말하고 있는지 확인하기 위해, 연구진은 "비밀 해독기"(수학적 모델)를 사용했습니다. 연구진은 로봇이 내린 수백 번의 선택을 관찰했고, 로봇이 실제로 선택한 것을 바탕으로 각 수치에 대한 숨겨진 "선호도 점수"를 계산했습니다. 이는 마치 어떤 사람이 무엇을 좋아하는지 직접 묻는 대신, 그 사람이 주문한 음식을 천 번 관찰하여 그 사람의 최애 음식을 추측하는 것과 같습니다.

발견: "이중 인격"

결과는 희소식과 혼란스러운 소식이 섞여 있었습니다.

1. 로봇은 실제로 패턴을 가지고 있습니다 (The "Hidden Logic")
"비밀 해독기"는 놀라울 정도로 잘 작동했습니다. 연구진이 로봇의 과거 선택을 이용해 미래의 선택을 예측했을 때, 적중률은 **80%**였습니다.

  • 비유: 이는 친구가 한 달 동안 커피를 주문하는 모습을 지켜보는 것과 같습니다. 비록 친구가 입 밖으로 말하지 않더라도, 당신은 그 친구가 내일도 라떼를 주문할 것이라고 예측할 수 있습니다. 로봇은 그냥 무작위로 찍는 것이 아니라, 숨겨진 일관된 논리를 가지고 있습니다.

2. 로봇의 "이야기"는 "논리"와 일치하지 않습니다 (The "Superficial Belief")
여기 반전이 있습니다. 연구진이 로봇의 실제 '숨겨진 논리'와 로봇이 겉으로 내뱉은 '이유'를 비교했을 때, 이 둘은 완벽하게 일치하지 않았습니다.

  • 로봇의 숨겨진 논리는 "나는 안전성 때문에 약물 A를 골랐다"라고 말합니다.
  • 하지만 로봇에게 물으면, 로봇은 종종 "나는 효능 때문에 약물 A를 골랐다"라고 답합니다.
  • 비유: 당신이 운전을 하고 있다고 상상해 보세요. 당신의 손은 포트홀 때문에 왼쪽으로 핸들을 꺾고 있습니다(숨겨진 논리). 하지만 누군가 "왜 왼쪽으로 가세요?"라고 묻는다면, 당신은 "경치를 보고 싶어서요"라고 답할 수 있습니다(이야기). 당신이 악의적으로 거짓말을 하는 것이 아니라, 단지 당신의 손이 움직인 진짜 이유에 대해 완전히 파악하지 못하고 있을 뿐입니다.

연구진은 이를 **"표면적 믿음(Superficial Belief)"**이라고 부릅니다. 로봇은 깊은 믿음과 우선순위를 가진 것처럼 행동하지만, 그것을 설명하는 능력은 오직 "표면적인" 수준에 머물러 있습니다. 로봇은 올바른 선택을 할 수는 있지만, 그 선택을 이끈 진짜 동인이 무엇인지 항상 명확하게 설명하지는 못합니다.

"스코어카드" 테스트

연구진은 진실을 찾기 위한 두 번째 방법을 시도했습니다. 로봇에게 승자를 고르게 하는 대신, 각 수치가 얼마나 중요한지 "점수"(0에서 1 사이)를 매기도록 했습니다.

  • 결과: 이 방법은 더 일관성이 있었습니다(로봇은 매번 유사한 점수를 주었습니다). 하지만 이 점수 역시 선택을 통해 도출된 숨겨진 논리와 완벽하게 일치하지는 않았습니다. 이는 마치 로봇에게 배고픔 정도를 수치로 나타내라고 하는 것과 같습니다. 로봇은 일관된 숫자를 제시했지만, 그 숫자들 역시 로봇이 실제로 어떤 샌드위치를 먹고 싶어 하는지를 완벽하게 설명해주지는 못했습니다.

"대조군" 확인

로봇이 단순히 단어를 무작위로 고르는 것이 아님을 확인하기 위해, 연구진은 전혀 상관없는 "가짜" 수치(예: 약물의 "포장 대칭성")를 추가했습니다.

  • 결과: 로봇은 이러한 가짜 수치를 이유로 거의 선택하지 않았습니다. 이는 로봇이 실제 데이터에 주의를 기울이고 있다는 것을 증명합니다. 다만, 어떤 실제 데이터 포인트가 가장 중요했는지를 설명하는 데에는 서툴 뿐입니다.

결론

이 논문은 거대언어모델(LLM)이 단순한 무작위 노이즈 생성기도 아니고, 그렇다고 완전히 투명한 사고 체계도 아니라고 결론짓습니다.

  • 그들은 무작위가 아닙니다: 결정을 내릴 때 숨겨진, 예측 가능한 패턴을 따릅니다.
  • 그들은 완전히 투명하지 않습니다: 그들이 말하는 설명은 그 숨겨진 패턴을 부분적으로만, 그리고 불완전하게 반영할 뿐입니다.

비유: LLM을 매번 완벽한 요리를 만들어내는 아주 유능한 셰프로 생각해보세요. 하지만 당신이 셰프에게 "비밀 재료가 무엇인가요?"라고 묻는다면, 실제 비밀은 '특정한 종류의 후추'였음에도 불구하고 셰프는 "소금"이라고 대답할 수도 있습니다. 셰프는 요리를 완성하는 법은 알지만, 자신의 뇌가 정확히 어떻게 그 요리를 만들어내는지에 대한 명확한 언어적 지도를 가지고 있지는 않은 것입니다. 그들은 자신의 요리 과정에 대해 "표면적인 믿음"을 가지고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →