← 최신 논문
💬 NLP

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

본 논문은 대규모 언어 모델에서의 표현 수렴이 공유된 추론 전략을 의미한다는 관념에 도전하여, 모델이 공유 입력에 대해 유사한 내부 표현을 발달시키지만 문제 난이도, 결정 단계, 공유 정보의 인과적 영향과 관련하여 추론 과정에서 상당한 분리를 보인다는 점을 밝혀냅니다.

원저자: Muhammad Usama, Dong Eui Chang

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Muhammad Usama, Dong Eui Chang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

16 명의 서로 다른 학생 (AI 모델) 들이 교실에 앉아 같은 800 개의 어려운 수수께끼를 풀려고 노력하는 상황을 상상해 보세요. 이 학생들은 서로 다른 선생님, 서로 다른 교과서, 심지어 서로 다른 사고 방식을 가지고 있습니다.

AI 세계의 한 인기 있는 이론인 **플라톤적 표현 가설 (Platonic Representation Hypothesis)**은 이러한 학생들이 더 똑똑해짐에 따라 모두 정확히 같은 방식으로 사고하기 시작한다고 제안합니다. 마치 그들이 세상이 작동하는 방식에 대한 동일한 '보편적 진리'를 발견하는 것과 같습니다.

이 논문은 단순한 질문을 던집니다: 만약 이 학생들이 문제를 같은 방식으로 바라본다면, 그들은 또한 같은 방식으로 문제를 해결할까요?

그 답은 놀랍게도 **"아니요"**입니다. 논문은 이 모델들이 무엇을 보는지에는 동의하지만, 어떻게 생각하는지에는 완전히 이견이 있음을 발견했습니다. 간단한 비유를 사용한 구체적인 분석은 다음과 같습니다:

1. "혼란은 전염된다" 효과 (난이도 역전)

학생들이 어려운 문제를 올바르게 풀 때, 모두 유사하고 훌륭한 논리를 사용할 것이라고 기대할 수 있습니다. 그들이 정답을 맞았을 때 매우 비슷해 보일 것이라고 예상할 수 있습니다.

실제로 일어나는 일:

  • 정답을 맞았을 때: 학생들은 매우 다르고 독특한 전략을 사용합니다. 그들의 '사고 과정'은 서로 전혀 닮지 않았습니다.
  • 오답을 냈을 때: 그들은 모두 정확히 똑같이 보입니다.

비유: 안개가 짙은 숲속에서 길을 찾으려 노력하는 사람들의 그룹을 상상해 보세요.

  • 길이 명확할 때 (쉬운 문제), 모두 목적지까지 서로 다른 효율적인 경로를 택합니다. 성공적이기 때문에 서로 다르게 보입니다.
  • 안개가 짙을 때 (어려운 문제), 모두 길을 잃습니다. 안개가 모두의 시야를 똑같이 흐리게 만들기 때문에, 모두 같은 자리에 서서 멍하니 바라보게 됩니다.
  • 발견: 모델들은 똑똑할 때가 아니라 혼란스러울 때 가장 비슷합니다. 그들은 '공유된 이해'가 아닌 '공유된 혼란'에 수렴합니다.

2. "첫인상 vs 최종 결정" 간극 (생성 간극)

연구자들은 두 가지 다른 시점에 모델들의 '뇌'를 살펴봤습니다:

  1. 결정 전: 질문을 읽기만 할 때.
  2. 결정 후: 실제로 답을 생성할 때.

실제로 일어나는 일:

  • 질문을 읽을 때: 모든 모델이 거의 동일하게 보입니다. 그들은 단어의 의미에 동의합니다.
  • 답을 만들 때: 무엇을 말할지 결정해야 하는 순간, 그들의 뇌는 극적으로 갈라집니다. 완전히 다른 방향으로 나아갑니다.

비유: 같은 재료 바구니를 보는 요리사들의 그룹을 생각해 보세요.

  • 1 단계 (읽기): 그들은 모두 재료가 무엇인지에 동의합니다 (이것이 '결정 전' 단계입니다). 모두 토마토와 양파를 봅니다.
  • 2 단계 (요리): 요리를 시작하면, 한 요리사는 샐러드를 만들고, 다른 요리사는 수프를 만들고, 세 번째 요리사는 태워버립니다. 그들의 최종 요리 (출력) 는 완전히 다르지만, 같은 재료로 시작했습니다.
  • 발견: 모델들은 입력 (재료) 에는 동의하지만, 계산 (요리) 에는 이견이 있습니다.

3. "유령 지식" 효과 (부수적 정확성)

연구자들은 모델들이 공유된 '사고' 안에 정답을 실제로 저장하고 있음을 발견했습니다. 만약 똑똑한 탐정 (작은 탐지기) 이 모델 A 의 뇌를 살펴본다면, 그 탐정은 답을 알려줄 수 있습니다. 그 탐정이 모델 B 의 뇌를 살펴보면, 역시 답을 알려줄 수 있습니다.

그러나:

  • 정보가 거기 있다는 것이 반드시 모델이 결정을 내리기 위해 그것을 사용한다는 뜻은 아닙니다.
  • 만약 그 특정 지식을 모델의 뇌에서 '삭제'하려고 시도한다면, 모델은 거의 눈치채지 못할 것입니다. 여전히 같은 답을 줄 것입니다.

비유: 시험을 치르는 학생이 손에 정답을 적어놓고 있지만, 너무 긴장해서 그것을 보지 못하는 상황을 상상해 보세요.

  • 정답은 손에 물리적으로 존재합니다 (공유된 표현).
  • 하지만 학생은 실제로 그 정보를 사용하여 문제를 해결하지 않습니다; 대신 추측합니다.
  • 발견: 모델들은 마음속에 '진리'를 지니고 있지만, 그것이 실제 행동을 주도하지는 않습니다. 마치 목적지를 알고 있지만 운전자는 아닌 차 안의 승객과 같습니다.

왜 이런 일이 일어날까요?

이 논문은 **주의 (Attention)**와 관련된 메커니즘을 제안합니다.

  • 문제가 쉬울 때, 모델의 '주의' (집중) 는 날카롭고 구체적입니다. 서로 다른 모델이 서로 다른 세부 사항에 집중하여 서로 다른 해결책을 도출합니다.
  • 문제가 어려울 때, 모델의 주의는 '확산'되거나 흐려집니다. 너무 넓은 손전등 빛처럼 모든 것에 퍼집니다. 이 흐릿함으로 인해 모든 모델이 비슷해 보입니다. 왜냐하면 그들은 모두 비슷하고 비구조적인 방식으로 '추측'하고 있기 때문입니다.

결론

이 논문은 AI 모델들이 공유된 '논리'나 '진리'에 수렴하지 않는다고 결론 내립니다. 대신, 그들은 입력을 처리하는 방식 (우리가 모두 빨간 사과를 빨간색으로 보는 것과 같은) 에 수렴합니다.

  • 공유하는 것: 프롬프트를 읽는 방법.
  • 공유하지 않는 것: 문제를 추론하는 방법.

이는 AI 모델 팀 (앙상블) 을 잘 작동하도록 구축하고 싶다면, 종이 위에서 다르게 보이는 모델을 선택해서는 안 된다는 것을 의미합니다. 대신 그들이 어려운 문제를 풀 때 서로 다른 실수를 하거나 서로 다른 전략을 사용하는 모델을 선택해야 합니다. 왜냐하면 그들의 진정한 차이는 바로 그 곳에 있기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →