← 최신 논문
🤖 machine learning

When Chain-of-Thought Fails, the Solution Hides in the Hidden States

이 논문은 활성화 패칭(activation patching) 기법을 통해 Chain-of-Thought(CoT) 과정의 개별 토큰들이 추론 과정의 오류 여부와 상관없이 정답을 도출할 수 있는 핵심 정보를 은닉 상태(hidden states)에 담고 있음을 기계론적 인과 분석으로 입증했습니다.

원저자: Houman Mehrafarin, Amit Parekh, Ioannis Konstas

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Houman Mehrafarin, Amit Parekh, Ioannis Konstas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 제목: "생각의 흐름(CoT)이 틀려도, 정답은 '뇌 속'에 숨어 있다!"

1. 배경: 인공지능의 '연습장' (Chain-of-Thought)

요즘 똑똑한 AI(ChatGPT 같은 모델들)에게 어려운 수학 문제를 풀라고 하면, 바로 답을 내놓지 않고 "자, 먼저 이걸 더하고, 그다음엔 이걸 빼면..." 하고 중간 과정을 차근차근 적으며 풀죠? 이걸 전문 용어로 **'생각의 흐름(Chain-of-Thought, CoT)'**이라고 합니다. 마치 우리가 수학 문제를 풀 때 옆에 **'연습장'**을 두고 풀이 과정을 적는 것과 같아요.

그런데 문제가 하나 있습니다. AI가 연습장에 풀이 과정을 적다가 중간에 계산 실수를 해서 결국 틀린 답을 적을 때가 있다는 거죠.

2. 이 논문의 질문: "연습장이 틀렸다면, AI는 정말 모르는 걸까?"

연구자들은 아주 흥미로운 의문을 가졌습니다.

*"AI가 연습장(풀이 과정)에는 틀린 답을 적었더라도, 사실 그 AI의 **'머릿속(Hidden States, 은닉 상태)'*에는 정답을 알고 있는 정보가 남아있지 않을까?"

즉, **"입으로는 틀린 말을 해도, 속으로는 정답을 알고 있는 상태"**가 있는지 확인해보고 싶었던 겁니다.

3. 실험 방법: '기억 이식' 수술 (Activation Patching)

연구팀은 아주 독특한 실험을 했습니다. 일종의 **'기억 이식 수술'**이에요.

  1. 환자 A (CoT 모델): 문제를 풀면서 연습장에 풀이 과정을 적습니다. (가끔 틀린 답을 적기도 함)
  2. 환자 B (직접 답변 모델): 연습장 없이 바로 답만 말하라고 시킵니다. (보통 수학 문제를 못 풀고 헤맴)
  3. 수술: 환자 A가 연습장에 글자를 적을 때 발생하는 **'뇌파(Hidden States)'**를 몰래 채집합니다. 그리고 그 뇌파를 환자 B의 뇌에 '툭' 하고 이식해 버립니다.

만약 이식 후에 환자 B가 갑자기 정답을 맞힌다면? 그건 AI가 겉으로 내뱉는 글자(연습장)와 상관없이, 뇌 속에는 이미 정답을 푸는 핵심 정보가 들어있었다는 증거가 됩니다!

4. 놀라운 발견 (결과)

  • "입은 거짓말을 해도 뇌는 진실을 말한다": AI가 연습장에 틀린 풀이를 적었더라도, 그 과정에서 나온 '뇌파'를 이식했더니 AI가 갑자기 정답을 맞히기 시작했습니다! 즉, 글자로 표현되지 못한 '진짜 실력'이 뇌 속에 숨어 있었던 것이죠.
  • "숫자보다 '말'이 더 중요하다": 신기하게도 "15 + 3 = 18" 같은 숫자 정보보다는, "더한다", "남은 것은", "사과를" 같은 **동사나 명사(언어적 정보)**를 이식했을 때 AI가 정답을 훨씬 더 잘 맞혔습니다. 숫자는 단순한 결과일 뿐이지만, 언어는 문제를 푸는 '논리적 설계도' 역할을 하기 때문입니다.
  • "길게 말할 필요 없다": AI가 연습장에 길게 풀이 과정을 적지 않아도, 핵심적인 뇌파 몇 개만 이식해주면 아주 짧은 답변만으로도 정답을 척척 맞혔습니다. 굳이 구구절절 설명하지 않아도 **'핵심 요령'**만 있으면 된다는 뜻이죠.

5. 요약하자면? (결론)

이 논문은 인공지능에게 "말(출력된 텍스트)"이 전부가 아니라는 것을 보여줍니다.

AI가 겉으로는 횡설수설하거나 계산 실수를 하더라도, 그 내부의 **'생각의 흐름(Hidden States)'**에는 문제를 해결할 수 있는 강력한 에너지가 응축되어 있습니다. 우리는 앞으로 AI가 겉으로 내뱉는 말만 보고 판단할 게 아니라, 그 내부의 '진짜 생각'을 어떻게 더 잘 끌어낼지 연구해야 한다는 아주 중요한 메시지를 던지고 있습니다.


한 줄 요약:
"AI가 수학 문제를 풀다 말실수를 해도, 그 녀석의 '뇌파'를 잘 추출해서 이식해주면 정답을 맞힐 수 있다! 즉, AI의 진짜 실력은 겉으로 보이는 글자가 아니라 내부의 숨겨진 상태에 들어있다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →