← 최신 논문
🤖 machine learning

The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models

본 논문은 소규모 언어 모델 (1~3B) 이 체인 오브 씽킹 프롬프팅에서 정답 구분 기호 바로 앞의 숫자를 단순히 복사하는 위치적 단서에 의존함으로써 진정한 산술 추론을 우회하는 경우가 많으며, 이러한 메커니즘이 성능을 지배하고 CoT 기반 감독의 충실성을 훼손한다는 사실을 밝힌다.

원저자: Ming Liu

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ming Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

작고 열정적인 로봇에게 수학 문제를 풀라고 상상해 보세요. 당신은 로봇에게 최종 답을 제시하기 전에 단계별로 풀이 과정을 보여달라는 '생각의 사슬 (Chain of Thought, CoT)' 프롬프트를 줍니다. 당신은 로봇이 수학을 풀고, 논리를 검증한 뒤 결과를 적어낼 것이라고 기대합니다.

하지만 이 논문은 놀라운 비밀을 밝혀냈습니다: 로봇은 실제로 답을 얻기 위해 수학을 풀고 있는 것이 아닙니다. 그저 마지막에 본 숫자를 복사할 뿐입니다.

연구자들이 발견한 내용을 간단한 비유로 정리해 보면 다음과 같습니다:

1. "마지막 페이지" 속임수

정답이 맨 마지막 페이지에 숨겨진 동화책을 읽고 있다고 상상해 보세요.

  • 기대: 로봇이 이야기 전체를 읽고, 줄거리를 이해한 뒤 결말을 추론할 것이라고 생각합니다.
  • 현실: 로봇은 훑어볼 뿐입니다. 줄거리, 등장인물, 논리는 무시합니다. 그저 "끝 (The End)" 표시 (구분자 ####) 바로 전에 쓰인 맨 마지막 숫자를 보고 복사할 뿐입니다.

연구자들은 이야기의 페이지 순서를 뒤섞어 이를 증명했습니다.

  • 수학 단계의 순서를 뒤섞되 마지막 페이지에 올바른 답을 남겨두면, 로봇은 여전히 정답을 맞췄습니다.
  • 수학 단계의 순서는 완벽하게 유지하되 올바른 답을 이야기 중간으로 옮기면, 로봇은 실패했습니다.
  • 결론: 논리의 순서는 중요하지 않습니다. 오직 마지막 숫자의 위치만이 중요합니다.

2. "산만함 (Distractor)" 함정

로봇이 실제로 사고하는지 테스트하기 위해 연구자들은 장난을 쳤습니다. 완벽하고 올바른 수학 해설을 작성한 뒤, "끝 (The End)" 표시 바로 직전에 틀린 숫자를 슬쩍 끼워 넣은 것입니다.

  • 결과: 로봇은 방금 작성한 올바른 수학을 무시하고 자신 있게 틀린 숫자를 복사했습니다.
  • 비유: 칠판에서 문제를 올바르게 푼 학생이 있지만, 시험지를 제출하기 직전 선생님이 귓속말로 잘못된 답을 속삭이는 것과 같습니다. 학생은 자신의 올바른 풀이를 지우고 방금 들은 대로 적어냅니다.
  • 테스트된 소형 모델 (10 억~30 억 파라미터) 에서 이는 **87% 에서 95%**의 빈도로 발생했습니다. 로봇이 숫자가 맞는지 틀린지는 상관없었습니다. 그저 그것이 마지막 숫자라는 사실만 중요했을 뿐입니다.

3. "마법의 문" (다른 로봇, 다른 규칙)

모든 로봇이 정확히 같은 방식으로 행동하는 것은 아닙니다. 연구자들은 세 가지 다른 유형의 소형 모델을 테스트했습니다.

  • Qwen 과 Llama: 이들은 "복사기"와 같습니다. 마지막에 있는 숫자가 가짜 산만함 (distractor) 이라 하더라도 어떤 숫자든 복사해냅니다. 필터가 거의 없습니다.
  • Gemma: 이 로봇은 조금 더 영리합니다. "문"이 있습니다. 마지막 숫자가 명백히 틀리거나 문맥에 맞지 않는다면, 때로는 복사하기를 거부합니다. 더 선택적이지만 여전히 마지막 위치에 크게 의존합니다.

4. "숨겨진 계산"

가장 놀라운 부분은 여기 있습니다: 로봇은 실제로 수학을 풀 수 있습니다.

  • 연구자들이 "마지막 숫자"를 완전히 제거하자 (로봇에게 최종 답을 복사할 수 있는 숫자 없이 수학 단계만 남김), 로봇의 정확도가 크게 향상되었습니다.
  • 비유: 보통 페이지 하단의 정답지를 훔쳐보며 속임수를 쓰는 학생을 상상해 보세요. 정답지를 테이프로 가리면 학생은 실제로 문제를 풀어야 합니다. 그들은 할 수 있습니다! 하지만 정답지가 하단에 보이는 한, 그들은 자신의 풀이를 무시하고 그냥 그것을 복사할 뿐입니다.
  • 마지막 숫자를 복사하는 이 "단순한 방법"은 로봇이 자신의 계산 능력을 사용하는 것을 방해할 정도로 강력합니다.

5. AI 를 "검증"하는 데 이것이 중요한 이유

많은 사람들이 AI 가 정직한지 확인하기 위해 "생각의 사슬"을 사용합니다. 논리가 타당한지 확인하기 위해 단계들을 살펴봅니다.

  • 문제: 이 논문은 소형 모델의 경우 단계들이 종종 단순한 "장식"임을 보여줍니다. 로봇은 단계들을 적어내지만, 최종 답은 완전히 다른 게으른 메커니즘 (마지막 숫자 복사) 에 의해 결정됩니다.
  • 위험: 로봇이 수학 문제에 대한 완벽하고 논리적인 설명을 작성하더라도, 실수로 (또는 악의적으로) 맨 마지막에 잘못된 숫자를 넣을 수 있습니다. 로봇은 그 잘못된 숫자를 출력할 것이며, 인간 검토자는 "아, 단계들은 훌륭해 보이니 답도 틀림없이 맞겠군"이라고 생각할 수 있습니다. 하지만 로봇은 실제로 그 단계들을 이용해 답을 얻지 않았습니다.

요약

소형 AI 모델의 세계에서는 생각의 사슬 (Chain of Thought) 이 종종 과정이 아닌 퍼포먼스입니다. 모델은 똑똑해 보이게 논리를 적어내지만, 최종 답을 줄 때가 되면 단순한 방법을 택합니다: 본 마지막 숫자를 집어 복사하고 나머지는 무시합니다.

이는 70 억~80 억 파라미터 규모의 더 크고 진보된 모델에서는 발생하지 않습니다. 그런 모델들은 복사하기 전에 숫자의 내용을 실제로 확인하기 시작합니다. 하지만 더 작고 저렴한 모델들의 경우, "마지막 숫자" 규칙이 왕입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →