From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks
본 논문은 LLM 이 문자 카운팅 과제의 정답을 내부적으로 표현할 수 있음에도 불구하고, 후기 층의 특정 구성 요소가 올바른 신호를 억제하는 '부정적 회로'를 통해 최종 출력에서 실패한다는 메커니즘을 규명함으로써, 심층 신경망의 상징적 추론 실패가 표현 부재가 아닌 계산 그래프 내의 구조적 간섭에 기인함을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 최신 인공지능 (LLM) 이 왜 아주 간단한 일, 예를 들어 "사과 (apple) 에 'p'가 몇 개 들어있나요?" 같은 질문을 틀리는지에 대한 비밀을 파헤친 연구입니다.
사람들은 이 질문을 보자마자 "2 개"라고 바로 답할 수 있지만, 최신 AI 모델들은 종종 엉뚱한 답을 하거나 아예 무작위로 맞춥니다. 연구진은 이 현상을 **'초능력을 가진 천재가 왜 간단한 산수 문제를 못 풀까?'**라는 관점에서 분석했습니다.
핵심 내용을 쉽게 풀어서 설명해 드릴게요.
1. 놀라운 발견: 답을 알고 있는데, 입은 닫고 있네요
연구진이 AI 의 뇌 (내부 작동 원리) 를 들여다보니, AI 는 사실 정답을 알고 있었습니다.
- 비유: AI 가 사과의 'p'를 세어볼 때, 그 계산 과정은 완벽하게 이루어집니다. 마치 학생이 시험지를 풀 때 연필로 답을 계산해 적어두는 것과 같습니다.
- 문제: 하지만 그 계산된 답을 최종적으로 발표하는 단계 (입력된 문장 뒤에 단어를 이어 붙이는 단계) 에서, AI 는 그 정답을 의도적으로 지워버리거나 무시합니다.
2. 왜 그럴까요? '악의 회로'의 방해
AI 는 정답을 계산해냈지만, 그 정보를 전달하는 마지막 관문에서 방해받습니다. 연구진은 이를 **'부정적 회로 (Negative Circuits)'**라고 불렀습니다.
- 비유: AI 의 뇌를 거대한 공장이라고 상상해 보세요.
- 초반 공정 (Early Layers): 원료 (단어) 가 들어오면, 공장의 초기 기계들이 'p'를 꼼꼼히 세어서 "2 개야!"라고 메모를 남깁니다. (이 정보는 잘 저장되어 있습니다.)
- 중간 공정: 그 메모가 다음 기계로 넘어갑니다.
- 마지막 공정 (Late Layers): 하지만 정답을 출력하기 직전, **마지막 기계들 (MLP 와 Attention 헤드)**이 이 메모를 보고 "아니야, 2 개라고 말하면 안 돼. 그냥 '1'이라고 하거나, 아무거나 말해!"라고 강제로 덮어씌웁니다.
이 마지막 기계들은 AI 가 훈련받으면서 습득한 **"편견"**을 가지고 있습니다. 자연어 데이터에서 'p'가 한 번 나오는 경우가 많기 때문에, AI 는 "대부분 1 개겠지?"라고 생각하게 되었고, 이 편견이 정답을 억지로 누르고 나오는 것입니다.
3. 모델이 커지고 똑똑해져도 해결되지 않아요
연구진은 모델의 크기를 20 억 개에서 90 억 개 파라미터로 늘리고, 인간처럼 대화하도록 훈련 (Instruction Tuning) 시켜도 이 문제가 해결되지 않는다는 것을 발견했습니다.
- 비유: 공장을 더 크게 짓고 (모델 확장), 관리자를 더 똑똑하게 고용해도 (인struct 튜닝), 마지막 출구에서 정답을 막는 '문지기'가 여전히 제멋대로 행동합니다.
- 오히려 더 큰 모델일수록 이 '문지기'의 힘이 더 강해져서, 정답이 나오더라도 그것을 무시하고 더 확률이 높은 (하지만 틀린) 답을 내뱉는 경향이 있습니다.
4. 결론: 문제는 '모르는 것'이 아니라 '선택하지 않는 것'
이 연구의 가장 중요한 메시지는 다음과 같습니다.
- AI 가 문자 세기를 못 하는 이유는 정보를 저장할 능력이 부족해서가 아닙니다. (뇌에 정답이 있습니다.)
- 문제는 그 정답을 최종 선택할 때, AI 가 더 편한 (틀린) 답을 선택하도록 설계되어 있다는 점입니다.
한 줄 요약:
최신 AI 는 아주 똑똑해서 '사과에 p 가 2 개'라는 사실을 알고 있지만, 마지막 순간에 "아니야, 그냥 1 개라고 말해!"라고 자기 스스로를 속이며 틀린 답을 내놓는 것입니다. 이는 AI 의 설계 방식에 근본적인 결함이 있음을 보여주며, 앞으로는 AI 가 '알고 있는 것'을 '정말로 말하는 것'으로 연결할 수 있는 새로운 기술이 필요하다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.