← 최신 논문
🤖 machine learning

Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs

본 논문은 대규모 언어 모델이 반복된 토큰을 세지 못하는 실패가 내부적으로 올바른 개수를 표현할 수 없는 능력 부족에서 비롯된 것이 아니라, 출력 생성 과정에서 고정된 잘못된 답변으로 정확한 표현을 덮어쓰는 특정 형식 유발 MLP 메커니즘에서 비롯됨을 보여준다.

원저자: Sohan Venkatesh

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sohan Venkatesh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 독서량이 풍부한 사서 (AI 모델) 가 있다고 가정해 봅시다. 이 사서에게 긴 목록에서 "사과"라는 단어가 몇 번 등장하는지 세어달라고 요청합니다. 당연히 정확하게 세어낼 것이라고 기대하지만, 대신 그들은 자신 있게 "사과가 8 개 있습니다"라고 말합니다. 하지만 분명히 10 개가 있습니다.

오랫동안 사람들은 이 사서가 단순히 셈을 잘하지 못한다고 생각했습니다. 사서의 뇌에 "세는 기능"이 내장되어 있지 않아서 숫자를 추적할 수 없다고 가정했습니다.

이 논문은 그 가정이 잘못되었다고 말합니다.

연구자들이 실제로 발견한 내용을 일상적인 비유를 사용해 간단히 설명해 보겠습니다.

1. 사서는 정답을 알고 있습니다

연구자들은 사서의 뇌 (모델의 내부 계층) 를 깊이 들여다보며 사고 과정의 모든 단계를 관찰했습니다. 그들은 올바른 숫자 (10) 가 첫 단계부터 마지막 단계까지 명확하고 완벽하게 기록되어 있음을 발견했습니다.

  • 비유: 사서가 손에 화이트보드를 들고 복도를 걷고 있다고 상상해 보세요. 걷는 모든 단계에서 화이트보드에는 명확하게 "10"이라고 적혀 있습니다. 정보가 그곳에 선명하고 또렷이 존재합니다. 사서는 혼란스러운 것이 아닙니다. 그들은 실제로 정답을 알고 있습니다.

2. "오작동"하는 표지판 작성자

그렇다면 사서가 정답이 10 임을 알고 있음에도 불구하고 왜 "8"이라고 말할까요?

연구자들은 복도 중간에 특정 "오작동"이 있음을 발견했습니다. 사고 과정의 약 90% 지점에서, 목록의 형식 (공백으로 구분된 단어) 을 보고 화이트보드를 무시하기로 결정하는 특정 작업자 (MLP 블록이라고 불리는 컴퓨터 코드 부분) 가 있습니다.

  • 비유: 사서가 "10"이라는 표지판을 들고 복도를 걷고 있다고 상상해 보세요. 갑자기 특정 작업자 (그를 '형식 프레드'라고 부르겠습니다) 가 튀어 나옵니다. 프레드는 목록이 공백으로 작성된 것 ("사과 사과 사과"와 같이) 을 봅니다. 그는 사전에 프로그래밍된 규칙을 가지고 있습니다. "만약 공백으로 구분된 단어 목록을 보게 되면, 표지판을 '8'이라고 바꾸어야 한다."
  • 프레드는 화이트보드를 낚아채 "10"을 지우고 그 위에 "8"이라고 씁니다.
  • 사서의 뇌는 여전히 그것이 10 임을 알고 있습니다 (원래 신호는 여전히 배경에 남아 있습니다). 하지만 최종 출력은 프레드가 덮어썼기 때문에 이제 "8"이 됩니다.

3. 단어의 문제가 아니라 형식의 문제입니다

이 오작동은 단어 ("사과"나 "고양이"와 같은) 에 대해서만 발생하며, 숫자 ("1"이나 "2"와 같은) 에 대해서는 발생하지 않습니다.

  • 비유: 만약 사서에게 숫자 목록 ("1 1 1 1...") 을 주면, 형식 프레드는 관심을 갖지 않습니다. 그는 단어에만 반응합니다. 사서는 숫자를 완벽하게 셉니다. 하지만 만약 단어 목록을 주면 프레드가 발동됩니다.
  • 또한, 공백 대신 쉼표로 형식을 변경하면 (예: "사과, 사과, 사과"), 프레드는 튀어 나오지 않습니다. "8" 규칙이 발동되지 않아 사서가 정확하게 답을 냅니다. 이는 문제가 셈 능력에 있는 것이 아니라, 목록이 어떻게 보이는지에 대한 특정 반응에 있음을 증명합니다.

4. "표현" 문제가 아닌 "라우팅" 문제입니다

이 논문은 두 가지 유형의 실패를 크게 구분합니다.

  • 표현 실패: 사서가 셈을 하는 방법을 모릅니다. (이 논문은 이것이 아니라고 말합니다).

  • 라우팅 실패: 사서는 셈을 하는 방법을 알지만, 신호가 입에 도달하기 전에 탈취됩니다. (이것이 일어나고 있는 일입니다).

  • 비유: 라디오 방송국이 올바른 노래 (숫자 세기) 를 틀고 있는데, 부스 안의 DJ(MLP 블록) 가 음악이 스피커로 나가기 직전에 음악을 끊고 다른 노래 (잘못된 숫자) 를 틀기로 결정하는 것과 같습니다. 음악은 문제없습니다. 라우팅이 고장 난 것입니다.

5. 더 큰 모델은 다른 오작동을 가집니다

연구자들은 더 크고 똑똑한 모델들도 살펴보았습니다. 이러한 모델들은 보통 숫자를 정확하게 세지만, 사과 목록에 "바나나"를 슬쩍 넣으면 실패합니다.

  • 오작동: 이러한 더 큰 모델들은 바나나를 봅니다. 그들의 주의 시스템이 그것을 감지합니다. 하지만 더 작은 모델들과 마찬가지로, 그 정보가 최종 답변을 바꾸도록 허용하지 못합니다. 그들은 이상치를 보지만 그 새로운 정보를 최종 출력으로 "라우팅"할 수 없습니다.

결론

이 논문은 이러한 AI 모델들이 "셈을 못 하는 것"이 아니라고 결론 내립니다. 그들은 실제로 내부적으로 숫자를 추적하는 데 매우 능숙합니다. 문제는 목록이 어떻게 작성되었는지 (공백 대 쉼표, 단어 대 숫자) 에 따라 뇌의 특정 부분이 발동되어 이미 존재하던 올바른 답변을 덮어쓰고 잘못된 답변을 최종 출력으로 강요한다는 점입니다.

이를 해결하기 위해 AI 에게 셈을 가르칠 필요는 없습니다 (이미 알고 있습니다). 우리는 올바른 답변이 밖으로 나가는 것을 막고 있는 "교통 경찰"(라우팅 메커니즘) 을 고쳐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →