← 최신 논문
💬 NLP

Causal Evidence of Stack Representations in Modeling Counter Languages Using Transformers

이 논문은 카운터 언어(counter languages)로 학습된 트랜스포머가 특정 스택 표현을 학습하고 이에 의존한다는 인과적 증거를 제공하는데, 이는 식별된 주요 방향(principal direction)을 제거했을 때 순차적 정확도가 0에 가깝게 붕괴되기 때문이다.

원저자: Nishit Singh

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nishit Singh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신에게는 '괄호 맞추기'라는 복잡한 게임을 배우는 아주 똑똑한 로봇이 있습니다. 이 게임은 ((()))나 여러 가지가 뒤섞인 형태처럼 열린 괄호와 닫힌 괄호로 이루어진 문자열을 다룹니다. 게임에서 이기려면 로봇은 현재 닫히기를 기다리고 있는 열린 괄호가 정확히 몇 개인지 알아야 합니다. 만약 숫자를 놓치면 실수를 하게 됩니다.

과학자들은 이 로봇들(트랜스포머라고 불립니다)이 이 게임을 배울 때, 뇌 속에 몰래 '스택(stack)'을 구축한다고 오랫동안 의심해 왔습니다. 즉, 현재의 괄호 개수를 적어두는 정신적인 메모장 같은 것이죠. 하지만 여기서 큰 질문이 하나 생깁니다: 이 정신적인 메모장은 학습의 부수적인 효과일까요, 아니면 실제로 로봇을 움직이게 만드는 '엔진'일까요?

이 논문은 이렇게 말합니다: 그것은 엔진입니다. 스택은 단순한 습관이 아닙니다. 그것은 게임을 가능하게 만드는 로봇 뇌의 핵심적인 부분입니다.

연구진이 이를 증명한 방법은 다음과 같은 간단한 이야기로 설명할 수 있습니다.

1. 설정: 로봇 가르치기

연구진은 작은 로봇에게 이 괄호 게임에서 다음 수를 예측하도록 가르쳤습니다. 그들은 다양한 난이도(단순한 쌍부터 최대 8가지 유형의 복잡한 혼합형까지)를 사용했습니다. 로봇은 매우 능숙해졌고, 결국 완벽한 점수를 얻었습니다.

2. 탐정 놀이: "스택" 찾기

먼저, 연구진은 로봇이 실제로 뇌 속에 '스택'을 가지고 있는지 확인하고 싶었습니다. 그들은 **프로브(probe)**라고 불리는 간단한 도구(금속 탐지기라고 생각하면 됩니다)를 만들었습니다. 그들은 게임의 매 단계마다 로봇의 내부 사고(숨겨진 상태)를 향해 이 탐지기를 비추었습니다.

금속 탐지기는 제대로 작동했습니다! 탐지기는 로봇의 뇌 활동을 관찰하는 것만으로도 현재 공중에 떠 있는(열려 있는) 괄호가 정확히 몇 개인지 알려주었습니다. 이는 로봇이 스택의 깊이를 표현하는 법을 실제로 배웠음을 확인시켜 주었습니다.

3. 대규모 실험: "뇌 수술"

로봇이 이 스택 표현을 가지고 있다는 것을 아는 것은 좋은 일이었지만, 그것이 스택이 필수적이라는 것을 증명하지는 않았습니다. 어쩌면 로봇이 비밀스러운 백업 플랜을 사용하고 있고, 스택은 그저 장식일 수도 있기 때문입니다.

이를 알아내기 위해, 연구진은 게임을 하는 동안 로봇에게 아주 정밀하고 미세한 "뇌 수술"을 수행했습니다.

  • 대상: 연구진은 로봇의 뇌에서 "스택 개수" 정보를 담고 있는 특정 방향을 식별했습니다.
  • 행동: 그들은 게임의 매 단계마다 로봇의 뇌로부터 그 특정 정보를 효과적으로 "끄거나" 지워버렸습니다.
  • 대조군: 또한, 단순히 실수로 로봇을 망가뜨린 것이 아님을 확인하기 위해, 뇌의 무작위적이고 의미 없는 방향들을 지우는 시도도 함께 했습니다.

4. 결과: 로봇의 붕괴

결과는 극적이었습니다.

  • 무작위 정보를 지웠을 때는 로봇이 완벽하게 계속 플레이했습니다.
  • 하지만 스택 정보를 지웠을 때는, 로봇의 성능이 단순히 약간 나빠진 것이 아니라 완전히 붕괴되었습니다.

로봇은 100% 정답을 맞히던 상태에서 거의 **0%**의 정답률로 떨어졌습니다. 마치 달리는 자동차에서 운전대를 뽑아버린 것과 같았습니다. 자동차는 단순히 느리게 가는 것이 아니라, 작동 자체를 멈춰버린 것입니다.

결론

이 실험은 "스택"이 단순한 부수 효과가 아니라는 강력한 증거를 제공합니다. 그것은 인과적으로 필수적입니다. 로봇은 이 퍼즐을 풀기 위해 그 특정한 정신적 스택을 반드시 필요로 합니다. 만약 스택을 제거하면, 로봇은 언어를 이해하는 능력을 상실합니다.

요약하자면: 연구진은 단순히 로봇이 어떻게 생각하는지에 대한 지도를 찾은 것이 아니라, 그 지도가 실제 지형임을 증명했습니다. 스택 표현 없이는 로봇의 뇌가 이 작업을 수행하기 위해 물리적으로 기능할 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →