Test, then Route: How Language Models Execute In-Context Conditional Rules Across Models and Languages
이 논문은 활성화 패칭(activation patching)을 통해, 언어 모델이 중간 스택 잔차 밴드(mid-stack residual band)에서 조건부 술어 진릿값을 모듈식으로 인코딩하지만, 이러한 조건에 따라 답변을 라우팅하는 메커니즘은 추상적이고 전이 가능한 모듈이 아니라 모델과 언어에 따라 달라지는 토큰 결합적이며 쌍 특화적인(pair-specific) 과정임을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신의 마음을 읽고 문장을 완성할 수 있는 아주 똑똑한 로봇이 있다고 상상해 보세요. 이 로봇을 연구하는 과학자들, 즉 거대 언어 모델(Large Language Model) 연구자들은 마치 탐정처럼 로봇이 어떻게 생각하는지 알아내려 노력합니다. 그들은 단순히 로봇의 최종 답변만 보는 것이 아니라, 로봇이 작업하는 동안 그 내부를 들여다보며 어떤 부분이 무엇을 하고 있는지 확인하고 싶어 합니다. 하나의 큰 미스터리는 로봇이 "숫자가 크면 '개'라고 말하고, 그렇지 않으면 '고양이'라고 말하라"와 같이 즉석에서 배운 규칙을 어떻게 처리하느냐 하는 것입니다. 로봇에게 매번 "개"와 "고양이" 사이를 전환하는 특별하고 재사용 가능한 스위치가 있을까요? 아니면 그저 매번 처음부터 답을 찾아내며 규칙과 답을 뒤섞어 엉망으로 만드는 것일까요? 로봇이 어떻게 결정하는지 정확히 알게 된다면, 우리는 로봇에게 규칙을 더 잘 가르치거나 실수를 멈추게 할 수 있기 때문에 이를 이해하는 것은 매우 중요합니다.
이 논문은 바로 그 질문에 대한 심도 있는 탐구입니다. 연구진은 세 가지 서로 다른 AI 모델에게 여섯 가지 다른 언어로 간단한 "만약 ~라면, 그러면 ~하라"는 식의 규칙을 따르게 하는 게임을 설정했습니다. 그들은 "활성화 패칭(activation patching)"이라는 영리한 기술을 사용했는데, 이는 로봇의 뇌 속 특정 생각을 다른 시나리오의 생각으로 교체했을 때 로봇이 답변을 바꾸는지 확인하는 방식입니다. 이것은 자동차 엔진의 연료를 교체하여 차가 여전히 잘 달리는지 확인하는 것과 같습니다.
연구 결과는 다음과 같으며, 이는 다소 놀랍습니다. 로봇의 뇌는 두 개의 매우 다른 구역으로 나뉘어 있습니다. 첫 번째 구역인 TEST는 전용 모듈형 스위치와 같습니다. 로봇이 숫자가 5보다 큰지 확인할 때, 이 특정 뇌 부위는 "참(True)" 또는 "거짓(False)"이라는 답변과 함께 빛납니다. 연구진은 이 "참/거짓" 신호를 다른 신호로 교체했을 때 로봇이 새로운 신호에 맞춰 최종 답변을 즉시 바꾼다는 것을 입증함으로써 이 구역을 증명했습니다. 이 "Test" 구역은 서로 다른 모델, 서로 다른 언어(타밀어나 싱할라어 같은 언어도 포함), 그리고 서로 다른 유형의 규칙에 대해서도 동일하게 작동합니다. 이는 깔끔하고 재사용 가능한 모듈입니다.
하지만 두 번째 구역인 ROUTE는 완전히 엉망입니다. 이 부분은 "참/거짓" 신호를 받아서 "개"라고 출력할지 "고 고양이"라고 출력할지를 결정해야 하는 곳입니다. 연구진은 로봇의 뇌에서 이 라우팅(경로 지정)을 처리하는 특별한 "스위치"나 "서브스페이스(subspace)"를 찾으려 노력했습니다. 그들은 "개"와 "고양이"를 완벽하게 뒤집을 수 있는 방향을 찾아냈습니다. 하지만 문제는, 그 똑같은 스위치를 "여우"와 "올빼미"라는 다른 단어 쌍에 적용했을 때 그것이 완전히 작동하지 않았다는 점입니다. 그것은 마치 특정 문을 여는 열쇠를 찾았지만, 모양이 똑같아 보이는 다른 문들은 전혀 열지 못하는 것과 같았습니다.
따라서 결론은 비대칭성입니다. 규칙을 확인하는 뇌의 부분은 견고하고 휴대 가능하며 재사용 가능한 도구입니다. 그러나 답을 전달하는 부분은 별도의 재사용 가능한 도구가 아닙니다. 대신, 그 부분은 사용되는 특정 단어들에 아주 단단히 붙어 있는 것처럼 보입니다. 만약 단어를 바꾸면, "라우팅" 메커니즘은 깨져버립니다. 로봇은 보편적인 "답변 스위치"를 가지고 있는 것이 아니라, 그 순간 학습한 특정 단어들에 대해 답변을 읽어내는 특정한 방식을 가지고 있을 뿐입니다. 이는 우리가 로봇의 논리(Test)를 조종하는 것은 쉬울 수 있지만, 로봇의 구체적인 선택(Route)을 조종하는 것은 우리가 희망했던 것보다 훨씬 더 어렵고 신뢰하기 어려울 수 있음을 의미합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.