Tool-Call Dependency Structure is Linearly Decodable in LLM Agent Residual Streams
본 논문은 LLM 에이전트의 도구 호출 궤적에 대한 방향성 의존성 그래프가 모델의 잔여 스트림으로부터 선형적으로 디코딩 가능함을 입증하여, 네트워크가 단순히 위치 순서나 식별자 값을 추적하는 것이 아니라 추상적 실행 토폴로지를 능동적으로 표현함을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 글은 간단한 언어와 창의적인 비유를 사용하여 해당 논문을 설명합니다.
핵심 아이디어: 계획의 "유령"을 읽기
거대 언어 모델 (LLM) 을 매우 똑똑하지만 약간 건망증이 있는 조수로 상상해 보세요. 이 조수에게 "사용자를 찾고, 주문을 확인한 후 제품을 교환하라"와 같은 복잡한 작업을 요청하면, 그것은 거대한 한 번의 도약으로 수행되지 않습니다. 대신 다양한 도구를 호출하며 여러 단계를 거쳐야 합니다.
이 논문은 다음과 같은 간단한 질문을 던집니다: 모델이 생각할 때, 이러한 단계들이 서로 어떻게 연결되는지 "알고" 있을까요?
구체적으로, 단계 A 가 단계 B 에 필요한 정보를 제공한다면, 모델의 내부 뇌 (즉, "잔여 스트림") 에 실제로 그 연결을 보여주는 지도가 존재할까요? 아니면 모델이 마지막으로 말한 내용을 바탕으로 다음 단계를 추측하고 있을까요?
연구자들은 모델이 실제로 이 지도를 보유하고 있다는 사실을 발견했습니다. 그들은 모델의 내부 사고를 읽어내고 숨겨진 의존성 그래프 (누가 누구로부터 무엇을 필요로 하는지에 대한 지도) 를 높은 정확도로 드러낼 수 있는 작고 간단한 "디코더"를 구축했습니다.
비유: 건설 현장의 설계도
모델을 건설 현장이라고 상상해 보세요.
- 도구: 모델은 "사용자 조회"나 "주문 조회"와 같은 도구를 사용합니다.
- 궤적: 모델이 취하는 행동의 순서입니다.
- 의존성 그래프: 이것이 설계도입니다. "시멘트 배송 영수증 (단계 A) 을 받기 전까지는 콘크리트를 부을 수 없습니다 (단계 B)"라고 말합니다.
보통 우리는 완성된 건물 (최종 답변) 만 봅니다. 작업자들의 머리 속에 있는 설계도는 보이지 않습니다. 이 논문은 작업자들이 일하는 동안 그들의 마음속에 떠다니는 설계도를 볼 수 있게 해주는 특수 X 선 안경을 쓴 것과 같습니다.
그들이 어떻게 했는지 ("디코더"를 통해)
연구자들은 Qwen3-32B라는 모델을 사용했습니다. 그들이 문제를 해결하는 과정을 관찰하며 내부 "잔여 스트림" (현재의 사고 상태를 나타내는 연속적인 데이터 스트림) 을 기록했습니다.
그들은 매우 작고 간단한 도구 ("프로브") 를 훈련시켜 이 스트림을 살펴보고, 과정 내의 임의의 두 단계에 대해 이진 질문을 답하도록 했습니다:
"단계 A 의 출력이 단계 B 의 입력으로 전달되는가?"
결과:
- 작동합니다: 프로브는 이러한 연결을 약 87% 의 정확도로 예측할 수 있었습니다.
- 속임수가 아닙니다: 그들은 무작위 추측과 "단계 2 는 항상 단계 1 을 따른다"와 같은 단순한 패턴에 대해 테스트했습니다. 프로브는 이들보다 훨씬 잘 수행하여, 단순히 사건의 순서가 아니라 연결의 논리를 실제로 읽고 있음을 증명했습니다.
- 추상적입니다: 데이터의 구체적인 숫자를 변경했음에도 (예: 사용자 ID 를 "123"에서 "456"으로 변경) 구조는 동일하게 유지했을 때, 프로브는 여전히 작동했습니다. 이는 모델이 구체적인 단어가 아니라 관계 (A 는 B 에 의존함) 를 이해한다는 것을 의미합니다.
기계 속의 "유령" (전파)
가장 흥미로운 발견 중 하나는 이 정보가 어떻게 이동하는지에 관한 것입니다.
첫 번째 작업자 (단계 A) 에게 속삭임을 전한다고 상상해 보세요. 이 논문은 이 비밀이 작업자가 일을 끝낸 후 단순히 사라지는 것이 아님을 보여줍니다. 그것은 전체 건설 현장을 통과하여 마지막 작업자 (단계 Z) 까지 "공기" (잔여 스트림) 속에 머무르며 이동합니다.
그들은 첫 번째 작업자의 내부 상태를 다른 시나리오로 "패치" (교체) 함으로써 이를 증명했습니다. 모델이 최종 행동을 바꾸지 않았음에도 (여전히 같은 집을 지음), 후속 작업자들 내부의 "설계도"는 새로운 시나리오에 맞춰 변경되었습니다. 이는 모델이 즉각적인 프롬프트에 반응하는 것을 넘어 구조적 계획을 능동적으로 전달하고 있음을 시사합니다.
이 지도가 언제 사라지는가?
연구자들은 이 지도가 항상 존재하는지 확인하기 위해 다양한 유형의 작업에서 이를 테스트했습니다. 그들은 다음과 같은 패턴을 발견했습니다:
- 복잡한 체인 (멀티 홉): 작업이 긴 의존성 체인 (A B C D) 을 필요로 한다면, 지도는 매우 명확하고 읽기 쉽습니다.
- 단순한 목록: 작업이 연결 없이 독립적인 단계들의 목록 (A, 그 다음 B, 그 다음 C) 일 뿐이라면, 지도는 사라집니다.
- "순서" 단서: 단계가 너무 단순하여 단순히 순서만 알면 모든 것이 알려진 경우 (예: "먼저 A 를 하고, 그 다음 B 를 하라"), 모델은 복잡한 내부 지도를 구축할 필요가 없습니다. 위치만으로도 충분하기 때문에 "추가" 신호는 사라집니다.
이것이 의미하는 바 (그리고 의미하지 않는 바)
의미하는 바:
우리는 AI 에이전트 내부로 들여다보는 새로운 방법을 발견했습니다. 우리는 그들이 다음 단어를 맹목적으로 추측하는 것이 아니라, 그들의 행동이 서로 어떻게 의존하는지에 대한 구조적이고 추상적인 지도를 유지하고 있음을 알 수 있습니다. 이 지도는 선형적 (읽기 쉬움) 이며 모델의 계층을 통해 이동합니다.
의미하지 않는 바 (이 논문에 근거한 엄격한 해석):
- 이것이 우리가 모델을 더 나은 결정을 내리도록 쉽게 조절할 수 있음을 의미하지는 않습니다 (논문은 명시적으로 패칭이 내부 지도를 변경했지만 최종 행동은 변경하지 않았다고 말합니다).
- 이것이 모든 AI 모델이나 모든 작은 모델에서 작동함을 의미하지는 않습니다 (그들은 특정 대형 모델만 테스트했습니다).
- 이것이 우리가 이를 사용하여 "환각"을 수정하거나 모델을 더 안전하게 만들 수 있음을 의미하지는 않습니다; 그것은 미래의 과제입니다.
요약
이 논문은 마술사의 조수가 대본을 단순히 암기하는 것이 아니라, 전체 트릭의 논리에 대한 정신적 지도를 실제로 들고 있다는 것을 발견한 것과 같습니다. 간단한 디코더를 사용하여 연구자들은 이 지도가 존재하며 모델의 뇌를 통해 이동하고, 복잡하고 다단계 문제를 해결하는 데 필수적임을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.