← 최신 논문
🤖 machine learning

Where's the Plan? Locating Latent Planning in Language Models with Lightweight Mechanistic Interventions

본 논문은 언어 모델이 계획 과정에서 미래 제약에 대한 내부 표현을 어디에서 어떻게 형성하는지 조사하며, 미래 운율 정보가 여러 모델 계열과 규모에 걸쳐 선형적으로 디코딩 가능하지만, Gemma-3-27B 만이 이러한 정보를 활용하기 위해 특정 후기 계층의 전이 메커니즘에 인과적으로 의존하는 반면, 다른 모델들은 강력한 프로브 신호를 보임에도 불구하고 운율 단어 자체에 조건을 둔다는 사실을 밝혀냅니다.

원저자: Nicole Ma, Nick Rui

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nicole Ma, Nick Rui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마술사가 마술을 공연하는 장면을 상상해 보세요. 그들이 모자에서 토끼를 꺼내는 것은 보이지만, 어떻게 했는지는 알 수 없습니다. 토끼를 처음부터 소매에 숨겨 두었을까요? 아니면 모자에 손을 넣는 순간 마법처럼 소환했을까요?

이 논문은 AI 모델에 대한 X-ray 안경과 같습니다. 연구자들은 궁금해했습니다: AI 가 시를 쓸 때, 다음 줄을 쓰기 시작하기 전에 결말을 비밀리에 "계획"하고 있을까요?

여기는 그들의 발견 이야기를 간단한 부분으로 나누어 설명한 것입니다.

테스트: 운율 도전

이를 테스트하기 위해 연구자들은 AI 모델에게 간단한 과제를 주었습니다: 운율이 맞는 두 줄 시를 완성하라는 것이었습니다.

  • 프롬프트: "그녀는 갑자기 공포감을 느꼈다,"
  • 목표: AI 는 "fright"(공포) 와 운율이 맞는 단어로 끝나는 두 번째 줄을 써야 합니다 (예: "night"나 "light").

질문은 이것입니다: AI 는 두 번째 줄을 타이핑하기 전에 "나는 'fright'와 운율을 맞춰야 한다"는 비밀 내부 메모를 가지고 있을까요? 아니면 단어를 하나씩 쓰면서 그때그때 알아내는 것일까요?

두 가지 도구: "스파이"와 "시간 여행자"

연구자들은 AI 의 뇌 (그들의 "은닉 상태") 를 들여다보기 위해 두 가지 다른 방법을 사용했습니다.

  1. 스파이 (선형 프로빙):
    AI 의 메모를 엿보며 "이봐, 다음 단어가 뭐야?"라고 묻는 스파이를 상상해 보세요.

    • 발견: 그들이 테스트한 거의 모든 AI 모델 (Qwen, Llama, Gemma) 에서 스파이는 답을 찾아냈습니다! AI 가 첫 번째 줄을 끝내는 순간 (개행 문자), AI 의 내부 메모에는 운율에 대한 정보가 실제로 포함되어 있었습니다.
    • 주의점: 스파이가 메모를 찾았다고 해서 AI 가 실제로 그것을 사용하는 것은 아닙니다. 마치 주머니에 지도를 넣고도 무시하고 무작위로 걷는 것과 같을 수 있습니다.
  2. 시간 여행자 (활성화 패칭):
    이것이 진정한 테스트입니다. 당신이 AI 라고 상상해 보세요. 당신은 두 번째 줄을 쓰려고 합니다. 연구자들은 "시간 여행"을 하여 당신의 현재 뇌 상태를 다른 단어 (예: "fright" 대신 "fear"와 운율을 맞추려던) 를 운율 맞추려던 다른 AI 의 뇌 상태와 바꿉니다.

    • 질문: 뇌 상태를 바꾸면, AI 가 갑자기 "fear"와 운율이 맞는 단어를 쓰기 시작할까요?
    • 만약 그렇다면: AI 는 실제로 그 정보를 계획하고 사용했던 것입니다.
    • 만약 아니라면: AI 는 계획을 가진 척하고 있었거나, 나중에 알아낸 것입니다.

큰 놀라움: 실제로 계획한 모델은 하나뿐

이제 이야기가 흥미로워집니다. 결과는 모델마다 매우 달랐습니다:

  • "가짜 계획가" (Qwen 과 Llama):
    이 모델들은 "스파이" 테스트에서는 훌륭했습니다. 첫 번째 줄이 끝날 때 그들의 뇌에 운율 정보가 저장되어 있었습니다. 하지만 연구자들이 "시간 여행자" 테스트를 시도했을 때, 아무 일도 일어나지 않았습니다. 뇌 상태를 바꾸어도 출력은 변하지 않았습니다.

    • 비유: 이는 조리대 위에 조리법 카드 (정보가 있음) 를 두고도 무시하고 냄새와 본능으로 요리하는 셰프와 같습니다. 그들은 요리를 안내하기 위해 실제로 그 계획을 사용하지 않았습니다. 대신 마지막에 쓴 단어 ("fright") 를 계속 보며 다음 단어를 알아냈을 뿐입니다.
  • "진짜 계획가" (Gemma-3-27B):
    이 특정 모델은 달랐습니다.

    • 초기 레이어: 두 번째 줄의 시작 부분에서는 마지막 단어 ("fright") 에 의존했습니다.
    • 인계: 약 30 번째 레이어 (AI 뇌의 특정 깊이) 에서 마법 같은 일이 발생했습니다. "계획 임무"가 마지막 단어에서 개행 문자 (첫 번째 줄 뒤의 빈 공간) 로 이동했습니다.
    • 결과: 연구자들이 개행 문자에서 뇌 상태를 바꾸었을 때, AI 는 즉시 새로운 단어와 운율을 맞추려 하기 시작했습니다.
    • 비유: 이 모델은 지휘자와 같습니다. 노래 시작 시에는 악보 (마지막 단어) 를 봅니다. 하지만 halfway(중반) 에 악보를 내려놓고, 휴식 시간 (개행 문자) 에 구축한 정신적 지도를 바탕으로 오케스트라를 지휘하기 시작합니다. 그들은 실제로 그 계획을 사용하여 음악을 이끌었습니다.

"누가 했나?" 수사

Gemma 모델의 경우, 연구자들은 정확히 뇌의 어떤 부분이 이 계획을 수행했는지 알고 싶어 했습니다. 그들은 이를 매우 작고 구체적인 팀으로 좁혔습니다: 다섯 개의 어텐션 헤드 (이를 AI 뇌의 다섯 개의 특정 뉴런이나 "작업자"로 생각하세요).

그들이 이 다섯 명의 작업자만 건드리면, AI 는 계획 능력을 잃었습니다. 그들이 그들을 방치하면 AI 는 완벽하게 계획했습니다. 이는 messy(불규칙한) 일반적인 과정이 아니라, 작은 팀이 수행한 정밀하고 외과적인 작업이었습니다.

주요 교훈

이 논문은 **AI 가 정보를 가지고 있다고 해서 그것이 계획이라는 뜻은 아니다**라고 결론 내립니다.

  • 많은 모델은 미래의 운율 아이디어를 저장할 수 있습니다 (그들은 지도를 가지고 있습니다).
  • 하지만 하나의 모델 (Gemma-3-27B) 만이 그 저장된 지도를 사용하여 미래 행동을 실제로 이끌고 있습니다 (그들은 지도를 따릅니다).
  • 다른 모델들의 경우, 미래 정보가 기술적으로 그들의 뇌에 앉아 있더라도, 그들은 미래를 계획하는 것이 아니라 즉각적인 과거에 반응할 뿐입니다.

이는 중요합니다. 왜냐하면 "지능"이나 "계획"은 단순히 데이터를 보유하는 것이 아니라, 그 데이터가 어떻게 다음에 일어날 일을 형성하기 위해 적극적으로 사용되는지에 달려 있음을 보여주기 때문입니다. 그리고 놀랍게도, 이 "계획" 능력은 모든 대형 AI 의 일반적인 특징이 아니라, 일부 모델만이 개발한 특정 특징입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →