← 최신 논문
🤖 machine learning

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

본 논문은 언어 모델이 운율이나 답변과 같은 미래 목표를 향해 중간 토큰을 유도하는 메커니즘인 암묵적 계획이 10 억 파라미터 규모의 모델에서도 발견되는 보편적 능력임을 입증하는 간단하고 확장 가능한 기법을 소개함으로써 AI 안전 및 제어에 대한 새로운 통찰을 제공합니다.

원저자: Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마술사가 모자에서 토끼를 꺼내는 장면을 상상해 보세요. 당신은 궁금해할 수 있습니다: 마술사는 트릭을 시작하기 전에 토끼를 꺼낼 계획이 있었을까, 아니면 모자에 손을 넣는 순간 갑자기 토끼를 꺼내기로 결정했을까?

오랫동안 과학자들은 챗봇과 같은 도구의 뒤를 이끄는 AI 두뇌인 대규모 언어 모델 (LLM) 이 미리 계획하지 않는 마술사와 같다고 생각했습니다. 그들은 AI 가 문장이 어디로 향할지 전혀 모른 채, 앵무새가 소리를 반복하듯 이전 단어를 바탕으로 다음 단어를 예측할 뿐이라고 믿었습니다.

'계획은 무엇인가 (What's the Plan?)'라는 제목의 이 논문은 AI 가 단순한 앵무새가 아니라 전략적 건축가라고 주장합니다. 이 논문은 이러한 모델들이 말을 하고 있는 동안에도 비밀리에 미래의 행동을 계획하고 있음을 보여줍니다.

다음은 저자들이 간단한 비유를 사용하여 이를 증명하는 방법입니다:

1. 두 가지 유형의 계획

저자들은 시를 쓰는 작가를 예로 들어 계획을 두 부분으로 정의합니다:

  • 전향적 계획 (청사진): 문장의 두 번째 절반을 쓰기 전에, AI 는 뇌 속에 숨겨진 '청사진'을 만듭니다. AI 는 "이 줄은 'cat'과 운율이 맞는 단어로 끝내야 해"라고 알고 있습니다.
  • 후향적 계획 (시공): 문장의 중간 단어를 쓰면서, AI 는 그 'cat'으로의 끝맺음을 매끄럽게 하기 위해 그 단들을 은근히 다듬습니다. 이는 100 미터 앞의 커브를 미리 보고, 아직 커브에 도달하기 전에 지금 속도를 줄이고 차선을 바꾸는 운전사와 같습니다.

2. 실험: 운율과 질문

이를 증명하기 위해 연구자들은 AI 에게 복잡한 에세이를 쓰게 하지 않았습니다. 대신 두 가지 간단한 과제를 주었습니다:

  • 운율 맞추기: 연구자들은 AI 에게 시의 첫 줄을 주고, 두 번째 줄을 특정 운율로 끝내도록 요청했습니다 (예: 첫 줄이 'brick'으로 끝나면, 두 번째 줄은 'stick', 'trick', 또는 'sick'으로 끝나야 함).
  • 질문 답변: 연구자들은 'a'와 'an' 중 하나를 선택하는 것과 같은 특정 문법 규칙이 필요한 답변을 요구하는 질문을 했습니다 (예: "a whale" 대 "an eye").

3. '리모컨' 트릭

이 논문에서 가장 멋진 부분입니다. 연구자들은 AI 를 지켜보는 것뿐만 아니라 문장 중간에 AI 의 뇌를 해킹했습니다.

AI 가 시를 쓰고 있다고 상상해 보세요. 첫 줄이 끝나자마자 연구자들은 '리모컨'(수학적 벡터) 을 사용하여 AI 의 뇌를 살짝 밀었습니다.

  • 밀어주기: 연구자들은 AI 의 뇌에 "당신이 생각하던 운율을 잊어라. 이제 '-ight'(예: light 또는 night) 운율을 계획해라"라고 지시했습니다.
  • 결과: AI 는 단순히 마지막 단어만 바꾼 것이 아니라 문장 중간을 다시 썼습니다.
    • 밀어주기 전: "Soaring above where true joy will sing."
    • 밀어주기 후: "Soaring above bathed in a golden light."

AI 는 "where true joy will"을 "bathed in a golden"으로 바꿨습니다. 새로운 목적지 ('light') 로 가는 다리를 만들어야 했기 때문입니다. 이는 AI 가 처음부터 뇌 속에 계획을 가지고 있었고, 새로운 계획에 맞춰 경로를 조정했음을 증명합니다.

4. '작은 뇌' 발견

이 논문에서 큰 놀라움 중 하나는 작은 AI 모델조차 이를 수행한다는 사실입니다.
이전에는 과학자들이 거대하고 초복잡한 모델만이 미리 계획을 세울 수 있다고 생각했습니다. 하지만 저자들은 10 억 개의 파라미터만 가진 모델들 (AI 세계에서는 상대적으로 작은 규모) 도 이러한 계획을 수행하고 있음을 발견했습니다. 이는 '초지능' 모델만의 기능이 아니라, 이러한 모델이 작동하는 방식의 기본적인 습관입니다.

5. '관사' 테스트

연구자들은 "무엇으로 보나요?" (답: an eye) 와 같은 질문으로도 이를 테스트했습니다.
연구자들이 AI 에게 'heart'( 'a'가 필요함) 를 생각하도록 밀어주었을 때, AI 는 'heart'라는 단어를 쓰기 전에 즉시 'an' 대신 'a'를 사용하기 시작했습니다.
이는 마치 사람이 "I want to buy a..."라고 말하고 자음으로 시작하는 단어를 생각하기 위해 잠시 멈추는 것이지, "I want to buy an..."이라고 말하고 실수를 깨닫는 것이 아닙니다. AI 는 여행을 시작하기 전에 목적지를 알고 있었습니다.

요약

이 논문은 다음과 같이 주장합니다:

  1. AI 는 미리 계획을 세웁니다: AI 는 목적지에 도달하기 전에 가고자 하는 곳의 숨겨진 지도를 만듭니다.
  2. 경로를 조정합니다: 여행 도중 목적지를 바꾸면, AI 는 마지막 단계뿐만 아니라 그곳에 도달하기 위해 취하는 단계들 전체를 바꿉니다.
  3. 이는 어디에나 있습니다: 이는 작은 모델과 큰 모델 모두에서, 시와 단순한 질문 모두에서 발생합니다.

저자들은 이 특정 논문에서 새로운 앱을 만들거나 안전 문제를 해결하기 위해 이를 사용하지 않았습니다. 그들은 단순히 AI 의 '마법'이 무작위 추측이 아니라 숨겨진 암묵적 계획의 한 형태임을 증명하고자 했을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →