← 최신 논문
🤖 AI

Decomposing how prompting steers behavior

이 논문은 프롬프팅이 내부 표현을 변형함으로써 거대 언어 및 시각-언어 모델을 어떻게 유도하는지를 밝히는 중첩된 기하학적 분해 프래임워크를 소개하며, 특히 차원 간 선형 혼합(cross-dimensional linear mixing)인 아핀 변환이 지시된 작업 구조에 맞춰 표현을 재구성하고 목표 행동을 회복하는 핵심 메커니즘임을 입증한다.

원저자: Fan L. Cheng, Nikolaus Kriegeskorte

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fan L. Cheng, Nikolaus Kriegeskorte

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)이나 시각-언어 모델(VLM)을 하나의 거대하고 복잡한 공장이라고 상상해 보십시오. 이 공장 내부에는 원재료(고양이 사진이나 슬픈 이야기에 관한 문장 같은 것들)가 일련의 컨베이어 벨트(모델의 레이어들)를 통해 흘러갑니다. 재료들이 이동함에 따라, 그것들은 가공되고, 모양이 바뀌며, 정리됩니다.

보통 공장이 생산하는 것을 바꾸려면 기계를 새로 만들어야 합니다(모델을 다시 학습시켜야 함). 하지만 **프롬프팅(prompting)**은 관리자가 공장에 들어와서 새로운 지시를 내리는 것과 같습니다. *"색깔별로 분류하지 말고, 이제 크기별로 분류해!"*라고 말이죠. 기계는 변하지 않지만, 출력값은 갑자기 변화합니다.

이 논문은 다음과 같은 단순하면서도 심오한 질문을 던집니다: 관리자의 외침이 실제로 컨베이어 벨트 위의 아이템들을 어떻게 재배치하여 다르게 분류하게 만드는가?

다음은 일상적인 비유를 사용한 그들의 발견에 대한 분석입니다:

1. 실험: "마법의 지도"

연구진은 일련의 아이템들(예: 1,000개의 서로 다른 이미지)을 가져와 두 가지 서로 다른 지시와 함께 모델에게 보여주었습니다:

  • 프롬프트 A: "이 사진에 사람이 있습니까?" (예/아니오 답변).
  • 프롬프트 B: "이 사진에 사람이 몇 명 있습니까?" (숫자 답변).

그들은 다양한 깊이에서 모델의 "내부 상태"(컨베이어 벨트 위의 아이템 배치)를 관찰했습니다. 그들은 프롬프트 A일 때의 아이템 배치와 프롬프트 B일 때의 배치가 서로 다른 형태를 띠고 있다는 것을 발견했습니다.

그 후 그들은 다음과 같이 물었습니다: " '예/아니오' 배치를 '개수 세기' 배치로 바꿀 수 있는 간단한 지도를 그릴 수 있을까?"

2. 다섯 단계의 "지도" (중첩된 분해)

답을 찾기 위해, 그들은 가장 단순한 것부터 가장 복잡한 것 순으로 다섯 가지 유형의 수학적 "지도"(변환)를 시도했습니다. 이것을 책 더미를 재배치하는 서로 다른 방법이라고 생각하십시오:

  1. 이동 (Translation, 미끄러지듯 움직이기): 책 더미 자체는 건드리지 않고 그냥 테이블 위의 새로운 위치로 통째로 미끄러뜨려 옮기는 것입니다.
  2. 강체 + 균등 스케일링 (Rigid + Uniform Scaling, 강체 이동): 더미를 이동시키고 전체 크기를 약간 키우거나 줄일 수는 있지만, 책들 사이의 상대적인 모양은 그대로 유지하는 것입니다.
  3. 강체 + 축 스케일링 (Rigid + Axis Scaling, 늘리기): 더미를 이동시키고 특정 방향으로 늘리는 것입니다 (예: 고무판을 수평으로는 잡아당기되 수직으로는 당기지 않는 것과 같습니다).
  4. 어파인 (Affine, 섞기): 이동시키고, 늘리고, 그리고 섞는 것입니다. 이것은 "맨 위"에 있는 책을 가져와 "옆면"에 있는 책과 혼합하여 새로운 위치를 만드는 것과 같습니다.
  5. 비선형 (Nonlinear, 뒤틀기): 테이블 자체를 구부리거나 비트는 것입니다. 책들을 복잡하고 예측 불가능한 방식으로 뒤트는 방식입니다.

3. 핵심 발견: 대부분은 "섞기"였다

연구진은 다음을 발견했습니다:

  • "이동(Translation)"이 많은 역할을 수행합니다. 내부 상태를 새로운 위치로 옮기는 것만으로도 변화의 상당 부분을 설명할 수 있습니다.
  • 하지만 "섞기(Affine)"가 비결입니다. 이동이 도움이 되긴 하지만, 모델이 새로운 과업을 완전히 이해하기 위해서는 내부 특징들을 섞어야(교차 차원 선형 혼합) 합니다.
  • "뒤틀기(Nonlinear)"는 필요하지 않았습니다. 놀랍게도, 복잡하게 뒤트는 수학을 사용하지 않아도 모델의 동작을 설명할 수 있었습니다. "섞기(Affine)"를 추가하자 모델의 행동이 거의 완벽하게 복구되었습니다. 복잡한 비선형적인 요소들은 큰 가치를 더해주지 못했습니다.

비유: 여러분에게 레고 블록으로 만든 성(프롬프트 A)이 있다고 상상해 보십시오. 여러분은 이것을 우주선(프롬프트 B)으로 바꾸고 싶습니다.

  • 플라스틱을 녹일(Nonlinear) 필요는 없습니다.
  • 단순히 상자를 방 안의 다른 곳으로 옮길(Translation) 필요도 없습니다.
  • 성을 해체하고, 조각들을 늘리고, 새로운 구조물로 만들기 위해 브릭들을 재배치하고 섞어야 합니다. 이 논문은 이러한 "재배치와 섞기"가 프롬프트가 작동하는 핵심 메커니즘임을 밝혀냈습니다.

4. "인과적" 테스트: 지도가 실제로 작동하는가?

이것이 단순한 우연이 아님을 증명하기 위해, 그들은 모델에 "수술"을 가했습니다:

  1. 그들은 "예/아니오" 프롬프트와 함께 이미지를 모델에 입력했습니다.
  2. 특정 레이어에서 프로세스를 중단했습니다.
  3. 그 내부 상태에 자신들의 "섞기 지도"를 적용했습니다.
  4. 모델이 처리를 완료하도록 내버려 두었습니다.

결과: 모델은 여전히 "예/아니오" 질문을 받고 있음에도 불구하고, 갑자기 "개수 세기" 답변을 하기 시작했습니다! 이는 기하학적 변환(지도)이 행동의 변화를 **유발(cause)**한다는 것을 입증했습니다.

5. 서로 다른 모델, 서로 다른 전략

서로 다른 공장에 서로 다른 관리자가 있듯이, 서로 다른 AI 모델들도 서로 다른 전략을 사용합니다:

  • OPT-2.7B는 초기에 "늘리기"와 "섞기"(복잡한 변환)에 크게 의존하는 것으로 보입니다.
  • Llama3와 Qwen3는 초기에 단순한 "이동(Translation)"에 더 많이 의존하는 것으로 보이며, 데이터를 적절한 위치로 옮겨주는 특정 "지시 코드"를 사용하는 듯합니다.

요약

이 논문은 AI에게 새로운 지시를 내릴 때, 모델이 근본적으로 뇌를 다시 쓰거나 복잡하게 뒤트는 수학을 수행할 필요가 없다고 결론짓습니다. 대신, 모델은 주로 내부 이해도를 새로운 위치로 **이동(slide)**시키고, 새로운 과업에 맞게 특징들을 직선적인 방식(어파인 변환)으로 섞어서(mix) 적응합니다.

이는 AI 모델이 어떻게 지시를 "듣는지"에 대한 명확한 기하학적 그림을 제공합니다. 모델들은 본질적으로 내부 데이터를 정교하고 다단계로 재배치하는 작업을 수행하며, 우리는 이제 그 재배치가 단순한 이동인지 아니면 복잡한 혼합인지를 정확하게 측정할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →