← 최신 논문
💬 NLP

Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention

본 논문은 기존 접근법의 제한적인 가정을 극복하여 AxBench 에서 기존 스티어링 기법과 인-컨텍스트 프롬프팅 모두를 능가하는 모델 활성화를 운반하기 위해 일반적이고 개념 조건부 속도장을 학습하는 흐름 기반 활성화 스티어링 방법인 FLAS 를 소개합니다.

원저자: Zehao Jin, Ruixuan Deng, Junran Wang, Xinjie Shen, Chao Zhang

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zehao Jin, Ruixuan Deng, Junran Wang, Xinjie Shen, Chao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 거대하고 천재적인 셰프로 상상해 보세요. 이 셰프는 이미 거대한 한 끼 식사를 준비해 두었습니다 (모델은 학습되어 고정된 상태). 때로는 셰프에게 요리를 다시 배우게 하거나 레시피 책을 바꾸지 않은 채, 접시에 음식을 담는 동안 특정 맛을 추가하고 싶을 때가 있습니다.

오랫동안 이를 수행하는 가장 좋은 방법은 **활성화 조종 (Activation Steering)**이었습니다. 이는 셰프의 부셰프가 특정 향신료 병을 집어 특정 순간 냄비에 고정된 양을 붓는 것과 같습니다.

  • 구식 방법 (고정 벡터): 부셰프는 다음과 같은 규칙을 가지고 있었습니다. "셰프가 '공손함'에 대해 생각할 때, 바로 여기에 정확히 5 그램의 '공손함 향신료'를 추가하라."
  • 문제점: 이는 간단한 경우에는 작동했지만, 요리가 복잡해지면 향신료 병이 맞지 않았습니다. 맛이 너무 약해지거나, 셰프가 원래 지시를 잊게 만들어 전체 요리를 망칠 수도 있었습니다. 또한, 셰프가 한 번도 맛보지 않은 새로운 맛을 원한다면, 부셰프는 완전히 새로운 향신료 병을 사서 처음부터 교정해야 했습니다.

새로운 해결책: FLAS (Flow-Based Activation Steering)

이 논문의 저자인 FLAS는 셰프를 안내하는 더 지능적인 방법을 제안합니다. 정적인 향신료 병 대신, 역동적이고 흐르는 맛의 강을 상상해 보세요.

간단한 비유를 통해 작동 방식을 설명하겠습니다.

1. "점프"에서 "흐름"으로

  • 구식 방법: 셰프의 생각을 평평한 바닥을 굴러가는 공으로 상상해 보세요. 맛을 바꾸기 위해 구식 방법은 공을 한 번만 차서 한 방향으로 밀었습니다. 이는 단일하고 경직된 점프였습니다.
  • FLAS 방법: FLAS 는 복잡한 생각을 바꾸는 것이 단일 점프가 아니라 여정임을 깨닫습니다. 공이 어디에 있고 어떤 맛을 원하는지에 따라 방향과 세기가 변하는 "바람" (속도장) 을 만들어 공을 부드럽게 밀어줍니다. 공은 구부러진 경로를 따라 여러 단계를 거쳐 새로운 맛으로 부드럽게 변합니다.

2. "나침반" 대 "GPS"

  • 구식 방법: 구식 조종은 어디에 있든 항상 북쪽을 가리키는 나침반과 같았습니다. 숲이든 도시든 상관없이 같은 힘을 가했습니다.
  • FLAS 방법: FLAS 는 스마트 GPS와 같습니다. 셰프의 현재 생각 (공의 위치), 원하는 특정 맛 (개념), 그리고 시간 단계를 고려합니다. 그리고 지금 필요한 정확한 밀림을 계산합니다.
    • 셰프가 문장 중간에 있다면, "바람"은 부드럽게 밀 수 있습니다.
    • 셰프가 시작점에 있다면, 바람은 더 세게 밀 수 있습니다.
    • 생성되는 특정 단어들에 맞춰 적응하므로, "맛"은 문맥에 완벽하게 들어맞도록 단어마다 약간씩 변할 수 있습니다.

3. 해보며 배우기 (부정적 예제 불필요)

  • 구식 방법: 부셰프에게 "공손함"을 추가하는 법을 가르치려면, 보통 무례한 문장과 공손한 문장의 예시를 보여주고 "무례한 생각에서 공손한 생각으로 옮겨라"라고 말해야 했습니다. 이는 개에게 간식과 막대기를 보여가며 훈련시키는 것과 같습니다.
  • FLAS 방법: FLAS 는 좋은 예시만 필요합니다. 공손한 문장을 보고 "알겠다, 여기까지 오려면 생각은 이렇게 흘러야 하구나"라고 학습합니다. 이를 수정하는 방법을 알기 위해 "무례한" 버전을 볼 필요가 없습니다. 좋은 것들의 "흐름"을 직접 학습합니다.

이것이 왜 중요한가요?

이 논문은 AxBench라는 거대한 도전 과제에서 이를 테스트했는데, 이는 모델에게 "숫자만 사용하여 이야기 쓰기"나 "이모지로 물리학 설명하기"처럼 수천 가지의 기이하고 구체적인 작업을 수행하도록 요구합니다.

  • 결과: 구식 방법들 (그리고 "프롬프팅"을 통해 셰프에게 정중하게 요청하는 것조차) 은 종종 실패하거나 셰프가 로봇처럼 들리게 만들었습니다.
  • FLAS 의 승리: FLAS 는 "정중하게 요청하기" (프롬프팅) 접근법을 일관되게 능가한 첫 번째 학습된 방법이었습니다. 복잡한 지시를 받아 새로운 맛을 자연스럽게 엮어 넣을 수 있었고, 셰프가 원래 레시피를 따르는 능력을 깨뜨리지 않았습니다.

"비밀 소스" (논문이 실제로 발견한 것)

저자들이 FLAS 가 어떻게 작동하는지 보기 위해 "블랙박스" 안을 들여다보았을 때, 놀라운 사실을 발견했습니다.

  • 경로는 구부러져 있습니다: 생각은 직선으로 이동하지 않습니다. 굽히고 비틀립니다.
  • 단계가 필요합니다: 한 번의 빠른 수정이 아니라 다단계 과정입니다.
  • 개인적입니다: 문장 내의 모든 단어마다 "밀어주는 힘"이 다릅니다.

요약

FLAS를 고정된 힘으로 모델을 한 번 때리는 메이플에서, 모델이 어디에 있고 무엇을 하려는지 실시간으로 조정하며 단계별로 안내하는 숙련된 춤 강사로 업그레이드하는 것으로 생각하세요.

이를 통해 모델은 전체 모델을 다시 학습시키거나 매번 완벽한 프롬프트를 작성할 필요 없이, 더 자연스럽고 신뢰할 수 있게 새로운 행동 (더 창의적이 되거나, 더 사실적이 되거나, 특정 형식을 사용하는 등) 을 받아들일 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →