← 최신 논문
💬 NLP

Fine-Grained Activation Steering: Steering Less, Achieving More

이 논문은 거친 블록 단위의 활성화가 아닌 유익한 원자 단위(개별 차원)만을 식별하고 조종함으로써 LLM의 행동 수정 효율성과 정밀도를 향상시키고, 이를 통해 더 적은 개입으로도 우수한 결과를 달성하는 미세 조정 활성화 스티어링 방법인 AUSteer을 소개한다.

원저자: Zijian Feng, Tianjiao Li, Zixiao Zhu, Hanzhang Zhou, Junlang Qian, Li Zhang, Jia Jim Deryl Chua, Lee Onn Mak, Gee Wah Ng, Kezhi Mao

게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zijian Feng, Tianjiao Li, Zixiao Zhu, Hanzhang Zhou, Junlang Qian, Li Zhang, Jia Jim Deryl Chua, Lee Onn Mak, Gee Wah Ng, Kezhi Mao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 오케스트라와 같은 대규모 언어 모델(LLM)을 상상해 보세요. 모델이 질문에 답할 때마다 수천 명의 음악가(뉴런)들이 동시에 악기를 연주합니다. 과거에 연구자들이 모델의 행동을 바꾸려 할 때, 그들은 바이올린 섹션 전체나 금관악기 섹션 전체를 통째로 붙잡고 한꺼번에 더 크게 혹은 더 작게 연주하라고 지시했습니다. 이것이 이 논문에서 말하는 **"블록 단위 스티어링(Block-Level Steering)"**입니다.

ICLR 2026에서 발표된 이 논문의 저자들은 이러한 방식이 너무 투박하다고 주장합니다. 바이올린 섹션이 연주하고 있다고 해서 모든 바이올리니스트가 정확한 음을 연주하고 있다는 뜻은 아니기 때문입니다. 어떤 이들은 멜로디를 연주하고(도움이 됨), 어떤 이들은 배경 소음을 내며(무관함), 어떤 이들은 실제로 틀린 곡을 연주하고 있습니다(해로움). 여러분이 전체 섹션에 "더 크게 연주하라"고 말하면, 좋은 음악과 함께 실수까지도 의도치 않게 증폭시키게 됩니다.

이 논문의 해결책을 쉽게 설명하면 다음과 같습니다.

1. 문제점: "블록"은 너무 무질서하다

연구자들은 이러한 모델 내부의 "블록" 안에 많은 **이질성(heterogeneity, 뒤섞인 신호)**이 존재한다는 것을 발견했습니다.

  • 과거의 방식: 모델을 더 정직하게 만들고 싶다면, "어텐션(Attention)" 블록 전체를 미세하게 조정할 수 있습니다. 하지만 이 블록은 수천 개의 차원을 포함하고 있습니다. 어떤 차원은 정직함에 도움이 되지만, 다른 차원은 모델이 거짓말을 하는 데 더 확신을 갖게 만들 수도 있습니다. 블록 전체를 조정하면 나쁜 부분도 좋은 부분과 함께 끌고 가기 때문에 "스티어링 효율이 떨어지게" 됩니다.
  • 비유: 집의 누수를 고치기 위해 동네 전체의 물을 끊는 것과 같습니다. 누수는 잡겠지만, 다른 모든 사람의 물도 끊게 됩니다. 이는 비효리적이며 불필요한 피해를 줍니다.

2. 해결책: "원자 단위(Atomic Units)" (개별 음악가)

논문은 오케스트라를 개별 음악가 수준으로 세분화할 것을 제 제안합니다. 이들은 이를 **원자 단위(Atomic Units, AUs)**라고 부릅니다.

  • 전체 "바이올린 섹션"을 조종하는 대신, 그들은 특정한 한 명의 바이올리니스트(데이터의 단일 차원)를 바라봅니다.
  • 그들은 특정 작업에 대해 올바른 음을 연주하는 데 천재적인 개별 음악가들이 있는 반면, 형편없는 음악가들도 있다는 것을 발견했습니다.
  • 통찰: 특정 작업에 유능한 특정 음악가들만 조정한다면, 전체 섹션을 고치려고 노력하는 것보다 훨씬 더 나은 성능을 얻을 수 있습니다. 이것이 그들의 핵심 슬로건인 **"적게 스티어링하여 더 많이 달성하기(Steering Less, Achieving More)"**입니다.

3. 방법론: AUSteer (스마트한 지휘자)

이것을 구현하기 위해 그들은 AUSteer라는 새로운 방법을 만들었습니다. 이는 정확히 어떤 음악가에게 더 크게 연주하라고 요청해야 할지 아는 매우 똑똑한 지휘자 역할을 합니다. 이 방법은 크게 두 가지 단계를 거칩니다.

  • 1단계: 스타 찾기 (Localization)
    이 방법은 **"활성화 모멘텀(Activation Momentum)"**이라는 지표를 사용합니다. 모델이 질문에 답하고 있다고 가정해 봅시다. 연구자들은 모델에게 "좋은" 답변과 "나쁜" 답변을 보여줍니다. 그리고 개별 음악가(AU)들을 관찰하여, 누가 좋은 답변에는 일관되게 크게 연주하고 나쁜 답변에는 작게 연주하는지 확인합니다.

    • 만약 어떤 음악가가 옳은 답변에 대해 항상 올바른 음을 연주한다면, 그들은 "스타(star)"로 표시됩니다.
    • 만약 어떤 음악가가 무작위로 연주하거나 답변을 악화시킨다면, 그들은 무시됩니다.
    • 이를 통해 수천 명의 음악가 중 상위 100명의 가장 도움이 되는 "음악가"만을 골라낼 수 있습니다.
  • 2단계: 볼륨 조절 (Adaptive Steering)
    누구를 고쳐야 할지 알게 되면, 얼마나 고칠지를 결정합니다.

    • 단순히 일정한 볼륨 부스트를 더하는 것이 아닙니다. 대신, 음악가가 이미 얼마나 크게 연주하고 있는지에 따라 볼륨을 조절합니다. 만약 음악가가 이미 작게 연주하고 있다면 더 큰 부스트를 주고, 이미 크게 연주하고 있다면 더 작은 부스트를 줍니다.
    • 또한 가장 중요한 음악가들에게는 더 많은 "힘"을 주고, 덜 중요한 음악가들에게는 적은 힘을 줍니다.

4. 결과: 노이즈는 줄이고, 음악은 더 좋게

이 논문은 여러 가지 AI 모델(LLaMA, Gemma, Qwen 등)과 다양한 작업(수학, 추론, 안전한 텍스트 생성)에 대해 테스트를 진행했습니다.

  • 결과: AUSteer는 일관되게 최첨단(state-of-the-art) 방법들을 능가했습니다.
  • 효율성: 다른 방법들이 수천 개의 차원을 조정하려고 시도할 때(오케스트라 전체의 볼륨을 높이는 것처럼), AUSteer는 종종 100개 미만의 특정 차원만을 조정했습니다.
  • 증명: 더 적은 것을 조종함으로써, 그들은 실제로 더 나은 결과를 얻었습니다. 모든 것을 통제하려는 시도가 오히려 "노이즈"(해롭거나 무관한 부분)를 증폭시켜 역효과를 낼 수 있음을 입증했습니다.

요약

논문은 AI를 가이드하는 최선의 방법은 그룹 전체에 소리를 지르는 것이 아니라, 일을 제대로 수행할 능력이 있는 소수의 개인에게 구체적인 지침을 속삭이는 것이라고 주장합니다. 가장 도움이 되는 "원자 단위"를 식별하고 그것만을 조정함으로써, 훨씬 적은 노력으로 AI를 더 똑똑하고, 안전하며, 정확하게 만들 수 있습니다.

핵심 요점: 지형을 바꾸기 위해 산 전체를 옮길 필요는 없습니다. 때로는 몇 개의 특정 바위만 옮기는 것으로도 강의 흐름을 바꿀 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →