← 최신 논문
💬 NLP

FishBack: Pullback Fisher Geometry for Optimal Activation Steering in Transformers

이 논문은 결함이 있는 유클리드 가정을 피셔 정보 메트릭(Fisher information metric)으로 대체하여 최적의 스티어링 방향을 도출함으로써, 다양한 크기와 계층의 트랜스포머 모델에서 오프 타겟 왜곡(off-target distortions)을 현저히 줄이는 새로운 활성화 스티어링 방법인 FishBack을 소개한다.

원저자: Sihan Wang, Jiayi Zhao, Qingyan Cao, Hongbo Yao, Lin Shu

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sihan Wang, Jiayi Zhao, Qingyan Cao, Hongbo Yao, Lin Shu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 수조 개의 사례를 읽음으로써 문장에서 다음 단어를 예측하는 법을 배운 인공 뉴런의 거대한 네트워크입니다. 일단 훈련되면 이 모델들은 매우 유용할 수 있지만, 편향되거나 정직하지 못하거나, 혹은 단순히 사용자가 의도한 것이 아닌 텍스트를 생성하는 등 고집스럽거나 안전하지 못할 수도 있습니다. 수년 동안 연구자들은 모델이 작동하는 동안 모델의 내부 계산에 작은 자극을 더함으로써 이러한 행동을 수정하려고 노력해 왔습니다. '활성화 스티어링(activation steering)'이라고 알려진 이 기술은 모델의 은닉층에서 특정 방향을 찾아내고, 그 경로를 따라 데이터를 밀어 넣어 진실성이나 특정 문법적 시제와 같은 원하는 특성을 장려하는 방식을 포함합니다. 이는 비용이 많이 들고 시간이 오래 걸리는 전체 모델 재학습의 가벼운 대안입니다. 하지만 이러한 자극은 매우 신뢰하기 어려운 것으로 알려져 왔습니다. 네트워크의 한 부분에서는 완벽하게 작동하는 자극이 다른 부분에서는 실패하거나, 더 나아가 하나의 문제를 해결하는 동시에 다른 것을 완전히 망가뜨려 모델이 횡설수설하게 만들거나 본래의 개성을 잃게 만드는 경우도 발생합니다.

사우스 차이나 공과대학교(South China University of Technology) 연구진의 새로운 연구에 따르면, 이 불안정성의 핵심 원인은 이러한 모델들이 작동하는 공간에 대한 근본적인 오해에 있습니다. 기존의 대부분의 방법은 모델의 내부 상태를 평평하고 일반적인 격자처럼 취급하며, 어떤 방향으로든 일정 거리를 이동하는 데 드는 비용이 동일하다고 가정합니다. 연구진은 이러한 관점이 틀렸다고 주장합니다. 실제로 언어 모델 내부의 공간은 지구의 표면과 평면 지도 사이의 관계처럼 곡선형이며 불균일합니다. 한 방향으로 짧은 거리를 이동하면 모델의 출력이 급격히 변할 수 있는 반면, 그 옆의 다른 방향으로 같은 거리를 이동하면 거의 아무런 영향도 미치지 않을 수 있습니다. 평면을 가정했던 기존 방식들은 산맥을 가로질러 직선으로 운전하려 하면서, 실제 경로를 결정하는 가파른 경사와 골짜기들을 무시한 것과 같았습니다.

이를 해결하기 위해 연구팀은 '피시백(FishBack)'이라 불리는 새로운 접근 방식을 개발했습니다. 피시백은 단순히 올바른 방향을 추측하는 대신, 모델이 항해하고 있는 지형의 실제 모양을 계산합니다. 연구진은 네트워크 중간에서의 작은 변화가 최종 출력에 어떻게 영향을 미치는지 결정하는 규칙이 '피셔 정보 메트릭(Fisher information metric)'이라는 특정 수학적 속성에 의해 결정된다는 것을 발견했습니다. 이 메트릭은 지형도와 같은 역할을 하여, 모든 방향에서 지형이 얼마나 '가파른지' 또는 '평탄한지'를 정확하게 보여줍니다. 연구진은 이 지형도를 모델의 최종 출력층으로부터 스티어링이 일어나는 중간층으로 역추적하여 가져옴으로써, 문제의 진정한 기하학적 구조를 볼 수 있었습니다. 그런 다음 이 지형도를 사용하여 모델의 상태를 이동시킬 수 있는 단 하나의 최적의 경로를 찾아냈습니다. 이 경로는 직선이 아니라, 원하는 행동의 변화를 달면서도 가장 적은 '에너지'를 소모하고 모델의 나머지 지식에 미치는 방해를 최소화하는 곡선 경로입니다.

연구진은 768개의 내부 차원을 가진 작은 모델부터 4,000개가 넘는 차원을 가진 거대 모델에 이르기까지 다양한 크기의 세 가지 언어 모델을 대상으로 이 방법을 테스트했습니다. 그들은 동사를 3인칭 단수형으로 바꾸거나, 진행형으로 바꾸거나, 과거 시제로 바꾸는 세 가지 특정 작업에 집중했습니다. 모든 경우에 대해, 그들은 새로운 기하학적 방법을 기존의 평면 공간 기술과 비교했습니다. 결과는 놀라웠습니다. 작은 모델에서 새로운 방법은 기존의 가장 우수한 방법들과 비교했을 때 원치 않는 부작용, 즉 연구진이 '오프 타겟 왜곡(off-target distortion)'이라고 부르는 현상을 최대 6.5배까지 줄였습니다. 더 크고 복잡한 모델에서도 개선 효과는 더욱 일관되게 나타났으며, 네트워크의 초기 및 중간층에서 원치 않는 변화를 거의 4배 가까이 줄였습니다.

결정적으로, 이 연구는 기존의 방법들이 단순히 효율성이 약간 떨어지는 것이 아니라, 그 접근 방식 자체가 근본적으로 결함이 있다는 것을 보여주었습니다. 연구진이 자신들의 시스템에서 복잡한 기하학적 지도를 단순한 평면 가정으로 대체했을 때 성능이 크게 떨어졌으며, 이는 공간의 곡률이 성공의 핵심임을 입증했습니다. 새로운 방법은 모든 입력에 대해 하나의 고정된 벡터를 사용하는 대신, 각 특정 상황에 맞는 정밀하고 최적화된 방향을 계산함으로써 작동합니다. 이를 통해 모델은 그 순간의 고유한 내부 상태 모양에 적응할 수 있습니다. 또한 연구진은 가장 큰 모델에서도 너무 느리지 않게 이 복잡한 방향을 계산할 수 있는 방법을 개발했습니다. 대신, 그들은 수백 번의 계산만으로 지형의 필수적인 모양을 포착하는 영리한 근사치를 사용하여, 이 기술을 실제 환경에서 실용적으로 사용할 수 있게 만들었습니다.

이러한 발견은 현재의 활성화 스티어링 방법들을 괴롭히는 불안정성이 모델 자체의 버그가 아니라, 모델을 탐색하기 위한 잘못된 기하학을 사용한 결과임을 시사합니다. 언어 모델의 내부 세계가 곡선형이며 이동 비용이 방향에 따라 크게 달라진다는 점을 인정함으로써, 피시백 방식은 이러한 시스템을 안내하는 안정적이고 효율적인 방법을 제공합니다. 연구진은 이러한 기하학적 교정이 네트워크의 초기 및 중간층, 즉 지형이 가장 불균일한 곳에서 가장 가치 있다는 것을 입증했습니다. 데이터가 최종 출력으로 이동함에 따라 지형이 평탄해지며, 복잡한 방법의 이점도 줄어드는데, 이는 이론과 완벽하게 일치합니다. 이 연구는 언어 모델을 더 신뢰할 수 있고 제어 가능하게 만드는 명확한 길을 제시하며, 취약한 시행착오 과정을 정밀하고 수학적으로 근거가 있는 도구로 탈바꿈시켰습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →