← 최신 논문
💬 NLP

MoRFI: Monotonic Sparse Autoencoder Feature Identification

본 논문은 새로운 지식에 대한 미세 조정 과정에서 환각과 단조롭게 상관관계를 갖는 대규모 언어 모델의 잠재적 방향을 식별하기 위해 희소 오토인코더를 활용하는 MoRFI 방법을 소개하며, 이러한 특정 특징에 개입하여 모델이 저장된 지식을 검색하는 능력을 회복시킬 수 있음을 보여줍니다.

원저자: Dimitris Dimakopoulos, Shay B. Cohen, Ioannis Konstas

게시일 2026-04-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dimitris Dimakopoulos, Shay B. Cohen, Ioannis Konstas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 수년 동안 방대한 도서관의 책들을 읽으며 훈련한 천재 학생으로 상상해 보세요. 이 학생은 방대한 양의 사실을 암기했습니다. 그러나 나중에 새로운 특정 사실 집합을 배우도록 요청할 때 (파인튜닝), 이상한 일이 발생합니다. 만약 그 새로운 사실이 학생에게 완전히 생소한 것이라면, 그들은 '환각 (hallucination)'을 시작합니다. 그들은 과거에 완벽하게 알았던 사실에 대해서조차 자신 있게 거짓 답변을 만들기 시작합니다.

이 논문, MoRFI는 이러한 현상이 학생의 뇌 내부에서 왜 발생하는지, 그리고 모든 것을 다시 가르치지 않고 어떻게 해결할 수 있는지 조사합니다.

문제: '새로운 지식' 결함

학생의 뇌를 수천 개의 스위치 (이를 잠재 특징이라고 합니다) 로 가득 찬 거대하고 복잡한 제어실로 상상해 보세요. 학생이 새로운 것을 배울 때, 그들은 일부 스위치를 켭니다. 연구자들은 학생이 이전에 알지 못했던 많은 새로운 사실을 강제로 학습하게 할 때, 특정 스위치들이 'ON' 위치에 고장 나게 된다는 사실을 발견했습니다.

이러한 고장 난 스위치들은 시끄러운 소음이나 방해 요소처럼 작용합니다. 그들은 학생이 과거의 신뢰할 수 있는 지식을 회상하는 데 필요한 조용하고 꾸준한 신호들을 압도해 버립니다. 그들이 더 많은 새로운 생소한 사실을 억지로 주입하려 할수록, 그리고 더 오래 공부할수록 이 소음은 더 커지고, 이미 알고 있던 것에 대한 답변 능력은 더 나빠집니다.

해결책: MoRFI (탐정)

연구자들은 MoRFI(Monotonic Relationship Feature Identification, 단조 관계 특징 식별) 라는 도구를 개발했습니다. MoRFI 를 특별한 안경을 낀 초지능 탐정으로 상상해 보세요.

  1. 수사: 탐정은 학생이 학습하는 동안 제어실을 지켜봅니다. 그들은 매우 특정한 방식으로 행동하는 스위치들을 찾습니다. 즉, 학생에게 점점 더 많은 '생소한' 사실이 주어질수록, 이러한 특정 스위치들이 일정하고 예측 가능한 선형으로 점점 더 밝아지거나 (또는 점점 더 어두워지는) 것입니다.
  2. 필터: 대부분의 스위치는 무작위로 깜빡일 뿐입니다. MoRFI 는 그러한 것들을 무시합니다. 오직 새로운 지식이 증가함에 따라 한 방향으로만 일관되게 변화하는, 즉 단조롭게 변화하는 스위치들만 관심을 가집니다.
  3. 발견: 이 특정 스위치들을 다양한 모델 (Llama, Gemma, Mistral 등) 에 걸쳐 추적함으로써, 탐정은 '환각 소음'을 직접적으로 유발하는 작고 희소한 그룹의 스위치들을 발견했습니다.

해결: 스위치를 다시 뒤집기

탐정이 이러한 '문제아' 스위치들을 식별하자마자, 연구자들은 간단한 실험을 시도했습니다: 조종 (Steering).

학생을 다시 훈련시키는 대신, 그들은 물리적으로 제어실에 손을 넣어 그 특정 스위치들을 원래 상태로 되돌리거나 (또는 반대 방향으로) 뒤집었습니다.

  • 결과: 그것은 마법처럼 작동했습니다. 단 몇 개의 스위치만 조정함으로써, 학생은 갑자기 과거의 사실들을 다시 기억하게 되었습니다.
  • 비유: 새로운 방송국에서 너무 많은 정전기 잡음을 받아들이게 된 라디오와 같습니다. 라디오를 다시 건설하는 대신, 다이얼을 살짝 돌려 정전기 주파수를 상쇄시키면 됩니다. 그러면 음악 (과거의 지식) 이 다시 선명해집니다.

쉬운 영어로 요약된 주요 발견

  • 삭제가 아니라 차단입니다: 연구는 학생이 실제로 과거의 사실을 잊어버린 것이 아니라는 것을 발견했습니다. 사실들은 여전히 존재했지만, 새로운 학습에서 발생한 '소음'이 그것을 회상하는 경로를 차단하고 있었습니다. 스위치를 뒤집으면 경로가 정리되었습니다.
  • 켜기보다 끄기가 더 좋습니다: 연구자들은 일부 스위치의 경우, 켜는 것보다 끄는 것(억제하는 것) 이 더 효과적임을 발견했습니다. 이는 새로운 학습이 뇌의 특정 부분을 과도하게 활성화시켰으며, 이를 진정시키는 것이 핵심임을 시사합니다.
  • 어디서나 작동합니다: 그들은 세 가지 다른 유형의 '학생'(다른 AI 모델) 에서 이를 테스트했고, 동일한 작은 스위치 그룹이 모두에서 문제를 일으켰습니다. 이는 이러한 모델들이 혼란에 빠지는 방식에 보편적인 메커니즘이 있음을 시사합니다.
  • '복합' 스위치 vs '단일' 스위치: 만약 모든 변화를 한꺼번에 조정하여 ( '복합' 방향) 문제를 해결하려 한다면, 약간 도움이 됩니다. 하지만 가장 중요한 단일 스위치를 찾아 그 하나만 고치면 개선 효과가 엄청납니다. 이는 문제가 뇌 전체를 덮는 일반적인 안개가 아니라, 매우 구체적이고 국소화된 것임을 의미합니다.

요약

이 논문은 AI 모델이 새로운 생소한 사실을 배울 때, 과거의 지식을 잃는 것이 아니라 몇 가지 특정 내부 신호에 의해 '방해'를 받는다고 주장합니다. 저자들은 이러한 방해 신호들을 찾아내는 방법을 개발했으며, 단순히 그것들을 끄거나 (또는 조정함으로써) AI 가 즉시 질문에 올바르게 답변할 수 있는 능력을 회복하게 하여 새로운 학습 데이터로 인한 환각을 효과적으로 치료할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →