← 최신 논문
🤖 machine learning

Crafting Reversible SFT Behaviors in Large Language Models

본 논문은 모델 가중치를 수정하지 않고 추론 시 소프트 프롬프트를 통해 선택적으로 억제할 수 있는 희소하고 인과적으로 필수적인 서브네트워크("캐리어") 로 지도 미세조정 행동을 압축하는 Loss-Constrained Dual Descent(LCDD) 와 SFT-Eraser 를 소개합니다.

원저자: Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇 (대형 언어 모델) 이 새로운 기술을 배우는 상황을 상상해 보세요. 예를 들어, 모든 질문에 "모릅니다"라고 대답하거나, 위험한 질문에는 답변을 거부하거나, 셰익스피어처럼 말하는 기술입니다. 이 과정은 **지도 미세 조정 (Supervised Fine-Tuning, SFT)**이라고 불립니다.

저자들이 발견한 문제는 로봇에게 이 새로운 기술을 가르칠 때, 그 수행 방식에 대한 "지식"이 로봇의 뇌 전체에 흩어져 버린다는 점입니다. 마치 자전거 타기를 가르치되, 다리와 균형 감각만 사용하는 대신 온몸의 모든 근육을 동원하게 하는 것과 같습니다. 기술이 여기저기 퍼져 있기 때문에, 나중에 이를 끄려고 하면 로봇의 정상적인 대화 능력을 손상시키지 않고는 불가능합니다.

이 논문은 로봇에게 새로운 기술을 매우 구체적이고 컴팩트한 방식으로 가르쳐, 그 기술이 로봇 뇌 내부의 작고 고립된 "방"에 머물도록 하는 방법을 제시합니다. 그리고 나서 그들은 비밀 코드로 그 특정 방을 끄는 방법을 보여주어, 로봇이 즉각적으로 그 기술을 잊게 하되 뇌의 나머지 부분은 완벽하게 온전하게 유지합니다.

다음은 그들이 사용한 간단한 비유를 통해 설명한 방법입니다:

1. 문제: "지저분한 다락방"

일반적으로 모델을 미세 조정할 때, 새로운 행동은 지저분한 다락방처럼 퍼져 나갑니다. 나중에 그 행동을 제거하려면 온전한 다락방을 뒤져야 하며, 실수로 로봇의 수학 능력이나 이메일 작성 능력을 잃어버릴 수도 있습니다. 새로운 행동의 정확한 "스위치"를 찾기 어렵습니다. 왜냐하면 그것이 다른 모든 것과 얽혀 있기 때문입니다.

2. 해결책 부분 1: LCDD ("포장 전문가")

저자들은 **손실 제약 이중 하강 (Loss-Constrained Dual Descent, LCDD)**이라는 방법을 개발했습니다. 이를 초고도로 조직화된 포장 전문가라고 생각하세요.

  • 목표: 그들은 "새로운 행동"을 가져와 로봇 뇌 내부의 작고 희소한 "배낭" (이를 **캐리어 (Carrier)**라고 부름) 에 강제로 넣으려 합니다.
  • 제약 조건: 그들은 포장 전문가에게 말합니다. "전체 새로운 행동을 이 작은 배낭에 넣어야 하지만, 로봇이 다른 일 (예: 질문에 정확하게 답변하는 것) 을 하는 능력을 잊게 해서는 안 됩니다."
  • 결과: 전문가는 새로운 행동을 작고 고립된 서브 네트워크로 성공적으로 압축합니다. 로봇 뇌의 나머지 부분은 훈련 전과 정확히 동일하게 유지됩니다. 새로운 행동은 이제 이 작은 배낭에 100% 의존하게 됩니다. 배낭이 있으면 행동이 발생합니다. 배낭이 차단되면 행동은 사라집니다.

3. 해결책 부분 2: SFT-Eraser ("비밀 코드")

행동이 그 작은 배낭 안에 잠긴 후, 저자들은 SFT-Eraser라는 두 번째 도구를 만들었습니다.

  • 작동 원리: 그들은 로봇의 뇌 가중치 (로봇의 매뉴얼을 다시 쓰는 것과 같음) 를 변경하지 않습니다. 대신, 입력에 추가되는 보이지 않는 수학적인 "단어" 시퀀스인 특수한 **소프트 프롬프트 (soft prompt)**를 생성합니다.
  • 마법: 이 비밀 코드가 질문에 추가되면, 새로운 행동이 거주하는 "배낭"을 특정적으로 마비시키는 열쇠처럼 작용합니다.
  • 결과: 로봇은 즉각 원래의 성격으로 돌아갑니다. 셰익스피어처럼 말하도록 훈련되었다면 갑자기 현대 영어로 다시 말하기 시작합니다. 위험한 질문에 답변을 거부하도록 훈련되었다면 다시 답변하기 시작합니다. 로봇이 "재훈련"된 것은 아닙니다. 그 행동을 담고 있는 뇌의 특정 부분이 일시적으로 무력화된 것입니다.

4. 증명: 구조가 중요한 이유

저자들은 그 비밀 코드뿐만 아니라 실제 영웅이 바로 그 구조 (작은 배낭) 임을 증명하기 위해 중요한 테스트를 수행했습니다.

  • 실험: 그들은 작은 배낭이 없는 로봇 (행동이 여기저기 흩어진 표준 로봇) 에 동일한 "비밀 코드"를 사용해보았습니다.
  • 결과: 코드는 실패했습니다. 마비시킬 단일 고립된 목표가 없었기 때문에 행동을 끄지 못했습니다.
  • 교훈: 이는 지저분한 뇌에서 행동을 단순히 "해킹"해 낼 수 없음을 증명합니다. 먼저 그 행동이 거주할 깨끗하고 고립된 구조를 구축해야 합니다. 일단 고립되면 완벽하게 제어할 수 있습니다.

그들이 발견한 것의 요약

  • 행동을 되돌릴 수 있을까요? 네.
  • 어떻게? 훈련 중 (LCDD 사용) 에 행동을 작고 희소한 "캐리어"에 강제로 넣은 후, 그 캐리어를 차단하는 특수 입력 코드 (SFT-Eraser) 를 사용합니다.
  • 효과가 있을까요? 그들은 세 가지 매우 다른 행동에 대해 이를 테스트했습니다:
    1. 고정된 응답: 로봇이 항상 "모릅니다"라고 말하게 하기.
    2. 안전: 로봇이 유해한 질문에 답변을 거부하게 하기.
    3. 스타일: 로봇이 셰익스피어처럼 말하게 하기.
  • 판단: 모든 경우에서 그들은 행동을 뇌의 작은 부분으로 성공적으로 압축했고, 로봇의 근본적인 코드를 변경하지 않고도 원할 때 켜고 끌 수 있었습니다.

중요한 참고 사항: 그들이 사용하는 "비밀 코드"는 채팅창에 입력할 수 있는 간단한 단어가 아니라, 연속적인 수학 시퀀스 (소프트 프롬프트) 입니다. 이 논문은 일상적인 챗봇을 위한 즉시 사용 가능한 제품이라기보다는, 행동이 인과적으로 격리되고 제어될 수 있음을 증명하는 방법으로 다룹니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →