← 최신 논문
💻 computer science

Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition

이 논문은 표준적인 모델 병합 기법이 비대칭적 붕괴를 자주 유발하며, 이는 거절 파인튜닝이 벡터들이 거의 직교함에도 불구하고 병합 과정에서 지배적인 역할을 하는 현저히 큰 태스크 벡터 크기를 유도하기 때문에 안전 인식 능력은 상실되는 반면 광범위한 거절 행동은 유지된다는 것을 입증한다.

원저자: Aarnav Choudhary, Matheus Fonseca Rocha, Jiwon Seo, Vasu Sharma, Maheep Chaudhary

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aarnav Choudhary, Matheus Fonseca Rocha, Jiwon Seo, Vasu Sharma, Maheep Chaudhary

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 새로운 기술을 배울 수 있는 아주 똑똑한 로봇이 있다고 상상해 보세요. 때때로 당신은 로봇에게 가짜 뉴스 헤드라인을 찾아내는 법과 같은 특정한 한 가지 기술을 가르치고 싶을 수 있습니다. 또 다른 때는 위험한 요청에 대해 "아니오"라고 말하는 법과 같이 다른 기술을 가르치고 싶을 수도 있죠. 하지만 만약 당신이 로봇에게 이 두 가지를 동시에 하기를 원한다면 어떻게 될까요? 인공지능의 세계에는 '모델 병합(model merging)'이라는 영리한 지름길이 있습니다. 두 가지 기술을 처음부터 다시 학습시키는 대신, 과학자들은 기술 A를 위해 훈련된 버전과 기술 B를 위해 훈련된 두 가지 서로 다른 버전의 로봇을 가져와 수학적으로 그들의 뇌를 하나로 섞습니다. 이것은 마치 두 가지 맛의 아이스크림을 섞어 새로운 완벽한 소용돌이 맛을 만드는 것과 같습니다. 여기서 큰 질문은, 이 두 가지 '맛'의 안전 훈련을 섞었을 때, 두 가지 모두를 잘 수행하는 로봇이 탄생할 것인가, 아니면 한 가지 맛이 다른 맛을 완전히 집어삼켜 버릴 것인가 하는 점입니다. 이 미스터리를 해결하기 위해 한 새로운 연구는, 우리가 위험을 '이해'하는 능력과 그것을 '거절'하는 능력을 동시에 유지할 수 있는지에 주목했습니다.

COLM 2026 컨퍼런스에서 발표된 이 연구의 연구진은 이를 테스트하기 위해 Gemma-3-1B-IT라는 특정 로봇 모델을 사용하기로 결정했습니다. 그들은 이 로봇의 두 가지 특별한 버전을 만들었습니다. 첫 번째 버전은 '탐정(Detective)'이라고 부를 수 있는데, 이 버전은 방대한 의료 관련 질문 데이터셋을 학습하여 프롬프트가 얼마나 해로운지를 식별하는 전문가가 되도록 훈련되었습니다. 이 버전은 "이것은 약간 위험합니다" 또는 "이것은 매우 위험합니다"와 같이 등급을 매겨 답변하는 법을 배웠습니다. 두 번째 버전은 '수호자(Guardian)'로, 로봇의 규칙을 깨뜨리기 위해 설계된 까다롭고 적대적인 프롬프트의 거대한 컬렉션을 학습했습니다. 수호자는 하나의 단순하고 단호한 교훈을 배웠습니다. 만약 위험해 보인다면, 묻지도 따지지도 말고 그냥 "아니오"라고 말하며 답변을 거부하라는 것이었습니다.

연구팀은 이 두 명의 전문가를 가져와 네 가지 서로 다른 수학적 혼합 방법을 사용하여 하나의 로봇으로 병합하려고 시도했습니다. 그들은 결과물로 위험을 감지하면서 동시에 나쁜 것을 거절할 수 있는 로봇이 나오기를 기대했습니다. 하지만 대신, 그들은 이상하고 불균형한 결과를 발견했습니다. 모든 경우에 '수호자'의 행동이 완전히 장악했습니다. 병합된 로봇들은 나쁜 프롬프트를 거절하는 데 탁월해졌으며, 거절률을 81%에서 85% 사이로 높게 유지했습니다. 그러나 '탐정'의 기술은 거의 완전히 사라졌습니다. 로봇들은 해로움을 등급 매기는 법을 잊어버렸습니다. 프롬프트의 심각성을 분류하는 능력은 사용하는 방법에 따라 0.6%에서 12.9%까지 떨어지며 거의 제로에 가깝게 급락했습니다. 그것은 마치 로봇이 무엇이 실제로 있는지 확인하기 위해 외시경을 통해 들여다보는 법을 잊어버린 채, 문을 쾅 닫아버리는 법을 배운 것과 같았습니다.

왜 이런 일이 일랐을까요? 과학자들은 두 로봇의 'DNA'를 면밀히 조사하여 범인을 찾아냈습니다. 그들은 이것이 두 로봇이 서로 싸우거나 서로 반대 방향으로 가려고 했기 때문이 아니라는 것을 발견했습니다. 사실, 그들의 뇌는 거의 직각을 이루고 있었는데, 이는 그들이 충돌하지 않으면서도 완전히 다른 일을 하려 했다는 것을 의미합니다. 진짜 문제는 **볼륨(음량)**의 문제였습니다. '수호자' 로봇은 '탐정'의 데이터셋보다 약 29배 더 큰 데이터셋으로 훈련되었습니다. 이 때문에 수호자의 뇌에 가해진 변화는 훨씬 더 "크고" 강력했습니다. 과학자들이 뇌를 섞었을 때, 그들이 사용한 수학적 도구들은 더 큰 신호를 키우고 더 작은 신호를 줄이는 볼륨 조절기처럼 작동했습니다. 수호자의 크고 대담한 "아니오!"가 탐정의 미묘하고 정교한 "아마도"를 집어삼킨 것입니다.

연구진이 수호자의 훈련 데이터 크기를 탐정의 크기에 맞춰 줄임으로써 이를 해결하려고 노력했을 때도, 모든 병합 방법에서 문제가 완전히 사라지지는 않았습니다. 이는 데이터의 크기가 주요 요인이긴 하지만, 병합 알고리즘이 이러한 "큰" 업데이트와 "작은" 업데이트를 처리하는 방식이 실질적인 핵심임을 시사합니다. 이 연구는 표준 병합 도구들이 현재 크고 투박한 행동(예: 모든 것에 거절하기)을 유지하는 데 편향되어 있으며, 실수로 세밀하고 상세한 기술(예: 왜 나쁜지에 대한 이해)을 삭제한다는 것을 보여줍니다.

그렇다면 이것이 미래에 어떤 의미를 가질까요? 논문은 만약 우리가 나쁜 것을 거절할 수도 있고 안전의 미묘한 차이를 이해할 수도 있는 안전한 AI를 구축하고자 한다면, 현재의 표준 도구를 사용하여 모델을 단순히 섞고 맞추는 것만으로는 안 된다고 제안합니다. 우리는 '수호자' 안에 있는 '탐정'을 잃어버리고 있을지도 모릅니다. 연구진은 미래의 방법론이 이러한 서로 다른 '볼륨'의 균형을 맞추는 데 더 똑똑해져야 하며, 로봇이 단순히 모든 것에 "아니오"라고 말하는 법을 배우는 것이 아니라, 약간의 경고와 큰 위험의 차이를 이해하는 법을 배우도록 보장해야 한다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →