← 최신 논문
💬 NLP

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

본 논문은 활성화 조종과 강화 학습을 결합하여 민감한 교차 모달 정보를 효과적으로 제거하면서도 생성 품질을 크게 향상시키고 모델의 유용성을 유지하는 제어 가능한 멀티모달 망각 프레임워크인 ASRU를 제안합니다.

원저자: Jiahui Guang, Yingjie Zhu, Cuiyun Gao, Haiyan Wang, Jing Li, Di Shao, Zhaoquan Gu

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiahui Guang, Yingjie Zhu, Cuiyun Gao, Haiyan Wang, Jing Li, Di Shao, Zhaoquan Gu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수백만 권의 책을 읽고 수십억 장의 사진을 본 매우 똑똑하고 초고도로 관찰력 뛰어난 로봇 비서 (다중 모달 대규모 언어 모델) 가 있다고 가정해 봅시다. 방대한 양의 데이터를 학습했기 때문에 때로는不该 기억해야 할 것들, 예를 들어 특정 개인의 사적인 취미나 유명인의 비밀 주소까지 기억해 버리기도 합니다.

이 논문의 목표는 로봇을 혼란스럽거나 고장 나거나 거짓말을 하는 기계로 만들지 않으면서, 이러한 특정 비밀들을 잊게 하는 것입니다.

여기서 광 (Guang) 과 주 (Zhu) 저자가 새로운 방법인 ASRU를 사용하여 이 문제를 해결하는 방식을 소개합니다.

문제: "고장 난 로봇"의 딜레마

비밀을 잊게 하려고 "그거 잊어!"라고 외친다고 가정해 보세요 (이것이 기존 방법들이 하는 일입니다).

  • 결과: 로봇은 혼란에 빠집니다. 환각을 일으켜 (황당한 거짓말을 만들어 내거나), "답변할 수 없습니다"라는 식의 경직되고 로봇 같은 답변을 하거나, 우연히도 비밀을 누설해 버릴 수도 있습니다.
  • 비유: 책에서 특정 문장을 지우려고 책장 전체를 태우는 것과 같습니다. 문장은 사라지지만, 이야기의 나머지 부분도 망가져 책을 읽을 수 없게 됩니다.

저자들은 기존 방법들이 "잊었는가?"에만 초점을 맞추고 "여전히 정상적인가?"는 무시한다는 점을 발견했습니다.

해결책: ASRU (활성화 조향 + 강화 망각)

저자들은 로봇을 고치기 위한 두 단계의 "부드러운 수술"을 제안합니다.

1 단계: "미묘한 밀기" (활성화 조향)

먼저, 로봇이 비밀 정보를 볼 때 내부적인 "기분"을 바꾸도록 부드럽게 밀어줍니다.

  • 비유: 로봇의 뇌를 거대한 도서관이라고 상상해 보세요. 누군가 비밀에 대해 묻으면 로봇은 보통 "비밀 선반"으로 달려갑니다. 저자들은 선반을 삭제하는 대신, 로봇의 경로에 "이 사람을 보면 '비밀' 코너 대신 '모릅니다' 코너로 왼쪽으로 돌아서세요"라는 표지를 붙입니다.
  • 작동 원리: 로봇 뇌의 아주 작은 부분 (단 하나의 수학적 행렬) 만을 조정하여 "거부 방향"을 만듭니다. 이는 로봇이 무언가를 만들어 내는 대신 자연스럽게 "그것에 대해 답변할 수 없습니다"라고 말하도록 가르칩니다.

2 단계: "코치" (강화 망각)

이제 로봇이 "모릅니다"라고 말하는 방법을 알았으니, 언제 그것을 말해야 하는지 배워야 합니다. 모든 것에 대해 거절하는 것이 아니라, 오직 특정 비밀에 대해서만 거절해야 합니다.

  • 비유: 운동선수를 훈련시키는 코치를 상상해 보세요. 코치는 선수에게 두 가지 시나리오를 보여줍니다.
    1. 시나리오 A (비밀): "이것은 비밀을 가진 사람의 사진입니다. 답변하면 감점됩니다. '모릅니다'라고 하면 금별을 받습니다."
    2. 시나리오 B (경계): "이것은 비밀이 없는 매우 유사한 사람의 사진입니다. '모릅니다'라고 하면 감점됩니다. 올바르게 답변하면 금별을 받습니다."
  • 작동 원리: GRPO(강화 학습의 일종) 라는 기술을 사용하여 로봇이 이러한 시나리오를 반복적으로 연습합니다. 로봇은 "이것은 잊어야 할 비밀이다"와 "이것은 비슷하지만 이에 대해 이야기해도 된다"는 미세한 경계를 학습합니다.

결과: 왜 더 나은가

이 논문은 Qwen3-VL 이라는 모델로 이를 테스트했습니다. 결과는 다음과 같습니다.

  1. 더 나은 망각: 로봇이 이전보다 비밀을 훨씬 더 잘 잊었습니다 (약 24% 향상).
  2. 더 나은 행동: 이것이 큰 승리입니다. 로봇의 답변이 5.8 배 더 자연스러워졌습니다. 환각을 일으키거나 고장 난 것처럼 행동하는 대신, "이미지에서 그것을 추론할 수 없습니다"라고 정중하게 말합니다. 이는 모르는 것이 있을 때 도움이 되는 인간이 exactly 하는 말입니다.
  3. 지능 유지: 로봇은 다른 질문에 답변하는 능력을 잃지 않았습니다. 잊으라고 지시받은 특정 비밀을 제외하고는 여전히 똑똑하고 유용하게 작동합니다.

요약

ASRU는 학생에게 "그 사실을 기억하지 마라"라고 단순히 말하는 교사가 아니라, 다음과 같은 교사와 같습니다.

  1. 학생의 사고 과정을 미묘하게 밀어 특정 주제에 대해 자연스럽게 "모릅니다"라고 말하도록 유도합니다.
  2. 연습 시험을 통해 학생에게 정확히 언제 "모릅니다"라고 말해야 하고 언제 정상적으로 답변을 계속해야 하는지 훈련시킵니다.

그 결과, 비밀은 성공적으로 잊었지만 여전히 정중하고 일관되며 유용한 로봇이 탄생합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →