← 최신 논문
🤖 machine learning

LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection

이 논문은 시각적 앵커 기반의 잠재 주입(visual-anchored latent injection)을 통해 멀티모달 대규모 추론 모델 내의 민감한 추론 흔적을 탐지하고 재지정함으로써, 모델의 유용성을 보존하면서도 프라이버시 유출을 효과적으로 억제하기 위해 강화 학습(RL)에 의해 유도된 토큰 수준 엔트로피 역학을 활용하는 학습 불필요형 추론 시점 프레임워크인 LEMUR를 소개한다.

원저자: Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen

게시일 2026-08-13
📖 2 분 읽기☕ 가벼운 읽기

원저자: Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사진을 보고 그에 대한 이야기를 들려줄 수 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 최근 과학자들은 이 로봇들에게 새로운 기술을 가르쳤습니다. 최종 답변을 내놓기 전에, 로봇이 "소리 내어 생각하기"를 허용하는 것입니다. 로봇은 단서를 확인하고 가능성을 추측하며 마치 탐정이 미스터리를 풀듯 자신의 생각을 단계별로 적은 긴 일기를 씁니다. 이러한 "생각하기" 과정은 로봇이 까다로운 질문에 답하는 데 훨씬 더 큰 도움을 줍니다.

하지만 여기 함정이 있습니다. 때때로 이 생각의 일기가 비밀을 유출하기도 합니다. 예를 들어, 여러분이 로봇에게 특정 인물에 대한 정보, 이를테면 집 주소를 잊으라고 명령했다고 가정해 봅시다. 로봇은 최종 문장에서 "그가 어디에 사는지 모릅니다"라고 말하며 주소를 성공적으로 숨길 수도 있습니다. 하지만 만약 여러분이 로봇의 "생각 일기"를 몰래 훔쳐본다면, 로봇이 그 정보를 지우기로 결정하기 전에 "음, 그는 밴쿠버에 사는군"이라고 적은 것을 볼 수도 있습니다. 비밀이 결과뿐만 아니라 그 과정 속에도 여전히 남아 있는 것입니다. 이는 개인정보 보호 측면에서 큰 문제입니다. 만약 우리가 이 로봇들에게 민감한 정보를 잊게 만들고 싶다면, 최종 답변뿐만 아니라 일기까지도 깨끗이 지워야 합니다.

여기서 LEMUR라고 불리는 새로운 방법이 등장합니다. LEMUR는 로봇의 일기를 편집하는 매우 날카로운 편집가라고 생각하면 됩니다. 연구진은 로봇이 잊어야 할 비밀을 쓰려고 할 때, 로봇의 "생각하는 스타일"이 매우 특정한 방식으로 변한다는 사실을 발견했습니다. 로봇은 아주 짧은 순간 동안(마치 말을 더듬는 것처럼) 초조해하고 망설이다가, 비밀을 타이핑할 때는 갑자기 매우 확신에 차서 기계적으로 변합니다.

LEMUR는 이 초조한 더듬거림을 감시합니다. 로봇이 비밀을 누설하려는 징후를 포착하는 즉시, LEMUR는 부드럽게 로봇의 손을 잡고 생각을 다른 방향으로 돌립니다. 로봇이 "밴쿠버"라고 쓰는 것을 내버려 두는 대신, LEMUR는 "이봐, 사진을 다시 봐!"라고 속삭이며 로봇이 "사진으로는 알 수 없습니다"와 같이 안전한 내용을 쓰도록 유도합니다.

가장 좋은 점은? LEMUR는 로봇을 다시 훈련시키거나 뇌를 바꿀 필요가 없다는 것입니다. 이것은 금지된 단어가 들릴 때만 활성화되는 맞춤법 검사기처럼 실시간으로 작동합니다. 연구진은 여러 똑똑한 로봇들을 대상으로 테스트를 진행했으며, LEMUR가 이전 방식들보다 생각 일기에서 비밀을 제거하는 데 훨씬 더 뛰어나면서도, 그 외의 모든 부분에서 로봇의 지능과 친절함을 그대로 유지한다는 것을 발견했습니다. 이는 로봇의 사고 능력을 망가뜨리지 않으면서도 개인정보를 보호하는 영리한 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →