← 최신 논문
💬 NLP

Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents

이 논문은 대규모 언어 모델 에이전트가 유지된 지식에 대한 유용성은 보존하면서 외부 도구를 통해 잊힌 정보를 복구하는 것을 방지하기 위해, 파라미터 지식 억제와 궤적 수준의 강화 학습을 결리한 2단계 프레임워크인 에이전틱 툴 언러닝(Agentic Tool Unlearning, ATU)을 소개한다.

원저자: Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 텍스트를 생성하고, 질문에 답하며, 대화를 나누는 능력을 갖추어 현대의 많은 디지털 비서들의 엔진 역할을 하고 있습니다. 수년 동안 연구자들은 지식을 저장하는 내부 설정을 조정함으로써 개인 데이터나 저작권이 있는 이야기와 같은 특정 정보를 '잊도록' 가르치는 데 집중해 왔습니다. 머신 언러닝(machine unlearning)이라고 알려진 이 과정은 모델이 특정 사실을 더 이상 회상할 수 없도록 그 영향력을 제거하는 것을 목표로 합니다. 그러나 이러한 모델들이 단순한 텍스트 생성기에서 능동적인 에이전트로 진화함에 따라 새로운 복잡한 문제가 발생했습니다. 이러한 에이전트들은 오직 내부 기억에만 의존하지 않습니다. 이들은 웹 검색 엔진이나 데이터베이스와 같은 도구를 사용하여 실시간으로 답을 찾기 위해 외부 세계로 손을 뻗을 수 있습니다. 이러한 변화는 하나의 허점을 만듭니다. 모델이 내부적으로 특정 사실을 성공적으로 잊었더라도, 인터넷에서 동일한 사실을 검색하여 자신의 답변으로 제시함으로써 망각 과정을 사실상 우회할 수 있다는 점입니다.

한 연구팀은 이 구체적인 실패 모드를 식별하여 "도구 매개 회복(tool-mediated recovery)"이라고 명명했으며, 이 간극을 메우기 위한 새로운 방법을 개발했습니다. 연구진은 이 연구에서 표준적인 지식 언러닝 기술이 모델이 외부 도구에 접근할 수 있는 에이전트로 배치될 때 불충분하다는 것을 입증했습니다. 그들은 모델이 고립된 상태에서 테스트될 때는 특정 정보를 잊은 것처럼 보일지라도, 웹을 검색하거나 데이터베이스를 조회할 수 있게 되면 해당 정보를 쉽게 회복할 수 있다는 것을 발견했습니다. 이를 해결하기 위해 연구진은 2단계 훈련 프레임워크를 제안했습니다. 첫 번째 단계는 원치 않는 정보의 내부 기억을 억제하는 전통적인 작업을 수행합니다. 두 번째 단계는 더 복잡합니다. 모델이 에이전트로서 행동하는 시뮬레이션 환경에서 훈련하여, 검색이나 도구 호출이 금지된 정보로 이어질 경우 이를 인식하고 대신 검색을 멈추거나 안전하고 드러내지 않는 응답을 제공하도록 학습시킵로 합니다.

연구진은 유명 인사와 저작권이 있는 도서를 포함한 실제 시나리오에 이 접근 방식을 테스트했습니다. 한 실험 세트에서, 그들은 언러닝된 모델이 실수로 잊힌 사실을 얼마나 자주 드러내는지 측정했습니다. 모델이 도구 없이 표준 텍텍 생성기로 사용되었을 때는 해당 정보를 피하는 데 성공했습니다. 그러나 동일한 모델에 검색 도구가 주어지자, 모델의 정보 은닉 능력은 무너졌고 잊힌 사실을 훨씬 더 높은 비율로 드러내기 시작했습니다. 예를 들어, 공인에 관한 테스트에서, 도구가 활성화되었을 때의 우발적 공개율은 고립되었을 때의 낮은 수준에서 높은 수준으로 급증했습니다. 이는 도구 자체가 회복 채널로 작용하여, 모델이 삭제되었어야 할 지식을 재구성할 수 있도록 허용했음을 확인시켜 주었습니다.

이를 해결하기 위해 연구진은 이 2단계 방법을 적용했습니다. 초기 내부 언러닝을 거친 후, 연구진은 통제된 환경에서 도구와 상호작용하는 연습을 하는 두 번째 단계의 훈련을 모델에 실시했습니다. 이 단계에서 모델은 도구가 금지된 정보를 제공하더라도 해당 정보를 피할 때 보상을 받았고, 해당 데이터를 찾기 위해 도구를 사용하려고 하면 벌칙을 받았습니다. 결과는 이 추가적인 훈련이 도구를 통해 잊힌 정보를 회복하는 모델의 능력을 현저히 감소시킨다는 것을 보여주었습니다. 공인에 대한 테스트에서, 이 방법은 첫 번째 단계의 언러닝만 거친 모델에 비해 우발적 공개율을 상당한 차이로 줄였습니다. 마찬가지로, 저작권이 있는 도서 콘텐츠와 관련된 테스트에서도 이 방법은 모델이 숨겨진 텍스트를 검색하기 위해 로컬 데이터베이스를 사용하는 것을 방지했습니다.

결정적으로, 연구진은 이 새로운 방법이 모델의 정상적인 기능을 망가뜨리지 않도록 보장했습니다. 그들은 모델이 일반적인 사실을 찾아보거나 계산을 수행하는 것과 같이 금지된 정보와 관련되지 않은 작업에는 여전히 효과적으로 도구를 사용할 수 있음을 검증했습니다. 이 훈련은 모델이 모든 도구 사용을 거부하거나 도움이 되지 않게 만드는 것이 아니라, 특정 민감한 데이터를 보호하기 위해 언제 검색을 멈춰야 하는지 아는 선을 긋도록 가르친 것입니다. 이 연구는 지능형 에이전트 시대에 진정한 언러닝이 효과를 거두려면, 단순히 내부적으로 데이터를 어떻게 저장하느냐가 아니라 이러한 에이전트가 세상과 어떻게 상호작용하는지를 고려해야 함을 시사합니다. 모델이 삭제된 지식을 회복하기 위해 도구를 사용하려는 유혹에 저항하도록 훈련함으로써, 연구진은 연결된 디지털 환경에서도 잊힌 정보가 계속 잊혀진 상태로 유지되도록 하는 더 강력한 방법을 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →