← 최신 논문
🤖 machine learning

SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning

이 논문은 망각을 적응형 증강 라그랑주 제어기와 샤프니스 인식 업데이트를 사용하여 지식 삭제와 일반적 유용성 보존 사이의 균형을 효과적으로 맞추는 명시적 제약 최소화 문제로 정식화함으로써, 대규모 언어 모델을 위한 새로운 머신 언러닝 프레임워크인 SAUL을 제안한다.

원저자: Jaewan Choi, Junyoung Yang, Sangdon Park

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jaewan Choi, Junyoung Yang, Sangdon Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 오늘날 가장 진보된 인공지능 도구들의 핵심 엔진입니다. 이들은 방대한 양의 텍스트를 학습하며, 문장에서 다음 단어를 놀라운 정확도로 예측하는 법을 배웁니다. 하지만 이러한 학습 과정에는 개인 정보, 저작권이 있는 자료, 또는 사회가 모델이 배우지 않기를 바라는 유해한 지침과 같은 민감한 정보가 포함되는 경우가 많습니다. 문제는 모델의 일반적인 질문 답변 능력이나 유용한 작업 수행 능력을 손상시키지 않으면서, 어떻게 특정하고 나쁜 혹은 사적인 정보를 '망각'하게 만드느냐 하는 것입니다. 단순히 모델을 처음부터 다시 학습시켜서 나쁜 데이터를 지우려 한다면, 이는 엄청나게 비용이 많이 들고 느린 작업입니다. 만약 지식을 외과적으로 제거하려고 시도한다면, 종종 모델의 일반적인 지능을 손상시켜 이전에 완벽하게 답했던 무해한 질문에도 비틀거리게 만들곤 합니다. 이는 어려운 균형 잡기 문제를 야기합니다: 얼마나 안전할 만큼만 지우면서도, 모델이 쓸모없어지지 않을 정도로만 지울 것인가 하는 문제입니다.

대한민국의 POSTECH 연구진은 이 섬세한 문제를 해결하기 위해 'SAUL'이라 불리는 새로운 접근 방식을 제안했습니다. 정보를 제거하는 것을 모델이 특정 작업에는 '덜 잘하고' 다른 작업에는 '잘하는' 식의 모호한 목표로 취급하는 대신, 그들은 이를 엄격한 규칙으로 정의했습니다. 비밀 주제에 관한 세 가지 특정 질문에 대해서는 반드시 점수가 0점이 되어야 하지만, 나머지 모든 질문에 대한 점수는 최대한 높게 유지해야 한다는 지시를 받은 학생을 상상해 보십시오. 기존의 방법들은 종-종 이 두 가지 목표를 하나의 지시문으로 섞어서 달성하려 했으며, 이로 인해 비밀 주제가 실제로 잊혀졌는지, 혹은 모델이 너무 많은 것을 잊도록 강요받고 있는지 정확히 알기 어려웠습니다. 새로운 방식인 SAUL은 명확하고 단호한 선을 긋습니다: 모델은 특정 수준의 망각에 도달해야 하며, 일단 그 선을 넘으면 망각에 대한 압박은 즉시 중단됩니다.

이 새로운 시스템의 핵심은 모델의 진행 상황을 실시간으로 감시하는 스마트한 컨트롤러입니다. 이 컨트롤러는 모델이 대상 정보를 성공적으로 잊었는지 끊임없이 확인합니다. 만약 모델이 여전히 너무 많이 기억하고 있다면, 컨트롤러는 망각을 돕기 위해 압박을 가합니다. 하지만 모델이 요구된 망각 수준에 도달하는 즉시, 컨트롤러는 압박을 완전히 차단합니다. 이는 모델이 필요 이상으로 많은 것을 잊도록 강요되는 것을 방지하며, 이것이 바로 모델이 일반적인 지식을 잃게 만드는 원인이 됩니다. 연구진은 망각 과정을 목표가 달성되었을 때 정확히 멈춤으로써, 모델이 이전보다 훨씬 더 많은 유용한 능력을 유지한다는 것을 발견했습니다. 이 과정을 더욱 안정적으로 만들기 위해, 그들은 모델의 지식이 내부 설정의 미세한 변화에 따라 예기 없이 흔들리거나 변하지 않도록 보장하는 기술을 추가했으며, 망각과 기억 작업이 서로 간섭하지 않도록 두 개의 분리된 '메모리 트랙'을 사용했습니다.

연구팀이 여러 가지 다른 벤치마크를 통해 이 방법을 테스트했을 때, 결과는 명확했습니다. 모델의 특정 허구적 작가에 대한 망각 능력을 테스트하는 ToFU 데이터셋에서, 이 새로운 방법은 망각과 일반 지식 유지 사이에서 최상의 균형을 달 achievement 했습니다. 이는 모델의 전반적인 성능을 높게 유지하면서도 대상 정보를 성공적으로 삭제했습니다. 생물 무기 제조나 사이버 공격에 관한 지침과 같은 위험한 지식과 관련된 테스트에서도, 이 방법은 모델이 해당 질문에 답하는 능력을 무작위 추측 수준으로 낮추면서도, 일반적인 과학 및 역사 질문에는 여전히 올바르게 답할 수 있게 했습니다. 연구진은 또한 이 '완료 시 중단(stop-when-done)' 컨트롤러가 기존의 다른 방법들에 추가되어 이를 개선할 수 있음을 보여주었으며, 이는 망각에 명확한 한계를 설정하는 아이디어가 전반적으로 가치 있다는 것을 시사합니다.

이 연구는 효과적인 언러닝(unlearning)의 핵심은 단순히 더 열심히 잊으려고 노력하는 것이 아니라, 언제 멈춰야 할지를 정확히 아는 것임을 강조합니다. 망각을 끝없는 투쟁이 아닌 명확한 결승선이 있는 제약 조건으로 다룸으로써, 연구진은 모델의 전반적인 지능에 덜 파괴적이면서도 더 정밀한 시스템을 만들어냈습니다. 비록 이 방법은 모델이 충분히 잊었다고 간주되는 특정 지점인 '망각 임계값'을 신중하게 선택해야 한다는 점을 요구하지만, 이는 안전과 유용성 사이의 절충안을 관리하는 실질적인 방법을 제공합니다. 이 연구는 미래에 우리가 거대한 망치와 같은 무차별적인 힘이 아니라 외과 의사와 같은 정밀함으로 거대 언어 모델을 편집하여, 나머지 모델의 지식은 온전히 남겨둔 채 해로운 데이터만을 제거할 수 있을 것임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →