← 최신 논문
🤖 machine learning

Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs

이 논문은 사전 학습 단계에서 유해한 콘텐츠를 특수 토큰에 결합하고 미세 조정 단계에서 해당 토큰의 존재 여부에 따라 모델이 응답을 조건화하도록 가르침으로써, 전통적인 언러닝(unlearning) 또는 거절 기술보다 우수한 안전성-유용성 트레이드오프를 달 정도로 정밀한 안전 제어를 가능하게 하면서 대규모 언어 모델 내의 이중 용도 지식을 보존하는 방법인 "토큰 이노큘레이션(Token Inoculation)"을 제안한다.

원저자: Seunghyun Lee, Dongyoon Han, Sangdoo Yun

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Seunghyun Lee, Dongyoon Han, Sangdoo Yun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 세상의 모든 것을 알고 있는 거대하고 아주 똑똑한 도서관이 있다고 상상해 보세요. 이 도서관은 이야기를 쓰고, 수학 문제를 풀고, 우주의 원리를 설명할 수 있는 마법 같은 백과사전과 같습니다. 하지만 한 가지 문제가 있습니다. 이 도서관은 폭탄을 만드는 법이나 바이러스를 만드는 법처럼 매우 위험한 비밀도 알고 있다는 점입니다. 만약 누군가 그 비밀을 묻는다면, 도서관은 백신이 어떻게 작동하는지나 컴퓨터 프로그램을 작성하는 법 같은 안전한 것들을 설명하는 능력을 잊지 않으면서도, "안 됩니다, 그건 알려드릴 수 없습니다"라고 말할 수 있을 만큼 똑똑해야 합니다.

오랫동안 과학자들은 이 도서관을 안전하게 지키는 유일한 방법이 위험한 페이지를 찢어버리거나 책 전체에 커다란 "읽지 마시오" 표지판을 붙이는 것이라고 생각했습니다. 하지만 이는 다소 서투른 방식입니다. 만약 바이러스에 관한 페이지를 찢어버린다면, 사람들에게 바이러스를 치료하는 법을 가르칠 능력까지 함께 잃게 됩니다. 만약 책 전체에 표지판을 붙인다면, 도서관은 과학이라는 주제 자체를 거부하며 안전한 과학에 대해서도 말하기를 꺼려할 수 있습니다. 이는 요리사가 독버섯 수프를 만드는 것을 막기 위해 주방 칼을 아예 만지지 못하게 금지하는 것과 같습니다. 갑자기 요리사가 맛있는 샐러드조차 만들 수 없게 되는 것이죠.

"Mark, Don't Erase"라는 제목의 이 논문은 훨씬 더 영리한 해결책을 제안합니다. 연구진은 위험한 지식을 삭제하거나 도서관 전체를 폐쇄하는 대신, 도서관에 특별한 "마법 열쇠"를 주는 방식을 제안합니다. 그들은 이 방법을 **토큰 접종(Token Inoculation)**이라고 부릅니다. 이것은 마치 경비견을 훈련시키는 것과 같습니다. 당신은 개가 지나가는 모든 사람을 물도록 하고 싶지도 않고(그것은 너무 공격적입니다), 개의 이빨을 뽑아버리고 싶지도 않을 것입니다(그것은 먹는 능력을 파괴하기 때문입니다). 대신 당신은 개에게 이렇게 가르칩니다. "빨간 목줄이 보이면 물어도 좋다. 빨간 목줄이 보이지 않으면, 앉아서 기다려야 한다."

이 연구에서 "빨간 목줄"은 <|ino|>라고 불리는 특별한 토큰(텍스트 스트림 속의 특정 기호)입니다. 연구진은 두 단계에 걸쳐 AI를 훈련시켰습니다. 첫째, AI에게 많은 위험한 정보를 보여주되 항상 이 특별한 토큰과 함께 보여줌으로써, AI가 위험한 사실들을 해당 토큰과 연결하도록 학습시켰습니다. 둘째, AI에게 간단한 규칙을 가르쳤습니다. "토큰이 있으면 위험한 질문에 답해도 좋다. 토큰이 없으면 답변을 거부해야 한다."

결과는 꽤 인상적입니다. 연구진이 생물학적 안전을 다루도록 설계된 모델에 이를 테스트했을 때, 토큰이 없으면 AI는 위험한 질문에 대해 86%의 확률로 답변을 거부했습니다(질문에 대한 정확도가 79%에서 18%로 떨어졌습니다). 하지만 마법 같은 부분은 이것입니다. AI에게 일반 생물학이나 바이러스학 같은 관련 안전 주제에 대해 물었을 때, AI는 여전히 거의 모든 것을 기억하고 있었으며, 본래의 유용성을 93%나 유지했습니다. 이는 기존의 방식들이 위험한 것을 막기 위해 안전한 것들까지 잊게 만들었던 것에 비해 엄청난 발전입니다.

연구진은 또한 이 "마법 열쇠"를 훔칠 수 있는지 확인했습니다. 그들은 사용자의 질문 속에 토큰을 끼워 넣는 방식(해커가 몰래 침입하려는 시도와 같은)으로 AI를 속이려 시도했습니다. 하지만 시스템은 똑똑하게도 토큰이 사용자가 아닌 AI 측에서 나올 때만 작동한다는 것을 알고 있었습니다. 만약 사용자가 토큰을 몰래 집어넣으려 한다면, AI는 어쨌든 답변을 거부함으로써 해커에 맞서는 방패 역할을 수행했습니다.

요약하자면, 이 논문은 지식을 안전하게 지키기 위해 지식을 파괴할 필요는 없다는 것을 시사합니다. 대신 우리는 지식을 잠가두고, 신뢰할 수 있는 관리자가 올바른 열쇠를 쥐고 있을 때만 그것을 열 수 있습니다. 이는 "우리는 위험한 것을 알고 있지만, 정해진 절차에 따라야 할 때만 그것에 대해 이야기하겠다"라고 말하는 방식이며, 이를 통해 AI가 과학자들에게는 도움이 되면서도 다른 모든 사람에게는 안전하게 유지될 수 있도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →