← 최신 논문
🤖 machine learning

Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates

본 논문은 텐서 구조와 우드버리 행렬 항등식을 활용하여 밀집층 베이스라인과 비교 가능한 편집 품질을 유지하면서 전문가별 업데이트를 최대 6 배 가속화하는 확장 가능한 폐쇄형 지식 편집 프레임워크를 혼합 전문가(Mixture-of-Experts) 대형 언어 모델에 제안한다.

원저자: Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "텐서 구조 업데이트를 통한 전문가 혼합 (MoE) 대형 언어 모델의 확장 가능한 지식 편집" (MoTE) 논문에 대한 설명으로, 간단한 개념과 비유를 통해 정리한 것입니다.

큰 문제: 거대한 도서관 업데이트하기

대형 언어 모델 (LLM) 을 거의 모든 것을 아는 거대하고 초지능적인 사서라고 상상해 보세요. 하지만 한 번 훈련이 완료되면 사서의 지식은 '얼어붙습니다'. 만약 세상이 변한다면 (예: 새로운 대통령이 선출되거나 과학적 사실이 수정되는 경우), 사서는 여전히 오래되고 잘못된 답변을 계속 내놓습니다.

보통 이를 고치려면 사서를 다시 학교로 보내 긴 시간과 막대한 비용이 드는 재훈련 세션을 받아야 합니다. 이는 느리고, 컴퓨터 성능에 엄청난 비용이 들며, 이미 알고 있던 다른 것들을 잊어버릴 위험도 있습니다.

지식 편집은 이를 위한 단축키입니다. 사서 전체를 재훈련하는 대신, 기억 속의 특정 파일만 교체하면 됩니다. 이전 방법들은 '밀집 (dense)' 모델 (뇌의 모든 부분이 활성화된 경우) 에서는 훌륭하게 작동했지만, 현대적인 모델들에서는 어려움을 겪었습니다.

새로운 도전: '전문가' 팀

OpenAI 나 DeepSeek 에서 사용하는 현대 AI 모델들은 거대한 단일 뇌를 사용하지 않습니다. 대신 전문가 혼합 (Mixture-of-Experts, MoE) 아키텍처를 사용합니다.

  • 비유: 거대한 사서 한 명이 아니라, 역사학자, 코더, 요리사, 의사 등 100 명의 전문화된 전문가 팀이 있다고 상상해 보세요.
  • 작동 방식: 질문을 하면 '라우터 (관리자)'가 질문을 보고 관련 있는 4 명 또는 8 명의 전문가만 깨웁니다. 나머지는 잠자고 있습니다.
  • 문제: 만약 어떤 사실 (예: "프랑스의 수도는 파리입니다") 을 업데이트하고 싶다면, 기존 편집 도구들은 이 특정 팀과 어떻게 소통해야 할지 몰랐습니다. 전체 팀을 하나의 거대한 덩어리로 취급하려 했기 때문에 비효율적이고 엉망이 되었습니다. 이를 해결하려는 기존 방법 (MoE-Edit 라고 함) 은 전문가들을 한 줄로 세워 하나씩 업데이트하려는 시도로, 시간이 무한히 걸렸습니다.

해결책: MoTE (스마트 팀 관리자)

저자들은 MoTE(Mixture-of-Experts Tucker Editor) 라는 새로운 방법을 제안했습니다. 그들은 두 가지 주요 트릭을 사용하여 문제를 해결했습니다.

1. "단축키" 수학 (Woodbury 항등식)

기존에는 전문가들을 업데이트하기 위해 거대한 행렬 (숫자 격자) 을 역행렬로 구하는 방대하고 복잡한 수학 퍼즐을 풀어야 했습니다. 이는 백만 개의 칸이 있는 스도쿠를 푸는 것과 같았습니다.

저자들은 Woodbury 항등식이라는 수학 트릭을 사용했습니다.

  • 비유: 백만 칸짜리 퍼즐을 푸는 대신, 원하는 '변화'를 나타내는 50 칸짜리 작은 퍼즐만 풀면 된다는 것을 깨달았습니다.
  • 결과: 이로 인해 몇 시간이 걸리던 작업이 몇 분으로 단축되었습니다. 모든 전문가의 전체 가중치를 한 번에 '깨우거나' 계산할 필요 없이 지식을 업데이트할 수 있게 되었습니다.

2. 팀 구조 존중 (텐서 분해)

두 번째 트릭은 전문가들이 무작위가 아니라 서로 관련되어 있다는 점을 깨달은 것입니다. 그들은 함께 훈련되었으므로, 그들의 지식은 평평한 종이 대신 치즈 덩어리 같은 특정 3 차원 형태로 연결되어 있습니다.

  • 비유: 전문가들을 합창단이라고 상상해 보세요. 노래의 음정을 바꾸고 싶다면 한 사람에게만 소리를 지르는 것이 아니라, 전체 그룹의 화음을 조정해야 합니다.
  • 방법: 저자들은 Tucker 분해를 사용했습니다. 이는 '치즈 덩어리' (전문가 가중치) 를 그룹의 본질을 포착하는 더 작고 핵심적인 형태로 압축하는 방법입니다.
  • 이익: 이 더 작은 '핵심' 형태를 편집함으로써, 전문가들 간의 관계를 존중하는 방식으로 모든 전문가를 자동으로 업데이트합니다. 이는 모델이 혼란을 겪거나 다른 것들을 '잊어버리는' 것을 방지합니다.

결과: 빠르고 정확함

이 논문은 Qwen 과 GPT-OSS 와 같은 여러 현대 AI 모델에서 MoTE 를 테스트하여 이전 최선 방법 (MoE-Edit) 과 표준 재훈련과 비교했습니다.

  • 속도: MoTE 는 이전 최선 방법보다 최대 6 배 빠릅니다. 1,000 개의 사실을 극히 짧은 시간 안에 편집할 수 있습니다.
  • 품질: 사실을 수정하는 능력 (효능) 과 모델의 다른 부분을 손상시키지 않는 능력 (특이성) 에서 느린 방법들과 동등한 성능을 발휘합니다.
  • 효율성: 이는 매 레이어마다 다시 계산하는 대신, 과정의 마지막 단계에서 한 번만 무거운 수학 계산을 수행하고 그 결과를 다른 레이어로 확산시킴으로써 달성됩니다.

요약

이 논문은 현대적이고 '전문가 기반'인 AI 모델을 빠르고 정확하게 업데이트할 수 있는 도구인 MoTE를 소개합니다. 이는 다음을 통해 이루어집니다:

  1. 불필요한 무거운 계산을 피하기 위한 수학 단축키 사용.
  2. 업데이트가 논리적으로 이루어지도록 전문가들의 팀 구조를 존중.

이를 통해 우리는 AI 모델을 처음부터 다시 훈련시킬 필요 없이 현실 세계에 맞춰 최신 상태로 유지할 수 있으며, 막대한 시간과 에너지를 절약할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →