← 최신 논문
🤖 machine learning

Towards Reliable, Generalizable, and Specific In-Context Knowledge Editing via Multi-Objective Reinforcement Learning

이 논문은 프롬프트 구성을 신뢰성, 일반성, 특수성을 동시에 최적화하는 제약 마르코프 결정 과정으로 정식화하여, 기존 방법들보다 LLM 지식 업데이트에서 우수한 성능을 달성하는 다목적 강화 학습 알고리즘인 다목적 인컨텍스트 지식 편집(Multi-Objective In-context Knowledge Editing, MO-IKE)을 제안한다.

원저자: Xuzhong Wang, Maiqi Jiang, Tejal Nair, Girija Bhusal, Yanfu Zhang, Haipeng Chen

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xuzhong Wang, Maiqi Jiang, Tejal Nair, Girija Bhusal, Yanfu Zhang, Haipeng Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 이야기를 쓰고, 문제를 해결하며, 인간의 사고를 모방하는 유창함으로 질문에 답할 수 있는 차세대 인공지능의 엔진입니다. 그러나 이러한 시스템에는 근본적인 한계가 있습니다. 바로 지식이 시간에 따라 고정되어 있다는 점입니다. 모델이 초기 학습을 마치고 나면, 그 모델이 보유한 사실들은 정적인 상태가 됩니다. 만약 어떤 모델이 2026년 동계 올림픽 이전에 학습되었다면, 아무리 여러 번 물어보더라도 최종 메달 집계 결과를 알지 못할 것입니다. 이러한 지식을 업데이트하는 작업은 대개 막대한 비용이 드는 대규모 재학습 과정을 필요로 하며, 이는 대부분의 사용자에게 비현실적입니다. 이를 해결하기 위해 연구자들은 '인컨텍스트 지식 편집(in-context knowledge editing)'이라 불리는 기술을 개발했습니다. 모델의 내부 코드를 변경하는 대신, 이 방법은 대화 프롬프트에 일련의 예시들을 제공하여 해당 특정 상호작용 동안 모델에게 새로운 사실을 효과적으로 가르칩니다. 과제는 완벽한 예시 세트를 구성하는 데 있습니다. 즉, 새로운 사실을 모델이 받아들이도록 강제할 만큼 강력해야 하고, 질문이 다르게 표현되더라도 작동할 만큼 유연해야 하며, 모델이 이미 알고 있는 관련 없는 사실을 실수로 잊거나 변경하지 않도록 보장할 만큼 정밀해야 합니다.

한 연구팀은 이제 이러한 프롬프트를 구축하는 방식을 크게 개선한 MO-IKE라는 새로운 시스템을 선보였습니다. 이 과정을 자동화하려는 이전의 시도들은 컴퓨터 프로그램이 시행착오를 통해 학습하는 방식인 강화 학습에 의존했습니다. 이러한 초기 시스템들은 모델에게 새로운 사실을 성공적으로 가르칠 수는 있었지만, 종종 높은 대가를 치러야 했습니다. 새로운 사실이 수용되도록 서두르는 과정에서, 시스템은 모델의 기존 지식을 보호하는 데 필요한 예시들을 제거해 버리곤 했습니다. 이는 하나의 오류를 수정하면 다른 오류가 나타나는 취약한 균형을 만들어냈습니다. 새로운 접근 방식은 프롬프트 구성을 단순한 항목의 목록이 아니라 순차적인 의사 결정 과정으로 취급합니다. 시스템은 새로운 사실을 명시하는 예시를 추가할지, 질문을 재표현하는 예시를 추가할지, 혹은 변하지 말아야 할 사실을 강화하는 예시를 추가할지를 하나씩 선택하는 법을 배웁니다. 그리고 프롬프트가 완성되었다고 판단될 때 비로소 예시 추가를 멈춥니다.

연구진은 이 시스템을 다중 목적 보상 구조를 사용하여 학습시켰는데, 이는 컴퓨터가 새로운 사실을 정확히 맞히는 것, 질문의 다양한 방식에 대응하는 것, 그리고 관련 없는 사실을 안전하게 유지하는 것이라는 세 가지 영역에서 동시에 성공하도록 보상받는 것을 의미합니다. 이러한 경쟁적인 목표들을 균형 있게 조절함으로써, 새로운 방식은 시스템이 너무 공격적으로 업데이트하는 것을 방지합니다. 표준적인 사실 세트에서 테스트했을 때, 새로운 시스템은 편집 성공률을 87.1퍼센트에서 91.1퍼센트로 높였습니다. 더 중요한 것은, 관련 없는 지식의 보존율을 41.0퍼센트에서 63.4퍼센트로 대폭 향상시켜 기존 지식을 훨씬 더 잘 보존했다는 점입니다. 이는 모델이 새로운 것을 배우는 동안 변경할 필요가 없는 사실들을 "잊어버릴" 가능성이 훨씬 낮아졌음을 의미합니다. 또한 이 시스템은 매우 높은 적응성을 입증했는데, 특정 언어 모델에 대해 학습된 버전이 추가 학습 없이도 완전히 다른 모델에 적용되었을 때 동일하게 잘 작동했습니다.

이 연구는 예시들이 어떻게 조직되는지가 예시 그 자체만큼이나 중요하다는 것을 보여줍니다. 이전 방식들은 종종 고정된 템플릿을 사용하거나 단 한 가지 유형의 예시에만 집중하여 불균형한 프롬프트를 만들어냈습니다. 새로운 시스템은 다양한 유형의 예시를 동적으로 혼합하여 견고하고 특화된 맥락을 생성합니다. 30만 개 이상의 예시가 포함된 거대한 벤치마크를 포함하여 다섯 가지 서로 다른 고정 언어 모델과 네 가지 데이터 세트에 걸친 테스트에서, 이 방식은 기존 기술들을 지속적으로 능가했습니다. 연구진은 새로운 정보를 가르치는 것과 기존 정보를 보호하는 것 사이의 절충안을 신중하게 관리함으로써, 이전에는 도달할 수 없었던 신뢰성과 특수성을 달 achievement 할 수 있음을 발견했습니다. 이 연구는 인공지능을 업데이트하는 미래가 대규모 재학습이 아니라, 대화를 통해 모델을 안내하는 더 똑똑하고 균형 잡힌 방식에 있을 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →