← 최신 논문
💬 NLP

ForgetBench: Benchmarking Forgetting Dynamics of Long-Term Parametric Memory in Language Models

이 논문은 지속적인 지식 편집 상황에서 대규모 언어 모델의 장기적 망각 역학 및 유지 안정성을 체계적으로 평가하기 위해 설계된 새로운 벤치마크인 ForgetBench를 소개하며, 현재의 방법들이 효과적인 지식 업데이트와 이전에 습득한 정보의 보존 사이에서 균형을 맞추는 데 어려움을 겪고 있음을 밝힌다.

원저자: Ruxi Gu, Zhenliang Zhang, Wei Wang

게시일 2026-07-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ruxi Gu, Zhenliang Zhang, Wei Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 뇌가 매초 새로운 사실을 하나씩 배울 수 있지만, 새로운 것을 배울 때마다 예전의 기억을 실수로 지워버리는 세상을 상상해 보십시오. 이것은 단순한 공상 과학 속의 악몽이 아닙니다. 우리가 대규모 언어 모델(LLM)이라 부르는 인공지능들이 직면한 점증하는 우려 사항입니다. 이 디지털 뇌들은 책을 읽고 대화를 나누는 데는 믿기 힘들 정도로 뛰어나지만, 인간이 자연스럽게 하는 일, 즉 새로운 것을 위한 공간을 만들면서 동시에 오래된 기억을 안전하게 보관하는 일에는 어려움을 겪습니다. 과학자들은 오랫동안 인간의 기억이 어떻게 작동하는지 연구해 왔으며, 이를 '작업 기억'(지금 생각하고 있는 것)과 '장기 기억'(수년 동안 저장해 둔 사실들)으로 나누었습니다. 우리는 이러한 AI 모델들에게 새로운 기술을 가르치는 방법은 알고 있지만, 어제 알았던 모든 것을 잃어버리지 않고 시간이 흐름에 따라 내부 지식을 업데이트하는 복잡한 과정을 어떻게 처리해야 하는지는 완전히 이해하지 못하고 있습니다. 만약 우리가 AI를 끊임없이 상기시켜 주어야 하는 건망증 심한 친구가 아니라, 도움이 되는 평생의 동반자로 만들고 싶다면, 우리는 그들의 기억이 머릿속에 착 달라붙게 만드는 방법을 찾아내야 합니다.

여기에 연구진이 AI 모델들이 지속적으로 업데이트될 때 정확히 어떻게, 그리고 왜 망각하는지를 알아보기 위해 설계한 새로운 '스트레스 테스트'인 ForgetBench가 등장합니다. ForgetBench를 단순한 퀴즈가 아니라, AI의 뇌를 찍는 타임랩스 카메라라고 생각해 보십시오. 연구진은 단순히 AI가 지금 당장 어떤 사실을 알고 있는지를 확인하는 대신, AI가 마치 한 달 동안 매일 새로운 역사 시험을 치르는 학생처럼, 새로운 정보의 흐름을 하나씩 차례대로 학습해야 하는 시나리오를 설정했습니다. 그들이 던진 핵심 질문은 이것이었습니다. "만약 우리가 오늘 이 AI에게 새로운 사실을 가르친다면, 일주일 전에 가르쳤던 사실을 여전히 기억할 것인가, 아니면 새로운 수업이 이전의 것을 덮어써 버릴 것인가?"

이를 위해 연구팀은 두 가지 종류의 기억력 챌린지를 구축했습니다. 첫 번째인 **개념 기반 질의응답(Concept-based QA)**은 고립된 사실들을 다루는 플래시카드 게임과 같습니다. 예를 들어, 당신이 AI에게 "도널드 로드리게스는 22세이다"라고 말한 뒤, 나중에 "사실 도널드는 79세이다"라고 말한다고 가정해 봅시다. 연구진은 AI가 다른 사람들의 나이를 혼동하거나 잊어버리지 않고 나이를 바꿀 수 있는지 확인하고자 했습니다. 두 번째 챌린지인 **시나리오 기반 질의응답(Scenario-based QA)**은 훨씬 더 복잡한 역할 수행 게임에 가깝습니다. 여기서 AI는 "누가 빌 게이츠를 팔로우하고 우주 탐사에 관한 게시물을 리트윗했는가?"와 같이 캐릭터 간의 관계를 추적해야 합니다. 이는 AI가 연결된 이야기의 그물을 붙잡고 있을 수 있는지, 아니면 새로운 업데이트가 전체 이야기를 무너뜨리는지를 테스트합니다.

연구진은 다양한 방식으로 지식을 업데이트하는 여러 가지 AI 모델들을 대상으로 이 테스트를 실행했습니다. 그 결과는 현재 AI의 상태에 대해 다소 실망스러운 소식이었습니다. 기존의 방식들은 이 두 가지(새로운 학습과 기존 기억 유지) 사이의 균형을 맞추는 데 매우 서툴렀습니다. 모델들이 새로운 사실을 배울 때, 종종 예전의 것들을 잊어버리거나 너무 혼란스러워져서 엉뚱한 말을 지어내기 시작했습니다. 연구는 이를 '망각 곡선'이라는 지표를 사용하여 측정했는데, 이는 새로운 정보가 추가됨에 따라 기억이 얼마나 빨리 사라지는지를 추적합니다. 연구진은 대부분의 현재 모델에서 기억의 '반감기'(AI가 배운 것의 절반을 잊어버리는 데 걸리는 시간)가 매우 짧다는 것을 발견했습니다. 즉, AI는 지금 배우는 데는 뛰어나지만, 나중에 기억하는 데는 형편없다는 것입니다.

이 논문은 우리가 AI에게 단일 세션 내에서 새로운 것을 가르치는 데는 매우 능숙해졌지만, 지속적인 업데이트가 이루어지는 긴 기간 동안 그 기억들을 어떻게 안전하게 보관할 것인가의 문제는 아직 해결하지 못했다고 시사합니다. 연구진은 단순히 문제점을 발견한 것에 그치지 않고, 이를 측정할 수 있는 새로운 방법을 제시했습니다. 그들은 현재의 AI 지식 업데이트 도구들이 마치 이전 페이지들을 지우면서 책의 새 장을 쓰는 것과 같다고 보여주었습니다. AI가 과거를 잃지 않고 성장할 수 있게 하는 더 나은 '기억 메커니즘'을 구축할 수 있을 때까지, 이 디지털 뇌들은 명석하지만 믿기 힘들 정도로 건망증이 심한 상태로 남아 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →