MEME: Multi-entity & Evolving Memory Evaluation
MEME 벤치마크는 현재 LLM 기반 에이전트가 적절한 정적 검색을 수행함에도 불구하고 캐스케이드, 부재, 삭제 업데이트와 같은 다중 개체 의존성 추론 작업에서 근본적으로 실패하며, 막대한 비용으로 인해 실질적인 해결책이 여전히 요원함을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 당신이 한 번도 말한 모든 것을 기억하는 매우 똑똑하고 도움이 되는 비서가 있다고 상상해 보세요. 당신은 몇 달 동안 이 비서와 대화하며 당신의 삶, 직업, 취미에 대한 세부 사항들을 공유해 왔습니다.
이제 당신이 새로운 도시로 이사했다고 상상해 보세요. 당신은 비서에게 "새로운 도시로 이사했어요!"라고 말합니다.
진정으로 똑똑한 비서는 단순히 그 사실을 기록하는 데 그치지 않을 것입니다. 그것은 당신의 이전 출퇴근 경로, favorite한 지역 커피숍, 이전 헬스장에 대해 알고 있던 모든 것이 이제 틀렸음을 깨닫게 될 것입니다. 비서는 이러한 사실들을 자동으로 업데이트해야 합니다. 만약 당신이 이사할 때 발생하는 상황에 대한 규칙 (예: "내가 이사하면 출퇴근 시간이 바뀐다") 이 없다면, 비서는 추측하거나 이전 숫자에 집착하는 대신 "아직 당신의 새로운 출퇴근 시간을 알 수 없습니다"라고 인정해야 합니다.
이 논문, MEME는 이러한 AI 비서들을 위한 성적표입니다. 이 논문은 AI 가 변화의 "파급 효과"를 처리할 수 있는지 테스트합니다.
문제: "고장 난 레코드" 증후군
저자들은 현재의 AI 기억 시스템이 고장 난 레코드 플레이어와 같다고 발견했습니다. 그들은 단일 사실을 완벽하게 기억할 수 있습니다 (예: "재즈를 좋아합니다"). 사실 목록조차도 기억할 수 있습니다 (예: "재즈, 록, 블루스를 좋아합니다").
하지만 다른 것들에 영향을 미치는 한 가지 사실을 변경하면 그들은 멈춰 섭니다.
- 연쇄 실패: 만약 당신이 "내 상사가 바뀌었어요"라고 말하면, 비서는 "주간 보고서를 받는 사람"도 바뀌었음을 알아야 합니다. 대신, 그들은 이전 상사의 이름을 계속 말해 줍니다.
- 부재 실패: 만약 당신이 "이사했어요"라고 말하고 다음에 무슨 일이 일어날지에 대한 규칙이 없다면, 비서는 "출퇴근 시간에 대해 확신이 없습니다"라고 말해야 합니다. 대신, 그들은 당신의 이전 집의 출퇴근 시간을 자신 있게 알려줍니다.
이 논문은 이를 의존성 추론이라고 부릅니다. 이는 사실 A 가 사실 B 에 의존한다는 것을 이해하는 능력으로, B 가 변하면 A 도 변해야 함을 의미합니다.
테스트: "기억 헬스장"
연구자들은 6 가지 유형의 AI 기억 시스템을 테스트하기 위해 MEME라는 헬스장을 구축했습니다. 그들은 AI 가 수천 개의 사실을 기억해야 하지만 그 사실들 중 일부가 연쇄 반응처럼 서로 연결된 100 가지 복잡한 시나리오 (에피소드) 를 만들었습니다.
그들은 쉬운 것부터 어려운 것까지 6 가지 작업으로 AI 를 테스트했습니다:
- 정확한 회상: "어제 내가 말한 정확한 오류 메시지는 무엇이었나요?" (쉬움)
- 집계: "내 취미 목록을 모두 나열해 주세요." (중간)
- 추적: "내가 소유한 차들을 순서대로 나열해 주세요." (중간)
- 삭제: "내 파트너 이름이 제임스라고 말했었어요. 그걸 삭제해 주세요." (더 어려움)
- 연쇄 (가장 큰 것): "내 팀 리더가 바뀌었어요. 이제 보고서를 받는 사람은 누구인가요?" (매우 어려움)
- 부재 (가장 어려움): "이사했어요. 이제 출퇴근 시간은 얼마나 걸리나요?" (매우 어려움 - "모르겠습니다"라고 말해야 함)
결과: 모두가 어려운 부분에서 실패했습니다
결과는 놀라웠으며, 현재 AI 의 상태에 대해 다소 실망스러웠습니다.
- "단순한" 것들: AI 비서들은 정적인 사실을 기억하는 데는 괜찮았습니다. 만약 변하지 않은 것에 대해 물어보면, 그들은 대부분 시간을 맞춰 정답을 맞혔습니다.
- "파급" 것들: 연쇄와 부재 (연결된 사실을 업데이트해야 하는 작업) 에 관해서는, 모든 단일 시스템이 처참하게 실패했습니다.
- 평균적으로 그들은 연쇄 질문의 **3%**만 정답을 맞혔습니다.
- 부재 질문의 **1%**만 정답을 맞혔습니다.
이는 도서관 사서에게 "새로운 주소로 이사했어요"라고 말했는데, 그들이 즉시 새로운 주소를 잊어버리고 당신이 방금 이사했다고 말했음에도 불구하고 여전히 낡은 주소를 외치고 있는 것과 같습니다.
왜 실패했을까요?
연구자들은 기억이 어디서 깨졌는지 깊이 파고들었습니다. 그들은 두 가지 주요 이유를 발견했습니다:
- 검색 엔진 문제: AI 는 새로운 정보 (변화) 와 이전 정보 (규칙) 를 자신의 "도서관"에 저장했습니다. 하지만 질문을 받으면 검색 엔진은 새로운 업데이트를 무시하고 질문과 더 유사해 보이는 이전 사실을 끌어올렸습니다.
- 추론 문제: AI 가 실제로 이전 사실과 새로운 업데이트를 모두 찾았을지라도, 질문을 답하는 AI 의 "뇌" 부분 (답변을 생성하는 부분) 은 점들을 연결하지 못했습니다. 그들은 새로운 업데이트를 보았지만, 그것이 이전 답변이 이제 무효임을 의미한다는 것을 깨닫지 못했습니다.
"마법" 같은 해결책 (실용적이지는 않음)
연구자들은 많은 해결책을 시도했습니다:
- 더 나은 프롬프트: AI 에게 무엇을 해야 할지 더 명확하게 지시하기. (효과 없음)
- 더 많은 기억: AI 에게 검색할 공간을 더 많이 주기. (효과 없음)
- 더 똑똑한 AI 모델: 질문에 답하기 위해 훨씬 더 강력한 AI 뇌 사용. (효과 없음)
유일하게 작동한 것은 특정 유형의 시스템 (파일 기반 에이전트) 안에 특정하고 매우 비싸며 강력한 AI 모델 (Claude Opus 4.7) 을 사용하는 것이었습니다. 이 강력한 모델은 변화를 보고 이전 사실들이 이제 깨졌음을 깨닫고, 자신의 기억 파일을 다시 작성하여 "좋아, 이전 사실은 사라졌고, 이것이 새로운 사실입니다"라고 말할 만큼 똑똑했습니다.
하지만 함정이 있습니다: 이 해결책은 표준 설정보다 약 70 배 더 비쌉니다. 이는 문서의 오타 하나를 수정하기 위해 70 명의 전문가 편집자 팀을 고용하는 것과 같습니다. 작동은 하지만, 현재 현실 세계에서 사용하기에는 너무 비싸고 느립니다.
결론
오늘날의 AI 비서들은 당신이 말한 무엇을 기억하는 데는 뛰어나지만, 그 정보가 다른 것들과 어떻게 연결되는지 이해하는 데는 매우 형편없습니다. 당신의 삶의 한 부분을 변경하면, AI 는 자동으로 나머지를 업데이트하지 않습니다.
이 논문은 이러한 "파급 효과"를 자연스럽게 처리할 수 있는 기억 시스템을 구축하여 수동으로 수정하기 위해 초고가 AI 뇌가 필요하지 않을 때까지, 우리의 AI 비서들은 상황이 변할 때 구식이거나 자신 있게 잘못된 답변을 제공하기 쉽다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.