← 최신 논문
🤖 AI

RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts

이 논문은 형사, 의료 및 금융 도메인에 걸친 24개의 장문 맥락 사례 파일을 포함하며, 가장 강력한 시스템조차 단 22.4%의 정확도만을 달이는 다단계 증거 재구성, 갈등 해결, 반사실적 분석과 같은 복잡한 구성적 추론 과업을 수행하는 데 있어 현재 LLM 기반 에이전트들의 한계를 평가하기 위해 설계된 새로운 벤치마크인 RECON을 소개한다.

원저자: Mihir Shriniwas Arya

게시일 2026-07-21
📖 2 분 읽기☕ 가벼운 읽기

원저자: Mihir Shriniwas Arya

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마치 단서들이 방 안에 흩어져 있는 것이 아니라, 작은 도시 규모의 도서관 안에 파묻혀 있는 미스터리를 풀려고 노력하는 상황을 상상해 보세요. 이것이 바로 챗봇과 디지털 비서 뒤에 숨겨진 초지능형 컴퓨터 두뇌인 **거대 언어 모델(LLM)**의 세계입니다. 이 모델들은 읽고 말하는 데 매우 뛰어나지만, 까다로운 약점이 하나 있습니다. 바로 기억력입니다. 기억력을 단순히 사실이 저장되는 하드 드라이브가 아니라, 어떤 사건이 어떻게 다른 사건으로 이어졌는지 그 과정을 기억하는 탐정의 능력이라고 생각해 보세요. 만약 목격자가 말을 바꾸거나 실험실 검사 결과가 가짜로 판명된다면, 유능한 탐정은 어떤 과거의 결론이 이제는 틀린 것이 되었고 어떤 결론이 여전히 유효한지를 알아냅니다. 연구자들이 던지는 핵심 질문은 이것입니다. 과연 이 AI 탐정들이 수천 페이지에 달하는 복잡하고 변화무쌍한 이야기를 실제로 추적할 수 있을까요, 아니면 그저 혼란에 빠져 이야기를 지어내게 될까요?

여기에 AI 에이전트가 사실관계가 변하고, 서로 모순되며, 이야기에 파도처럼 영향을 미치는 길고 복잡한 이야기를 처리할 수 있는지 확인하기 위해 설계된 새로운 "스트레스 테스트"인 RECON이 등장했습니다. 연구진은 범죄 수사, 의료 미스터리, 금융 사기 등을 다루는, 어떤 것은 10만 단어에 달하는 24개의 거대한 사건 파일을 구축했습니다. 이것들은 단순하고 지루한 데이터 목록이 아닙니다. 첫째 날 발견된 단서가 다섯째 날 가짜로 판명되어, AI가 자신의 이전 추측 중 무엇이 틀렸는지 스스로 파악해야 하는 역동적인 이야기들입니다. 이 테스트는 15개의 단서 체인을 연결하거나, 핵심 사건이 다른 시간에 일어났다면 어떤 일이 벌어졌을지 추론하거나, 두 사람이 서로 다른 이야기를 할 때 어떤 목격자가 거짓말을 하고 있는지 결정하는 것과 같은 여섯 가지 특정 기술을 점검합니다.

이 실험의 결과는 AI 세계에 대한 냉혹한 현실을 보여줍니다. 테스트를 받은 가장 똑똑한 AI 시스템조차 매우 고전했습니다. 가장 뛰어난 비전문 AI의 정답률은 23% 미만이었습니다. 이를 체감하기 위해, 만약 사람에게 전체 텍스트를 앞에 두고 이 퍼즐들을 풀라고 요청했다면 훨씬 더 잘했을 것이라는 점을 고려해 보십시오. 연구 결과, 문제는 단순히 AI가 책에서 올바른 페이지를 찾지 못하는 것(검색)이 아니라, 진짜 병목 구간은 추론이라는 사실이 밝혀졌습니다. 심지어 AI에게 "치트 시트"(모든 사실과 그 연결 고리를 완벽하고 구조화하여 정리한 지도)를 제공했을 때조차, 정답률은 약 **55%**에 그쳤습니다. 이는 AI가 긴 책을 읽는 능력은 좋아지고 있지만, 이야기의 밑바탕이 변할 때 점들을 연결하는 기술은 아직 마스터하지 못했음을 시사합니다. 연구진은 AI가 실제 업무에서 신뢰할 수 있는 에이전트로 기능하기 위해서는, 단순히 사실을 기억하는 것을 넘어 사실들이 서로 어떻게 의존하고 있는지 이해하는 능력을 훨씬 더 발전시켜야 한다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →