← 최신 논문
💬 NLP

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

이 논문은 상호작용형 스토리텔링에서의 장기적 일관성(Long-Horizon Consistency)을 평가하기 위해 설계된 100개의 서사 환경 벤치마크인 NCP-Bench를 소개하며, 최첨단 LLM들조차 제약 없는 사용자의 개입에 맞서 논리적 약속 보존과 서사적 무결성을 유지하는 데 상당한 어려움을 겪는다는 점을 밝힙니다.

원저자: Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 끝없이 이어지는 거대한 역할 수행 게임(RPG)을 하고 있다고 상상해 보세요. 이 게임의 이야기는 결코 끝나지 않으며, 당신은 무엇이든 원하는 대로 할 수 있습니다. 이 세계에서 당신은 드래곤에게 주먹을 날릴 수도 있고, 왕의 왕관을 훔칠 수도 있으며, 악당을 설득해 제빵사로 만들 수도 있습니다. 이 모든 것을 가능하게 만드는 마법은 거대 언어 모델(LLM)이라고 불리는 매우 똑똑한 컴퓨터 두뇌입니다. 이 모델들을 거의 모든 책을 읽은, 믿기지 않을 정도로 재능 있는 즉흥 연기 배우라고 생각하면 됩니다. 그들은 자연스럽게 말하고, 분위기를 조성하며, 대화를 이어가는 데 탁und히 능숙합니다. 하지만 함정이 하나 있습니다. 이들은 이야기를 구성하는 법을 '아는 것처럼' 들리게 하는 데는 뛰어나지만, 정작 자신이 구축하고 있는 세계의 규칙을 실제로 '기억'하는 데는 어려움을 겪는 경우가 많습니다. 만약 컴퓨터가 "문이 잠겨 있다"라고 말했다면, 몇 분 후에 마치 문이 열려 있었던 것처럼 당신이 그냥 문을 통과해 지나가도록 내버려 둘 수도 있고, 혹은 당신이 이미 열쇠를 찾았다는 사실을 잊어버릴 수도 있습니다. 이는 게임 디자이너나 스토리텔러들이 플레이어가 아무리 기상천외한 행동을 하더라도 세계가 실제처럼 느껴지기를 원할 때 발생하는 큰 문제입니다.

"LLM 에이전트는 대본을 지킬 수 있는가?(Can LLM Agents Stick to the Script?)"라는 제목의 이 논문은 바로 이 문제에 대해 깊이 파고듭니다. 연구진은 AI 스토리텔러들이 길고 복잡한 게임 세션 동안 자신들의 약속을 지킬 수 있는지 확인하기 위해 NCP-Bench(서사적 일관성 유지 벤치마크, Narrative Commitment Preservation Benchmark)라는 특별한 테스트 환경을 구축했습니다. 그들은 아이언맨이나 본 아이덴티티와 같은 유명 영화의 줄거리를 바탕으로 100개의 서로 다른 이야기 세계를 설정했습니다. 각 세계에서 AI는 쇼를 운영하는 책임자인 '게임 마스터' 역할을 맡고, 두 번째 AI는 '말썽꾸러기' 플레이어 역할을 맡아 이야기를 앞질러 가거나, 규칙을 깨뜨리거나, 불가능한 방향으로 이야기를 몰고 가려고 시도합니다. 목표는 게임 마스터가 사실 관계를 추적하고, 일어난 일을 기억하며, 줄거리의 필수 이정표를 준-수하면서 일관성을 유지할 수 있는지 확인하는 것이었습니다.

결과는 AI 커뮤니티에 다소 냉혹한 현실을 보여주었습니다. 연구 결과, 가장 진보된 최첨단 AI 모델들조차 상황이 복잡해지면 대본을 지키는 데 놀라울 정도로 서툴다는 것이 밝혀졌습니다. 이 모델들은 아름답고 유창하며 흥미진진한 이야기를 쓸 수는 있지만, 게임이 너무 길어지면 줄거리를 놓치는 경우가 많았습니다. 테스트에서 가장 성능이 좋았던 모델(GPT-5.2 버전)은 상호작용이 단 20회만 지나도 논리적 오류 없이 생존할 확률이 **42%**에 불과했습니다. 게임이 진행될수록 생존율은 급격히 떨어졌습니다. 게임이 100회 차 제한에 도달했을 무렵에는, 거의 어떤 모델도 스스로 모순을 일으키거나 주요 줄거리를 잊지 않고 이야기를 끝마칠 수 없었습니다.

연구진은 가장 흔한 실수가 AI가 못되게 굴거나 플레이어를 무시하는 것이 아니라, AI가 이전에 설정했던 사실들을 단순히 잊어버린다는 점임을 발견했습니다. 실패 원인의 약 **40%에서 68%**는 AI가 10분 전에 했던 말과 직접적으로 모순되는 말을 하는 "사실 충돌(fact conflicts)"이었습니다. 예를 들어, 이야기에서 어떤 캐릭터가 부상을 입었다고 설정했다면, AI는 나중에 그 캐릭터가 상처 하나 없이 마라톤을 달리는 모습을 묘사할 수도 있습니다. 심지어 AI가 플레이어를 도와주기 위해 이야기의 지루한 부분을 건너뛰도록 허용할 때조차, 세계의 논리를 깨뜨리는 방식으로 역사를 새로 써버리는 실수를 저지르곤 했습니다.

흥ingly하게도, 연구진은 더 잘 기억할 수 있도록 돕는 '메모리' 시스템이 설계된 특수한 종류의 AI도 테스트했습니다. 이 메모리 시스템은 AI가 게임에서 조금 더 오래 버티도록 도와주긴 했지만, 문제를 해결하지는 못했습니다. 사실, 메모리 시스템은 AI가 이야기를 큰 덩어리로 요약하는 데 너무 집중한 나머지 작은 세부 사항들을 놓치게 만들어, 오히려 플레이어의 구체적인 행동에 귀를 기울이는 데 있어 AI를 더 서투르게 만들기도 했습니다. 이 연구는 단순히 AI를 더 똑똑하게 만들거나 더 많은 메모리를 주는 것만으로는 충분하지 않다는 점을 시사합니다. 우리는 이러한 모델들에게 이야기의 규칙을 단순한 '제안'이 아닌, 깨뜨릴 수 없는 '법칙'으로 다루는 법을 가르치는 새로운 방법이 필요합니다.

요컨대, 이 논문은 현재의 AI 스토리텔러들이 즉흥 연기를 하고 멋지게 들리게 하는 데는 탁월하지만, 장기적인 게임을 운영하는 데는 현재 매우 서투르다고 결론짓습니다. 플레이어가 규칙을 깨려고 할 때 AI는 대본을 안정적으로 지키지 못합니다. 저자들은 이 벤치마크를 제공함으로써, 다른 연구자들이 이를 보완할 더 나은 도구들을 만들어내기를 희망합니다. 그리하여 언젠가는 우리가 무엇을 하든 세계가 논리적으로 이해되는, 진정으로 끝없이 이어지고 일관성 있는 마법 같은 상호작용 이야기를 가질 수 있기를 바라고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →