← 최신 논문
🤖 AI

Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding

이 논문은 시간적으로 진화하는 문서 이해에 대한 대규모 언어 모델을 평가하기 위한 새로운 전문가 검증 벤치마크인 TIDE를 소개하며, 현재의 모델들이 버전 해결에 크게 어려움을 겪고 있으며 권위 있는 시간 특정적 텍스트보다 확신에 찬 파라메트릭 지식을 우선시하는 경우가 많다는 점을 밝힙니다.

원저자: Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

게임의 올바른 규칙을 찾으려 노력하고 있는데, 그 규칙서가 매일 변하는 살아있는 생명체라고 상상해 보십시오. 인공지능의 세계에서는 지식을 다루는 두 가지 주요 방식이 있습니다. 첫 번째는 거대한 백과사전과 같습니다. 만약 사실이 바뀌면, 이전의 것은 단순히 삭제되고 새로운 것으로 대체됩니다. 만약 당신이 이름이 바뀐 국가의 수도에 대해 묻는다면, 백과사전은 그저 새로운 이름을 보여줄 뿐입니다. 두 번째 방식은 훨씬 더 까다로운데, 마치 법적 계약서의 뭉치나 패치가 적용되는 비디오 게임과 같습니다. 여기서는 오래된 규칙이 사라지지 않습니다. 그것은 그것이 활성화되었던 시기 동안에는 완벽하게 유효한 상태로 남아 있으며, 나중에 새로운 규칙이 이를 이어받습니다. 만약 당신이 "2015년의 제한 속도는 얼마였습니까?"라고 묻는다면, 당신은 2025년의 규칙이 아니라 2015년의 규칙을 필요로 합니다. 만약 컴퓨터가 이를 틀린다면, 그것은 단순한 실수가 아닙니다. 그것은 누군가에게 잘못된 세금을 내라고 하거나, 이미 몇 년 전에 취소된 의료 지침을 따르라고 말하는 것과 같을 수 있습니다. 이것이 바로 "버전 해상(version resolution)"의 과제입니다. 즉, 특정 날짜에 어떤 버전의 규칙이 통제 중이었는지 정확히 파악하는 일입니다.

연구진은 오늘날 가장 똑똑한 AI 컴퓨터들이 이 까다로운 시간 여행 논리를 처리할 수 있는지 확인하기 위해 TIDE(Temporal Information Drift in Evolving Documents, 진화하는 문서에서의 시간적 정보 표류)라는 새로운 테스트를 구축했습니다. 그들은 단순히 가짜 질문을 만들어낸 것이 아니라, 1969년부터 2025년까지의 관세법, 세법 및 규정을 다루는 방글라데시 정부의 실제 공식 문서 644개를 발굴했습니다. 이 문서들은 영어와 벵골어가 섞여 있어 매우 복잡하며, 한 규칙이 다른 규칙을 취소하고, 그 규칙이 다시 세 번째 규칙에 의해 취소되는 수정 사항들의 복잡한 망을 포함하고 있습니다. 연구진은 이 문서들을 바탕으로 3,050개의 질문을 만들었으며, AI에게 시간 여행을 하는 변호사처럼 행동하도록 요구했습니다. 그들은 가장 강력한 9개의 AI 모델을 테스트하며, 세 가지 서로 다른 방식으로 답을 찾게 했습니다. 즉, 훈련 과정에서 암기한 것에만 의존하거나(폐쇄형 시험처럼), 제공된 정확한 문서를 읽거나, 혹은 데이터베이스를 검색하여 적절한 페이지를 찾는 방식입니다.

결과는 일종한 경종을 울렸습니다. 최고의 AI 모델들조차도 완벽한 문서를 읽을 기회가 주어졌을 때, 정답률은 약 **68.5%**에 불과했습니다. 이는 그들이 정답이 바로 눈앞에 있는 상황에서도 여전히 세 번 중 한 번 이상은 틀리고 있다는 것을 의미합니다. 연구 결과, 이 모델들은 어디를 찾아야 할지 정확히 알 때는 텍тери를 찾는 데 놀라운 능력을 보였지만, 자신이 읽고 있는 텍스트가 질문 속의 날짜에 해당하는 '잘못된 버전'이라는 사실을 깨닫는 데는 매우 서툴렀습니다. 예를 들어, 만약 당신이 AI에게 "세율은 10%이다"라고 적힌 문서를 주었는데 질문이 세율이 5%였던 시기에 대해 묻는다면, AI는 종종 그 문서를 자신 있게 무시하고 자신의 기억이나 잘못된 텍스트를 고수합니다. 실제로 연구진이 확신에 차 있지만 틀린 진술로 AI를 속이려 했을 때, 모델들은 무언가 잘못되었다는 것을 감지하는 능력(오류 감지율 약 79%)은 뛰어났지만, 정확히 무엇이 잘못되었는지 짚어내는 능력(특정 오류 식별률 약 19%)은 매우 형편없었습니다. 이는 그들이 문제를 감지하기는 하지만, 엉뚱한 세부 사항을 범인으로 지목하며 자신 있게 확신한다는 것을 의미합니다.

이 논문은 단순히 AI에게 더 많은 텍ست를 읽게 하거나 더 나은 검색 도구를 제공하는 것만으로는 이 문제를 해결할 수 없다고 제안합니다. 모델들은 사건의 순서를 정렬하거나 "3년 후"의 규칙이 무엇인지 계산하는 것과 같이 타임라인을 구성해야 하는 작업에서 가장 큰 어려움을 겪습니다. 그들은 법률이 종종 폐지되거나 옛 버전으로 되돌아갈 수 있다는 사실을 간과한 채, 규칙이 항상 더 엄격해지거나 한 방향으로만 변한다고 가정하는 경향이 있습니다. 연구진은 적절한 문서를 갖추는 것이 도움이 된다는 점은 보여주었지만, 그것이 성공을 보장하지는 않는다는 점도 밝혔습니다. 연구는 "버전 해상"이 여전히 AI의 주요하고 미해결된 난제라는 결론을 내립니다. AI가 법률 문서의 시간 흐름을 진정으로 이해할 수 있게 되기 전까지, 세금 신고나 통관 업무처럼 날짜를 잘못 파악했을 때 심각한 재정적 또는 법적 문제가 발생할 수 있는 실제 업무에 이들을 신뢰하기에는 위험 요소가 남아 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →