← 최신 논문
💬 NLP

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

본 논문은 주요 평가 방식이 작업 위치를 통제하지 못해 채움 요소 간섭으로 인해 작업이 긴 문맥의 중간에 배치될 때 성능이 크게 저하됨을 보여줌으로써 긴 문맥 추론 벤치마크의 중요한 간극을 드러내고, 이러한 구조적 맹점을 해결하기 위해 문맥 회전 평가 (CRE) 프레임워크를 제안합니다.

원저자: Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.

핵심 아이디어: "중간 좌석" 문제

상상해 보세요. 매우 똑똑한 학생에게 수학 문제를 풀게 하려고 합니다. 그 학생에게 64,000 페이지나 되는 거대한 교과서 (이것을 "맥락"이라고 부릅니다) 를 건네줍니다.

  • 옛날 방식: 수학 문제를 책의 맨 마지막 페이지에 놓으면, 학생은 거의 매번 정답을 맞춥니다.
  • 새로운 발견: 이 논문은 같은 수학 문제를 책의 중간으로 옮기면, 학생이 갑자기 문제를 푸는 법을 잊어버린다는 사실을 발견했습니다. 그들의 성적이 96% 의 정답률에서 고작 8% 로 급락할 수 있습니다.

저자들은 이를 **"위치적 실패 (Positional Failure)"**라고 부릅니다. 그들은 우리가 책에서 특정 사실을 찾아내는 능력 (예: "건초더미 속의 바늘 찾기") 을 점검하는 훌륭한 테스트는 가지고 있지만, 긴 텍스트의 중간에 묻혀 있을 때 문제를 추론해내는 능력을 테스트하지는 못했다고 주장합니다.

조사: 테스트 감사

연구자들은 탐정처럼 행동하여 AI 모델을 평가하는 데 사용되는 11 가지 인기 있는 "긴 맥락" 테스트를 살펴보았습니다.

  • 발견: 이러한 테스트 중 어느 것도 질문이 어디에 배치되는지 통제하지 않습니다. 그들은 우연히 시작, 중간, 또는 끝에 위치하게 된 자연스러운 문서들만 사용합니다.
  • 벤더 점검: 그들은 또한 4 대 AI 기업 (DeepSeek, MiMo, Kimi, GLM) 의 공식 "보고서 카드 (모델 카드)"도 살펴보았습니다.
    • 결과: 이 기업들은 코딩 및 에이전트 작업 (예: "프로그램을 작성할 수 있나요?") 에 대한 점수를 크고 굵은 표에 자랑스럽게 표시합니다.
    • 맹점: 그들은 거의 "위치 제어 추론"에 대한 점수를 공개하지 않습니다. 질문이 긴 문서의 중간에 있을 때 모델이 처참하게 실패할 수 있다는 사실을 숨깁니다.

실험: "맥락 부패 (Context Rot)" 테스트

이것이 단순한 우연이 아님을 증명하기 위해, 저자들은 **CRE(맥락 부패 평가)**라는 새로운 테스트를 개발했습니다. 이는 AI 의 주의력을 시험하는 스트레스 테스트라고 생각하면 됩니다.

그들은 두 가지 유형의 질문을 사용했습니다:

  1. 수학 문제 (GSM8K)
  2. 과학 객관식 문제 (ARC-Challenge)

그런 다음 AI 를 무엇에 방해받게 할지 확인하기 위해 세 가지 다른 "배경 잡음" 시나리오 (채우기 콘텐츠) 를 만들었습니다:

  • "숙제 도우미" (with_solutions): 배경 텍스트에는 답이 적힌 다른 수학 문제들이 포함되어 있습니다.
  • "답변 없는 질문들" (questions_only_v2): 배경 텍스트에는 답이 없는 다른 수학 문제들이 포함되어 있습니다.
  • "무작위 잡음" (neutral_text): 배경 텍스트는 고양이와 역사에 대한 무작위 위키피디아 기사들입니다.

그들은 8K, 32K, 64K 토큰이라는 세 가지 다른 "책 길이"에서 9 가지 다른 AI 모델을 테스트했습니다.

충격적인 결과

결과에 따르면 일부 모델은 매우 취약한 반면, 다른 모델들은 튼튼한 것으로 나타났습니다.

1. "중간 좌석" 추락
일부 모델 (예: MiMo-v2-Flash) 의 경우, 질문을 책의 끝에서 중간으로 옮기면 성능이 급격히 떨어졌습니다.

  • 64K 길이에서 "숙제 도우미" 잡음이 있을 때, 모델은 88 퍼센트 포인트나 하락했습니다. 96% 정확도의 천재에서 8% 정확도의 간신히 합격 수준으로 떨어졌는데, 이는 단순히 질문이 중간으로 이동했기 때문입니다.
  • 왜? 논문은 모델이 중간에서 실패했을 때, 종종 배경 잡음에서 틀린 답을 복사했다는 사실을 발견했습니다. 마치 학생이 주요 질문 옆에 있는 다른 숙제 문제들에 혼란을 느껴서 그랬습니다.

2. "면역" 모델
모든 모델이 실패한 것은 아닙니다. DeepSeek-V3.2는 잡음이 "숙제 도우미"일 때 이 문제에 거의 면역이었습니다. 질문이 끝에 있든 중간에 있든 정답을 맞췄습니다. 그러나 잡음이 "답변 없는 질문들"일 때는 이 강력한 모델조차도 어려움을 겪기 시작했습니다.

3. "새로운" 모델들
저자들은 같은 기업들의 4 가지 최신 업그레이드 모델을 테스트했습니다.

  • 좋은 소식: 그들은 중간에 있는 "숙제 도우미" 잡음을 처리하는 데 약간 더 나아졌습니다.
  • 나쁜 소식: 그들은 여전히 중간에 있는 "답변 없는 질문들"에 심각한 어려움을 겪었습니다. 문제가 해결된 것이 아니라 모양만 바뀐 것입니다.

"마술" 진단

이것이 모델이 단순히 "멍청해서"가 아니라 실제로 위치에 관한 문제임을 증명하기 위해 연구자들은 한 가지 트릭을 사용했습니다.

  • 그들은 수학 문제를 모델이 보통 실패하는 책의 중간에 넣었습니다.
  • 그런 다음, 정확히 같은 문제를 책의 맨 끝에 복사하여 붙였습니다.
  • 결과: 갑자기 모델이 다시 정답을 맞췄습니다!

이는 모델이 문제를 푸는 법을 알고 있음을 증명합니다. 단지 중간에 묻혀 있을 때 그것을 찾거나 집중할 수 없을 뿐입니다. 책상 위에 있으면 퍼즐을 풀 수 있는 사람이지만, 종이 더미 속에 숨겨지면 그것을 가지고 있다는 사실조차 잊어버리는 것과 같습니다.

결론

이 논문은 현재 우리가 AI 를 테스트하는 방식이 잘못되었다고 결론 내립니다.

  • 격차: 우리는 긴 문서의 "가장자리" (모델이 잘 수행하는 부분) 에서만 AI 를 테스트하고 있습니다. 우리는 종종 실패하는 "중간" 부분을 무시하고 있습니다.
  • 위험: 만약 어떤 기업이 "우리의 AI 는 긴 문서에서 95% 정확도를 보입니다"라고 말하지만, 질문을 맨 끝에서만 테스트했다면 그 숫자는 오해의 소지가 있습니다. 중요한 정보가 중간에 묻혀 있는 실제 세계 작업에서는 AI 가 쓸모없을 수 있습니다.

간단히 말해: AI 가 긴 책을 읽을 수 있다고 해서 그 책의 중간에 있는 답을 찾을 수 있다는 뜻은 아닙니다. 우리는 이 모델들이 실제로 얼마나 똑똑한지 진정한 그림을 얻기 위해 "중간"을 테스트하기 시작해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →