← 최신 논문
💬 NLP

Contexts are Never Long Enough: Structured Reasoning for Scalable Question Answering over Long Document Sets

이 논문은 대규모 문서 집합에 대한 질의응답 시 발생하는 컨텍스트 제한 문제를 해결하기 위해, 정보를 관계형 데이터베이스로 추출 및 정제하여 SQL 기반의 구조화된 추론을 수행하는 프레임워크인 SLIDERS를 제안합니다.

원저자: Harshit Joshi, Priyank Shethia, Jadelynn Dao, Monica S. Lam

게시일 2026-04-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Harshit Joshi, Priyank Shethia, Jadelynn Dao, Monica S. Lam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제 상황: "기억력은 좋은데, 정리 정돈이 안 되는 신입 사원"

요즘 AI(GPT 같은 모델)는 아주 똑똑합니다. 하지만 치명적인 약점이 두 가지 있어요.

  • 첫 번째 문제 (기억력의 한계): 아무리 똑똑해도 한 번에 읽을 수 있는 종이의 양에는 한계가 있습니다. 수만 페이지의 보고서를 한꺼번에 책상에 펼쳐놓으면, AI는 앞부분을 읽다가 뒷부분을 읽을 때쯤 앞 내용을 까먹거나 머릿속이 하얘집니다. (이것을 논문에서는 **'컨텍스트 창의 한계'**라고 부릅니다.)
  • 두 번째 문제 (정보의 파편화): 서류가 너무 많아서 종이를 조금씩 잘라서(Chunking) 읽게 시키면, AI는 각 종이 조각에 적힌 내용은 잘 이해합니다. 하지만 "이 회사 전체의 총 매출이 얼마야?"라고 물으면 문제가 생깁니다. 1번 종이에는 '매출 100억', 2번 종이에는 '매출 200억'이라고 적혀 있는데, 이 조각들을 다시 합쳐서 계산하는 과정에서 실수를 하거나, 중복된 내용을 보고 헷갈려 하는 것이죠. (이것을 **'집계 병목 현상'**이라고 합니다.)

2. 해결책: SLIDERS (똑똑한 정리 정돈 전문가)

연구팀은 이 문제를 해결하기 위해 **'SLIDERS'**라는 새로운 시스템을 만들었습니다. 이 시스템은 단순히 글을 읽는 것을 넘어, **'데이터베이스(DB)라는 정리함'**을 사용하는 것이 핵심입니다.

비유하자면, 신입 사원에게 그냥 "읽고 답해!"라고 하는 대신, 다음과 같은 **'3단계 업무 매뉴얼'**을 준 것입니다.

1단계: 핵심 요약 노트 만들기 (Structured Extraction)

종이 조각을 읽을 때마다 그냥 읽는 게 아니라, 정해진 양식(표)에 맞춰서 핵심 정보만 딱딱 뽑아냅니다.

  • 예: "이름: 삼성전자, 매출: 100조, 날짜: 2023년"
    이렇게 하면 나중에 수만 장의 종이가 있어도, 핵심 정보만 적힌 깔끔한 '요약 노트'만 모으면 됩니다.

2단계: 엉망진창인 노트 정리하기 (Data Reconciliation)

요약 노트를 모으다 보면 중복되거나 충돌하는 내용이 생깁니다.

  • A 종이에는 "매출 100조", B 종이에는 "매출 100.1조"라고 적혀 있다면?
    SLIDERS는 **'데이터 정리 전문가(Reconciliation Agent)'**를 투입합니다. 이 전문가는 "어떤 종이가 더 정확한 근거(출처)를 가지고 있지?"를 따져보고, 중복된 건 합치고, 틀린 건 바로잡아서 **'완벽하게 깨끗한 하나의 데이터베이스'**를 만듭니다.

3단계: 데이터베이스에 질문하기 (SQL Reasoning)

이제 모든 정보가 깔끔한 표(데이터베이스)로 정리되었습니다. 질문이 들어오면 AI는 다시 수만 장의 종이를 뒤지는 게 아니라, 정리된 표에 '계산기(SQL)'를 두드려 답을 찾습니다.

  • 질문: "지난 3년간 매출 합계가 가장 높은 회사는?"
  • AI: (정리된 표를 보고) "1번 회사 300조, 2번 회사 250조... 정답은 1번입니다!"

3. 결과: "압도적인 성적"

이 방식이 얼마나 대단한지는 실험 결과가 보여줍니다.

  • 기존 방식: 종이가 너무 많아지면 AI가 아예 읽지도 못하거나(에러), 엉뚱한 답을 내놓습니다.
  • SLIDERS 방식: 종이가 3,600만 페이지(36M tokens) 분량으로 엄청나게 많아져도, 마치 방금 읽은 것처럼 정확하게 답을 찾아냅니다. 기존의 가장 똑똑한 AI 모델들보다 훨씬 높은 정확도를 기록했습니다.

요약하자면!

SLIDERS는 단순히 '글을 읽는 AI'를 넘어, '방대한 정보를 스스로 표로 정리하고, 오류를 검수하며, 데이터베이스처럼 관리하여 완벽한 답을 찾아내는 AI 시스템'입니다.

이제 AI는 아무리 두꺼운 백과사전 뭉치를 가져다줘도 당황하지 않고, 순식간에 정리해서 정답을 알려줄 수 있게 된 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →