← 최신 논문
💻 computer science

The Effect of Text Chunk Size on Retrieval-Augmented Generation Performance

이 논문은 문서 분할의 세분화 정도(청크 크기)와 검색된 세그먼트의 수가 검색 증강 생성(RAG) 시스템의 생성 품질, 검색 효율성 및 계산 효율성에 어떠한 영향을 미치는지 조사한다.

원저자: German Garrido-Lestache Belinchon, Hugo Garrido-Lestache Belinchon

게시일 2026-07-29
📖 1 분 읽기☕ 가벼운 읽기

원저자: German Garrido-Lestache Belinchon, Hugo Garrido-Lestache Belinchon

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: 텍스트 청크 크기가 검색 증강 생성(RAG) 성능에 미치는 영향

문제 정의

검색 증강 생성(Retrieval-Augmented Generation, RAG) 시스템은 외부 지식을 검색하여 텍스트 생성을 보조함으로써 환각(hallucination) 및 정보 노후화 문제를 완화하고 대규모 언어 모델(LLM)의 성능을 향상시킨다. 그러나 RAG 파이프라인에서 결정적인 역할을 하면서도 아직 충분히 탐구되지 않은 구성 요소는 바로 **문서 분할의 입도(granularity of document segmentation, 청크 크기)**이다. 청크 크기는 이론적으로 검색 정밀도, 문맥적 정확성, 생성 품질 및 계산 효율성에 영향을 미치지만, 엄격한 평가 없이 선택되는 경우가 빈번하다. 기존 문헌들은 문서 청킹을 정적인 전처리 단계로 취급하거나 검색 후 정제(post-retrieval refinement)에 집중하는 경-향이 있어, 다른 요인들과 격리된 상태에서 주요 변수인 청크 크기 자체가 다양한 텍스트 구조에 따라 전체 시스템 성능에 어떤 영향을 미치는지에 대한 이해가 부족한 실정이다.

방법론

본 연구는 **청크 입도(chunk granularity)**를 주요 변수로 설정하고 다른 모든 요인을 일정하게 유지함으로써 통제된 실험 설계를 채택하였다.

  • 소스 자료: 연구진은 성능 차이가 오직 세분화 전략에 의한 것임을 보장하기 위해, 내용의 차이로 인한 변수를 배제하고자 동일한 전체 길이의 학부 교재(수학 교재 1권, 서사형 교재 1권)를 사용하였다.
  • 세분화 전략: 문서는 네 가지의 서로 다른 입도로 분할되었다:
    • 문장(Sentences): 개별 문장 경계.
    • 단락(Paragraphs): 단락 단위 경계.
    • 페이지(Pages): 페이지 단위 경계.
    • 장(Chapters): 장 단위 경계.
    • 구현 관련 참고 사항: 일부 전략은 정규 표현식(regex)을 사용했으나, 본 연구에서는 단락 및 문장 수준에서 원시 포맷팅 아티팩트와 무관하게 자연스러운 경계를 확보하기 위해 에이전틱 세분화(agentic segmentation)(슬라이딩 윈도우를 통해 LLM을 사용하여 반복적으로 세그먼트를 추출하는 방식)를 채택하였다.
  • 파이프라인 아키텍처:
    1. 전처리(Preprocessing): 원시 텍스트를 정제(줄 바꿈, 페이지 번호, 하이픈 제거).
    2. 임베딩(Embedding): 각 청크를 사전 학습된 밀집 임베딩 모델(dense embedding model)을 사용하여 임베딩하고, 각 입도별로 별도의 벡터 데이터베이스에 인덱싱함.
    3. 검색(Retrieval): 사용자 프롬프트를 임베딩하고, 코사인 유사도 검색을 통해 상위 nn개의 가장 유사한 청크를 검색함.
    4. 생성(Generation): 검색된 청크를 사용자 프롬프트와 결합하여 LLM에 전달하여 응답을 생성함.
  • 평가 지표:
    • 검색 유효성(Retrieval Effectiveness): **역순위(Reciprocal Rank, RR)**를 사용하여 측정함. 관련성 에이전트(LLM)가 검색된 청크가 프롬프트에 답하기 위한 필수 정보를 포함하고 있는지 검증함.
    • 데이터셋: 범위, 구체성, 복잡성이 다양한 ChatGPT 생성 프롬프트 100개를 사용하여 모든 청킹 전략을 테스트함.

주요 결과 및 분석

연구 결과, 최적의 청크 크기는 소스 텍스트의 구조적 특성에 따라 크게 달라지며, 모든 매체에서 단일 전략이 우위를 점하지 못한다는 것이 밝혀졌다.

  • 구조화된/정보 밀도가 높은 텍스트 (수학 교재):
    • 최고 성능: 단락 단위 청킹이 가장 높은 평균 검색 점수를 기록했다.
    • 분석: 중간 크기의 청크가 검색 정밀도와 문맥적 완전성 사이의 최적의 균형을 제공했다. 문장 단위 청크는 정밀하지만 때때로 충분한 문맥을 제공하지 못했고, 장 단위 청크는 너무 많은 노이즈를 유입시켜 정확도를 떨어뜨렸다.
  • 서사 중심 텍스트 (서사형 교재):
    • 최고 성능: 문장 단위 청킹이 다른 모든 방법을 크게 앞질렀다 (평균 RR 0.294).
    • 분석: 서사적 맥락에서는 관련 세부 사항이 특정 대사나 묘사 라인에 국한되는 경우가 많다. 더 큰 청크(페이지, 장, 단락)는 이러한 구체적인 세부 사항을 희석시켜, 검색 시스템이 유용한 콘텐츠를 고립시키는 것을 어렵게 만들었다.
  • 트레이드오프(Trade-offs):
    • 작은 청크: 검색 정밀도를 높이지만, 저장 요구량, 인덱싱 시간 및 임베딩의 수를 증가시킨다.
    • 큰 청크: 저장 오버헤드를 줄이지만, 무관한 문맥(노이즈)을 도입하고 검색 품질을 저하시킬 위험이 있다.
    • 에이전틱 청킹(Agentic Chunking): 더 의미 있는 경계를 생성하지만, 전처리 과정에서 상당한 계산 비용을 발생시켜 확장성을 제한한다.

주요 기여

  1. 변수의 격리: 임베딩 모델이나 도메인 특화 구조와 혼동될 수 있는 기존 연구들과 달리, 본 연구는 동일한 소스 자료를 사용하여 청크 크기를 엄격하게 평가함으로써 변수를 격리하였다.
  2. 문맥 의존적 최적화: 본 논문은 "원 사이즈 피츠 올(one-size-fits-all)" 방식의 청킹이 최선이 아님을 입증한다. 이상적인 입도가 텍스트의 성격(구조적/정보 밀집형은 단락 선호, 서사/대화 중심형은 문장 선호)에 따라 변화한다는 경험적 근거를 제시한다.
  3. 포괄적 평가: 본 연구는 상류(upstream)의 검색 유효성(역순위 활용)과 하류(downstream)의 생성 품질에 미치는 영향을 모두 평가하여, 청킹 트레이드오프에 대한 총체적인 관점을 제공한다.

의의 및 향후 방향

본 논문은 효과적인 RAG 시스템 설계가 고정된 세분화 파라미터를 넘어설 필요가 있다고 주장한다. 그 의의는 청크 크기가 소스 자료의 특정 구조에 맞춰 정렬되어 정밀도와 문맥 사이의 균형을 맞출 수 있도록, 시스템 설계의 구성 가능한 요소가 되어야 함을 확립한 데 있다.

저자들은 연구 결과를 바탕으로 다음과 같은 향후 연구 방향을 제안한다:

  • 적응형/에이전틱 청킹(Adaptive/Agentic Chunking): 문서 구조, 쿼리 의도 또는 검색 피드백에 따라 텍스트를 동적으로 분할하는 시스템 개발 (예: 사실 기반 쿼리에는 작은 청크를, 추론 기반 쿼리에는 큰 청크를 사용).
  • 하이브리드 접근법(Hybrid Approaches): 정적 체계에 내재된 정밀도-문맥 트레이드오프를 완화하기 위해 여러 청크 크기를 결합하거나, 원자적 단위로부터 문맥을 동적으로 조립하는 방법 탐색.

결론적으로, 청킹 방식을 소스 자료의 구조와 일치시키는 것이 검색 품질과 생성 성능을 일관되고 효율적으로 개선하는 데 필수적이다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →