← 최신 논문
💬 NLP

Adaptive Chunking: Optimizing Chunking-Method Selection for RAG

이 논문은 다양한 문서의 구조와 의미에 맞춰 최적의 청킹 전략을 자동 선택하는 '적응형 청킹 (Adaptive Chunking)' 프레임워크를 제안하여, 기존 일률적 접근법의 한계를 극복하고 RAG 시스템의 정확도와 성공률을 크게 향상시켰음을 보여줍니다.

원저자: Paulo Roberto de Moura Júnior, Jean Lelong, Annabelle Blangero

게시일 2026-03-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Paulo Roberto de Moura Júnior, Jean Lelong, Annabelle Blangero

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"검색 증강 생성 (RAG)"**이라는 인공지능 기술의 성능을 획기적으로 높여주는 새로운 방법을 소개합니다.

한마디로 요약하면, **"문서를 잘게 쪼갤 때 '한 가지 방식'으로 모든 것을 처리하지 말고, 문서의 성격에 따라 가장 잘 맞는 자를 찾아서 잘라라"**는 이야기입니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 문제: "모든 것을 똑같이 자르는 실수"

지금까지 많은 AI 시스템은 문서를 잘게 쪼개는 (Chunking) 작업을 할 때, 모든 문서에 똑같은 가위를 사용했습니다.

  • 상황: 한 가위는 10 페이지짜리 법전도, 300 페이지짜리 소설도, 복잡한 기술 매뉴얼도 똑같은 크기로 잘라냅니다.
  • 결과:
    • 법전: 중요한 조항이 잘려나가서 의미가 통하지 않게 됩니다. (예: "계약서 제 3 조"와 "계약 내용"이 분리됨)
    • 소설: 한 문단 전체가 잘려나가서 이야기가 끊깁니다.
    • 기술 매뉴얼: 그림과 설명이 분리되어 사용자가 무엇을 봐야 할지 모릅니다.

이를 논문에서는 "일률적인 접근 (One-size-fits-all)"의 실패라고 부릅니다. 마치 모든 옷에 똑같은 사이즈의 재킷을 입히려는 것과 같습니다.

2. 해결책: "적응형 자르기 (Adaptive Chunking)"

이 연구팀은 **"문서마다 가장 적합한 자를 골라라"**는 새로운 방식을 제안합니다. 이를 적응형 자르기라고 부릅니다.

🧐 5 가지 '품질 검사 기준' (메트릭)

문서를 잘라내기 전에, AI 가 그 문서를 분석해서 어떤 자를 써야 할지 판단합니다. 이때 5 가지 중요한 기준을 봅니다:

  1. 참조 완성도 (RC): "그것"이라는 대명사가 앞의 명사를 잃어버리지 않았는지 확인합니다. (예: "그가"라는 단어가 앞에 "누구"가 있는지)
  2. 조각 안의 결속력 (ICC): 잘린 조각 안에 주제 하나만 명확하게 담겨 있는지 봅니다. (여러 주제가 뒤섞이지 않았는지)
  3. 문맥의 연결성 (DCC): 잘린 조각이 앞뒤 문맥과 자연스럽게 이어지는지 확인합니다.
  4. 블록 무결성 (BI): 표, 그림, 제목이 중간에서 잘려나가지 않았는지 확인합니다. (예: 표가 반으로 잘려서 데이터가 깨지지 않았는지)
  5. 크기 준수 (SC): 조각이 너무 크거나 너무 작지 않은지 확인합니다. (너무 크면 AI 가 이해하기 힘들고, 너무 작으면 정보가 부족함)

✂️ 새로운 '자' 두 가지

연구팀은 이 기준들을 만족시키기 위해 두 가지 새로운 자를 개발했습니다:

  1. LLM-regex 자: AI 가 문서의 구조를 먼저 분석한 뒤, 가장 적합한 자르기 규칙 (정규식) 을 만들어냅니다. (법전처럼 구조가 딱딱한 문서에 좋음)
  2. 잘라낸 뒤 다시 붙이는 자 (Split-then-Merge): 일단 잘게 쪼갠 뒤, 너무 작은 조각들은 붙이고 너무 큰 조각들은 다시 잘라내어 최적의 크기를 맞춥니다. (소설이나 긴 보고서에 좋음)

3. 실험 결과: "왜 이게 좋은가?"

연구팀은 법률, 기술, 사회과학 등 다양한 분야의 문서 33 개를 가지고 실험을 했습니다.

  • 기존 방식: 정답률이 **62~64%**였으며, 질문에 답을 못 하고 "모르겠습니다"라고 한 경우가 많았습니다.
  • 적응형 방식: 정답률이 **72%**로 크게 올랐고, 질문에 답을 할 수 있는 경우가 30% 이상 증가했습니다.

비유하자면:

기존에는 모든 문서를 "한 사이즈"로 잘라서 AI 에게 줬더니, AI 가 중요한 정보를 놓쳐서 엉뚱한 답을 하거나 모른다고 했습니다.
하지만 적응형 방식은 문서의 성격에 따라 "법전용 자", "소설용 자", "매뉴얼용 자"를 각각 골라 최적의 조각을 AI 에게 줬더니, AI 가 훨씬 더 정확한 답을 내놓게 된 것입니다.

4. 핵심 교훈: "맞춤형이 최고다"

이 논문의 가장 중요한 메시지는 **"어떤 문서든 가장 좋은 자를 찾아서 써야 한다"**는 것입니다.

  • 문서마다 다르다: 법전처럼 구조가 명확한 문서와, 이야기처럼 흐름이 중요한 문서는 자르는 방식이 달라야 합니다.
  • 자동화: AI 가 문서의 특성을 분석해서 자동으로 가장 좋은 자를 선택하게 함으로써, 별도의 복잡한 설정 없이도 성능을 극대화할 수 있습니다.

요약

이 연구는 **"문서를 잘게 쪼개는 작업이 RAG(검색 증강 생성) 의 성패를 좌우한다"**는 점을 깨닫고, **"모든 문서에 똑같은 가위를 쓰는 것은 그만두자"**고 제안합니다. 대신 **문서의 특성을 파악하여 가장 적합한 자를 골라주는 '적응형 시스템'**을 만들면, AI 의 답변 정확도가 훨씬 높아진다는 것을 증명했습니다.

이는 마치 맞춤형 양복을 지어 입으면 오히려 더 편안하고 잘 어울리듯, 문서에 맞는 자르기를 적용하면 AI 도 더 똑똑해진다는 뜻입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →