← 최신 논문
🤖 AI

Qwen Goes Brrr: Off-the-Shelf RAG for Ukrainian Multi-Domain Document Understanding

본 논문은 복잡한 휴리스틱보다 문서 구조 보존과 정답 공간 인식을 우선시하여 최상위 리더보드 점수를 달성하기 위해 문맥적 청킹, 질문 인식 밀도 기반 검색, 그리고 정답 옵션에 기반한 재순위화를 활용하는 우크라이나어 다도메인 문서 이해 작업을 위한 고성능 검색 증강 파이프라인을 제시한다.

원저자: Anton Bazdyrev, Ivan Bashtovyi, Ivan Havlytskyi, Oleksandr Kharytonov, Artur Khodakovskyi

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anton Bazdyrev, Ivan Bashtovyi, Ivan Havlytskyi, Oleksandr Kharytonov, Artur Khodakovskyi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 명의 단서가 아니라 수천 권의 책으로 가득 찬 도서관을 가지고 있고, 특정 질문에 답하는 정확한 문장을 찾아야 한다고 상상해 보세요. 이것이 바로 이 논문이 다루는 핵심입니다: 우크라이나어 문서를 읽고 객관식 질문에 답할 수 있는 지능형 시스템을 구축하는 것입니다.

다음은 팀이 어떻게 이 '탐정'을 구축했는지 단순한 개념으로 분해한 이야기입니다.

도전 과제: 건초더미 속의 바늘

팀은 UNLP라는 대회에 참가했습니다. 규칙은 까다로웠습니다:

  1. 과제: 6 가지 가능한 답변 (A-F) 이 포함된 질문을 받습니다. 올바른 답을 선택하고, 그 답이 어떤 PDF 문서에서 나왔는지, 심지어 몇 페이지인지 시스템에 알려야 합니다.
  2. 문제: 문서들은 서로 다른 레이아웃을 가진 길고 지저분한 PDF(법률 또는 기술 매뉴얼 등) 입니다. 질문은 우크라이나어로 되어 있는데, 영어에 비해 우크라이나어용 AI 도구는 훨씬 적습니다.
  3. 주의할 점: 시스템은 인터넷 연결 없이 엄격한 시간 제한이 있는 특정 컴퓨터 (Kaggle) 에서 실행되어야 했습니다. 몇 시간 동안 '생각'할 수 없었으며, 빠르고 효율적이어야 했습니다.

해결책: 세 단계로 구성된 탐정 팀

하나의 거대하고 초복잡한 두뇌를 만드는 대신, 팀은 세 명의 전문화된 작업자로 구성된 파이프라인을 구축했습니다. 이를 '검색 증강 (Retrieval-Augmented)' 시스템이라고 부르는데, 이는 단순히 **"정보를 찾아낸 다음 답을 결정하라"**는 뜻입니다.

1 단계: 사서 (맥락적 청킹)

페이지가 찢어져 무작위로 섞인 책을 읽으려 한다고 상상해 보세요. 이것이 PDF 를 컴퓨터에 그냥 넣었을 때 발생하는 일입니다.

  • 그들이 한 일: 그들은 텍스트를 무작위로 잘라내지 않았습니다. 책의 구조를 존중하는 신중한 사서처럼 행동했습니다. 장 제목, 섹션 헤더, 그리고 문서의 시작 부분을 모든 텍스트 조각에 부착했습니다.
  • 비유: 탐정에게 "회의는 오후 5 시였다"는 문장 하나를 건네는 대신, *"제 4 장: 일정, 제 2 절: 회의는 오후 5 시였다"*는 메모를 건네준 것입니다. 이 추가적인 맥락은 컴퓨터가 정보가 어디에 있는지 이해하는 데 도움을 줍니다.

2 단계: 검색 엔진 (밀집 검색)

이제 시스템에는 수백만 개의 이러한 '맥락 메모'가 있습니다. 가장 유력한 상위 20 개 후보를 찾아야 합니다.

  • 그들이 한 일: Qwen3-Embedding-8B라는 사전 훈련된 AI 모델을 검색 엔진으로 사용했습니다. 이 모델은 질문과 텍스트 메모를 수학적인 '지문'으로 변환합니다. 그런 다음 지문을 비교하여 어떤 메모가 질문과 가장 잘 일치하는지 확인합니다.
  • 발견: 새로운 트릭을 가르치기 위해 작은 모델을 훈련시키는 것보다, 크고 사전 훈련된 모델을 바로 사용하는 것이 더 효과적이었습니다. 마치 새로운 인턴을 처음부터 훈련시키기보다 경험 많은 사서를 고용한 것과 같습니다.

3 단계: 판사 (옵션 인식 재순위화)

검색 엔진은 20 개의 좋은 메모를 제공했지만, 그들은 가장 좋은 하나를 필요로 합니다.

  • 반전: 대부분의 시스템은 질문만 봅니다. 이 팀은 객관식 질문의 경우 오답이 정답만큼이나 중요하다는 것을 깨달았습니다.
  • 그들이 한 일: 질문과 6 가지 답변 옵션을 모두 함께 보는 '판사'(Qwen3-Reranker) 를 구축했습니다. 이 판사는 이렇게 묻습니다: "이 텍스트가 답변 A 를 지지하는가, 아니면 실제로 답변 B 를 지지하는가?"
  • 비유: 변호사가 사건을 변론한다고 상상해 보세요. 검찰의 증거만 보여주면 미묘한 뉘앙스를 놓칠 수 있습니다. 하지만 검찰의 증거와 방어 측의 주장을 모두 보여주면, 어떤 증거가 사건을 승리로 이끄는지 정확히 pinpoint 할 수 있습니다. 이 단계는 게임 체인저였으며, 정확도를 크게 높였습니다.

4 단계: 최종 판결 (답변 선택)

마지막으로, 시스템은 상위 2 개의 메모를 가져와 강력한 AI(Qwen3-32B) 에게 최종 답변을 선택하도록 요청합니다.

  • 요령: 속도를 유지하고 AI 가 '환각'(거짓 정보를 만들어 냄) 하는 것을 방지하기 위해, AI 가 하나의 문자 (A, B, C, D, E 또는 F) 만 선택하도록 강제했습니다. 마치 AI 가 하나의 원만 채울 수 있는 객관식 버블 시트와 같습니다.

그들이 배운 것 (비밀 재료)

논문은 팀을 놀라게 한 몇 가지 핵심 교훈을 강조합니다:

  1. 구조가 왕이다: 텍스트 청크에 문서의 구조 (제목, 섹션) 를 부착하는 것이 나중에 복잡한 수학적 트릭을 추가하는 것보다 더 중요했습니다.
  2. 적은 것이 더 많다: 그들은 (인간 탐정처럼) 검색하고, 생각하고, 다시 검색할 수 있는 '지능형 에이전트'를 구축해 보았습니다. 너무 느리고 실수를 저질렀습니다. 단순한 직선형 파이프라인 (검색 → 순위 매기기 → 답변) 이 더 빠르고 정확했습니다.
  3. 보이지 않는 도메인: 대회에는 AI 가 이전에 본 적이 없는 숨겨진 세 번째 문서 카테고리가 있었습니다. 질문이 어떤 카테고리에 속하는지 추측하려던 시스템은 실패했습니다. 가장 좋은 전략은 먼저 분류하려고 시도하지 않고 검색 엔진이 모든 것을 보게 하는 것이었습니다.

결과

이 세 단계 팀 (사서 + 검색 엔진 + 판사) 을 사용하여 그들은 매우 높은 점수를 달성했습니다.

  • 개선: '판사' 단계 (재순위화) 를 추가함으로써 올바른 문서를 찾을 수 있는 능력이 **69% 에서 79%**로 향상되었습니다.
  • 최종 점수: 그들의 시스템은 숨겨진 테스트 세트에서 **96%**의 확률로 정답을 맞혔으며, 많은 다른 경쟁자들을 제쳤습니다.

요약

이 논문은 어려운 문서 문제를 해결하기 위해 초복잡한 맞춤형 로봇이 필요하지 않음을 증명합니다. 대신, 문서의 구조를 존중하고 결정을 내리기 전에 전체 그림 (질문 + 모든 답변) 을 살펴보기 위해 지능형 사전 훈련 AI 도구를 사용하는 잘 조직된 파이프라인이 필요합니다. 그들은 본질적으로 우크라이나어 문서 이해에 있어 조직과 맥락복잡성보다 우월함을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →