← 최신 논문
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

본 논문은 신뢰성, 관련성 및 애플리케이션별 요구사항과의 정합성을 보장하기 위해 다면적 평가, 근본 원인 분석 및 프로덕션 모니터링을 제공함으로써 검색 증강 생성 (RAG) 시스템 평가의 복잡한 과제를 해결하도록 설계된 포괄적인 프레임워크인 Deepchecks 를 소개합니다.

원저자: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 말수가 많은 비서 (대형 언어 모델, 또는 LLM) 가 있다고 가정해 봅시다. 이 비서는 이야기 쓰기나 질문 답변에 탁월하지만, 나쁜 습관이 하나 있습니다. 때로는 완전히 사실을捏造하거나 특정 상황에 잘 맞지 않는 일반적인 답변을 내놓는다는 점입니다. 이는 교과서를 외웠지만 숙제 문제의 구체적인 세부 사항을 확인하는 것을 잊어버린 학생처럼, 자신감은 넘치지만 정답이 아닌 답변을 내놓는 것과 같습니다.

이를 해결하기 위해 개발자들은 RAG(검색 증강 생성, Retrieval-Augmented Generation) 라는 시스템을 만들었습니다. RAG 를 그 똑똑한 비서에게 도서관 카드와 사서를 제공하는 것으로 생각하세요.

  1. 사서 (검색): 비서가 답변하기 전에, 사서가 도서관 (문서 데이터베이스) 을 빠르게 검색하여 질문과 관련된 정확한 페이지를 찾아냅니다.
  2. 비서 (생성): 비서는 해당 페이지들을 읽은 후, 도서관 책들을 사실의 근원으로 삼아 답변을 작성합니다.

문제점:
사서가 있더라도 시스템은 여전히 실패할 수 있습니다. 사서가 잘못된 책을 꺼내오거나, 비서가 책을 무시하고 어쨌든 사실을捏造할 수도 있습니다. 해당 논문은 이 전체 시스템이 잘 작동하는지 확인하는 것이 너무나 많은 구성 요소들이 얽혀 있어 매우 어렵다고 설명합니다.

해결책: Deepchecks
저자들은 이러한 RAG 시스템을 위한 초엄격한 품질 관리 검사관 역할을 하는 Deepchecks를 소개합니다. 단순히 '합격/불합격' 점수 하나만 주는 대신, Deepchecks 는 자동차 정비사가 엔진의 다양한 부품을 점검하듯이 시스템을 구체적인 '속성'으로 나누어 점검합니다.

다음은 Deepchecks 가 간단한 비유를 사용하여 시스템을 점검하는 방식입니다:

1. 세 가지 주요 점검 (속성)

Deepchecks 는 답변이 양호한지 확인하기 위해 세 가지 구체적인 사항을 살펴봅니다:

  • 검색 관련성 (사서가 올바른 책을 찾았나요?):
    • 비유: "케이크를 어떻게 구우나요?"라고 물었을 때, 사서가 "자동차 수리 방법"에 관한 책을 건네서는 안 됩니다. Deepchecks 는 찾아낸 문서들이 실제로 질문에 유용한지 확인합니다.
  • 맥락 기반성 (비서가 책에 충실했나요?):
    • 비유: 이는 '할루시네이션 (환각)' 탐지기입니다. 책에 케이크에 달걀이 2 개 필요하다고 적혀 있는데, 비서가 10 개 필요하다고 말한다면 Deepchecks 는 그 거짓말을 잡아냅니다. 답변에 포함된 모든 사실이 사서가 찾은 문서에 실제로 뒷받침되는지 검증합니다.
  • 완전성 (비서가 질문 전체에 답했나요?):
    • 비유: "케이크를 어떻게 구우며 오븐 온도는 얼마로 해야 하나요?"라고 물었을 때, 답변이 "오븐에 넣으세요"라고만 해서는 안 됩니다. Deepchecks 는 비서가 요청의 모든 부분을 다 다뤘는지 확인합니다.

*(또한 비서가 무례하거나 개인 정보를 유출하거나 위험한 말을 하지 않는지 확인하는 안전 점검도 있습니다.)*

2. '전체적' 점수 (최종 성적)

대부분의 도구는 위의 부분에 대한 점수 목록만 제공합니다. 하지만 Deepchecks 는 한 걸음 더 나아갑니다. 모든 점수를 하나의 최종 성적 (긍정, 부정, 또는 불확실) 으로 통합하는 스마트한 '집계 메커니즘' (학습된 공식) 을 사용합니다.

  • 긍정: 사서가 올바른 책을 찾았고, 비서가 이를 바탕으로 완벽하게 답변했습니다.
  • 부정: 무언가 잘못되었습니다 (잘못된 책,捏造된 사실, 또는 불완전한 답변).
  • 불확실: 끔찍하지는 않지만 '완벽함'이라는 높은 기준에는 미치지 못했습니다.

3. 탐정 도구 (근본 원인 분석)

시스템이 '부정' 성적을 받으면, Deepchecks 는 단순히 실패했다고 알려주는 것을 넘어 실패했는지 탐정처럼 알려줍니다.

  • 비유: 자동차가 고장 났다고 가정해 봅시다. 기본적인 정비사는 "고장 났습니다"라고 말합니다. 반면 Deepchecks 는 "엔진은 정상이지만 타이어가 펑크 났습니다"라고 말합니다.
  • 이는 개발자들이 문제를 정확히 어디에서 고쳐야 하는지 알게 해줍니다. 더 나은 사서 (더 나은 검색) 가 필요한가요? 아니면 비서가 더 잘 듣도록 훈련 (더 나은 생성) 해야 하나요?

4. '타임머신' (버전 비교 및 모니터링)

Deepchecks 를 사용하면 시스템의 서로 다른 버전들을 나란히 비교할 수도 있습니다.

  • 비유: 타이어를 교체하기 전후의 자동차 성능을 비교하는 것과 같습니다. 새로운 타이어가 속도를 높였나요?
  • 또한 Deepchecks 는 시스템이 현실 세계에서 작동하는 동안 이를 감시합니다. 시간이 지남에 따라 시스템이 악화되기 시작하면 (아마도 도서관 책이 바뀌거나 사용자 질문이 변했기 때문일 수 있음), Deepchecks 는 즉시 경보를 울립니다.

논문에서 발견한 내용

저자들은 다음을 사용하여 Deepchecks 를 RAGAS 및 LangSmith 와 같은 다른 인기 있는 도구들과 비교 테스트했습니다:

  1. 공개 데이터셋: 누구나 아는 표준 테스트 질문들.
  2. 클라이언트 데이터셋: 실제 기업들로부터의 실제 사례 (기술 지원 채팅 및 구직자 검토 등).

결과: Deepchecks 는 특히 실제 클라이언트 데이터에서 오류를 포착하는 데 더 뛰어났습니다. 다른 도구들은 때때로 실수를 놓치거나 일관성 없는 점수를 매겼지만, Deepchecks 는 시스템이 거짓말 (할루시네이션) 을 하거나 관련 없는 답변을 줄 때 이를 더 정확하게 식별했습니다.

요약하자면:
Deepchecks 는 AI 비서가 단순히 자신감 있게 말하는 것이 아니라, 제공된 문서를 기반으로 진실을 말하고 있는지 보장하는 포괄적인 툴킷입니다. 사서를 점검하고, 작성자를 점검하며, 안전성을 점검하여 정확히 무엇이 고장 났는지 수정할 수 있도록 명확한 성적표를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →