← 최신 논문
💬 NLP

Evaluating RAG Metrics in Applied Contexts: An Experiment, Its Findings and Its Limitations

이 논문은 비즈니스 질의응답 데이터셋을 대상으로 4개의 라이브러리에서 추출한 다양한 RAG 지표들의 점수를 인간 평가 및 표준 지표와 비교함으로써 해당 지표들의 관련성을 평가하는 실증적 연구를 제시하며, 동시에 방법론적 한계와 향후 연구 방향에 대해 논의한다.

원저자: Quentin Brabant

게시일 2026-07-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Quentin Brabant

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 때때로 혼란스러워하는 "RAG"라는 이름의 사서의 매니저라고 상상해 보세요. 이 사서의 업무는 질문에 답하기 위해 먼저 서가로 달려가 적절한 책의 페이지를 찾아낸 다음(검색), 그 페이지들을 바탕으로 요약된 답변을 작성하는 것(생성)입니다.

문제는 무엇일까요? 당신이 이 사서가 정말 일을 잘하고 있는지 어떻게 알 수 있을까요? 단순히 사서에게 "제가 잘했나요?"라고 물어볼 수는 없습니다. 사서가 거짓말을 하거나 지나치게 자신만만할 수도 있기 때문입니다. 당신은 그들의 성과를 채점할 방법이 필요합니다.

이 논문은 본질적으로 이 사서를 평가하는 데 사용하는 **채점 도구(지표)**들에 대한 성적표입니다. 저자인 Orange Research의 Quentin Brabant는 어떤 채점 도구가 인간 전문가의 생각과 실제로 일치하는지 알아보기 위해 작은 실험을 설계했습니다.

이 실험의 구성, 결과, 그리고 주의사항을 알기 쉽게 설명하면 다음과 같습니다.

1. 설정: "모의 시험"

팀은 실제 비즈니스 문서(통신 상품 제안이나 고객 규칙 등)를 기반으로 한 96개의 구체적인 질문이 포함된 연습 테스트를 만들었습니다.

  • 인간 채점자: 두 명의 전문가가 질문과 사서의 답변을 읽고 1점에서 5점 사이의 점수를 부여했습니다.
    • 5점: 완벽한 답변, 정확한 사실, 적절한 상세함.
    • 1점: 사서가 완전히 관련 없는 이야기를 함.
  • 자동 채점자: 그들은 네 가지 인기 있는 "AI 채점 소프트웨어" 라이브러리(Ragas, DeepEval, RAGChecker, Opik)를 테스트했습니다. 이 도구들은 사람이 모든 답변을 일일이 확인하지 않고도 자동으로 점수를 매기려고 시도합니다.

2. 목표: 최적의 "자(Ruler)" 찾기

목표는 특정 소프트웨어 라이브러리를 영원히 "승자"로 선언하는 것이 아니었습니다. 대신 그들은 다음과 같은 점을 알고 싶었습니다: "이 자동화된 자들이 실제로 인간 전문가가 측정하는 것을 측정하고 있는가?"

만약 컴퓨터 프로그램은 답변이 "훌륭하다"(5/5)고 말하는데, 인간은 "형편없다"(1/5)고 말한다면, 그 컴퓨터 프로그램은 고장 난 자입니다. 팀은 상관관계(correlation), 즉 컴퓨터의 점수와 인간의 점수 사이의 통계적 악수를 확인하고자 했습니다.

3. 결과: 누가 성적을 제대로 맞혔나?

결과는 놀라움과 실망이 섞여 있었습니다.

  • 전통적인 도구들: 놀랍게도, METEOR와 같은 일부 오래되고 단순한 도구들이 실제로 인간과 꽤 높은 상관관계를 보였습니다.
  • "참조 없는(No-Reference)" 도구들: 일부 도구는 "정답" 키를 보지도 않고 답변을 채점하려고 합니다. 이는 수학 시험을 채점하면서 정답을 모르는 것과 같습니다. 컴퓨터는 그냥 추측할 뿐입니다.
  • 큰 놀라움 (RAGChecker): 한 가지 도구, 즉 RAGChecker는 인간의 점수와 매우 강한 상관관계를 보였습니다. 사실, 그 상관관계가 너무 높아서 저자들은 의구심을 가질 정도였습니다.
  • "환각(Hallucination)" 체크: 사서가 지어낸 이야기를 하는지(충실도, faithfulness)를 확인하도록 설계된 도구들은 전체적인 품질 점수와 상관관계가 낮았습니다. 이는 타당합니다. 사서가 진실을 말하더라도 지루하거나 무관한 답변을 할 수 있기 때문입니다.

4. 함정: "고장 난 자" 문제

이 부분이 이 논문에서 가장 중요한 부분입니다. 저자들은 자신들의 실험에 존재하는 주요한 결함을 지적합니다.

비유: 당신이 온도계를 테스트하고 있다고 상상해 보세요. 당신은 집에 방을 딱 하나만 가지고 있고, 그 방의 온도는 항상 70°F입니다.

  • 당신이 온도계를 방에 넣습니다. 그것은 70°F라고 읽습니다.
  • 당신이 두 번째 온도계를 넣습니다. 그것도 70°F라고 읽습니다.
  • 당신은 결론을 내립니다: "이 온도계들은 완벽하다!"

현실: 당신은 이 온도계들이 실제로 온도를 측정하고 있는 것인지, 아니면 그냥 항상 "70"이라고 말하는 고장 난 장치인지 알 수 없습니다. 왜냐냐하면 당신은 오직 하나의 사서 시스템(방 하나)만을 테스트했기 때문입니다. 당신은 자동 채점기가 실제로 답변의 품질을 측정하고 있는 것인지, 아니면 질문이 얼마나 쉬운지와 같은 질문의 난이도를 측정하고 있는 것인지 알 수 없습니다.

  • 예시: 질문이 매우 간단하면 사서는 높은 점수를 받습니다. 만약 자동 채점기가 단순히 쉬운 질문에는 높은 점수를 준다고 추측하는 데 "똑똑하다면", 인간과 완벽하게 일치할 것입니다. 하지만 어려운 질문을 던지면, 그것은 완전히 실패할 수도 있습니다. 저자들은 RAGChecker가 정확히 이 작업을 하고 있다고 의심합니다. 즉, RAGChecker는 답변의 품질이 아니라 실수로 "질문의 난이도"를 측정하고 있는 것일 수 있습니다.

5. 결론: 다음 단계는 무엇인가?

논문은 이러한 자동화된 도구들이 최악의 옵션들을 걸러내는 데는 유용하지만, 이런 종류의 테스트만으로는 아직 100% 신뢰할 수 없다고 결론짓습니다.

진정으로 신뢰할 수 있는 성적을 얻으려면, 저자들은 채점 도구를 많은 다양한 사서들(다양한 AI 시스템)과 많은 다양한 유형의 질문들에 대해 테스트해야 한다고 제안합니다. 만약 어떤 도구가 전반적으로 좋은 사서와 나쁜 사서를 일관되게 구별해 낼 수 있다면, 그때서야 우리는 그것이 좋은 자라는 것을 알 수 있습니다.

요약하자면: 이 논문은 AI 사서를 채점하는 데 사용되는 '자'들을 테스트했습니다. 어떤 자들은 좋아 보였지만, 테스트에 단 하나의 사서만을 사용했기 때문에, 저자들은 그 자들이 실제 답변의 품질이 아니라 질문의 난이도에 따라 추측하고 있을 수 있다고 경고합니다. 이를 해결하려면, 다음번에는 전체 교실에 있는 다양한 사서들을 대상으로 자를 테스트해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →