← 최신 논문
🤖 AI

The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation

이 논문은 위키백과와 위키데이터를 활용하여 지리적 위치와 인기도 등 특정 특성을 제어할 수 있는 다국어 엔티티 생성 파이프라인을 제안하고, 이를 통해 구축된 'RiDiC' 데이터셋을 통해 대형 언어 모델의 장문 생성 사실성 평가 방법과 frontier 모델조차 환각을 일으킬 수 있음을 보여주는 결과를 제시합니다.

원저자: Pavel Braslavski, Dmitrii Iarosh, Nikita Sushko, Andrey Sakhovskiy, Vasily Konovalov, Elena Tutubalina, Alexander Panchenko

게시일 2026-04-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pavel Braslavski, Dmitrii Iarosh, Nikita Sushko, Andrey Sakhovskiy, Vasily Konovalov, Elena Tutubalina, Alexander Panchenko

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🌟 'RIDIC' 프로젝트: AI 가 모르는 '희귀한 것'을 얼마나 잘 아나?

이 논문은 인공지능 (LLM) 이 잘 알려진 유명한 것드문 드문 나오는 희귀한 것 중 무엇을 더 잘 알고 있는지, 그리고 그 사실을 얼마나 정확하게 말해줄 수 있는지 테스트하기 위해 만든 새로운 실험실 같은 이야기를 담고 있습니다.

상상해 보세요. AI 는 마치 모든 지식을 가진 거대한 도서관 사서와 같습니다. 하지만 이 사서가 정말로 모든 책을 다 읽었을까요? 아니면 인기 있는 베스트셀러만 읽었을 뿐일까요?

이 연구는 바로 그 의문을 해결하기 위해 **'RIDIC'**이라는 특별한 도구를 만들었습니다.


1. 🎯 왜 이런 실험이 필요할까요? (문제 상황)

지금까지 AI 를 테스트할 때는 주로 "수도꼭지는 어디에 있나요?" 같은 짧고 명확한 질문을 던졌습니다. 하지만 실제 우리가 AI 에게 묻는 것은 **"유럽의 강들에 대해 자세히 설명해 줘"**처럼 길고 복잡한 이야기입니다.

  • 기존의 문제: AI 가 유명 인사 (예: 엘론 머스크) 에 대해서는 잘 말하지만, 드문 드문 나오는 강이나 희귀한 자연재해에 대해서는 엉뚱한 이야기를 지어내기도 합니다 (이를 '할루시네이션'이라고 합니다).
  • 우리의 목표: AI 가 **인기 있는 것 (Head)**부터 **인기 없는 것 (Tail)**까지, 다양한 수준의 주제에 대해 얼마나 정확한 정보를 제공하는지 체계적으로 확인하고 싶었습니다.

2. 🛠️ RIDIC: AI 의 '실력 시험지' 만들기

연구팀은 3,000 개의 주제를 선정해서 AI 의 실력을 시험하는 '시험지'를 만들었습니다. 이 시험지는 세 가지 카테고리로 나뉩니다.

  1. 강 (Rivers): 나일강처럼 유명한 것부터, 시골 마을을 흐르는 작은 강까지.
  2. 자연재해 (Disasters): 대형 허리케인부터, 작은 산사태까지.
  3. 자동차 모델 (Cars): 테슬라 같은 유명 차종부터, 낡은 구형 차까지.

🌟 핵심 아이디어: '인기 순위' 조절
이 시험지의 가장 큰 특징은 **'인기 순위'**를 인위적으로 조절했다는 점입니다.

  • Head (머리): 사람들이 매일 검색하는 아주 인기 있는 것들.
  • Torso (몸통): 중간 정도 인기 있는 것들.
  • Tail (꼬리): 거의 아무도 모르는 아주 희귀한 것들.

마치 유명 배우 (Head), 중견 배우 (Torso), **무명 단역 배우 (Tail)**를 모두 섞어서, AI 가 이들을 모두 잘 알아맞히는지 보는 것과 같습니다.

3. 🧪 실험 과정: AI 에게 물어보고, 사실 확인하기

연구팀은 영어와 중국어로 3 개의 최신 AI 모델 (Llama, Qwen, GPT-5 등) 에게 이 3,000 개의 주제에 대해 "자세히 설명해 줘"라고 요청했습니다.

그리고 AI 가 만든 답변이 사실인지 확인하기 위해 다음과 같은 과정을 거쳤습니다.

  1. 사실 추출: AI 의 긴 답변을 작은 사실 조각 (예: "이 강은 길이가 100km 다") 으로 쪼개었습니다.
  2. 증거 대조: 위키백과 같은 신뢰할 수 있는 출처를 찾아서, AI 가 말한 사실이 맞는지 확인했습니다.
  3. 점수 매기기: 맞는 사실의 비율을 계산하여 점수를 주었습니다.

4. 🔍 실험 결과: AI 의 약점이 드러나다!

이 실험을 통해 놀라운 사실들이 밝혀졌습니다.

① "인기 없는 것"은 AI 가 잘 모릅니다. (Long-tail 문제)

  • 유명한 것 (Head): AI 는 유명 강이나 유명 재해에 대해 아주 잘 설명했습니다.
  • 희귀한 것 (Tail): 하지만 이름도 생소한 강이나 재해에 대해선 엉뚱한 이야기를 지어내는 '환각' 현상이 심하게 나타났습니다.
    • 비유: 유명한 레스토랑 메뉴는 잘 외우지만, 시골 작은 식당의 메뉴는 대충 지어낸다는 뜻입니다.

② "영어"는 잘하지만, "중국어"는 약합니다.

  • 영어로 답변할 때는 사실 확인 점수가 꽤 높았지만, 중국어로 답변할 때는 점수가 확 떨어졌습니다.
  • 이유: 중국어 위키백과 같은 신뢰할 수 있는 자료 (증거) 가 영어에 비해 부족하고, AI 가 중국어 학습 데이터가 상대적으로 적기 때문입니다.

③ "주제"에 따라 실력이 다릅니다.

  • 자동차자연재해에 대해서는 비교적 잘했지만, 에 대해서는 사실 오류가 가장 많았습니다.
  • 이유: 강은 이름이 비슷하거나 위치가 애매한 경우가 많아 AI 가 혼동하기 쉽기 때문입니다.

④ "더 많은 정보"가 항상 좋은 건 아닙니다.

  • 흥미롭게도, AI 에게 검색 결과나 관련 페이지를 더 많이 보여줬을 때, 유명한 주제에서는 도움이 되었지만, 희귀한 주제에서는 오히려 헷갈려서 더 틀린 말을 하는 경우가 있었습니다.

5. 💡 결론: 이 연구가 우리에게 주는 메시지

이 논문은 **"AI 는 아직 만능이 아니다"**라고 경고합니다. 특히 우리가 잘 모르는 희귀한 주제비영어권 언어에서는 AI 가 자신감 있게 거짓말을 할 수 있다는 것입니다.

RIDIC이라는 도구는 앞으로 AI 개발자들이:

  1. AI 가 어떤 부분에서 약한지 정확히 파악하게 하고,
  2. 더 신뢰할 수 있는 AI 를 만들기 위한 나침반 역할을 할 것입니다.

한 줄 요약:

"AI 는 유명인사는 잘 알아도, 무명 단역 배우는 잘 모르는 '편식'을 합니다. 이 연구는 그 편식을 고쳐서 AI 가 모든 주제에 대해 정직한 '사실'을 말하도록 돕는 첫걸음입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →