← 최신 논문
💬 NLP

LLMpedia: A Transparent Framework to Materialize an LLM's Encyclopedic Knowledge at Scale

이 논문은 검색 없이 모델의 매개변수 기억만으로 약 100 만 개의 백과사전 기사를 생성하는 'LLMpedia' 프레임워크를 소개하며, 기존 벤치마크가 과대평가한 사실성 수치를 실제 검증 가능한 데이터로 재평가하고 모든 프로세스를 공개하여 투명성을 확보했다고 요약할 수 있습니다.

원저자: Muhammed Saeed, Simon Razniewski

게시일 2026-03-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Muhammed Saeed, Simon Razniewski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📚 LLMpedia: AI 의 '두뇌'를 직접 확인하는 투명한 백과사전

이 논문은 **"AI 가 정말로 알고 있는 걸까, 아니면 그냥 외운 것일까?"**라는 질문에 대한 답을 찾기 위해 쓴 연구입니다.

기존의 AI 평가 방식이 얼마나 '눈가림'을 하고 있는지, 그리고 새로운 방법으로 AI 의 진짜 실력을 어떻게 파악할 수 있는지 아주 재미있는 비유로 설명해 드릴게요.


1. 문제: "시험 점수 90 점"의 함정 📝

지금까지 AI 의 지능을 평가할 때는 MMLU 같은 표준 시험지를 사용했습니다. 마치 "수학 문제 100 개를 풀게 해서 점수를 매기는" 방식이죠.

  • 현실: 최신 AI 는 이 시험에서 90 점 이상을 받아 '완벽한 천재'처럼 보입니다.
  • 문제점: 하지만 이 시험은 시험을 만든 사람이 '무엇을 물어볼지' 정해놓은 질문들만 포함합니다.
    • 비유: 한 학생이 "수학 문제집 100 개"는 다 외웠지만, 정작 "오늘 날씨"나 "내가 좋아하는 음식" 같은 질문에는 엉뚱한 답을 할 수 있습니다. 시험지 밖의 지식을 전혀 확인하지 못했기 때문입니다.

2. 해결책: LLMpedia (AI 가 직접 백과사전 쓰기) 🏗️

연구팀은 AI 에게 시험지를 풀게 하지 않고, 스스로 백과사전 기사를 100 만 개나 써보게 했습니다.

  • 방법: AI 는 인터넷 검색 (RAG) 을 하지 않고, 오직 자신의 머릿속 (학습된 데이터) 만을 이용해 글을 씁니다.
  • 과정:
    1. 시작점 (예: '반 버너 부시'라는 인물) 을 정합니다.
    2. AI 가 그 사람에 대해 글을 쓰고, 글속에 나오는 다른 인물이나 개념을 링크합니다.
    3. 그 링크된 주제들을 다시 AI 가 써서 새로운 글을 만듭니다.
    4. 이 과정을 반복하며 AI 가 알고 있는 지식의 지도를 그려나갑니다.

3. 충격적인 발견: "진짜 실력은 74 점" 😱

시험지 (기존 벤치마크) 에서는 90 점 이상을 받았던 AI 가, 스스로 글을 쓸 때는 **74.7%**만 사실에 맞았습니다.

  • 비유: 시험지에서는 정답을 외워서 90 점을 받았지만, 자신의 머릿속에서 자유롭게 이야기를 지어낼 때는 15 점이나 떨어졌습니다.
  • 이유: 시험지는 AI 가 잘 아는 '유명한 질문'만 냈지만, 스스로 글을 쓸 때는 AI 가 잘 모르는 '어두운 구석'까지 드러났기 때문입니다.

4. '캡처 트랩 (Capture Trap)': 위키백과를 베끼는 함정 🕸️

연구팀은 Grokipedia (일론 머스크의 AI 가 만든 백과사전) 와 비교했습니다.

  • Grokipedia 의 모습:
    • 위키백과와 글자 그대로 매우 비슷했습니다 (유사도 49%).
    • 하지만 사실은 70% 만 맞았습니다.
    • 비유: 위키백과를 복사해서 붙여넣기하듯 글을 썼는데, 오히려 실수가 더 많았습니다. 마치 "위키백과를 베껴 썼으니 믿을 만할 거야"라고 생각하지만, 사실은 잘못된 정보까지 함께 베껴서 더 엉망이 된 상태입니다.
  • LLMpedia 의 모습:
    • 위키백과와 글자 구조가 많이 달랐습니다 (유사도 25%).
    • 하지만 사실은 84% 까지 맞았습니다.
    • 비유: 위키백과를 베끼지 않고, 자신의 언어로 새롭게 설명했지만, 오히려 내용이 더 정확했습니다.

5. 왜 이 연구가 중요한가요? 🔍

  1. 투명성: Grokipedia 는 어떻게 만들었는지 비밀이지만, LLMpedia 는 모든 과정 (질문, 중간 결과, 평가) 을 공개했습니다. 누구나 "이 AI 가 왜 이런 실수를 했는지" 확인할 수 있습니다.
  2. 진실된 지식: AI 가 정말로 세상을 어떻게 이해하고 있는지, 위키백과에 없는 지식까지 얼마나 알고 있는지 확인할 수 있는 첫 번째 '열린 창'이 되었습니다.
  3. 경고: 우리가 AI 에게 너무 많은 신뢰를 하기 전에, 시험지 밖의 실력을 반드시 확인해야 한다는 것을 알려줍니다.

📝 한 줄 요약

"AI 가 시험지에서는 천재처럼 보이지만, 스스로 글을 쓸 때는 15 점이나 떨어집니다. 그리고 다른 AI 는 위키백과를 베껴서 더 엉망진창이 되기도 하죠. LLMpedia 는 AI 의 진짜 두뇌를 투명하게 보여주는 첫 번째 거울입니다."

이 연구는 AI 가 단순히 정보를 검색해서 말하는 게 아니라, 진짜로 알고 있는 지식이 얼마나 되는지, 그리고 우리가 얼마나 조심해야 하는지를 일깨워줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →