← 최신 논문
💬 NLP

Predictable Confabulations: Factual Recall by LLMs Scales with Model Size and Topic Frequency

본 논문은 대규모 언어 모델의 사실적 회상이 모델의 파라미터 수와 훈련 데이터 내 주제 빈도의 복합적 영향으로 구동되는 예측 가능한 시그모이드 스케일링 법칙을 따르며, 이는 특정 모델 패밀리 내 성능 변동의 최대 94% 를 설명한다고 규명한다.

원저자: Matthew L. Smith, Jonathan P. Shock, Samuel T. Segun, Iyiola E. Olatunji, Tegawendé F. Bissyandé

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Matthew L. Smith, Jonathan P. Shock, Samuel T. Segun, Iyiola E. Olatunji, Tegawendé F. Bissyandé

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇의 뇌 안에 거대한 도서관이 있다고 상상해 보세요. 이 로봇은 인공지능 (AI) 이며, 그 도서관에서 사실을 끌어와 질문에 답하는 일을 합니다. 때로는 로봇이 정확한 답을 내놓지만, 다른 때는 실제가 아닌 것처럼 들리는 사실을 만들어내기도 합니다. 이 논문의 저자들은 이렇게 만들어낸 사실을 '허구 (confabulations)'라고 부릅니다.

이 논문은 단순한 질문을 던집니다: 무엇이 로봇이 더 자주 진실을 말하게 만드는가?

연구자들은 38 개의 서로 다른 AI 모델 (작은 것부터 거대한 것까지) 을 테스트하여 24 가지 다른 주제에 대해 10 개의 실제 학술 논문을 나열하도록 요청했습니다. 어떤 주제는 매우 인기가 많았지만 (예: '기후 변화'), 다른 주제는 매우 틈새적이었습니다 (예: '농촌 지역의 학교 중퇴 예방'). 그 후 로봇들이 나열한 논문들이 실제로 존재하는지 확인했습니다.

다음은 그들이 발견한 바를 일상적인 비유로 설명한 것입니다:

1. 진실을 위한 두 가지 재료

이 논문은 정답을 도출하는 것이 두 가지 주요 요소가 조리법처럼 상호작용하는 데 달려 있음을 발견했습니다:

  • 뇌의 크기 (모델 크기): AI 의 규모입니다. 이는 도서관 선반의 크기로 생각할 수 있습니다. 더 큰 도서관은 책들이 으깨지거나 뒤섞이지 않고 더 많은 책을 보관할 수 있습니다.
  • 주제의 유명세 (주제 빈도): AI 가 학습하는 동안 읽은 책에서 그 특정 주제가 얼마나 자주 등장하는지입니다. 이는 도서관에 특정 책의 사본이 얼마나 많이 있는지로 생각할 수 있습니다. 만약 어떤 주제가 수천 권의 책에서 언급된다면 AI 는 그것을 잘 알고 있습니다. 하지만 몇 권의 책에서만 언급된다면 AI 는 어려움을 겪을 수 있습니다.

2. '신호 대 잡음'의 전투

저자들은 이것이 어떻게 작동하는지 설명하기 위해 **신호 대 잡음비 (Signal-to-Noise Ratio)**라는 개념을 사용합니다. 시끄럽고 붐비는 방에서 친구의 속삭임을 듣으려 한다고 상상해 보세요.

  • 신호: 이는 주제에 대한 '진실'입니다. 훈련 데이터에서 주제가 매우 흔하다면 (예: '기후 변화'), 신호는 크고 명확합니다.
  • 잡음: 이는 AI 의 제한된 기억으로 인한 간섭입니다. AI 가 작다면, 그 '방'은 다른 사실들로 매우 혼잡하여 많은 정적 (static) 이 발생합니다.
  • 결과: 진실을 듣기 위해 (사실을 회상하기 위해), 신호 (주제의 유명세) 가 잡음 (AI 의 기억력 부족) 을 뚫고 나올 만큼 충분히 커야 합니다.

3. 성공의 'S 자 곡선'

가장 흥미로운 발견은 관계가 직선이 아니라는 점입니다. 그것은 S 자 모양의 곡선 (시그모이드) 입니다. 평평한 바닥, 가파른 중간, 그리고 평평한 꼭대기를 가진 경사로를 상상해 보세요.

  • 평평한 바닥 (바닥): AI 가 매우 작거나 주제가 매우 생소할 때, '잡음'이 너무 큽니다. AI 는 진실을 전혀 들을 수 없습니다. 추측하는 대신, 템플릿을 만들어내기 시작합니다. 빈 공간을 채우기 위해 '스미스 (1990) 가 X 에 대해 썼다'라고 반복해서 말하며 '스미스'와 같은 일반적인 이름을 사용할 수 있습니다. 이는 거짓말을 하려는 것이 아니라, 실제 데이터가 부족하기 때문입니다.
  • 가파른 중간 (경사로): AI 가 커지거나 주제가 더 인기를 얻으면, 신호가 잡음을 뚫고 나오기 시작합니다. 이 시점에서 AI 는 매우 빠르게 크게 향상됩니다. 크기나 데이터 빈도의 작은 증가가 진실성의 큰 도약으로 이어집니다.
  • 평평한 꼭대기 (천장): 결국 AI 가 너무 커지고 주제가 너무 흔해지면 한계에 도달합니다. 이미 그 주제에 대해 기억할 수 있는 거의 모든 것을 기억하고 있는 상태입니다. AI 를 더 크게 만드는 것은 더 이상 많은 도움이 되지 않습니다. 찾을 사실이 더 이상 없기 때문입니다.

4. '긴 꼬리' 문제

이 논문은 큰 불평등을 강조합니다. AI 는 인기 있는 것들 (곡선의 '머리') 을 기억하는 데는 뛰어나지만, 드문 것들 (꼬리) 을 기억하는 데는 형편없습니다.

  • 비유: 상위 40 곡 히트곡을 반복해서 틀어주는 라디오 방송국을 상상해 보세요. 당신은 항상 히트곡을 명확하게 들을 것입니다. 하지만 1995 년에 단 한 번만 연주된 노래를 들어보려 한다면, 정적이 그것을 덮어버릴 것입니다.
  • 발견: 테스트된 가장 큰 AI 모델들조차 (수조 개의 파라미터를 가진) 가장 드문 주제들과는 씨름했습니다. AI 가 인기 있는 사실을 기억하는 것처럼 매우 드문 사실도 잘 기억하게 하려면, 테스트한 가장 큰 모델보다 30 배 더 큰 AI 가 필요합니다. 이는 엄청난 도약입니다!

5. 미래에 대한 함의 (논문에 따르면)

저자들은 '할루시네이션 (사실과 다른 내용 생성)'이 무작위적인 실수가 아니라고 결론지었습니다. 유한한 기억 안에 방대하고 불균형한 정보 세계를 밀어 넣으려 할 때 발생하는 예측 가능한 결과입니다.

  • 무작위가 아님: 주제가 드물고 AI 가 작다면, 실수를 할 것입니다.
  • 구조적임: AI 가 '거짓말'을 하는 것이 아니라, 해당 사실에 대한 신호가 제한된 기억의 잡음을 이겨내기에 너무 약하다는 것입니다.
  • 해결책: 드문 주제에 대해 이를 해결하려면 AI 를 거대하게 키우는 것 (비싸다는 단점이 있음) 이거나, 논문이 제안하듯 '검색 증강 (retrieval augmentation)'과 같은 다른 전략을 사용하여 AI 가 기억에 의존하는 대신 검색 엔진을 통해 답을 찾도록 해야 합니다.

요약하자면: 이 논문은 AI 가 진실을 말할 수 있는 능력이 그 크기와 주제의 인기라는 두 가지 요소의 수학적으로 예측 가능한 조합임을 증명합니다. 주제가 생소하고 AI 가 작다면, 그것이 사실을 만들어낼 것이라고 기대해야 합니다. 반면 주제가 유명하고 AI 가 거대하다면, 올바르게 답할 가능성이 높습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →