← 최신 논문
💬 NLP

Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions

이 논문은 대규모 언어 모델 (LLM) 이 명시된 확률 분포에서 신뢰할 수 있는 무작위 표본을 생성하는 데 근본적인 한계가 있으며, 특히 독립 요청 시 거의 완전한 실패를 보인다는 사실을 대규모 통계적 검증을 통해 규명하고, 이러한 결함이 하류 응용 작업에서 체계적인 편향을 초래하므로 통계적 보장이 필요한 경우 외부 도구의 사용이 필수적임을 주장합니다.

원저자: Minda Zhao, Yilun Du, Mengyu Wang

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Minda Zhao, Yilun Du, Mengyu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"거대 언어 모델 (LLM, AI) 은 사실 '주사위'를 굴리는 데 매우 서툴다"**는 놀라운 사실을 밝혀낸 연구입니다.

마치 AI 가 수학 문제를 풀거나 시를 쓰는 것은 천재처럼 잘하지만, **"완전히 무작위"**로 숫자를 뽑거나 상황을 결정하는 능력은 인간보다 훨씬 떨어질 수 있다는 것을 실험으로 증명했습니다.

이 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


🎲 1. 핵심 발견: AI 는 '가짜' 주사위입니다

우리는 AI 에게 "1 에서 100 사이에서 무작위 숫자 1000 개를 뽑아줘"라고 하면, AI 가 그걸 척척 해낼 거라고 생각합니다. 하지만 이 연구는 AI 가 실제로는 주사위를 굴리는 게 아니라, "무작위처럼 보이는 숫자 나열"을 외운 것처럼 행동한다는 것을 발견했습니다.

  • 비유: AI 는 주사위를 굴리는 사람이 아니라, **"주사위 굴리는 소리를 흉내 내는 배우"**입니다. 배우는 연기를 잘하지만, 실제 주사위처럼 공정한 확률을 만들지는 못합니다.

🧪 2. 실험 방법: "한 번에 1000 개" vs "1000 번 따로따로"

연구진은 AI 를 두 가지 방식으로 테스트했습니다.

  1. 한 번에 1000 개 뽑기 (Batch): "1000 개 숫자를 한 번에 나열해줘"라고 요청.

    • 결과: AI 가 그럭저럭 잘했습니다. (약 7% 만 통과)
    • 이유: AI 가 앞선 숫자들을 보고 "아, 이제 이 숫자가 나오지 않았으니 저걸 넣어야지"라고 **스스로 수정 (Self-correction)**을 했기 때문입니다. 마치 주사위를 1000 번 굴리는 게 아니라, 1000 개의 주사위를 한 번에 던져서 결과가 균형을 맞추는 것처럼 보인 것입니다.
  2. 1000 번 따로따로 뽑기 (Independent): "숫자 하나만 뽑아줘"를 1000 번 반복.

    • 결과: 대참사! 11 개 모델 중 10 개는 단 하나도 제대로 된 무작위성을 보여주지 못했습니다.
    • 이유: AI 는 앞선 맥락이 없으면, 자신의 내재된 편향 (선호하는 숫자) 대로 숫자를 뽑아냅니다. 진정한 '무작위'는 AI 내부에 존재하지 않습니다.

📉 3. 패턴의 발견: "복잡할수록, 많이 뽑을수록 망가진다"

  • 난이도: 단순한 주사위 (균등 분포) 는 조금은 잘하지만, 복잡한 확률 분포 (예: 특정 숫자가 나올 확률이 다른 숫자보다 훨씬 높은 경우) 로 갈수록 AI 는 완전히 엉망이 됩니다.
  • 양 (Quantity): "숫자 100 개만 뽑아줘"라고 하면 AI 가 그럭저럭 넘어가지만, **"숫자 2000 개를 뽑아줘"**라고 하면 AI 의 실수가 누적되어 통계적으로 명백한 오류가 드러납니다.
    • 비유: AI 는 짧은 대화에서는 "무작위 척"을 잘하지만, 긴 대화나 대량 생산을 시키면 "내 마음대로"라는 본색을 드러냅니다.

🏥 4. 실제 피해: "시험지"와 "인물화"에서 벌어지는 일

이 문제가 왜 중요한지 두 가지 실생활 예시로 보여줍니다.

  • 시험지 만들기 (객관식 문제):
    • AI 에게 "정답이 A, B, C, D 에 골고루 나오게 문제를 만들어줘"라고 시켰습니다.
    • 현실: AI 는 정답을 C 나 B 에 몰아세우는 편향을 보였습니다. 학생들은 "정답은 보통 C 에 있겠지"라고 추측해서 문제를 풀게 되고, 시험의 공정성이 무너집니다.
  • 그림 생성 프롬프트 (인물 묘사):
    • AI 에게 "미국 인구 비율대로 다양한 인종과 성별의 사람이 그려진 그림을 만들어줘"라고 시켰습니다.
    • 현실: AI 는 특정 인종이나 성별을 과대표하거나, 반대로 아예 빼먹었습니다. 예를 들어, '히스패닉' 인종은 20% 여야 하는데 AI 는 0% 로 만들거나, '초록색 코트'만 96% 나 만들어내는 식입니다.

💡 5. 결론: AI 는 '계산기'가 필요합니다

이 연구의 결론은 매우 명확합니다.

"현재의 AI 는 스스로 확률을 계산하고 무작위를 생성하는 능력이 없습니다. 우리가 AI 에게 통계적으로 정확한 일을 시키려면, AI 가 직접 숫자를 뽑게 하는 게 아니라, AI 가 파이썬 (Python) 같은 외부 도구를 불러와서 계산하게 해야 합니다."

한 줄 요약:
AI 는 언어를 다루는 천재이지만, 주사위를 굴리는 능력은 초보도 못 미치지 못합니다. 따라서 AI 를 사용할 때는 "AI 가 무작위성을 잘할 거야"라고 믿지 말고, 외부 도구를 써서 검증해야 한다는 교훈을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →