Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions
이 논문은 대규모 언어 모델 (LLM) 이 명시된 확률 분포에서 신뢰할 수 있는 무작위 표본을 생성하는 데 근본적인 한계가 있으며, 특히 독립 요청 시 거의 완전한 실패를 보인다는 사실을 대규모 통계적 검증을 통해 규명하고, 이러한 결함이 하류 응용 작업에서 체계적인 편향을 초래하므로 통계적 보장이 필요한 경우 외부 도구의 사용이 필수적임을 주장합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"거대 언어 모델 (LLM, AI) 은 사실 '주사위'를 굴리는 데 매우 서툴다"**는 놀라운 사실을 밝혀낸 연구입니다.
마치 AI 가 수학 문제를 풀거나 시를 쓰는 것은 천재처럼 잘하지만, **"완전히 무작위"**로 숫자를 뽑거나 상황을 결정하는 능력은 인간보다 훨씬 떨어질 수 있다는 것을 실험으로 증명했습니다.
이 내용을 일상적인 비유로 쉽게 설명해 드릴게요.
🎲 1. 핵심 발견: AI 는 '가짜' 주사위입니다
우리는 AI 에게 "1 에서 100 사이에서 무작위 숫자 1000 개를 뽑아줘"라고 하면, AI 가 그걸 척척 해낼 거라고 생각합니다. 하지만 이 연구는 AI 가 실제로는 주사위를 굴리는 게 아니라, "무작위처럼 보이는 숫자 나열"을 외운 것처럼 행동한다는 것을 발견했습니다.
- 비유: AI 는 주사위를 굴리는 사람이 아니라, **"주사위 굴리는 소리를 흉내 내는 배우"**입니다. 배우는 연기를 잘하지만, 실제 주사위처럼 공정한 확률을 만들지는 못합니다.
🧪 2. 실험 방법: "한 번에 1000 개" vs "1000 번 따로따로"
연구진은 AI 를 두 가지 방식으로 테스트했습니다.
한 번에 1000 개 뽑기 (Batch): "1000 개 숫자를 한 번에 나열해줘"라고 요청.
- 결과: AI 가 그럭저럭 잘했습니다. (약 7% 만 통과)
- 이유: AI 가 앞선 숫자들을 보고 "아, 이제 이 숫자가 나오지 않았으니 저걸 넣어야지"라고 **스스로 수정 (Self-correction)**을 했기 때문입니다. 마치 주사위를 1000 번 굴리는 게 아니라, 1000 개의 주사위를 한 번에 던져서 결과가 균형을 맞추는 것처럼 보인 것입니다.
1000 번 따로따로 뽑기 (Independent): "숫자 하나만 뽑아줘"를 1000 번 반복.
- 결과: 대참사! 11 개 모델 중 10 개는 단 하나도 제대로 된 무작위성을 보여주지 못했습니다.
- 이유: AI 는 앞선 맥락이 없으면, 자신의 내재된 편향 (선호하는 숫자) 대로 숫자를 뽑아냅니다. 진정한 '무작위'는 AI 내부에 존재하지 않습니다.
📉 3. 패턴의 발견: "복잡할수록, 많이 뽑을수록 망가진다"
- 난이도: 단순한 주사위 (균등 분포) 는 조금은 잘하지만, 복잡한 확률 분포 (예: 특정 숫자가 나올 확률이 다른 숫자보다 훨씬 높은 경우) 로 갈수록 AI 는 완전히 엉망이 됩니다.
- 양 (Quantity): "숫자 100 개만 뽑아줘"라고 하면 AI 가 그럭저럭 넘어가지만, **"숫자 2000 개를 뽑아줘"**라고 하면 AI 의 실수가 누적되어 통계적으로 명백한 오류가 드러납니다.
- 비유: AI 는 짧은 대화에서는 "무작위 척"을 잘하지만, 긴 대화나 대량 생산을 시키면 "내 마음대로"라는 본색을 드러냅니다.
🏥 4. 실제 피해: "시험지"와 "인물화"에서 벌어지는 일
이 문제가 왜 중요한지 두 가지 실생활 예시로 보여줍니다.
- 시험지 만들기 (객관식 문제):
- AI 에게 "정답이 A, B, C, D 에 골고루 나오게 문제를 만들어줘"라고 시켰습니다.
- 현실: AI 는 정답을 C 나 B 에 몰아세우는 편향을 보였습니다. 학생들은 "정답은 보통 C 에 있겠지"라고 추측해서 문제를 풀게 되고, 시험의 공정성이 무너집니다.
- 그림 생성 프롬프트 (인물 묘사):
- AI 에게 "미국 인구 비율대로 다양한 인종과 성별의 사람이 그려진 그림을 만들어줘"라고 시켰습니다.
- 현실: AI 는 특정 인종이나 성별을 과대표하거나, 반대로 아예 빼먹었습니다. 예를 들어, '히스패닉' 인종은 20% 여야 하는데 AI 는 0% 로 만들거나, '초록색 코트'만 96% 나 만들어내는 식입니다.
💡 5. 결론: AI 는 '계산기'가 필요합니다
이 연구의 결론은 매우 명확합니다.
"현재의 AI 는 스스로 확률을 계산하고 무작위를 생성하는 능력이 없습니다. 우리가 AI 에게 통계적으로 정확한 일을 시키려면, AI 가 직접 숫자를 뽑게 하는 게 아니라, AI 가 파이썬 (Python) 같은 외부 도구를 불러와서 계산하게 해야 합니다."
한 줄 요약:
AI 는 언어를 다루는 천재이지만, 주사위를 굴리는 능력은 초보도 못 미치지 못합니다. 따라서 AI 를 사용할 때는 "AI 가 무작위성을 잘할 거야"라고 믿지 말고, 외부 도구를 써서 검증해야 한다는 교훈을 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.