← 최신 논문
🤖 AI

Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe

이 논문은 지시어 튜닝된 언어 모델들이 정렬 학습으로 인해 응답 분포로부터 진정으로 샘플링하는 데 실패하고 대신 결정론적인 출력으로 붕괴된다는 점을 밝혀내는 동시에, 단 한 번의 호출로 이러한 분포를 정확하게 설명할 수 있다는 "알지만 수행하지 못함(KNOWS/DOES)"의 격차를 드러내며, 이는 분포 기술 또는 프롬프트 섭동을 통해 인간 설문 데이터를 훨씬 더 정확하게 시뮬레이션할 수 있게 한다.

원저자: Chaemin Jang, Dongman Lee, Jihee Kim

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chaemin Jang, Dongman Lee, Jihee Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 백만 개의 질문을 던지며 수정구슬에게 미래를 예측해 달라고 요청한다고 상상해 보세요. 인공지능의 세계에서 과학자들은 이 수정구슬 대신 '거대 언어 모델(LLM)'을 사용하기 시작했습니다. 실제 사람들에게 정치, 영화, 또는 경제에 대해 어떻게 생각하는지 묻는 대신, 연구자들은 AI에게 "오하이오 출신의 십 대"나 "플로리다의 은퇴한 교사"와 같은 다양한 유형의 사람들이 되어달라고 요청합니다. 이것을 '실리콘 샘플링(silcon sampling)'이라고 부릅니다. 아이디어는 간단합니다. 만약 당신이 AI에게 천 명의 서로 다른 사람처럼 행동하라고 요청한다면, AI는 실제 군중이 그러하듯 천 개의 서로 다른 답변을 내놓을 것이라는 점입니다. 이 답변들을 모두 합산함으로써, 당신은 전체 인구의 생각을 추측할 수 있습니다. 이는 마치 모든 고객으로부터 한 스쿱씩 맛을 보아 거대한 아이스크림 가게의 맛을 알아내려는 것과 같습니다.

하지만 여기 함정이 있습니다. 이 방식이 제대로 작동하려면, AI가 질문을 던질 때마다 실제로 '주사위를 굴릴' 수 있어야 합니다. 만약 당신이 실제 십 대에게 "피자를 좋아하니?"라고 묻는다면, 그들은 오늘 "응"이라고 했다가 내일은 "아니"라고 할 수도 있고, 혹은 머릿속으로 동전을 던질 수도 있습니다. AI도 똑같이 해야 합니다. 당신이 '전송' 버튼을 누를 때마다 신선하고 무작위적인 답변을 생성해야 하는 것입니다. 만약 AI가 실제로 주사위를 굴리지 못한다면—즉, 당신이 아무리 여러 번 물어도 하나의 답변에 고착되어 버린다면—실험 전체가 무너집니다. 첫 번째 고객이 "초콜릿"이라고 말했는데 AI가 다음 999명의 고객에게도 강제로 "초콜릿"이라고 말하게 한다면, 당신은 아이스크림 가게의 맛을 맞출 수 없습니다.

이것이 바로 KAIST의 연구팀이 발견한 사실입니다. 그들은 오늘날 우리가 사용하는 AI 모델들이 이상한 결함을 가지고 있다는 것을 발견했습니다. 즉, 무작위 분포가 어떤 모습인지 설명하는 데는 매우 뛰어나지만, 실제로 '무작위 샘플링'을 수행하는 데는 형편없다는 것입니다. 이는 마술사가 카드 덱이 어떻게 섞이는지는 완벽하게 설명할 수 있지만, 막상 무작위로 카드를 뽑으라고 하면 항상 스페이드 에이스만 뽑는 것과 같습니다.

연구진은 이를 "KNOWS/DOES 분리(KNOWS/DOES split)"라고 불렀습니다. 모델은 정답을 알고(KNOWS) 있습니다. 만약 당신이 "A 옵션과 B 옵션을 선호하는 비율이 어떻게 됩니까?"라고 묻는다면, 모델은 완벽하고 정확한 수학적 답을 줄 수 있습니다. 하지만 모델은 그것을 행하지(DOES) 못합니다. 만약 모델에게 한 명의 사람이 되어 답변을 하나 달라고 요청하면, 모델은 붕괴됩니다. 다양한 응답을 내놓는 대신, 하나의 단조롭고 반복적인 답변에 갇혀 버립니다.

이를 증명하기 위해 과학자들은 일련의 테스트를 진행했습니다. 그들은 AI에게 1에서 100 사이의 무작위 숫자를 하나 골라보라고 했습니다. 당연히 답변이 사방에 흩어져 있을 것이라 예상했습니다. 하지만 AI는 78%의 시도에서 숫자 42를 선택했습니다! 또한 두 가지 옵션이 70 대 30의 비율로 나뉘어 있을 때 선택하라고 하자, AI는 혼합된 결과를 내놓는 대신 매번 70% 쪽의 옵션을 선택했습니다. 마치 AI의 고장 난 내부 주사위 롤러가 한쪽 면에 딱 붙어 있는 것 같았습니다.

연구팀은 또한 왜 이런 현상이 발생하는지 알아냈습니다. 그들은 '스마트' 버전의 AI 모델(지시를 따르고 도움이 되도록 훈련된 모델)과 '가공되지 않은(raw)' 버전의 모델(아직 대화법을 배우지 않은 모델)을 비교했습니다. 가공되지 않은 모델들이 주사위를 훨씬 더 잘 굴렸습니다. 반면, '스마트'한 모델들은 너무 일관적이고 도움이 되도록 훈련된 나머지 무작위성을 잃어버렸습니다. 이는 AI를 좋은 학생으로 만들기 위한 부작용이었습니다. AI는 무작위로 행동해야 할 때조차도 항상 '정답'을 내놓는 법을 배워버린 것입니다.

그렇다면 AI 모델을 설문조사에 사용해야 한다면 어떻게 해야 할까요? 연구진은 두 가지 영리한 비책을 찾아냈습니다.

첫째, 만약 당신이 단순히 대중의 일반적인 의견(인구 추정치)을 알고 싶은 것이라면, AI에게 100명의 서로 다른 사람인 척하라고 요구하지 마세요. 대신, AI에게 단 하나의 질문만 던지세요. "만약 당신이 100명에게 이 질문을 한다면, 결과가 어떻게 나타날 것 같습니까?"라고 묻는 것입니다. AI는 분포를 묘사하는 데 탁월합니다. 이 "설명 경로(Describe Pathway)"를 시도했을 때, 여러 명의 사람인 척하도록 요청하는 기존 방식보다 예측 오차가 절반 이상 줄어들었습니다.

둘째, 만약 반드시 AI로부터 100개의 서로 다른 개별 답변을 얻어야 한다면(예를 들어 모든 캐릭터가 고유한 성격을 가져야 하는 비디오 게임의 경우), 똑같은 질문을 100번 반복해서는 안 됩니다. AI는 그저 똑같은 말을 반복할 뿐입니다. 대신, 연구진은 "프롬프트 섭동 아가일(Prompt-Perturbed Argyle, PPA)"이라는 방법을 발명했습니다. 이는 질문을 던질 때마다 질문의 방식을 미세하게 바꾸는 것입니다. 예를 들어 답변 선택지의 순서를 바꾸거나, 질문의 문구를 수정하거나, '캐릭터' 설명의 위치를 옮기는 식입니다. 이러한 미세한 변화들은 AI의 고장 난 주사위 롤러를 '흔들어 깨워', 매번 다른 답변을 내놓도록 강제하는 역할을 합니다. 이 간단한 기술은 추가 비용이나 시간 없이도 오차를 21% 줄여주었습니다.

요약하자면, 이 논문은 AI가 세상이 어떻게 돌아가는지 설명하는 데는 놀랍도록 뛰어나지만, 현재로서는 세상의 무작위한 개인인 척하는 데는 형편없다는 점을 알려줍니다. 하지만 이러한 특이점을 이해한다면, 우리는 여ciąż 이 강력한 도구들을 사용하여 좋은 답을 얻을 수 있습니다. 다만, 질문하는 방식을 올바르게 바꿔야 할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →