Quantifying non deterministic drift in large language models
본 논문은 서로 다른 모델과 프롬프트 유형에 걸쳐 온도가 0인 상태에서도 출력 가변성이 지속됨을 입증함으로써 대규모 언어 모델의 기초적인 행동 드리프트를 실증적으로 정량화하며, 이를 통해 향후 완화 전략을 평가하기 위한 체계적인 기준점을 확립한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑하고 창의적인 로봇 비서가 있다고 상상해 보세요. 당신이 로봇에게 "날씨가 어때?"라는 똑같은 질문을 던지며, "최대한 정확하고 지루하게 대답해 줘"라고 말합니다. 그렇다면 당신은 로봇이 매번 정확히 똑같은 대답을 내놓을 것이라고 기대하겠죠, 맞나요?
클레어 니콜슨(Claire Nicholson)이 작성한 이 논문은 우리가 실제로 현대의 AI 로봇(대규모 언어 모델, LLM이라 불리는)에게 그런 시도를 했을 때 어떤 일이 일어나는지를 조사합니다. 놀라운 발견은 다음과 같습니다: 설령 당신이 로봇에게 완벽하게 일관성을 유지하라고 명령하더라도, 로봇은 종종 일관되지 않은 모습을 보인다는 것입니다.
다음은 이 연구가 발견한 내용을 일상적인 비유를 사용하여 쉽게 풀어낸 설명입니다:
1. "기계 속의 유령" (비결정성)
연구진은 두 가지 서로 다른 AI 모델을 동일한 쌍둥이처럼 취급했습니다:
- 클라우드 로봇: 거대한 서버 농장(보이지 않는 식당 주방 같은 곳)에 살고 있는
gpt-4o-mini라는 모델입니다. - 로컬 로봇: 실험실에 있는 단일 컴퓨터에서 실행되는
llama3.1-8b라는 모델입니다. (당신의 주방에서 요리하는 요리사 같은 존재입니다.)
그들은 이 로봇들에게 설정값을 "최대 일관성"(온도/Temperature 0.0)으로 맞춘 상태에서 똑같은 질문을 반복해서 던졌습니다.
- 결과: 클라우드 로봇은 4번 중 1번꼴로 다른 대답을 내놓았습니다. 로컬 로봇은 더 일관적이었지만, 여에도 10번 중 1번 정도는 대답이 바뀌었습니다.
비유: 제빵사에게 똑같은 레시피와 재료를 사용하여 초콜릿 케이크를 만들어 달라고 부탁한다고 상상해 보세요. 당신은 케이크가 매번 똑같이 생겼기를 기대할 것입니다. 하지만 이 연구에서 제빵사(AI)는 레시피를 완벽하게 따르라는 말을 들었음에도 불구하고, 가끔 소금을 한 꼬집 더 넣거나 스프링클을 다르게 배치하기도 합니다.
2. 왜 이런 일이 발생하는가?
논문은 이러한 "표류(drift)" 현상의 두 가지 주요 원인을 제시합니다:
- 모델 자체의 문제: 더 크고 복잡한 모델일수록 더 작고 단순한 모델보다 더 "들쑥날쑥(jittery)"하고 일관성이 없는 경향이 있습니다.
- 주방(인프라)의 문제: 클라우드 로봇의 경우, 요청이 인터넷을 통해 전달되는 방식, 컴퓨터가 데이터를 처리하는 방식, 또는 서버가 조직된 방식 등이 결과에 영향을 줄 수 있습니다. 이는 마치 제빵사의 오븐 온도가 미세하게 변하거나, 레시피는 같더라도 섞는 그릇의 크기가 매번 약간씩 달라지는 것과 같습니다.
3. "온도(Temperature)" 조절 노브
연구진은 "온도"(AI를 더 창의적이고 무작위적으로 만드는 설정값)를 높였을 때 어떤 일이 일어나는지도 테스트했습니다.
- 낮은 온도 (0.0): 로봇은 지루하고 일관되려고 노력하지만, 여전히 가끔 실수를 합니다.
- 높은 온도 (0.7): 로봇이 날뜁니다. 이 모드에서는 모든 대답이 제각각이었습니다. 이는 제빵사에게 케이크를 만들라고 하면서 동시에 "창의력을 발휘해 봐"라고 말하는 것과 같습니다. 갑자기 모든 케이크가 완전히 달라진 모습이 됩니다.
4. "단어 수" 및 "유사도" 확인
그들은 이를 어떻게 측정했을까요? 단순히 답변을 읽는 데 그치지 않고, 수학을 사용하여 답변들을 비교했습니다.
- 고유 분율(Unique Fraction): 로봇이 완전히 새로운 답변을 몇 번이나 내놓았는지 계산했습니다.
- 자카드 유사도(Jaccard Similarity): 이는 "단어가 얼마나 같은가?"를 묻는 세련된 방식입니다.
- 로봇이 "지루한" 상태(0.0)일 때, 답변들은 약 90% 유사했습니다.
- 로봇이 "창의적인" 상태(0.7)일 때, 답변들은 50% 미만으로 유사했습니다.
5. 이것이 당신에게 의미하는 바 ( "변동 예산" )
이 논문은 이 문제를 어떻게 해결할지 알려주는 것이 아닙니다. 대신 이렇게 말합니다: "문제를 해결하려고 시도하기 전에, 이런 일이 일어나고 있다는 사실을 먼저 알아야 합니다."
이것을 "변동 예산(Variance Budget)"이라고 생각해보세요.
- 만약 당신이 금융 수치를 생성하는 시스템을 구축하고 있다면, "나는 출력값의 차이가 5% 이내여야 한다"라고 정할 수 있습니다.
- 만약 AI가 그보다 더 많이 표류한다면, 당신은 개입이 필요하다는 것을 알게 될 것입니다.
- 하지만 먼저, 아무런 도움 없이 발생하는 "정상적인" 표류가 어느 정도인지 알아야 합니다. 이 논문은 그 기준이 되는 지도를 제공합니다.
요약
이 연구는 하나의 "측정 보고서"입니다. 이 논문은 로봇이 마음을 바꾸지 못하게 하는 새로운 방법을 발명한 것이 아닙니다. 대신, 아무런 조치를 취하지 않았을 때 로봇이 얼마나 많이 마음을 바꾸는지 정확하게 측정했습니다.
핵심 요점: 당신이 로봇을 100% 예측 가능하도록 꽉 잡아두었다고 생각할 때조차, 실제로는 로봇이 조금씩 흔들리고 있습니다. 만약 당신이 AI의 단 하나의 답변에 의존한다면, 다음에 똑같은 질문을 했을 때 AI가 약간 다른 답변을 할 수도 있다는 사실을 놓치고 있는 것일지도 모릅니다. 전체 그림을 파악하려면, 같은 질문을 몇 번 던진 뒤 그 평균을 확인해야 할 수도 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.