OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment
이 논문은 거대 언어 모델의 체계적인 방향성 편향을 탐지하기 위해 성공/실패 쌍을 역전시킨 방식을 사용하는 새로운 프레임워크인 OptimismBench를 소개하며, 대부분의 모델이 모델 구조나 언어가 아닌 사후 학습 정렬(post-training alignment)에 의해 유도된 '낙관주의 경향'을 보인다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하고 박학다식한 친구들에게 동전 던지기 결과나, 스타트업의 성공 여부, 혹은 내일 비가 올지 여부를 맞춰보라고 묻는다고 상상해 보십시오. 당신은 그들에게 "이 일이 잘될 확률이 얼마나 될까?"라고 묻고, 그와 별개로 "이 일이 잘못될 확률은 얼마나 될까?"라고 묻습니다. 완벽한 세상이라면, 만약 친구가 성공할 확률이 70%라고 말한다면, 그들은 실패할 확률이 30%라고도 말해야 합니다. 이 두 숫자의 합은 반드시 정확히 100%가 되어야 합니다. 이것이 확률의 기본 논리입니다. 만약 파이가 하나 있다면, 당신이 먹은 조각과 남겨둔 조각을 더했을 때 전체 파이와 같아야 하는 것과 같습니다.
하지만 인간은 이 부분에서 유명할 정도로 서툽니다. 우리에게는 '낙관 편향(optimism bias)'이라는 인지적 오류가 있는데, 이는 우리가 좋은 일이 실제로 일어나는 것보다 우리에게 더 자주 일어날 것이라고 생각하고, 나쁜 일은 덜 일어날 것이라고 생각하는 경향을 말합니다. 또한, 우리는 손실의 고통을 이득의 기쁨보다 훨씬 더 강렬하게 느낀다는 '전망 이론(prospect theory)'도 있습니다. 이는 우리가 위험과 보상을 불균형하게 가중치를 두게 만듭니다. 오랫동안 과학자들은 이러한 인간의 특성이 인공지능에도 전염되는지 궁금해했습니다. 만약 우리가 언어 모델에게 미래를 예측하라고 요청한다면, 모델에게도 수학적 계산을 왜곡하는 그들만의 '최선을 바라는 마음'이 존재할까요? 이것이 중요한 이유는 우리가 투자부터 의료 처방 계획에 이르기까지, 중대한 결정을 내리는 데 AI 모델을 사용하기 시작했기 때문입니다. 만약 AI가 비밀리에 낙관주의 편향을 가지고 있다면, 이는 우리가 의도하지 않은 위험한 선택을 하게 만들 수 있습니다.
이것이 바로 OptimismBench라는 논문이 조사하고 있는 내용입니다. 연구진은 대규모 언어 모델(LLM)이 확률 판단에 있어 체계적인 '기울어짐'을 가지고 있는지 확인하기 위해 특별한 테스트 환경을 구축했습니다. 그들은 단순히 모델에게 추측하라고 시킨 것이 아니라, '역쌍(inverted pairs)'이라는 영리한 기법을 사용했습니다. 모든 시나리오에 대해, 그들은 모델에게 두 가지 질문을 던졌습니다: "성공할 확률은 얼마인가?" 그리고 "실패할 확률은 얼마인가?" 만약 모델이 완벽하게 논리적이라면, 이 답변들의 합은 항상 100%가 되어야 합니다. 하지만 모델에 편향이 있다면, 이 숫자들은 합치지 않을 것입니다.
결과는 놀라울 정도로 명확했습니다. 8개 주요 기업에서 나온 16개의 서로 다른 AI 모델을 테스트한 결과, 14개의 모델이 일관되게 낙관적이었습니다. 그들은 성공 확률은 과대평가하고 실패 확률은 과소평가했습니다. 이는 마치 친구들에게 날씨를 맞춰보라고 물었더니, 구름이 몰려오고 있음에도 불구하고 거의 모든 사람이 화창할 것이라고 주장하는 것과 같았습니다. 유일하게 '비관적'(나쁜 일이 일어날 가능성을 실제보다 높게 봄)이었던 모델은 특정 회사인 앤스로픽(Anthropic)의 모델들이었으며, 그중에서도 가장 크고 발전된 모델들뿐이었습니다. 흥란하게도, 그들의 더 작고 가벼운 모델들은 다른 모든 모델과 마찬가지로 낙관적이었습니다.
연구는 또한 왜 이런 현상이 발생하는지를 파헤쳤습니다. 그들은 이 편향이 단순한 무작위 오류나 모델이 혼란스러워해서 생기는 결과가 아니라, 이 모델들이 학습되는 방식에 깊이 뿌리박힌 특징이라는 것을 발견했습니다. 연구진이 '가공되지 않은(raw)' 버전의 모델(도움이 되는 비서로 미세 조정되기 전의 모델)과 '챗봇' 버전을 비교했을 때, 학습 과정 자체가 편향의 방향을 바꾼다는 것을 확인했습니다. 어떤 모델 군에서는 학습이 그들을 더 낙관적으로 만들었고, 다른 모델 군에서는 더 비관적으로 만들었습니다. 이는 AI의 편향이 가진 '성격'이 인간과 대화하는 법을 가르치는 특정 레시피에 의해 결정된다는 것을 시사합니다.
또한 연구진은 이 편향이 질문의 기술인지, 아니면 단순히 AI에게 "헤이, 너무 낙관적으로 굴지 마!"라고 말함으로써 고칠 수 있는 것인지 확인했습니다. 그들은 온도(temperature) 설정을 변경하거나, 질문의 관점을 바꾸거나(예: "당신" vs "당신의 친구"), AI 지침에 경고 문구를 추가하는 등의 시도를 했습니다. 하지만 이러한 표면적인 해결책들은 효과가 없었습니다. 편향은 완고하게 남아 있었으며, 이는 편향이 일시적인 혼란이 아니라 모델의 내부 논리에 깊이 박힌 근본적인 부분임을 증명했습니다.
아마도 가장 놀라운 발견은 모델 자체가 언어보다 훨씬 더 중요하다는 점이었을 것입니다. 연구진은 이 모델들을 10가지 다른 언어로 테스트했습니다. 그들은 두 모델 사이의 편향 차이가 동일한 모델이 다른 언어를 사용할 때 나타나는 편향 차이보다 거의 5배나 더 크다는 것을 발견했습니다. 즉, AI가 낙관적인지 비관적인지는 그 AI가 영어, 중국어, 또는 스페인어를 말하느냐가 아니라, 어떤 AI를 사용하느냐에 달려 있다는 것입니다.
요컨대, 이 논문은 우리의 AI 도구들이 중립적인 계산기가 아님을 밝혀냅니다. 그것들은 위험과 보상에 대한 우리의 인식을 기울게 할 수 있는 숨겨진 '방향성 편향'을 지니고 있습니다. 대부분의 모델이 미래에 대해 밝고 낙관적인 견해를 갖는 경향이 있지만, 이것이 보편적인 규칙은 아닙니다. 이는 모델을 누가 만들었는지, 그리고 어떻게 학습시켰는지에 따라 크게 달라집니다. 저자들은 우리가 의사 결정을 돕기 위해 이 모델들을 사용할 때, 그들의 '직감'이 체계적으로 왜곡될 수 있음을 인지해야 하며, 그들이 세상을 명확하게 보고 있다고 막연히 가정해서는 안 된다고 경고합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.