Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases
이 논문은 전통적인 비구조화된 벤치마크의 인과적 모호성을 극복하기 위해, 완전 교차 요인 실험과 토큰 수준의 확률 분석을 결합하여 LLM의 태도와 편향을 정밀하게 측정하는 분석적으로 정확한 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 보이지 않는 로봇이 세상을 어떻게 생각하는지 알아내려 한다고 상상해 보세요. 이 로봇은 자동차를 만들거나 빨래를 접는 로봇이 아닙니다. 바로 인간이 쓴 거의 모든 것을 학습한 초지능형 컴퓨터 프로그램인 '대규모 언어 모델(LLM)'입니다. 이 모델들은 대화 능력이 매우 뛰어나져서, 기업들이 이들을 독립적인 에이전트로 활용하여 스스로 결정을 내리고 사람들과 상호작용하게 만들기 시작했습니다. 하지만 여기에는 함정이 있습니다. 우리는 그들이 실제로 무엇을 '믿는지' 잘 모른다는 점입니다. 그들에게 숨겨진 편향이 있을까요? 특정 국가나 사람을 더 선호할까요? 이를 알아내기 위해 과학자들은 보통 로봇에게 수천 개의 무작위 질문을 던지고 그 답변을 관찰합니다. 마치 낯선 사람의 성격을 추측하기 위해 백만 가지의 질문을 던지는 것과 같습니다. 문제는 너무 많은 무작위 질문을 던지다 보면, 로봇의 답변이 깊은 곳에 자리 잡은 신념 때문인지 아니면 단순히 질문 방식이 이상했기 때문인지 구분할 수 없다는 것입니다. 이는 어떤 사람이 피자를 얼마나 좋아하는지 알기 위해 피자에 대해 묻는 것이 아니라, 피자 이야기와 함께 좋아하는 색깔, 신발 사이즈, 그리고 날씨까지 한데 뒤섞어서 묻는 것과 같습니다. 데이터는 많이 얻겠지만, 피자에 대한 사랑과 신발 사이즈를 분리해낼 수는 없는 것이죠.
여기서 이 혼란을 정리해 줄 새로운 논문이 등장합니다. 연구자들인 다우드 와디(Davood Wadi), 모센 고드랏(Mohsen Ghodrat), 매슈 필립(Matthew Philp)은 무작위로 질문하는 것을 멈추고 통제된 과학 실험을 수행하기로 했습니다. 그들은 로봇을 추측하는 대신, 심리학 수업의 실험 대상처럼 취급했습니다. 그들은 로봇이 말을 내뱉기도 전에 그 '생각'을 들여다보는 특별한 수학적 방법을 사용했습니다. 일반적인 테스트는 로봇이 답변을 타이핑할 때까지 기다리지만(이는 노이즈가 많고 무작위적일 수 있습니다), 이 팀은 로봇의 내부 '확률 점수', 즉 가능한 모든 단어를 선택할 수학적 확률을 직접 살펴보았습니다. 이 방법을 통해 그들은 무작위적인 추측의 노이즈 없이 완벽한 정밀도로 로봇의 '태도'를 측정할 수 있었습니다. 그들은 '소비자 자국 중심주의(consumer ethnocentrism)', 즉 사람이(또는 로봇이) 자신의 나라를 얼마나 사랑하고 외국을 얼마나 싫어하는지를 주제로 이 방법을 테스트했습니다. 그들은 서로 다른 국가에서 만들어진 로봇들이 실제로 서로 다른 국가적 편향을 가지고 있는지, 그리고 그 편향이 실제 존재하는 것인지 아니면 잘못된 테스트 방법으로 인한 환상인지를 확인하고 싶었습니다.
위대한 로봇 성격 테스트
AI를 테스트하는 기존 방식은 마치 혼란스러운 '당나귀 꼬리 붙이기' 게임과 같습니다. 로봇을 빙글빙글 돌린 다음, 무작위 질문이 담긴 거대한 가방을 건네주고 로봇이 무엇이라고 말하는지 보는 식입니다. 만약 로봇이 편향된 발언을 한다면 편향되었다는 것은 알 수 있지만, 그 '이유'는 알 수 없습니다. 여성이 싫어서일까요? 리더십에 관한 질문이었기 때문일까요? 아니면 그냥 우연한 일일까요? 기존 방식은 이 모든 원인을 한데 뒤섞어 버리기 때문에, 로봇의 핵심 성격과 혼란스러운 프롬프트에 의한 일시적인 반응을 구분하는 것을 불가능하게 만듭니다.
이 논문의 저자들은 "당나귀를 그만 돌리세요!"라고 말합니다. 대신 그들은 모든 칸이 특정 테스트인 거대한 스도쿠 퍼즐처럼 완벽하게 조직된 격자를 설정했습니다. 그들은 실험을 레시피처럼 다루었습니다. '어떤 로봇인가?'와 '어느 나라에 대해 묻는가?'의 모든 가능한 조합을 가져와 전부 테스트했습니다. 그들은 미국, 중국, 캐나다, 프랑스에서 온 다섯 가지 로봇을 사용했고, 네 개의 국가에 대해 질문했습니다. 이 '완전 교차(fully crossed)' 설계 덕분에 그들은 무엇이 편향을 일으키는지 수학적으로 분리해낼 수 있었습니다. 그것이 로봇 자체였을까요? 논의 중인 국가였을까요? 아니면 그 둘의 기묘한 조합이었을까요?
노이즈 없이 로봇의 마음 읽기
이 기술의 가장 멋진 부분은 바로 이것입니다. 보통 우리가 AI에게 질문을 하면, AI는 주사위를 던지듯 다음 단어를 결정하며 하나씩 골라냅니다. 이 '주사위 던지기(샘플링)'는 많은 노이즈를 추가합니다. 같은 질문을 열 번 해도 답변이 조금씩 다를 수 있으며, 어떤 것이 '진짜' 답변인지 알기 어렵습니다.
이 논문은 이 주사위 던지기를 완전히 건너뜁니다. 로봇이 말하기를 기다리는 대신, 연구자들은 로봇의 내부 '확률 지도(확률 질량 함수, PMF)'를 들여다보았습니다. 로봇에게 평점 척도(1부터 7까지)에 대해 '1', '2', '3' 등을 말할 확률이 각각 몇 퍼센트인지 보여주는 비밀 대시보드가 있다고 상상해 보세요. 연구자들은 로봇이 하나를 선택할 때까지 기다리지 않고, 그 전체 대시보드를 한꺼번에 보았습니다. 이것은 주사위를 던지기 전에 그 주사위가 어떻게 무게가 실려 있는지 정확히 아는 것과 같습니다. 이 정확한 지도를 분석함으로써 그들은 모든 무작위 노이즈를 제거했습니다. 그들은 로봇의 진짜 '의견'을 울퉁불퉁하고 지저式한 선이 아닌, 매끄럽고 완벽한 곡선으로 볼 수 있었습니다.
연구 결과: 로봇은 국가적 정체성을 가진다 (어느 정도는)
그들이 이 초정밀 방법을 '자국 사랑'이라는 주제에 적용했을 때, 기존의 지저분한 방식으로는 놓쳤을 흥미로운 사실들을 발견했습니다.
첫째, 어떤 로봇은 믿기지 않을 정도로 일관적인 반면, 어떤 로봇은 다소 혼란스럽다는 것을 발견했습니다. 예를 들어, '미니스트랄(Ministral)'이라는 이름의 로봇(프랑스산)은 규칙을 지키는 데 어려움을 겪으며 답변이 사방팔방으로 튀는 경향이 있었습니다. 반면, 미국의 로봇들(Llama와 Gemma)과 중국의 로봇(Qwen)은 매우 집중되어 있고 일관적이었습니다.
둘째, 로봇들이 '국가적 편향'을 가지고 있는 것처럼 보이지만, 이는 복잡한 문제입니다. 미국산 로봇들(Llama와 Gemma)은 북미 국가(미국과 캐나다)를 뚜렷하게 선호하고 중국을 싫어하는 모습을 보였습니다. 이것은 소위 '내집단 선호(ingroup favoritism)'라고 부를 수 있는 것입니다. 하지만 단순히 "내 나라를 사랑한다"는 식의 이야기는 아니었습니다. 캐나다 로봇(Aya)과 중국 로봇(Qwen)은 동일한 종류의 강한 '자국 사랑' 편향을 보이지 않았습니다. 실제로 중국 로봇은 이 테스트에서 자신의 국가에 대한 구체적인 편향을 거의 보이지 않았으며, 상호작용 효과가 거의 제로에 가까웠습니다.
가장 중요한 발견은 기존의 방식들이 우리에게 거짓말을 하고 있었다는 점입니다. 만약 여러분이 단순히 모든 답변의 평균을 낸다면(기존 방식), 모든 로봇이 프랑스와 중국을 싫어한다고 생각할 것입니다. 하지만 연구자들이 새로운 '정확한 수학' 방식을 사용했을 때, 그것이 틀렸음을 알게 되었습니다. 프랑스 로봇(Ministral)은 실제로 프랑스를 좋아했습니다! 캐나다 로봇(Aya)은 실제로 중국을 좋아했습니다! 기존 방식은 다른 로봇들의 부정적인 감정과 섞어버림으로써 이러한 구체적인 긍정적 감정들을 숨겨버렸던 것입니다. 새로운 방식은 층을 하나씩 벗겨내어, 편향이 모든 로봇에게 똑같이 적용되는 것이 아니라, 어떤 로봇을 테스트하느냐와 정확히 무엇을 묻느냐에 따라 전적으로 달라진다는 것을 보여주었습니다.
이것이 왜 중요한가
이 논문은 기존의 테스트 방식이 얼마나 위험할 정도로 신뢰할 수 없는지도 보여주었습니다. 무작위적인 '주사위 던지기' 때문에, 기존 방식은 종종 편향의 방향을 잘못 짚곤 합니다. 때로는 단순히 무작위 노이즈 때문에 로봇이 긍정적인 상태임에도 부정적이라고 판단하기도 합니다. 저자들은 기존 방식을 사용할 경우, 운 좋게 편향의 부호가 반대로 뒤집힐(잘못 측정될) 가능성이 꽤 높다는 것을 계산해 냈습니다. 하지만 로봇 내부의 정확한 수학을 들여다보는 그들의 새로운 방식은 결코 이런 실수를 하지 않습니다.
요약하자면, 이 논문은 우리가 이 강력한 AI 에이전트들이 진정으로 무엇을 생각하는지 이해하고 싶다면, 그들을 단순히 무작위 텍스트를 뱉어내는 블랙박스로 취급해서는 안 된다고 주장합니다. 우리는 그들을 과학적 도구처럼 대하며, 그들의 내부 수학을 들여다봄으로써 진정한 가치를 파악해야 합니다. 이렇게 함으로써 우리는 마침내 로봇의 실제 성격과 테스트의 노이즈를 분리할 수 있으며, 이 에이전트들을 실제 세상에 배치할 때 그들이 어떤 편향을 가지고 함께 움직이는지 정확히 알 수 있게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.