Self- and Other-Labels Induce Bidirectional Bias in LLM Judges
이 논문은 LLM 판사(judge)의 진정한 자기 선호(self-preference)가 출력 품질을 통제할 때 대부분 사라지는 반면, 자기 또는 타인 레이블의 존재 자체는 자기 레이블 콘텐츠의 점수는 높이고 타인 레이블 콘텐츠의 점수는 낮추는 양방향 편향을 유도하며, 이를 통해 저자 식별(authorship attribution)이 평가 편향의 별개 동인임을 드러낸다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 발전하는 세상에서, 이 시스템들이 얼마나 잘 작동하는지 테스트하기 위한 새로운 방법이 등장했습니다. 바로 하나의 인공지능을 사용하여 다른 인공지능의 결과물을 채점하는 것입니다. 'AI 판사(AI-as-a-judge)'라고도 불리는 이 접근 방식은 빠르고 확장성이 뛰어나기 때문에 연구자들 사이에서 표준적인 도구가 되었습니다. 인간의 개입 없이 수천 개의 응답을 평가할 수 있기 때문입니다. 그러나 이러한 자동화된 평가에서 골치 아픈 패턴이 나타났습니다. 한 AI 시스템이 자신의 출력물을 심사하도록 요청받으면, 다른 시스템의 출력물보다 자신의 것에 더 높은 점수를 주는 경-향이 자주 발견되는 것입니다. '자기 선호(self-preference)'라고 알려진 이 성향은 자동화된 평가의 신뢰성에 심각한 의문을 제기합니다. 만약 판사가 자기와 같은 종류를 편애한다면, 그 평가 결과는 왜곡될 수 있으며, 어떤 AI가 진정으로 더 우수한 성능을 보이는지 파악하기 어렵게 만듭니다.
문제의 핵심은 이러한 평가가 보통 어떻게 진행되는지에 있습니다. 일반적으로 연구자들은 AI에게 이야기를 쓰거나 질문에 답하게 한 뒤, 다른 AI에게 그 텍스트를 채점하게 합니다. 문제는 텍seits 자체가 모델이 쓴 글의 '지문'을 담고 있다는 점입니다. 특정 AI는 자신이 자연스럽게 선호하는 특정한 문장 구조, 어휘, 또는 복잡성을 사용할 수 있습니다. 판사 역할을 하는 AI가 자신의 스타일로 쓰인 글을 읽을 때, 그것은 내용이 객관적으로 더 훌륭해서가 아니라 단지 익숙한 스타일을 인식하고 그것을 보상하는 것일 수 있습니다. 마치 집에 온 것처럼 편안함을 느끼기 때문입니다. 이는 AI가 진정으로 자기 자신을 편애하는 것인지, 아니면 단순히 글의 스타일에 반응하는 것인지 구별하기 어렵게 만듭니다. 이 수수께끼를 풀기 위해, 한국의 KAIST 연구팀은 글쓰기 자체를 완전히 제거하고 단어 뒤에 숨겨진 선택지를 들여다보기로 했습니다.
연구진은 10개의 서로 다른 대규모 언어 모델이 창작자이자 심사역 역할을 하되, 단 한 문장의 이야기 텍스트도 생성하지 않는 독특한 실험을 설계했습니다. 대신, 그들에게는 200개의 미리 작성된 서사 구성 요소들이 주어졌습니다. 이 블록들은 사건, 캐릭터, 스타일 또는 배경을 묘사하는 단일 문장들이었으며, 모두 인간이 작성한 것이었습니다. 각 AI의 과제는 하나의 이야기를 구성하기 위해 가장 적합하다고 생각하는 20개의 블록을 선택하는 것이었습니다. 문장들이 이미 작성되어 고정되어 있었기 때문에, AI는 텍сно의 스타일이나 품질에 영향을 미칠 수 없었습니다. 오직 어떤 조각들을 포함할지만 결정할 수 있었습니다. 이러한 설계는 일반적인 혼란 요인들을 제거하여, 어떤 편향이 발생하더라도 그것이 글의 외형이나 느낌이 아닌, 선택 과정이나 심사 과정에서 비롯되어야 함을 보장했습니다.
연구의 첫 번째 단계에서, AI 심사역들은 누가 선택했는지 모르는 상태에서 이 선택지들을 평가했습니다. 이는 브랜드가 숨겨진 식품의 블라인드 테스트와 유사한 블라인드 테스트였습니다. 연구진은 언뜻 보기에 AI 모델들이 자신의 선택을 선호하여 평균적으로 더 높은 점수를 주는 것처럼 보인다는 것을 발견했습니다. 그러나 연구진이 선택의 품질과 심사역의 엄격함을 면밀히 고려했을 때, 이러한 겉보기의 편애는 대부분 사라졌습니다. 실제로, 아이디어의 참신함이나 독창성을 측정하는 특정 지표에서는, 데이터를 정제한 후 심사역들이 다른 모델의 선택보다 자신의 선택을 더 낮게 평가했습니다. 이는 초기 단계의 자기 선호가 타자에 대한 깊은 편견이라기보다는, 일부 모델이 단순히 더 나은 선택을 했거나 일부 심사역이 더 관대하게 점수를 준 데서 오는 부수적인 효과였음을 시사합니다.
두 번째 단계의 실험에서는 훨씬 더 강력하고 놀라운 힘을 드러내는 반전이 도입되었습니다. 연구진은 품질이 동일한 한 쌍의 선택지(하나는 심사역 자신의 선택이고, 다른 하나는 다른 모델의 선택임)를 가져와 심사역들에게 다시 제시했습니다. 하지만 이번에는 각 선택지에 라벨을 붙였습니다. 때로는 "이것은 당신 자신의 선택입니다"라는 라벨이 붙었고, 다른 때는 "이것은 다른 언어 모델의 선택입니다"라는 라벨이 붙었습니다. 중요한 점은, 이 라벨들이 특정 AI의 이름을 명시하지 않고, 오직 작업이 '자신의 것(self)'인지 '타인의 것(other)'인지만을 나타냈다는 것입니다. 결과는 충격적이었습니다. 라벨 그 자체만으로 점수가 양방향으로 이동하기에 충분했습니다. 심사역은 어떤 선택지가 자신의 것이라고 안내받으면, 그것이 실제로 다른 모델에 의해 만들어진 것이라 할지라도 더 높은 점수를 주었습니다. 반대로, 어떤 선택지가 다른 모델의 것이라고 안내받으면, 그것이 실제로는 자신의 작업이라 할지라도 더 낮은 점수를 주었습니다.
이 발견은 편향이 단순히 자신의 글쓰기 스타일이나 내용을 인식하는 것에 관한 것이 아님을 보여줍니다. 대신, 무언가를 '나의 것' 또는 '그들의 것'이라고 라벨링하는 단순한 행위가 어떻게 체계적인 변화를 일으키는지 보여줍니다. 편향은 양방향으로 작용합니다. AI는 자신의 것이라고 믿는 것에 대해서는 점수를 높이고, 타인의 것이라고 믿는 것에 대해서는 점수를 낮춥니다. 이는 실제 품질이나 출처와 관계없이 발생합니다. 이 연구는 명확한 사실이 없는 상황에서 AI가 판단을 내리기 위해 이러한 외부적 단서에 크게 의존한다는 것을 보여줍니다. 이는 이전 연구에서 나타난 자기 선호가 자신의 출력물에 대한 진정한 애정 때문이라기보다, 저자 라벨에 대한 민감성 때문일 수 있음을 시사합니다.
이 발견의 함의는 우리가 AI 시스템을 구축하고 신뢰하는 방식에 있어 매우 중요합니다. 이는 자동화된 평가의 신뢰성이 작업의 저자를 나타내는 것과 같은 단순한 메타데이터에 의해 쉽게 훼손될 수 있음을 드러냅니다. 만약 AI 심사역이 라벨에 의해 마음을 바꾸어 이야기의 품질을 다르게 평가할 수 있다면, 그가 내놓는 점수는 작업물 자체보다 라벨을 반영할 가능성이 큽니다. 연구진은 진정한 성능 측정을 위해서는 표면적인 단서들을 통제하는 평가 과제를 설계해야 한다고 결론지었습니다. 정답(ground truth)을 알 수 없고 스타일이 중립적인 개방형 과제를 사용함으로써, 우리는 이러한 시스템이 실제로 어떻게 생각하는지 더 잘 이해할 수 있습니다. 이 연구는 AI 편향 문제를 해결했다고 주장하는 것이 아니라, 편향이 어디에서 오는지에 대한 명확한 지도를 제공하며, '자아'와 '타자' 사이의 경계가 판단의 저울을 양방향으로 기울게 만드는 강력한 레버임을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.