← 최신 논문
💬 NLP

Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence

이 논문은 판사 역할을 하는 대규모 언어 모델이 컨텍스트 메타데이터에 포함된 이전 점수에 의해 유의미하게 편향되며, 이는 Chain-of-Thought나 경고와 같은 완화 시도에도 불구하고 지속되는 체계적인 평점 변화와 결정 오류를 야기함으로써 LLM-as-a-Judge 시스템의 평가 독립성 가설에 도전한다는 것을 입증한다.

원저자: Ante Kapetanovic, Kemal Altwlkany, Andro Mercep, Tomislav Duricic, Emanuel Lacic

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ante Kapetanovic, Kemal Altwlkany, Andro Mercep, Tomislav Duricic, Emanuel Lacic

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 디지털 환경에서 인공지능은 단순히 질문에 답하는 도구에서 다른 시스템의 품질을 심사하는 시스템으로 진화했습니다. "판사로서의 AI(AI as a judge)"라고 불리는 이 새로운 역할은 에세이를 채점하고, 코드를 검토하며, 인간 독자에게 도달하기 전 콘텐츠를 필터링하는 데 점점 더 많이 사용되고 있습니다. 이러한 관행의 이면에 깔린 가정은 AI 판사가 각 작업물을 그 자체의 가치로 평가하며, 모든 제출물을 새로운 시작으로 대한다는 것입니다. 그러나 인간 심리학에서는 한 사람이 이전에 보았던 숫자, 설령 그 숫자가 무작위이거나 무관한 숫자일지라도 그 사람의 추정치나 결정이 그 숫자에 미묘하게 끌려가는 '앵커링(anchoring, 정박)' 현상을 오랫동안 관찰해 왔습니다. 연구자들은 수십 년 동안 법정 선고부터 가격 협상에 이르기까지 사람들에게서 이 현상을 관찰해 왔습니다. 디지털 시대의 결정적인 질문은 우리가 공정하다고 믿는 기계 내부에도 이러한 인간과 유사한 편향이 존재하는가 하는 점입니다. 만약 AI 판사가 배경에서 보이는 이전 점수에 영향을 받는다면, 자동화된 평가 시스템 전체가 체계적으로 왜곡되어 불공정한 거절이나 승리로 이어질 수 있습니다.

Infobip의 연구팀은 이 가정을 직접 테스트하기 위해 실험을 설계했습니다. 그들은 AI 판사에게 이전 판사의 점수를 보여주었을 때, 비록 그 이전 점수가 현재의 작업물과 전혀 관련이 없더라도 AI의 점수가 변하는지 확인하고자 했습니다. 연구진은 거대하고 강력한 시스템부터 작고 효율적인 시스템에 이르기까지 8가지의 서로 다른 대규모 언어 모델을 모았고, 이들에게 20가지의 서로 다른 텍스트를 채점하도록 요청했습니다. 이 텍스트들은 기사 요약, 컴퓨터 코드 리뷰, 창의적 이야기 쓰기, 사실적 질문 답변라는 네 가지 뚜렷한 영역을 다루었습니다. 연구진은 AI 판사를 위해 세 가지 시나리오를 만들었습니다. 첫 번째 시나리오에서 판사는 과업과 텍스트만을 보았습니다. 두 번째 시나리오에서 판사는 해당 텍스트가 수정본이라는 메모와 함께 텍스트를 보았습니다. 세 번째 시나리오에서 판사는 텍스트와 함께 이전 시도의 특정 숫자를 나타내는 "이전 점수"가 포함된 메모를 보았습니다. 결정적으로, 이 이전 점수들은 항상 합격 기준보다 낮은 무작위로 생성된 숫자였으며, 이는 실제 텍스트의 품질과는 무관하고 정보 가치가 없도록 설계되었습니다.

결과는 테스트된 대부분의 모델에서 명확하고 일관적이었습니다. AI 판사들에게 무작위 이전 점수를 보여주었을 때, 그들의 채점은 눈에 띄게 하락했습니다. 텍스트를 독립적인 작업물로 취급하는 대신, 모델들은 그 낮은 숫자에 자신의 판단을 고정(anchor)시키는 것처럼 보였습니다. 연구에서 8개 모델 중 7개가 이전 점수가 존재할 때 통계적으로 유의미한 점수 하락을 보였습니다. 이 효과는 단순한 미세한 변동이 아니었습니다. 일부 모델의 경우, 그 변화는 평가 결과를 바꿀 정도로 컸습니다. 예를 들어, 테스트된 가장 강력한 모델 중 하나에서는 이전 점수의 존재로 인해 텍스트의 승인율이 거의 22%포인트 하락했습니다. 이는 양질의 콘텐츠로 승인되었을 내용이 단지 배경에 낮은 숫자가 보였다는 이유만으로 갑자기 거절되었음을 의미합니다. 연구진은 이러한 편향이 모든 유형의 과업에 걸쳐 균일하지 않다는 것을 발견했습니다. 이 편향은 창의적 글쓰기와 사실적 질문에서 가장 강하게 나타났으며, 코드 리뷰에서는 더 약하고 불규칙한 반응을 보였습니다.

기계 내부에서 이것이 어떻게 일어나는지 이해하기 위해, 연구진은 모델들이 점수를 생성할 때 고려하는 특정 단어들을 살펴보았습니다. 그들은 점진적인 슬라이드라기보다는 스위치가 켜지는 것과 같은 패턴을 발견했습니다. 이전 점수가 도입되었을 때, 높은 점수를 선택할 모델의 확률은 급격히 떨어졌고, 낮은 점수를 선택할 확률은 급증했습니다. 그러나 그 이전 점수의 구체적인 값을 바꾸는 것은 큰 영향을 미치지 않는 것으로 보였습니다. 즉, 숫자의 존재 자체가 변화를 유발했습니다. 이는 모델들이 새로운 평균을 신중하게 계산하는 것이 아니라, 메타데이터의 존재 자체에 반응하고 있음을 시사합니다. 연구진은 간단한 지시사항이 문제를 해결할 수 있는지도 테스트했습니다. 그들은 모델에게 채점하기 전에 단계별로 생각하라고 요청하기도 했고, 이전 점수를 무시하라고 명시적으로 경고하기도 했습니다. 두 전략 모두 효과가 없었습니다. 실제로 어떤 경우에는 단계별 지시가 편향을 더 악화시켰으며, 명시적인 경고는 모델이 이미 편향되어 있는 상태에서 특정 숫자를 따르는 경향은 줄여주었을지언정 점수가 떨어지는 것을 막지는 못했습니다.

연구는 이 편향이 추상적인 숫자를 넘어 실제 의사 결정에 영향을 미치는지 확인하기 위해 더 나아갔습니다. 이미 인간에 의해 안전하거나 금지된 것으로 라벨링된 메시징 캠페인 데이터셋을 사용하여, 연구진은 AI 판사에게 잘못된 이전 라벨이 주어졌을 때 어떻게 수행되는지 테스트했습니다. AI에게 잘못된 이전 라벨이 주어졌을 때, AI는 원래라면 오류를 바로잡았을 상황의 거의 절반에 달하는 사례에서 오류를 수정하는 데 실패했습니다. 대신, AI는 메타데이터에 제공된 잘못된 라벨을 그대로 유지하는 경우가 많았습니다. 이전에 정답을 맞혔던 쌍체 테스트에서, 잘못된 이전 라벨의 도입은 AI가 올바른 판단을 잘못된 것으로 뒤집게 만드는 경우가 10%가 넘었습니다. 이는 편향이 단순한 점수 산정을 넘어 콘텐츠의 허용 여부를 결정하는 범주적 결정까지 확장됨을 보여줍니다. 연구진은 이 편향을 방지하는 유일한 신뢰할 수 있는 방법은 프롬프트에서 관련 없는 메타데이터를 완전히 제거하는 것이라고 결론지었습니다. 그들은 어떤 프이팅이나 경고도 이전 정보가 존재할 때 판사의 독립성을 완전히 회복시킬 수 없다는 것을 발견했습니다.

이 연구 결과의 함의는 AI를 공정한 평가에 의존하는 모든 이들에게 매우 중요합니다. 이 연구는 자동화된 시스템의 공정성에 대한 가정이 얼마나 취약한지를 보여줍니다. 제공된 정보가 명백히 무관할지라도, 모델은 맥락의 영향으로부터 자유롭지 못합니다. 이 편향은 단순한 명령어로 쉽게 패치할 수 있는 버그가 아니라, 시스템이 정보를 처리하는 방식의 근본적인 부분인 것으로 보입니다. 연구진은 이번 테스트가 특정 모델과 과업을 대상으로 했지만, 결과는 더 넓은 취약성을 시사한다고 강조했습니다. 신뢰할 수 있는 시스템을 구축하려면 개발자는 AI가 작동하는 맥락을 신중하게 설계해야 하며, 이전 단계의 불필요한 숫자나 라벨이 현재의 평가로 새어 들어가지 않도록 해야 합니다. 앞으로 나아갈 길은 기계가 스스로 세상을 명확하게 보고 있다고 막연히 믿는 것이 아니라, 모든 특정 모델과 과업에 대해 능동적인 검증을 수행하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →