← 최신 논문
💬 NLP

The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity

이 논문은 개방형 LLM의 순응이 수정 품질을 저하시키는 동료의 영향에 의해 유발된다는 점을 입증하는 동시에, 평가자의 판단이 비중립적이며 측정 타당성을 확보하기 위해 명시적인 앵커 보정이 필요함을 보여주는 새로운 실험 프로토콜을 소개한다.

원저자: Alicia Guerra, Yibo Hu

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alicia Guerra, Yibo Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 스스로 생각하고, 대화하며, 심지어 서로 논쟁하는 법을 배우고 있는 세상을 상상해 보십시오. 이것은 인공지능, 구체적으로는 인간이 쓴 거의 모든 것을 학습한 초강력 디지털 뇌와 같은 거대 언어 모델(LLM)의 영역입니다. 하지만 여기서 까다로운 점이 있습니다. 이 디지털 뇌들은 단순히 고립된 천재가 아닙니다. 그들은 종-종 하나의 AI가 답을 제안하면, 다른 AI가 이를 비판하고, 세 번째 AI가 이를 수정하려고 시도하는 '멀티 에이전트 시스템'이라는 팀 단위로 일합니다. 과학자들이 던지는 큰 질문은 이것입니다. 이 AI 친구들이 서로 의견이 다를 때 어떤 일이 벌어질까요? 그들은 진실을 고수할까요, 아니면 파티장의 십 대들처럼 무리에 맞추기 위해 마음을 바꾸는 것처럼 군중에 의해 휘둘리게 될까요? 이 현상을 '동조(conformity)'라고 부릅니다. 우리는 인간이 주변의 압박에 쉽게 영향을 받을 수 있다는 것을 알고 있지만, 우리의 디지털 창조물들도 그러한지를 알아야 합니다. 만약 AI가 '친구들'이 그렇다고 말한다는 이유만으로 틀린 생각을 믿도록 속을 수 있다면, 이는 의료 조언부터 법적 판단에 이르기까지 모든 분야에서 심각한 실수로 이어질 수 있습니다.

당신이 읽게 될 이 논문은 바로 이 문제에 대해 깊이 파고들지만, 한 가지 반전이 있습니다. 바로 답안을 채점하는 사람(또는 컴퓨터)을 단순한 중립적 심판이 아니라 실험의 일부로 취급한다는 것입니다. 연구자 알리시아 게라(Alicia Guerra)와 이보 후(Yibo Hu)는 네 가지 서로 다른 AI '생성기'(답을 만드는 존재)가 '동료'(다른 AI의 답)들이 모두 정답이거나, 모두 오답이거나, 혹은 혼합된 상황을 마주했을 때 어떻게 반응하는지 보기 위해 거대한 디지털 놀이터를 구축했습니다. 그들은 AI가 완전히 틀린 정보를 주는 동료들에게 둘로 둘러싸여 있을 때, 수정된 답안의 질이 현저히 떨어진다는 것을 발견했습니다. 이는 마치 정답을 알고 있는 학생이 학급 전체가 자신 있게 오답을 외치는 소리를 들은 후, 스스로를 의심하기 시작하여 결국 틀린 답을 적게 되는 것과 같습니다.

하지만 이야기는 더욱 흥ari집니다. 연구자들은 이를 측정하는 것이 단순히 답이 "예"에서 "아니오"로 바뀌었는지 확인하는 것만큼 간단하지 않다는 것을 깨달았습니다. 때로는 답은 그대로 유지되지만, 설명의 '질'이 나빠지거나, 집단에 맞추기 위해 이상하고 미신적인 세부 사항을 추가하기도 합니다. 이를 포착하기 위해 그들은 영리한 트릭을 사용했습니다. 똑같은 답안을 '판사'(또로 다른 AI)에게 두 번 보여준 것입니다. 한 번은 판사가 답안만을 보았고(맹검), 두 번째는 답안에 동료 그룹의 의견을 더해서 보았습니다(정보 제공). 그 결과, 판사들은 결코 중립적인 로봇이 아니라는 사실을 발견했습니다! 어떤 AI가 판사를 맡느냐에 따라, 동료의 의견을 보는 것이 동일한 답안을 다르게 평가하게 만들었습니다. 어떤 판사들은 군중의 의견에 더 동조하게 되었고, 어떤 판사들은 더 회의적이 되었습니다. 결국, AI의 세계에서는 시험을 채점하는 사람 또한 학생만큼이나 군중의 영향을 받는다는 것이 밝혀졌습니다.

연구자들은 또한 자신의 '자(ruler)'를 주의 깊게 점검하지 않으면 실험 전체가 무너질 수 있다는 점도 발견했습니다. 그들은 답안이 얼마나 좋은지를 설정하기 위해 '앵커(anchor)'—완벽하게 옳은 예시와 완벽하게 틀린 예시—를 사용했습니다. 그들은 만약 판사들이 이 앵커들을 신뢰성 있게 구별하지 못한다면, 전체 측정 시스템이 흔들리게 된다는 것을 발견했습니다. 요컨대, 이 논문은 AI의 동조를 측정하는 것이 두 부분으로 이루어진 문제임을 증명합니다. 즉, 답을 만드는 AI는 틀린 동료들에게 둘러싸일 때 질이 떨어지며, 답을 채점하는 AI는 동일한 동료들의 의견을 봄으로써 편향된다는 것입니다. 이는 디지털 시대에 주변의 압박이 우리뿐만 아니라, 우리를 돕기 위해 만든 기계, 그리고 그 기계들을 판단하기 위해 만든 기계에게도 영향을 미친다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →