← 최신 논문
🤖 machine learning

Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards

이 논문은 아이템 수준에서 전문가와 크라우드 어노테이터 간의 상당한 불일치가 작은 리더보드 규모에 의해 가려져 있으며, 이는 모델의 수가 증가함에 따라 일반화되지 못하는 모델 순위의 잘못된 안정성을 형성한다는 점을 밝히고 있다.

원저자: Anik Jha

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anik Jha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

더 똑똑한 인공지능을 구축하기 위한 경쟁 속에서, 연구자들은 단순하지만 강력한 아이디어에 의존하고 있다. 그것은 바로 기계가 나아지고 있는지 알기 위해서는 인간에게 그 결과물을 판단하도록 요청해야 한다는 것이다. '선호도 벤치마크(preference benchmark)'라고 알려진 이 과정은 인간에게 두 가지 서로 다른 AI 답변을 보여주고 어느 것이 더 나은지 묻는 과정을 포함한다. 이러한 인간의 투표를 수집한 결과물은 모든 새로운 모델을 측정하는 신뢰할 수 있는 기준점인 '골드 스탠더드(gold standard)'가 된다. 수년 동안 이 분야는 어떤 인간을 심판으로 고용하느냐는 것은 중요하지 않다는 조용한 가정을 바탕으로 운영되어 왔다. 지배적인 믿음은 개별적인 사람들은 무작위적인 실수를 할 수 있지만, 집단 전체는 무엇이 좋은 답변을 만드는지에 대한 단일하고 안정적인 진실을 측정하는 신뢰할 수 있는 도구라는 것이다. 만약 이 가정이 성립한다면, 심판의 구체적인 정체성은 점수를 기록하는 데 사용된 펜의 브랜드처럼 사소한 세부 사항에 불과할 것이다.

하지만 새로운 조사 결과는 이 세부 사항이 사실 방정식에서 가장 중요한 부분임을 시사한다. 연구진은 동일한 AI 비교 세트를 두 그룹의 서로 다른 사람들을 사용하여 두 번 실행함으로써, 인간 심판의 선택이 정말로 중요한지를 테스트하고자 했다. 한 그룹은 온라인 작업에 수천 명씩 고용되는 일반적인 크라우드워커(crowdworkers)들로 구성되었다. 다른 그룹은 해당 분야의 전문 지식을 갖춘 선별된 도메인 전문가들로 구성되었다. 연구진은 수천 개의 AI 비교 데이터셋을 가져와 두 그룹 모두에게 승자를 투표하게 했다. 그들은 두 그룹이 이 분야에서 가정했던 것만큼 서로 의견이 일치하지 않는다는 것을 발견했다. 거의 4개 중 1개의 항목에서 두 그룹은 서로 다른 다수 승자를 선택했다. 거의 10개 중 1개의 사례에서는 크라우드워커와 전문가가 정반대의 승자를 선택하여, 한 그룹의 패자를 다른 그룹의 챔피언으로 선언하기도 했다.

이러한 개별 항목 수준에서의 거대한 불일정에도 불구하고, 최종 결과는 기만적일 정도로 안정적으로 보였다. 연구진이 이 상충하는 투표들을 사용하여 연구 대상인 6개의 AI 모델의 순위를 매겼을 때, 어떤 그룹의 인간이 심판을 맡았는지와 관계없이 최종 리더보드는 동일했다. 모델들의 순서는 전혀 변하지 않았다. 이는 혼란스러운 그림을 만들어냈다. 심판들은 서로 다른 답을 외치고 있었지만, 점수판은 침묵하고 있었다. 연구진은 이러한 안정성이 견고한 시스템의 징후가 아니라, 비교되는 모델의 수가 적기 때문에 발생한 운 좋은 우연이라는 것을 깨달았다. 모델들이 성능 면에서 서로 멀리 떨어져 있었기 때문에, 심판의 변화로 인한 작은 투표 변화는 한 모델이 다른 모델을 추월할 만큼 충분하지 않았던 것이다.

이 안정성이 얼마나 취약한지 테스트하기 위해, 연구진은 실제 경쟁에서 흔히 볼 수 있는 수십 개의 모델을 포함하는 더 큰 리더보드가 있다면 어떻게 될지를 확인하기 위해 시뮬레이션을 실행했다. 결과는 극명했다. 6개의 모델로 구성된 리더보드는 변하지 않았지만, 10개의 모델이 있는 리더보드에서는 86%의 경우에서 모델 하나가 밀려났다. 20개의 모델이 있을 때는 순위가 뒤바뀔 확률이 거의 100%에 달했다. 연구는 현재의 작은 규모의 리더보드를 보고하는 방식이 모델의 수가 적고 드문드문 존재하기 때문에 안전한 것이라고 결론지었다. 만약 이 분야가 더 현실적인 규모의 더 많은 모델을 공개한다면, 인간 심판의 선택이 즉각적으로 순위를 뒤흔들 것이다. '골드 스탠더드'는 고정된 진리가 아니라, 누가 측정 테이프를 잡기 위해 고용되었느냐에 따라 변하는 움직이는 표적이다.

조사는 인간 심판에서 멈추지 않았다. 연구진은 순위를 자동화하기 위해 점점 더 많이 사용되고 있는 인공지능 심판들이 인간 그룹 간의 불일치를 어떻게 처리하는지도 조사했다. 그들은 세 가지 서로 다른 AI 심판(다양한 회사의 모델 포함)을 테스트하여, 어떤 그룹의 인간과 더 많이 일치하는지 확인했다. 모든 AI 심판은 전문가보다는 크라우드워커의 선호도에 현저히 더 일치했다. 이는 AI 심판이 크라우드 소싱된 노동자들과 유사한 데이터를 통해 학습되었기 때문에, 크라우드의 선호를 모방하도록 학습되었음을 시사한다. 연구진은 AI 심판이 인간과 일치하는 정도가 단순히 그 지능의 척도가 아니라, 수년 전 학습 데이터를 수집할 때 내려진 고용 결정의 반영이라는 것을 발견했다.

연구는 또한 이러한 AI 심판들이 제시되는 방식(prompting)이 인간 심판의 선택보다 그들의 생각을 더 많이 바꿀 수 있다는 점을 밝혀냈다. 연구진이 답변이 제시되는 순서를 변경했을 때, AI 심판들은 거의 절반에 가까운 항목(한 모델의 경우 44.6%)에서 결정을 뒤집었다. 더욱이, 다른 모든 조건은 고정한 채 출력 형식(JSON 객체를 요청하는 것과 순수 토큰만을 요청하는 것)만 변경했을 때, 동일한 심판이 자신과 일치하는 비율은 47.2%에 불과했으며, 이는 한 방향으로의 체계적인 이동을 보여주었다. 이러한 제시 순서와 형식에 대한 민감도는 인간의 의견 차이보다 훨씬 더 큰 오류의 원인이다. 연구진은 이 분야 전체가 이러한 결과를 보고하는 방식을 바꿔야 한다고 주장한다. 모델이 인간과 특정 퍼센트만큼 일치한다고 단순히 언급하는 것은 어떤 인간이 사용되었는지를 명시하지 않는다면 불완전하다. 현재 순위의 안전함은 작은 표본 크기가 만들어낸 환상이며, 미래 순위의 신뢰성은 주석 작성자의 선택이 사소한 세부 사항이 아니라 결과를 형성하는 근본적인 변수임을 인정하는 데 달려 있다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →