Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling
본 논문은 평가자 변이를 모델링하고 통계적 유의성을 위해 필요한 항목 수와 항목당 응답 수 간의 최적 균형을 결정하기 위해 지속적 평가자 식별자를 갖춘 대규모 데이터셋을 활용하는 다단계 부트스트래핑 접근법을 도입함으로써 생성형 AI 평가의 재현성 위기에 대응합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
두 개의 새로운 AI 채팅봇 중 어느 것이 더 "안전"하고 도움이 되는지 판단하려 한다고 상상해 보세요. 당신은 한 무리의 사람들에게 이를 평가해 달라고 요청합니다. 하지만 여기에 문제가 있습니다. 만약 단 세 명의 사람에게 열 가지 다른 대화를 평가하게 한다면, 현실을 반영하지 않는 운 좋은 (또는 불운한) 결과가 나올 수 있습니다. 이것이 이 논문이 다루는 "재현성 위기"입니다. 과학은 충분히 신중하게 측정하지 않기 때문에 일관된 결과를 얻는 데 어려움을 겪고 있습니다.
이 논문의 저자들은 모든 인간의 의견을 서로 전혀 관련이 없는 다른 사람으로부터 나온 것처럼 취급하는 것이 큰 실수라고 주장합니다. 현실에서는 같은 사람이 여러 항목을 평가하는 경우가 많으며, 그들은 자신만의 고유한 "맛"이나 편향을 지니고 있습니다.
다음은 그들의 발견을 간단한 비유로 정리한 것입니다:
1. "맛보기" 문제
두 가지 새로운 아이스크림 맛 (모델 A 와 모델 B) 을 위한 대규모 맛보기를 주최한다고 상상해 보세요.
- 옛날 방식 (대부분의 사람들이 하는 일): 100 명의 서로 다른 사람에게 각자 한 스푼씩 맛보게 합니다. 모든 사람의 의견이 독립적이라고 가정합니다.
- 현실: 많은 연구에서 실제로는 5 명에게 각자 20 스푼씩 맛보게 합니다.
- 문제점: 만약 "밥"이 우유를 싫어하게 되면, 브랜드와 상관없이 모든 우유 맛보기를 낮게 평가할 것입니다. 밥의 20 가지 의견을 20 개의 독립적인 데이터 포인트로 취급한다면, 당신은 엄청난 양의 증거를 가진 것처럼 스스로를 속이게 됩니다. 사실 당신은 밥의 목소리를 20 번 듣는 것에 불과합니다.
이 논문은 동일한 사람들이 여러 항목을 평가한다는 사실을 무시할 때 잘못된 확신을 얻게 된다고 보여줍니다. 당신은 두 AI 모델 사이에 명확한 승자가 있다고 생각하지만, 실제로는 진정한 평균을 얻기 위해 충분히 많은 서로 다른 사람을 물어보지 않은 것뿐입니다.
2. "다단계" 해결책
저자들은 **다단계 부트스트래핑 (Multi-Level Bootstrapping)**이라고 부르는 데이터를 바라보는 새로운 방식을 제안합니다.
- 비유: 단순히 표를 세는 대신, 당신은 "밥"이 항상 낮은 점수를 주는 까다로운 남자라는 것을 알아차린 탐정이라고 상상해 보세요. 최종 점수를 계산할 때 밥의 까다로움을 고려해야 합니다.
- 그들이 한 일: 123 명의 사람이 평가한 350 개의 대화와 같이 누가 무엇을 평가했는지 정확히 알고 있는 실제 데이터 세트를 가져왔습니다. 그들은 컴퓨터 시뮬레이션을 사용하여 데이터를 "재표본 추출"하여 다음과 같이 질문했습니다. "만약 다른 사람들에게 물어봤다면 어떨까? 같은 사람들에게 다시 물어봤다면 어떨까?"
3. 큰 발견: 더 많은 항목이 아닌 더 많은 사람
이 논문은 중요한 질문에 답합니다: 더 적은 항목을 평가할 더 많은 사람을 물어봐야 할까요, 아니면 더 많은 항목을 평가할 더 적은 사람을 물어봐야 할까요?
- 발견: 모든 것을 평가하는 소수의 사람보다 **더 많은 사람 (평가자)**이 더 적은 항목을 평가하는 것이 훨씬 좋습니다.
- 비유: 도시의 평균 키를 추측하려 한다고 상상해 보세요.
- 전략 A: 1 명에게 1,000 개의 서로 다른 건물을 재게 합니다. (이것은 나쁩니다. 그 사람이 근시가 있거나 망가진 줄자를 사용하면 도시 전체의 데이터가 틀리게 됩니다).
- 전략 B: 1,000 명의 서로 다른 사람에게 건물 하나씩을 재게 합니다. (이것이 더 좋습니다. 한 사람이 실수를 하더라도 1,000 명의 평균은 정확할 것입니다).
이 논문은 통계적으로 신뢰할 수 있는 결과 (유의미한 발견) 를 얻기 위해서는 단순히 항목 목록을 늘리는 것이 아니라, 종종 **사람 (K)**의 수를 크게 늘려야 한다고 밝혔습니다. 때로는 항목당 100 명까지 필요할 수도 있습니다.
4. "배치" 효과
연구자들은 또한 데이터가 "배치" (그룹) 로 수집되는 방식을 살펴보았습니다.
- 비유: 교실 전체에 선생님이 한꺼번에 시험지를 나눠주는 상황을 상상해 보세요. 학생들은 서로 수다를 떨며 영향을 주거나, 동시에 모두 피곤할 수 있습니다.
- 발견: 사람들이 그룹 (배치) 으로 항목을 평가할 때, 그들의 의견은 더욱 상관관계를 갖게 됩니다. 이 논문은 이러한 "배치"를 무시하면 실제로 필요한 데이터 양을 과소평가하게 된다고 보여줍니다. 확신을 얻기 위해 500 개의 평가가 필요하다고 생각할 수 있지만, "배치" 효과 때문에 실제로는 2,500 개의 평가가 필요할 수도 있습니다.
5. 결론
이 논문은 현재 항목당 3 명에서 5 명의 평가자만 사용하는 표준이 특히 한 AI 모델이 다른 모델보다 더 안전하다는 것을 증명하려 할 때, 결과를 신뢰하기에 부족한 경우가 많다고 결론지었습니다.
- 권장 사항: AI 가 진정으로 안전하거나 더 나은지 알고 싶다면, 인간 평가자를 interchangeable coin(서로 바꾸어 쓸 수 있는 동전) 처럼 취급하는 것을 멈춰야 합니다. 모든 인간은 고유한 "목소리"를 가지고 있음을 인정해야 합니다. 진정한 답을 얻기 위해서는 비용이 더 들더라도 더 많은 인간을 고용하여 의견을 제시하게 해야 합니다.
간단히 말해: 같은 몇몇 사람에게 천 가지 일을 평가하게 하지 마세요. 천 명의 서로 다른 사람에게 몇 가지 일을 평가하게 하세요. 가짜 통계로 스스로를 속이는 것을 멈추는 유일한 방법입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.