← 최신 논문
💻 computer science

Reviewer Scores Are Not Comparable Across Research Areas in ML Peer Review

본 포지션 페이퍼는 5만 편 이상의 논문에 대한 분석을 통해 리뷰어의 점수가 연구 분야 간에 근본적으로 비교 불가능하며, 이로 인해 동일한 점수임에도 주제에 따라 합격 확률이 최대 8배까지 차이 난다는 점을 입증함으로써, 머신러닝 컨퍼런스의 합격 결과가 개인적 편향보다는 측정 설계의 실패에 의해 결정된다고 주장한다.

원저자: Binyan Xu, Fan Yang, Xilin Dai, Kehuan Zhang

게시일 2026-07-31
📖 5 분 읽기🧠 심층 분석

원저자: Binyan Xu, Fan Yang, Xilin Dai, Kehuan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 스코어카드 미스터리

수천 명의 천재적인 학생들이 매년 수많은 프로젝트를 제출하는 거대한 글로벌 과학 박람회를 상상해 보세요. 결선 무대에 오를 주인공을 결정하기 위해, 심사위원단은 각 프로젝트에 1점에서 10점 사이의 단순한 숫자 점수를 부여합니다. 박람회의 규칙은 단순하고 공정해야 합니다. 즉, 7점이라는 점수는 프로젝트가 무엇이든 상관없이 "훌륭한 작업"을 의미해야 합니다. 춤추는 로봇을 만들었든, 날씨를 예측하는 프로그램을 개발했든, 혹은 컴퓨터가 글을 읽는 법을 가르치는 새로운 방법을 고안했든, 7점은 동일한 의미를 지녀야 합니다.

하지만 만약 "로보틱스" 섹션의 심사위원들은 매우 엄격해서 완벽한 로봇에게만 7점을 주고, "기상" 섹션의 심사위원들은 매우 흥분해서 구름처럼 보이는 것에는 거의 무엇이든 7점을 준다면 어떻게 될까요? 만약 당신이 어떤 섹션의 프로젝트인지 모른다면, 그 단 하나의 숫자는 혼란스러워집니다. 어떤 분야에서의 7점은 황금 티켓이 될 수도 있지만, 다른 분야에서의 7점은 정중한 거절이 될 수도 있습니다. 이것이 바로 머신러닝 분야의 연구자들이 해결하려고 노력 중인 퍼즐입니다. 그들은 컴퓨터가 패턴을 인식하고, 결정을 내리고, 문제를 해결하는 방식을 배우는 과정을 연구하며, 다음과 같은 두려운 질문을 던지고 있습니다. "우리가 이 논문들을 평가하는 데 사용하는 '점수'가 정말 공정한가, 아니면 전적으로 어느 클럽에 속해 있느냐에 따라 달라지는가?"

논문의 핵심 발견: 스코어카드는 고장 났다

연구팀이 작성한 이 논문은 주요 머신러닝 컨퍼런스인 ICLR의 데이터를 심층 분석했습니다. 그들은 2021년부터 2026년 사이에 제출된 50,000편 이상의 논문을 검토하며, "점수"가 정말 모든 사람에게 동일한 의미를 갖는지 확인했습니다. 그들의 결론은 놀랍습니다. 점수는 서로 비교할 수 없습니다.

이것은 마치 서로 다른 레벨에서 플레이하는 게임 속 플레이어들이 서로 다른 컨트롤러를 사용하는 것과 같습니다. "트렌디한" 레벨(AI와 같은 핫한 주제)에서는 컨트롤러가 매우 민감합니다. 살짝만 건드려도 높은 점수를 얻습니다. 반면 "올드 스쿨" 레벨(오래되고 확립된 주제)에서는 컨트롤러가 뻣뻣하고 누르기 어렵습니다. 만약 당신이 "트렌디한" 레벨에서 5.0점을 받았다면, 당신은 슈퍼스타일 수 있습니다. 하지만 "올드 스쿨" 레벨에서 5.0점을 받았다면, 당신은 고전하고 있는 것일 수 있습니다. 논문은 동일한 점수를 받았을 때, 주제에 따라 논문이 채택될 확률이 최대 8배까지 차이가 난다는 사실을 발견했습니다.

예를 들어, "사고(reasoning)"에 관한 논문은 5.0점을 받았을 때 채택 확률이 52.6%였습니다. 그러나 정확히 똑같은 5.0점을 받은 "이미지 인식"이나 "적대적 공격(adversarial attacks)"에 관한 논문의 채택 확률은 6.6%에 불과했습니다. 무려 8배의 차이입니다! 연구자들은 이를 "측정 설계의 실패(measurement design failure)"라고 부릅니다. 이는 리뷰어가 못됐거나 에리어 체어(Area Chair)가 편향되어서가 아니라, 근본적으로 다른 것들을 측정하는 데 하나의 자(ruler)를 사용하려 했기 때문에 시스템 자체가 고장 났다는 것을 의미합니다.

이것이 아닌 것들 (레드 헤링 - 혼동을 주는 요소들)

저자들은 이 격차의 다른 원인들을 배제하기 위해 매우 신중했습니다. 그들은 "트렌디한" 주제들이 단순히 품질이 더 좋아서 그런 것인가? 라고 물었습니다. 답은 아니오였습니다. 만약 그렇다면, 핫한 주제의 채택된 논문들이 더 높은 점수를 받아야 합니다. 하지만 데이터는 정반대의 결과를 보여줍니다. 핫한 주제들은 더 낮은 점수의 논문들을 채택하고 있습니다.

그들은 또한 "올드 스쿨" 주제들에 매우 전문적인 리뷰어들이 있어서 더 까다로운 것은 아닌지도 확인했습니다. 데이터는 다시 한번 아니오라고 말합니다. 까다로운 분야의 리뷰어들은 실제로 더 자신감이 있거나 전문가였던 것이 아니라, 다른 이들만큼이나 열정적이었습니다.

마지막으로, 혹시 "트렌디한" 주제들이 제출물이 너무 많아서(품질 희석 현상) 낮은 품질의 작업들을 받아들이는 것은 아닌지 의문을 가졌습니다. 데이터는 주제의 성장 속도와 품질 저하 사이에 아무런 연관성이 없음을 보여주었습니다. 실제로 일부 빠르게 성장하는 주제들은 채택률을 일정하게 유지한 반면, 다른 주제들은 급락하기도 했습니다.

진짜 범인: "하이프 사이클(Hype Cycle)"과 "패치(Patch)"

그렇다면 왜 이런 일이 발생하는 걸까요? 논문은 이것이 구조적인 문제라고 주장합니다. 어떤 주제가 "핫"할 때(새롭고 흥미로운 트렌드처럼), 그 주제는 열정적이고 아마도 조금 관대한 수많은 신입 주니어 리뷰어들을 끌어들입니다. 반면 어떤 주제가 "성숙"할 때(오래되고 확립된 분야처럼), 그 주제는 더 비판적인 시니어 전문가들을 끌어들입니다. 시스템은 누가 점수를 주는지 알지 못하기 때문에, 열정적인 주니어가 준 "6점"과 까칠한 시니어가 준 "6점"을 동일하게 취급합니다.

이를 해결하기 위해, 에리어 체어(최종 합격 여부를 결정하는 사람들)는 추측을 해야 합니다. 그들은 자신의 "커뮤니티 사전 지식(community priors)", 즉 특정 주제에서 논문이 통과되기가 얼마나 어려운지에 대한 직관을 사용합니다. 그들은 본질적으로 고장 난 시스템을 자신의 직관으로 "패치(patch)"하고 있는 셈입니다. 이는 경계선에 놓인 "경계선(borderline)" 논문의 경우, 그 운명이 작업의 질에 의해 결정되는 것이 아니라 그 주제가 현재 "유행"인지에 따라 결정된다는 것을 의미합니다.

우리는 무엇을 해야 하는가?

이 논문은 단순히 문제점을 지적하는 데 그치지 않고, 시스템 전체를 완전히 재구축할 필요 없이 해결할 수 있는 3단계 계획을 제시합니다.

  1. 투명성 확보: 컨퍼런스 운영진은 점수별 채택률을 주제별로 분류하여 보고서를 공개해야 합니다. 만약 어떤 논문이 5.0점을 받는다면, 누구나 다음과 같이 볼 수 있어야 합니다: "아, 주제 A에서의 5.0점은 50%의 확률로 채택되지만, 주제 B에서의 5.0점은 6%의 확률로 채택되는구나." 이렇게 하면 숨겨진 편향을 가시화할 수 있습니다.
  2. 맞춤형 규칙 제정: 모든 것에 적용되는 일반적인 "1~10점" 척도를 사용하는 대신, 각 연구 커뮤니티는 무엇이 좋은 논문인지에 대한 구체적인 체크리스트(루브릭)를 작성해야 합니다. 좋은 이론 논문은 좋은 엔지니어링 논문과 모습이 다르며, 규칙 또한 이를 반영해야 합니다.
  3. 더 나은 신호 사용: 논문은 "보정된 신호(calibrated signals)"를 사용할 것을 제안합니다. 예를 들어, 단순히 원시 숫자만 보는 대신, 리뷰어의 이력(평소에 높은 점수를 주는지, 낮은 점수를 주는지)을 바탕으로 점수를 조정할 수 있습니다. 또한 저자가 여러 편의 논문을 제출할 경우 자신의 논문 순위를 매기게 함으로써, 시스템이 원시 숫자보다 상대적인 품질을 더 잘 이해하도록 돕는 것을 제안합니다.

결론

논문은 현재의 시스템이 마치 서로 다른 레인에서 달리는 러너들이 서로 다른 지면 위에서 달리고 있음에도 불구하고, 모두가 동일한 스톱워치로 측정받는 경주와 같다고 결론짓습니다. "핫한" 레인의 러너들은 더 빨라서가 아니라 트랙이 더 쉽기 때문에 앞서 나가고 있습니다. 저자들은 트랙을 고치고 모든 레인에서 점수 측정이 공정해지기 전까지는, 최고의 논문이라 할지라도 단지 현재 "멋진(cool)" 주제를 다루고 있지 않다는 이유만으로 탈락할 수 있다고 주장합니다. 해결책은 심사위원을 비난하는 것이 아니라, 우리가 사용하는 자가 용도에 맞지 않는 크기임을 인정하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →