How Closely Do LLM Reviews Align with Human Peer Review?
본 연구는 ICLR 2026 제출 논문에 대한 인간 동료 검토를 대상으로 세 가지 주요 대규모 언어 모델을 평가하였으며, LLM이 합격 논문과 탈락 논문을 포괄적으로 구분할 수는 있으나 구두 발표와 포스터 발표 간의 인간적 구분을 재현하는 데 실패하고, 제공자별 점수 편향 및 약점을 식별하는 데 있어 주제적 차이를 보인다는 점을 발견하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
모든 새로운 과학적 아이디어가 세상에 공유되기 전 반드시 문지기를 통과해야 하는 세상을 상상해 보십시오. 수십 년 동안 이 문지기는 인간 전문가, 즉 동료 심사자(peer reviewer)였습니다. 그들은 논문을 읽고, 강점과 약점을 숙고한 뒤 점수를 매깁니다. 이는 마치 재능 경연 대회의 심사위원이 노래 대신 복잡한 수학과 컴퓨터 코드를 심사하는 것과 비슷합니다. 최근, 이 경기장에 새로운 유형의 심사위원이 등장했습니다. 바로 인공지능, 구체적으로는 거대 언어 모델(LLM)입니다. 이들은 방대한 양의 텍스트를 학습하여 논문을 읽고 인간처럼 리뷰를 작성할 수 있는 매우 똑똑한 컴퓨터 프로그램입니다. 하지만 여기서 중요한 질문이 생깁. 이 AI 심사위원들이 실제로 인간 심사위원처럼 '생각'하는 것일까요, 아니면 그저 단어를 흉내 내는 것일까요? 만약 AI가 어떤 논문에 대해 "좋다"라고 말한다면, 그것은 인간이 "좋다"라고 말할 때와 같은 의미일까요? 이것이 바로 과학자들이 풀고자 하는 미스터리입니다. 왜냐하면 우리가 어떤 과학 논문이 출판될지를 결정하는 데 AI를 사용하기 시작한다면, AI가 자신들을 대체하는 인간들과 동일한 규칙을 따르고 있는지 알아야 하기 때문입니다.
이 논문은 연구자들이 "리뷰 대결"을 설정한 거대하고 통제된 실험과 같습니다. 연구진은 주요 컴퓨터 과학 컨퍼런스(ICLR 2026)에서 가져온 300편의 실제 과학 논문을 가지고 OpenAI의 GPT-5.4, Google의 Gemini 3.1 Pro, Anthropic의 Claude Opus 4.6라는 세 가지 서로 다른 AI 모델에게 리뷰를 요청했습니다. 공정한 대결을 위해, 연구진은 각 "구두 발표(oral)" 논문(최상위 수준의 주목받는 논문)에 대해 그와 유사한 수준의 "포스터(poster)" 논문(우수하지만 최상위는 아닌 논문)과 "탈락(rejected)" 논문을 매칭했습니다. 그런 다음 AI 리뷰를 실제 인간의 리뷰 및 컨퍼퍼런스의 최종 결정과 비교했습니다.
결과는 "나쁘지 않음"과 "매우 다름"이 섞여 있었습니다. 먼저 좋은 소식은, 세 가지 AI 모델 모두 논문이 채택되었는지 혹은 탈락했는지를 구분할 만큼 충분히 똑똑했다는 점입니다. 그들은 숲을 볼 줄 알았습니다. 하지만 그들은 나무를 보는 데는 완전히 실패했습니다. 인간 심사위원들은 "구두 발표" 논문과 "포스터" 논문에 대해 뚜렷하게 다른 점수를 부여하며 (구두 발표 논문이 약간 더 뛰어나다는 점을 인식하며) 차이를 두었지만, AI 모델들은 이 둘을 똑같이 취급했습니다. 그들은 "좋은" 논문과 "훌륭한" 논문의 차이를 구분하지 못했습니다.
나아가 AI 모델들은 단순히 점수만 다르게 매긴 것이 아니라, 저마다의 독특한 개성도 가지고 있었습니다. Google의 Gemini는 그룹 내의 "착한 친구" 같아서, 인간이 탈락시킨 논문에도 높은 점수를 주는 등 체계적으로 높은 점수를 부여했습니다. 반면 OpenAI와 Claude는 특히 최상위 수준인 구두 발표 논문에 대해서는 인간보다 더 엄격한 "독설가" 같았습니다.
마지막으로, 연구진은 심사위원들이 '무엇'에 대해 불만을 제기하는지 살펴보았습니다. 인간과 AI는 "실험이 취약하다"거나 "글쓰기가 불분명하다"와 같은 큰 그림에서는 의견이 일치했습니다. 하지만 세부적인 사항에 있어서는 우선순위가 달랐습니다. AI 모델들은 다른 방법론(베이스라인)과의 비교가 누락된 것에 집착한 반면, 인간 심사위원들은 해당 연구에 얼마나 많은 컴퓨터 자원과 비용이 들지에 대해 훨씬 더 걱정했습니다.
요약하자면, 이 논문은 AI가 명백한 실수를 잡아내는 보조적인 눈으로서 도움이 될 수는 있지만, 인간 심사위자를 대체할 준비는 되어 있지 않음을 시사합니다. AI는 논문이 "통과"인지 "낙제"인지는 말해줄 수 있지만, 논문을 진정으로 탁월하게 만드는 미묘한 차이를 이해하는 데는 어려움을 겪으며, 인간과는 다른 것을 중요하게 여깁니다. AI의 점수를 인간의 점수와 정확히 동일하게 취급하는 것은, 로봇이 탄 과자가 구운 것인지 신선한 것인지는 구별할 수 있지만 "미식(gourmet)"의 맛이 무엇인지는 전혀 모르는 상태에서 요리 경연 대회를 심사하도록 신뢰하는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.