← 최신 논문
💬 NLP

The Authenticity Gap in Human Evaluation

이 논문은 표준적인 자연어 생성(NLG) 인간 평가 프로토콜이 결함이 있는 가정과 리커트 척도(Likert scale)의 한계로 인해 실제 선호도를 포착하는 데 종종 실패한다고 주장하며, 전통적인 방식이 실패하는 지점에서 모델 순위를 성공적으로 복구하는 새로운 "시스템 수준 확률적 평가(SPA)" 방법을 제안한다.

원저자: Kawin Ethayarajh, Dan Jurafsky

게시일 2026-08-19
📖 5 분 읽기🧠 심층 분석

원저자: Kawin Ethayarajh, Dan Jurafsky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터 언어의 세계에서, 기계가 이야기를 쓰고, 질문에 답하며, 대화를 나누도록 학습되는 과정에는 한 가지 지속적인 문제가 존재한다. 바로 우리가 기계가 정말로 일을 잘하고 있는지 어떻게 알 수 있느냐는 것이다. 수년 동안 표준적인 방법은 사람을 고용하여 컴퓨터가 생성한 텍스트를 읽게 하고, 마치 재능 경연 대회의 심사위원처럼 점수를 부여하게 하는 것이었다. 이러한 인간의 평점은 궁극적인 진실이자, 모든 새로운 컴퓨터 프로그램을 측정하는 기준인 '골드 스탠다드(gold standard)'로 취급되어 왔다. 그 논리는 단순해 보인다. 만약 컴퓨터가 쓴 이야기가 사람들에게 높은 점수를 받는다면, 그 컴퓨터는 훌는 작가라는 것이다. 하지만 이 접근 방식은 숨겨진 가정을 전제로 한다. 즉, 사람이 어떤 글에 숫자를 부여할 때, 그 숫자가 자신의 실제 느낌을 완벽하게 포착한다는 가정이다. 이는 '좋음' 점수와 '훌륭함' 점수 사이의 거리가 모두에게 동일하다고 가정하며, 이 점수들을 평균 내는 것이 어떤 컴퓨터가 더 나은지를 정확히 알려준다고 가정한다.

스탠퍼드 대학교의 연구진은 이 과정을 단순히 심사위원들이 역할을 제대로 수행하고 있는지 확인하는 것을 넘어, 평가 시스템 자체가 결함이 있는 것은 아닌지 질문하기 위해 더 면밀히 조사하기로 했다. 그들은 경제학자들이 인간의 선택을 이해하는 방식을 통해 이 문제에 접근했으며, 컴퓨터의 텍스트 생성 능력을 일종의 도박(gamble)으로 보았다. 컴퓨터가 글을 쓸 때, 단 하나의 고정된 결과물을 내놓는 것이 아니라, 아주 뛰어나거나 혹은 아주 형편없는 다양한 가능성의 범위를 만들어낸다. 연구진은 인간에게 이러한 결과물들을 평가하도록 요청하는 표준적인 방식이 사람들이 실제로 선호하는 바를 포착하는 데 종종 실패한다는 것을 발견했다. 사실, 그들은 이러한 평점을 평균 내는 행위 자체가 때로는 결과를 뒤집어 놓을 수 있으며, 이로 인해 더 나은 컴퓨터가 더 나쁜 것처럼 보이게 하거나, 인간이 기계와 사람의 차이를 구별할 수 있다는 사실을 은폐할 수 있다는 것을 발견했다.

이를 해결하기 위해 연구진은 의견을 묻는 완전히 새로운 방식을 제안했다. 한 사람에게 단 하나의 이야기를 1점에서 5점 사이의 척도로 평가하게 하는 대신, 두 대의 컴퓨터를 나란히 놓고 하나가 전체적으로 다른 하나보다 더 나을 확률을 추정하도록 요청한 것이다. 그들이 '시스템 수준 확률적 평가(system-level probabilistic assessment)'라고 부르는 이 방법은, 인간 심사위원을 계산기가 아니라 가능성을 추정하는 전문가로 취급한다. 연구진이 이 새로운 방법을 강력한 언어 모델의 여러 버전을 사용하여 기존 방법과 테스트했을 때, 그 결과는 놀라웠다. 수년간 업계 표준이었던 기존 방식은 당연히 드러나야 할 모델 간의 명확한 차이를 감지하지 못했다. 기존 방식은 더 크고 발전된 컴퓨터가 더 작고 기초적인 컴퓨터보다 더 낫다는 사실을 구분하지 못했으며, 심지어 컴퓨터가 인간 작가보다 현저히 뛰어나다는 결론을 내리기도 했는데, 이는 이전의 연구 결과와 모순되는 발견이었다.

그러나 새로운 방법은 연구진이 기대했던 대로 작동했다. 사람들이 확률 기반 접근 방식을 사용했을 때, 그들은 규모가 크고 복잡한 시스템이 더 좋은 이야기를 만들어낸다는 것을 인식하며 컴퓨터 모델들의 올正한 순서를 일관되게 식별해 냈다. 또한 그들은 가장 작은 컴퓨터는 인간보다 확실히 열등한 반면, 가장 큰 컴퓨터는 인간 작가와 구별할 수 없을 정도라는 사실도 정확히 식별했다. 이러한 성공은 더 많은 사람이나 더 많은 데이터를 투입했기 때문이 아니었다. 연구진은 두 테스트 모두에 동일한 90명의 자원봉사자 그룹을 사용했다. 차이는 전적으로 질문을 어떻게 던졌느냐에 있었다. 고정된 척도로 점수를 매기도록 요구하는 표준 방식은 인간의 뇌가 일관되게 내리도록 설계되지 않은 판단을 강요한다. 그것은 점수 3점과 4점 사이의 간격이 모든 사람에게 동일한 의미를 갖는다고 가정하지만, 현실에서는 거의 성립하지 않는 가정이다.

연구진은 이러한 결함이 단순한 기술적 오류가 아니라 인간의 선호도가 작동하는 방식에 대한 근본적인 오해임을 보여주었다. 사람들이 척도에 따라 글을 평가하게 되면, 그들은 점수 간의 거리를 추측하는 경우가 많으며, 그 추측은 사람마다 크게 다를 수 있다. 어떤 사람은 4점이 3점보다 약간 더 낫다고 생각하는 반면, 다른 사람은 4점이 3점보다 두 배는 더 낫다고 생각할 수 있다. 이러한 상충하는 견해들을 평균 내면, 진실을 가리는 흐릿한 신호가 남게 된다. 새로운 방법은 사람들이 더 넓은 관점에서 바라보게 함으로써 이 혼란을 우회한다. 단 하나의 문장을 판단하는 대신, 그들은 전체 시스템을 판단하며, 많은 예시를 보았을 때 한 컴퓨터가 다른 컴퓨터보다 얼마나 자주 더 나을 것인지에 대한 확률을 추정한다. 이 접근 방식은 인간이 컴퓨터가 생성할 수 있는 모든 출력을 볼 수는 없지만, 표본을 바탕으로 어떤 시스템이 더 우월한지에 대한 신뢰할 수 있는 감각을 형성할 수 있다는 점을 인정한다.

이 발견의 함의는 단순히 이야기 쓰는 컴퓨터를 테스트하는 것을 훨씬 뛰어넘는다. 이는 인공지능 분야 전체가 스스로의 발전을 평가하는 방식에 도전한다. 수년 동안 연구자들은 새로운 모델을 구축하고, 인간 심사위원으로부터 높은 평균 점수를 받았다는 이유로 그것이 더 낫다고 주장해 왔다. 만약 그 점수들이 인간의 선호에 수학적으로 충실하지 않다면, 그러한 주장 중 상당수는 틀렸을 수도 있다. 이 연구는 해당 분야가 단순한 평점 척도에서 벗어나 인간 판단의 복잡성을 존중하는 방식으로 이동해야 함을 시사한다. 사람들에게 숫자를 할당하는 대신 확률을 추정하게 함으로써, 우리는 이러한 기계들이 실제로 무엇을 할 수 있는지에 대해 더 명확하고 정직한 그림을 얻을 수 있다.

실험에서 연구진은 특정 이야기 프롬프트 세트를 사용하였고, 자원봉사자들에게 소규모의 기초적인 버전부터 거대하고 발전된 버전에 이르는 언어 모델의 다양한 버전을 비교하도록 요청했다. 또한 벤치마크로 활용하기 위해 실제 인간이 쓴 이야기도 포함했다. 결과는 명확했다: 새로운 방법은 예상된 모든 선호도를 복구하여, 컴퓨터를 최악에서 최고까지 정확하게 순위를 매겼으며, 인간 작가를 적절한 위치에 배치했다. 반면, 동일한 자원봉사자와 동일한 이야기를 사용했음에도 불구하고 기존 방식은 예상된 다섯 가지 선호도 중 두 가지만을 찾아냈다. 기존 방식은 중간 크기의 컴퓨터들 사이의 차이를 식별하지 못했으며, 더욱 놀랍게도 인간 작가가 가장 큰 컴퓨터보다 현저히 열등하다는 결론을 내렸다. 이 오류는 현재의 평가 관행에 존재하는 위험한 사각지대를 강조한다. 즉, 결함이 있는 프로토콜이 연구자들로 하여금 기계가 인간의 능력을 넘어섰다고 믿게 만들 수 있다는 것이다.

연구진은 또한 이 새로운 접근 방식을 이미지 생성에도 테스트하여, 사람들이 어떤 컴퓨터가 더 나은 그림을 만드는지 판단하게 했다. 결과는 다시 한번 유효했다. 이 방법이 다양한 유형의 창의적 과업에서도 작동함을 보여주었다. 연구진은 사람들이 더 많은 예시를 볼수록 자신의 선호에 대해 더 확신하게 된다는 것을 발견했지만, 적은 수의 예시만으로도 확률 기반 방식은 정확한 승자를 찾아낼 수 있었다. 이는 이 방법이 견고하고 효율적이며, 방대한 양의 데이터 없이도 신뢰할 수 있는 답을 제공할 수 있음을 시사한다. 이 방법은 인간의 주의력 한계를 존중하면서도 인간 선호의 본질을 포착한다.

궁극적으로, 이 작업은 우리의 도구를 현실과 일치시키는 것에 관한 것이다. 인공지능을 평가하는 표준 프로토콜은 인간이 실제로 생각하거나 느끼는 방식과 일치하지 않는 가정들 위에 세워져 왔다. 숫자를 할당하는 것에서 정직한 확률 추정으로 초점을 옮김으로써, 연구진은 더 정확하고 신뢰할 수 있는 평가를 향한 길을 제시했다. 이는 더 나은 기계를 만드는 여정에서, 우리가 그것들을 측정하는 방법 또한 건전한지 먼저 확인해야 한다는 점을 상기시켜 준다. 목표는 단순히 어떤 컴퓨터가 이기는가를 아는 것이 아니라, 그 승리가 인간과 컴퓨터의 상호작용의 미래에 실제로 무엇을 의미하는지를 이해하는 것이다. 이러한 시스템이 우리 삶에 점점 더 통합됨에 따라, 평가를 제대로 하는 것은 단순한 학술적 연습이 아니라, 우리가 만드는 기술이 진정으로 그것을 사용하는 사람들에게 봉사할 수 있도록 보장하기 위한 필수 과제이다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →