← 최신 논문
💻 computer science

The Trust Paradox: How CS Researchers Engage LLM Leaderboards

8 명의 컴퓨터 과학 연구자와의 인터뷰를 통해 이 논문은 실무자들이 LLM 리더보드에 대한 불신을 표명하면서도 이를 대략적인 가이드로 활용한다는 역설을 드러내며, 정적 벤치마크보다 동료 네트워크와 아레나 기반 순위가 모델 선택에 더 큰 영향을 미친다는 점과 비용 투명성에 대한 중요한 요구를 부각시킵니다.

원저자: Pouya Sadeghi, Anamaria Crisan, Jimmy Lin

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pouya Sadeghi, Anamaria Crisan, Jimmy Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능 연구의 세계를 거대하고 고도의 승부가 걸린 스포츠 리그로 상상해 보십시오. 이 리그에서 리더보드는 공식 점수판입니다. 리더보드는 AI 모델 (이들 '선수들') 을 표준화된 수학 시험이나 독해 퀴즈와 같은 특정 테스트 수행도에 따라 순위 매깁니다.

일반적인 가정은 단순합니다: 모델이 점수판 최상위에 있다면, 그 모델이 최고의 선수입니다.

그러나 워털루 대학교의 새로운 연구에 따르면, 실제로 이 게임을 플레이하는 연구자들은 점수판이 전체 진실을 말해주지 않는다고 믿습니다. 사실, 그들은 점수판과 기묘하고 모순적인 관계를 맺고 있습니다.

다음은 일상적인 비유를 활용한 연구 결과의 요약입니다:

1. "신뢰 역설": 점수판이 결함이 있음을 알면서도 여전히 확인하는 것

연구자들은 다양한 분야의 컴퓨터 과학자 여덟 명을 인터뷰했습니다. 그 결과 "실용적 회의주의" 라는 보편적인 패턴을 발견했습니다.

  • 비유: 당신이 차를 구매한다고 상상해 보십시오. 공식적인 "올해의 차" 잡지 순위가 결함이 있음을 알고 있습니다. 잡지가 편향되었을 수도 있고, 테스트가 실제 주행 조건을 반영하지 못할 수도 있기 때문입니다. 당신은 순위가 불안정하다는 것을 알고 있습니다.
  • 현실: 이러한 연구자들이 리더보드를 깊이 불신함에도 불구하고 여전히 이를 확인하는 이유는 무엇일까요? 최종 결정을 내리기 위해서가 아니라 목록을 좁히기 위해입니다.
  • 결과: 그들은 리더보드를 "대략적인 필터"처럼 취급합니다. 이는 명백히 나쁜 옵션들을 제거하여 100 개의 모델을 모두 테스트할 필요가 없게 해 주지만, 그들은 1 위를 절대적인 진실로 결코 신뢰하지 않습니다.

2. 진정한 "코치": 점수판보다 동료 네트워크

연구자들이 점수판을 신뢰하지 않는다면, 그들은 누구를 신뢰할까요? 그들의 친구와 동료들입니다.

  • 비유: 식당을 고르는 상황을 생각해 보십시오. 공식적인 "미슐랭 가이드" (리더보드) 를 볼 수도 있지만, 당신은 신뢰하는 친구에게 "어제 정말 맛있었던 곳 어디였어?"라고 물어볼 가능성이 훨씬 높습니다.
  • 발견: 여덟 명 중 일곱 명의 연구자에게 AI 모델을 선택하는 가장 중요한 요소는 동료의 추천이었습니다. 그들은 회사의 마케팅이나 정적인 테스트 점수보다 동료의 개인적 경험 ("이걸 써봤는데 내 특정 프로젝트에 잘 작동했어요") 을 훨씬 더 신뢰합니다.
  • 신뢰의 위계:
    1. 동료/동료들 (가장 신뢰함)
    2. 제 3 자 전문가
    3. AI 를 만드는 회사들 (가장 신뢰하지 않음, 편향된 광고주로 간주됨)

3. "경기장" 대 "필기시험"

연구자들은 한 가지 유형의 리더보드를 다른 유형보다 선호한다는 사실을 발견했습니다.

  • 정적 벤치마크 (필기시험): 이는 모델이 동일한 질문에 반복적으로 답하는 고정된 테스트입니다. 연구자들은 회사들이 "시험을 대비"하여 부정행위를 하거나 테스트가 구식일 수 있기 때문에 이에 대해 의심을 품습니다.
  • 경기장 기반 (라이브 쇼): 이는 실제 인간들이 실시간으로 어떤 AI 응답을 더 좋아하는지 투표하는 플랫폼입니다 (인기 투표와 유사).
  • 판결: 모두가 "경기장"을 선호했습니다. 그들은 AI 가 특정 테스트를 얼마나 잘 암기했는지보다 인간이 실제로 AI 와 어떻게 상호작용하는지를 반영하기 때문에 더 정직하다고 느꼈습니다.

4. 모두가 같은 게임을 하는 것은 아님

이 연구는 리더보드 최상위를 쫓는 압력이 당신이 속한 "팀" (하위 분야) 에 따라 전적으로 달라진다는 것을 드러냈습니다.

  • NLP 팀 (자연어 처리): 이 연구자들은 엄청난 압력을 받고 있습니다. 고등학교 스포츠 리그에서 GPA 가 가장 높지 않으면 대학에 진학할 수 없는 것과 같습니다. 그들은 출판되려면 최상위 순위 모델과 자신의 작업을 비교해야 합니다.
  • HCI 및 개인정보 보호 팀: 이 연구자들은 완전히 다른 스포츠를 하는 사람들처럼 행동합니다. 그들은 리더보드에 관심이 없습니다. 그들은 사용자 경험, 안전성, 또는 개인정보 보호를 중요하게 생각합니다. 수학 테스트에서 "최상위 순위"를 차지하는 것이 그들의 AI 가 안전하지 않거나 사용하기 어렵다면 중요하지 않습니다.
  • 놀라운 사실: 이러한 다른 분야의 일부 연구자들은 리더보드 자체가 존재한다는 사실조차 모르고 있었습니다! 그들은 점수판을 한 번도 보지 않은 채 AI 세계를 항해하고 있었습니다.

5. 빠진 조각: 가격표

연구자들이 리더보드를 실제로 유용하게 만들기 위해 재설계할 수 있다면, 무엇을 추가할까요?

  • 큰 요청: 비용 투명성.
  • 비유: 한 자동차가 갤런당 50 마일을 주행한다고 알려주지만, 그 자동차 가격이 20 만 달러라고 알려주지 않는 리더보드를 상상해 보십시오. 이는 쓸모없는 정보입니다.
  • 현실: 연구자들은 이러한 모델을 실행하는 데 드는 비용을 알아야 합니다. 모델이 "똑똑"할지라도 사용 비용이 천문학적이라면 실용적이지 않습니다. 여덟 명 중 일곱 명의 연구자가 이것이 가장 중요한 누락된 기능이라고 말했습니다. 그들은 또한 "경기장"에서 투표하는 사람들이 특정 국가나 문화의 사람들만은 아닌지 확인하기 위해 누가 투표했는지 알고 싶어 했습니다.

요약

이 논문은 리더보드가 "진실 전달자"로서는 고장 났지만, "대화 시작자"로서는 유용하다고 결론 내립니다.

연구자들은 순위표를 맹목적으로 따르지 않습니다. 그들은 이를 출발점으로 사용하지만, 실제 결정을 내리기 위해서는 인간 네트워크, 개인 테스트, 그리고 비용 계산을 의존합니다. 이 연구는 이러한 점수판이 더 도움이 되려면 완벽하다고 가장하는 것을 멈추고 비용, 구체적인 강점, 그리고 점수 뒤에 있는 인간 투표자들과 같은 전체 그림을 보여주기 시작해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →