Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards
이 논문은 LLM 리더보드의 한계를 지적하고, 사용자가 직접 평가 기준을 정의하여 모델 순위를 탐색할 수 있는 대화형 시각화 인터페이스를 제안함으로써 더 투명하고 맥락에 맞는 모델 평가를 가능하게 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 "누가 가장 좋은 AI 를 정하는가?"라는 질문에서 시작합니다.
지금까지 우리는 AI 모델이 얼마나 똑똑한지 비교할 때, 마치 스포츠 경기의 순위표(리더보드)를 보며 "1 위가 무조건 최고다"라고 믿어왔습니다. 하지만 이 논문은 "그 순위표는 정말 당신에게도 최고의 AI 를 보여주는 걸까?"라고 의문을 제기하며, 우리가 직접 평가 기준을 정할 수 있는 새로운 방식을 제안합니다.
이 내용을 쉽게 이해할 수 있도록 세 가지 비유로 설명해 드릴게요.
1. 문제: "모두를 위한 메뉴판"의 함정
지금까지의 AI 리더보드 (예: LMArena) 는 마치 **전 세계 모든 사람의 입맛을 한 번에 고려한 '만능 메뉴판'**과 같습니다.
- 현실: 메뉴판의 대부분은 '개발자'나 'AI 전문가'들이 좋아하는 메뉴 (코딩, 수학, 복잡한 데이터 분석 등) 로 가득 차 있습니다.
- 문제: 하지만 당신이 원하는 건 '초등학생을 위한 영어 튜터'일 수도 있고, '정치적 중립성이 중요한 뉴스 요약'일 수도 있습니다. 그런데 메뉴판에는 그런 메뉴가 거의 없거나, 전체 순위에는 '코딩 잘하는 AI'가 1 위라 해서 당신에게도 1 위라고 말하는 셈이 됩니다.
- 결과: "전체 점수 1 위"라는 숫자 하나에 가려져, 당신의 필요에 맞는 AI 가 100 위 아래로 밀려나는 일이 발생합니다.
2. 발견: "평균점수"는 거짓말을 할 수 있다
저자들은 실제로 AI 평가 데이터를 자세히 분석해 보니 놀라운 사실을 발견했습니다.
- 비유: 어떤 학생이 '수학' 시험에서는 100 점, '음악' 시험에서는 0 점을 받아 전체 평균이 50 점이라 가정해 봅시다.
- 기존 방식: "이 학생은 평균 50 점이라 보통 수준이다"라고 판단합니다.
- 이 논문의 발견: 하지만 당신이 '음악 선생님'을 구하는 중이라면, 이 학생은 0 점이라 쓸모없지만, '수학 선생님'을 구한다면 100 점인 이 학생이 최고의 선택이 됩니다.
- 실제 데이터: AI 도 마찬가집니다. 어떤 AI 는 코딩과 수학에서 천재처럼 보이지만, 역사나 정치 관련 질문에서는 엉뚱한 답을 하기도 합니다. 그런데 전체 순위표는 이 차이를 무시하고 하나의 점수로만 합쳐버립니다.
- 위험한 점: 특히 '정치'나 '가치관'이 필요한 질문에서는, 어떤 AI 는 특정 집단의 의견만 대변하고, 다른 AI 는 중립을 지키는데, 투표한 사람들의 성향에 따라 순위가 뒤죽박죽이 됩니다.
3. 해결책: "나만의 메뉴판"을 만드는 인터랙티브 도구
이 문제를 해결하기 위해 저자들은 **사용자가 직접 점수판의 규칙을 바꿀 수 있는 '인터랙티브 시각화 도구'**를 만들었습니다.
- 비유: 이제 메뉴판이不再是 고정된 것이 아니라, **나만의 취향을 반영할 수 있는 '레스토랑 커스터마이징 키트'**가 된 것입니다.
- **단계 1 **(선택) "나는 코딩은 필요 없으니 그 메뉴는 빼고, 초등학생 교육 관련 메뉴만 골라주세요"라고 선택합니다.
- **단계 2 **(가중치) "역사 과목은 100 점 만점, 수학은 50 점 만점으로 계산해주세요"라고 비중을 조절합니다.
- **단계 3 **(확인) "아, 이렇게 설정하면 1 위가 A AI 에서 B AI 로 바뀐다? 와, B AI 가 우리 팀에 딱 맞는구나!"라고 깨닫습니다.
이 도구를 통해 사용자는 "전체 1 위"에 매몰되지 않고, "내 상황에 가장 적합한 1 위"를 스스로 찾아낼 수 있습니다.
4. 실제 실험: 사람들이 어떻게 반응했나?
연구진은 실제 전문가 10 명에게 이 도구를 사용하게 했습니다.
- 반응: "내가 생각했던 1 위 AI 가 내 분야에서는 10 위였네? 알고 보니 이 AI 가 내게 더 필요한 기능을 가진 3 위 AI 가 더 좋았구나."
- 효과: 사람들은 단순히 점수를 믿는 것을 넘어, "왜" 그 AI 가 좋은지 구체적인 예시를 보며 판단하게 되었습니다. 마치 "이 AI 는 수학 문제만 잘 풀지만, 역사 문제는 잘 못 풀어요"라는 세부 사항을 확인하고 결정하는 것과 같습니다.
5. 결론: "최고"는 고정된 것이 아니라 "상황"에 따라 달라진다
이 논문의 핵심 메시지는 "'최고 (Best)'라는 것은 누가 정하는가가 아니라, 누가 (누구의 상황) 를 기준으로 하느냐에 따라 달라진다"는 것입니다.
- 과거: 순위표에 적힌 1 위를 무조건 믿고 따라야 했다.
- 미래: "나는 어떤 일을 할 때 이 AI 가 필요해"라고 생각하면, 내가 직접 그 기준을 만들어 AI 를 골라야 한다.
이 도구는 AI 평가가 단순한 '경쟁'이 아니라, 각자의 상황에 맞춰 **이해하고 선택하는 과정 **(Sensemaking)이 되어야 함을 보여줍니다. 이제 우리는 남이 정해준 '최고'가 아니라, 우리에게 맞는 '최고'를 직접 정의할 수 있게 된 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.