RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees
이 논문은 11 개 종목의 925 개 비디오와 6,475 개의 질문으로 구성된 'RefereeBench'를 통해 멀티모달 대규모 언어 모델 (MLLM) 이 스포츠 심판으로서의 신뢰할 수 있는 판단 능력을 아직 갖추지 못했음을 입증하고, 향후 도메인 지식과 멀티모달 이해의 통합이 필요함을 강조합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
1. 새로운 시험지 'RefereeBench'의 등장
지금까지 AI 는 영상을 보고 "사람이 뛰고 있다", "공이 날아갔다" 같은 단순한 행동을 알아내는 데는 매우 뛰어났습니다. 하지만 심판의 역할은 단순히 '무슨 일이 일어났는지' 보는 것을 넘어, **"이게 반칙일까? 아니면 정당한 플레이일까? 어떤 규칙에 따라 어떤 페널티를 줘야 할까?"**를 판단하는 고도의 판단력이 필요합니다.
저자들은 11 가지 스포츠 (축구, 농구, 아이스하키 등) 와 925 개의 실제 경기 영상을 수집하고, 실제 국가 공인 심판 30 명에게 이 영상들을 분석하게 하여 6,475 개의 질문과 정답을 만들었습니다. 이것이 바로 **'RefereeBench'**입니다.
비유: 마치 수험생 (AI) 들에게 11 개 다른 과목의 '실전 모의고사'를 치르게 한 것입니다. 단순히 공을 차는 걸 보는 게 아니라, "이 반칙은 왜 반칙인지, 어떤 규칙 조항이 적용되는지"까지 설명해야 하는 아주 까다로운 시험입니다.
2. 시험 결과: AI 들은 아직 '수석'이 못 됩니다
이 시험에 최신 AI 모델들 (GPT-5, Gemini, Qwen 등) 을 출시시켜 봤습니다. 결과는 어떨까요?
- 최고 점수: 가장 잘한 AI 가 약 60 점을 받았습니다. (Doubao-Seed-1.8, Gemini-3 등)
- 평균 점수: 대부분의 AI 는 40~50 점 선에 머물렀습니다.
- 결론: "심판 자격증"을 딸 수 있는 점수 (보통 80~90 점 이상) 에는 훨씬 못 미칩니다.
비유: 수능에서 60 점을 받은 학생은 대학에 갈 수 있지만, 의대나 법대에 합격할 수는 없습니다. AI 들은 "반칙이 일어났다"는 걸 눈치채는 건 잘하지만 (기본 지능), **"왜 반칙인지, 어떤 규칙을 적용해야 하는지"**를 논리적으로 설명하는 데는 여전히 서툴러서, 실제 경기장에 투입하면 경기 흐름을 망칠 위험이 큽니다.
3. AI 들이 특히 힘들어하는 부분 (약점 분석)
시험지를 자세히 분석하니 AI 들의 구체적인 약점이 드러났습니다.
- 시각은 좋지만, 규칙은 모름: "누가 누구를 밀었다"는 건 잘 보지만, **"그게 반칙인가?"**를 판단할 때 규칙을 적용하는 데서 막힙니다. 마치 영어를 잘 읽는 외국인이 한국어의 뉘앙스나 관용구를 잘 못 알아듣는 것과 비슷합니다.
- 시간 감각이 무뎌요: 반칙이 일어난 정확한 순간을 찾아내는 '시간적 위치 파악'이 매우 어렵습니다. "방금 전에 밀었나, 아니면 이미 넘어졌나?"를 구분하지 못해 엉뚱한 순간을 지적합니다.
- 과잉 심판 (Over-calling): 반칙이 아닌 정상적인 플레이를 보고도 **"반칙이다!"**라고 너무 자주 외칩니다. 마치 경고등이 고장 난 신호등처럼, 아무것도 아닌데도 빨간불을 켜는 경향이 있습니다.
- 소리의 중요성: 영상만 보면 점수가 낮았는데, **경기장의 소리 (심판의 휘슬 소리, 해설자의 목소리)**를 함께 들으면 점수가 크게 오릅니다. 이는 AI 가 스포츠 심판이라는 직업을 수행하려면 '눈'뿐만 아니라 '귀'도 함께 써야 함을 보여줍니다.
4. 왜 이렇게 어려울까요?
AI 가 심판이 되기 어려운 이유는 두 가지입니다.
- 규칙의 복잡성: 스포츠 규칙은 단순히 "손으로 공을 잡으면 안 된다"가 아니라, "상황에 따라", "강도에 따라", "의도에 따라" 달라지는 미묘한 차이가 많습니다. AI 는 이런 **맥락 (Context)**을 이해하는 데 한계가 있습니다.
- 편향된 학습: AI 는 학습 데이터에서 "반칙이 자주 나오는 장면"을 많이 봤기 때문에, 평범한 플레이를 봐도 "아, 반칙이겠지?"라고 착각하는 경향이 있습니다.
5. 결론: 아직은 인간 심판의 '보조'일 뿐
이 논문은 **"지금 당장 AI 심판을 투입하면 안 된다"**고 경고합니다. AI 는 아직 **인간 심판의 눈과 귀를 보조하는 '도구'**로는 쓸만하지만, **최종 결정을 내리는 '주인'**이 되기는 너무 초보입니다.
마무리 비유:
현재 AI 심판은 **"경기를 잘 보는 '관객'은 될 수 있지만, 휘슬을 불고 판정을 내리는 '심판'이 되기는 아직 멀었다"**는 것입니다. 앞으로는 AI 가 스포츠 규칙을 더 깊이 이해하고, 영상과 소리를 함께 분석하며, 인간처럼 '공정한 판단'을 내릴 수 있도록 더 많이 훈련시켜야 할 것입니다.
이 연구는 AI 기술이 단순히 "무엇이 보이는가"를 넘어, **"어떻게 판단해야 하는가"**라는 더 높은 단계로 나아가기 위해 필요한 중요한 첫걸음입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.