← 최신 논문
🤖 AI

Towards Comprehensive Basketball Understanding

이 논문은 2025-2026 NBA 시즌에서 유도된 포괄적인 멀티모달 벤치마크인 BasketballBench를 소개하고, 농구 이해의 복잡하고 통합적인 특성을 해결하기 위해 도메인 특화된 인지 및 검색 도구를 명시적으로 구성함으로써 기존 MLLM보다 뛰어난 성능을 보이는 에이전트인 BasketballSkills를 제안한다.

원저자: Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

프로 농구 경기를 관람하는 것은 풍부하고 다층적인 경험이다. 무엇이 일어나고 있는지를 진정으로 이해하기 위해서, 시청자는 단순히 공이 코트를 가로질러 움직이는 것을 보는 것 그 이상을 해야 한다. 시청자는 관련된 특정 선수들을 인식하고, 패스가 이루어지는 정확한 순간을 추적하며, 슛이 어디에서 던져졌는지 정확히 찾아내고, 이러한 시각적 순간들을 팀, 선수의 경력, 그리고 스포츠의 규칙에 관한 방대한 지식 라이브러리와 연결해야 한다. 수십 년 동안 컴퓨터는 이러한 종류의 깊고 통합적인 이해를 수행하는 데 어려움을 겪어 왔다. 현대의 인공지능은 사진 속의 객체를 식별하거나 이미지에 대한 간단한 질문에 답하는 데는 꽤 능숙해졌지만, 이러한 기술들을 결합하라는 요구를 받을 때는 종종 실패하곤 한다. 인공지능은 선수의 얼굴은 인식할 수 있어도 그 선수의 통산 기록을 떠올리지 못할 수 있으며, 슛이 던져지는 장면은 볼 수 있어도 그것이 코트 상의 정확히 어느 지점에서 일어났는지 말하지 못할 수도 있다. 이러한 '보는 것'과 '이해하는 것' 사이의 간극은 베이징 대학교와 상하이 교통 대학교 연구진의 새로운 연구가 메우고자 하는 핵심 과제이다.

연구진은 먼저 BasketballBench라는 거대하고 엄격한 테스트 환경을 구축함으로써 이 문제에 접근했다. 연구진은 2025-2026 NBA 시즌의 데이터를 수집하여, 2,500개 이상의 경기 소유권(possession) 비디오 클립, 530명의 현역 선수에 대한 공식 기록, 그리고 수천 개의 구조화된 경기 세부 정보를 모았다. 이 자료로부터 연구진은 다양한 유형의 사고를 요구하는 약 8,000개의 구체적인 질문을 만들어냈다. 어떤 질문들은 방송 그래픽에서 점수를 읽거나 사진에서 선수를 식별하도록 하는 단순한 질문이었다. 다른 질문들은 훨씬 더 복렴하여, 컴퓨터가 영상을 보고, 특정 플레이를 누가 했는지 파악하고, 그것이 시간과 공간상 어디에서 일어났는지 찾아낸 다음, 데이터베이스에서 해당 선수의 경력에 관한 특정 사실을 검색하도록 요구했다. 목표는 현재의 인공지능 시스템이 이러한 과업들을 개별적으로 수행할 수 있는지, 그리고 더 중요하게는, 이 능력들을 결로 하나의 다단계 문제를 해결할 수 있는지를 확인하는 것이었다.

연구진이 사용 가능한 가장 진보된 범용 인공지능 모델들을 테스트했을 때, 결과는 시사하는 바가 컸다. 이 강력한 시스템들은 단순한 작업에서는 좋은 성능을 보였다. 그들은 화면에서 점수를 읽거나 유니폼 번호를 높은 정확도로 식별할 수 있었다. 그러나 질문이 영상 속의 내용과 게임에 대해 알고 있는 지식을 연결할 것을 요구할 때 성능은 급격히 떨어졌다. 예를 들어, 슛을 던진 선수를 식별한 다음 그 선수의 통산 기록을 찾으라는 질문이 주어졌을 때, 모델들은 자주 실수를 저질렀다. 그들은 동작은 볼 수 있었지만, 그 동작을 올바른 사람에게 연결하고 적절한 정보를 끌어오는 데 어려움을 겪었다. 이 연구는 범용 모델들이 시각적 인지, 공간적 추론, 그리고 사실적 지식을 하나의 일관된 답변으로 엮어내는 능력을 자연스럽게 갖추고 있지 않음을 보여주었다.

이러한 한계를 해결하기 위해 연구팀은 BasketballSkills라고 불리는 새로운 시스템을 개발했다. 모든 것을 한꺼번에 수행하는 단일한 거대 모델에 의존하는 대신, 그들은 전문가 집단처럼 작동하는 프레임워크를 구축했다. 이 시스템은 질문을 읽고 이를 해결하기 위한 특정 도구 세트를 선택하는 중앙 컨트롤러를 사용한다. 이 도구들은 농구에 특화되어 있다. 하나는 선수와 공을 추적하고, 다른 하나는 진행 중인 플레이의 유형을 식별하며, 세 번째는 유니폼 번호를 읽고, 네 번째는 선수 정보가 담긴 구조화된 데이터베이스를 검색한다. 컨트롤러는 추측하지 않고 명확한 단계별 절차를 따른다. 만약 질문이 특정 플레이 이후의 선수의 슈팅 성공률에 대해 묻는다면, 시스템은 먼저 영상을 추적하여 선수를 찾고, 그다음 유니폼 번호를 식별한 뒤, 마지막으로 통계 데이터를 위해 데이터베이스를 쿼리한다. 시스템은 다음 단계로 넘어가기 전에 각 단계를 검증하여, 수집된 증거가 최종 답변을 형성하기에 정확한지 확인한다.

이 새로운 접근 방식의 결과는 놀라웠다. 10가지 유형의 질문 전반에 걸친 테스트에서, BasketballSkills 시스템은 8가지 항목에서 최고의 상용 인공지능 모델들을 능가했다. 이 시스템은 특히 비디오 클립에서 선수를 식별하고 그 선수의 경력 데이터를 검색하는 것과 같이 여러 능력을 결합해야 하는 복잡한 과업에서 탁월한 성과를 보였다. 범용 모델들이 시각적 증거를 사실적 지식과 연결하는 데 자주 실패했던 반면, 특화된 시스템은 이러한 서로 다른 역량들을 성공적으로 구성하여 올바른 결론에 도달했다. 이 연구는 전문적인 스포츠와 같은 복잡한 현실 세계의 영역을 위해서는, 범용 모델을 더 크게 만드는 것이 아니라 특화된 기술들을 명시적으로 조직하고 결합할 수 있는 시스템을 구축하는 것이 앞으로 나아갈 길임을 시사한다. 어려운 문제를 신뢰할 수 있는 도메인 특화 단계의 순서로 세분화함으로써, 연구진은 컴퓨터가 이전에는 도달할 수 없었던 깊이와 정확도로 농구 경기를 이해하도록 학습될 수 있음을 입증했다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →