← 최신 논문
💻 computer science

MoAKE: Toward Unified All-in-One Action Quality Assessment via Mixture of Action Knowledge Experts

본 논문은 세그먼트 인식 전문가 지식을 동적으로 집계하고 다중 입도(multi-granularity)의 시간적 역학을 모델링함으로써, 기존의 일대일 패러다임의 한계를 극복하고 올인원(all-in-one), 제로샷(zero-shot), 퓨샷(few-shot) 시나리오에서 우수한 성능을 달나하는 방식으로 다양한 동작 유형에 대한 동작 품질 평가를 단일 모델 내로 통합하는 새로운 혼합 동작 지식 전문가(MoAKE, Mixture of Action Knowledge Experts) 프레임워크를 소개한다.

원저자: Huangbiao Xu, Huanqi Wu, Xiao Ke, Jiaxin Cai, Junyi Wu, Jinglin Xu

게시일 2026-07-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Huangbiao Xu, Huanqi Wu, Xiao Ke, Jiaxin Cai, Junyi Wu, Jinglin Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 올림픽 체조부터 외과 수술, 심해 다이빙에 이르기까지 온갖 종목이 펼쳐지는 거대하고 혼란스러운 장기자랑의 심사위원이라고 상상해 보십시오. 옛날 방식대로라면, 체조 선수를 채점하기 위해 체조 전문가를 고용하고, 다이버를 위해 다이빙 전문가를, 외과 의사를 위해 의료 전문가를 고용해야 했을 것입니다. 종목마다 규칙, 동작, 그리고 '좋음'의 기준이 완전히 다르기 때문에 매 종목마다 서로 다른 심사위원이 필요했습니다. 이것이 과거 컴퓨터가 비디오 동작을 판독하던 방식이었습니다. 즉, 모든 종류의 움직임을 학습하기 위해 각각 별도의 전문화된 두뇌가 필요했던 것입니다. 하지만 만약 당신이 피겨 스케이터의 회전이든 다이버의 공중제비든, 어떤 비디오를 보더라도 미리 그 종목이 무엇인지 알 필요 없이 인간 전문가처럼 공정하게 점수를 줄 수 있는 단 하나의 똑똑한 심사위원을 원한다면 어떨까요? 그것이 바로 '동작 품질 평가(Action Quality Assessment, AQA)'라는 분야의 꿈입니다. 이는 컴퓨터에게 비디오를 보고 인간 전문가처럼 "9.5점 만점에 9.5점입니다"라고 말하는 법을 가르치는 분야입니다. 가장 큰 문제는 이러한 서로 다른 기술들을 한데 섞으면 컴퓨터가 혼란을 느껴, 마치 물고기에게 날기를 가르치고 새에게 수영을 동시에 가르치려 할 때처럼 모든 면에서 성능이 저하된다는 점입니다.

여기에 MoAKE라는 새로운 프레임워크가 등장했습니다. 이는 '동작 지식 전문가들의 혼합(Mixture of Action Knowledge Experts)' 역할을 합니다. 하나의 거대한 뇌에 모든 것을 억지로 학습시키는 대신, MoAKE는 공유된 사무실에서 함께 일하는 전문화된 전문가 팀을 구축합니다. 각자가 특정 스타일에 능통한 심사위원 패널을 상상해 보십시오. 예를 들어, 한 명은 리듬 체조를 사랑하고, 다른 한 명은 피겨 스케이트를 잘 알며, 세 번째 한 명은 아티스틱 스위밍을 이해하는 식입니다. 비디오가 들어오면, 영리한 '라우터(router, 빠른 판단력을 가진 무대 감독 같은 역할)'가 비디오를 살펴보고 어떤 전문가가 의견을 낼지 결정합니다. 화면에 체조 선수가 등장하면 체조 전문가가 크게 목소리를 높이고, 나머지 전문가들은 조용히 경청합니다. 하지만 여기서 마법 같은 일이 일어납니다. 그들은 단순히 혼자 일하는 것이 아닙니다. 그들은 공통된 언어로 서로의 노트를 공유하며, 서로의 움직임의 미묘한 차이를 이해하도록 돕습니다. 이를 통해 시스템은 다양한 스포츠의 '소음'을 유익한 지식의 합창으로 바꾸어, 서로 다른 동작들이 뒤섞인 혼란스러운 상황에서도 혼란 없이 처리할 수 있습니다.

연구진은 이 '올인원(all-in-one)' 모델이 놀라울 정도로 효과적이라는 것을 발견했습니다. 연구진이 세 가지 장기 스포츠 데이터셋(리듬 체조, 피겨 스케팅, 아티스틱 스위밍)에 대해 이 '올인원' 모델을 테스트했을 때, 이 모델은 기존의 '종목당 한 명의 심사위원' 방식과 대등할 뿐만 아니라 오히려 그들을 능가했습니다. 실제로, 이 새로운 모델은 이 전문가 팀 없이 단일 모델로 모든 것을 배우려고 했을 때와 비교하여 순위 정확도를 평균 약 4.7% 향상시켰으며, 점수 오차를 무려 34.4%나 줄였습니다. 더욱 인상적인 것은, 모델을 다이빙, 스키, 수술과 같이 완전히 새로운 미지의 동작(제로샷 테스트라고 불리는 것)에 던져 넣었을 때도 모델이 무너지지 않았다는 점입니다. 모델은 해당 영상을 본 적이 없음에도 불구하고 준수한 점수를 부여해 냈으며, 이는 전문가들이 다양한 세계에 적용되는 일반적인 움직임의 규칙을 학습했음을 증명합니다.

그 비결은 MoAKE가 복잡한 시간적 세부 사항을 처리하는 방식에 있습니다. 비디오는 모두 길이가 같지 않습니다. 체조 루틴은 2분일 수 있고, 수술 영상은 10분일 수도 있습니다. MoAKE는 '세그먼트 인식 시간적 집계(Segment-Aware Temporal Aggregation)'라는 영리한 기법을 사용하여, 이 비디오들을 관리 가능한 표준 크기의 덩어리로 잘게 나눕니다. 마치 긴 영화를 짧고 동일한 장면들로 나누어 전문가들이 공정하게 비교할 수 있게 만드는 것과 같습니다. 그런 다음, AIISRM(Adaptive Intra- and Inter-Segment Relationship Modeling)이라는 특별한 모듈을 사용하여 이 장면들이 어떻게 연결되는지 연구합니다. 이 모듈은 단일 장면 내부에서 일어나는 일(예: 스케이터의 팔 위치)과 장면들이 서로 어떻게 연결되는지(예: 점프에서 착지로 이어지는 흐름)를 모두 살핍니다. 다양한 수준의 세부 사항에서 이러한 관계를 모델링함으로써, 전문가들은 단순한 모델이 놓칠 수 있는 아주 작은 실수까지 잡아낼 수 있습니다.

논문은 기존의 컴퓨터 모델을 가져와서 아무런 특별한 도움 없이 모든 스포츠에 대해 동시에 학습시킬 수 있다는 생각을 명시적으로 배제합니다. 저자들은 이러한 '나이브(naive)'한 방식이 '부정적 전이(negative transfer)'를 초래한다는 것을 보여주었습니다. 즉, 한 스포츠의 지식이 다른 스포츠의 성능을 해쳐서 일부 테스트에서는 성능이 10% 이상 급격히 떨어지는 현상이 발생했습니다. 또한 저자들은 모든 동작 유형에 대해 별도의 모델이 필요하다는 생각에도 반박하며, 이러한 '하나씩 처리하는' 방식은 수천 개의 서로 다른 비디오가 존재하는 실제 환경에서 사용하기에는 너무 경직되어 있고 비용이 많이 든다는 점을 보여주었습니다.

요약하자면, MoAKE는 혼란스럽게 뒤섞인 동작들을 심사하는 최선의 방법은 더 크고 멍청한 뇌를 만드는 것이 아니라, 서로 대화할 줄 아는 똑똑한 전문가 팀을 구성하는 것임을 시사합니다. 여섯 가지 데이터셋을 통해 측정된 결과는, 이 팀 접근 방식이 서로 다른 스포츠를 혼합할 때 발생하는 문제를 해결할 뿐만 아니라, 미지의 새로운 동작을 판단하는 데도 놀라울 정도로 뛰어난 능력을 갖춘 시스템을 만든다는 것을 보여줍니다. 이는 단 하나의 AI가 어떤 경기장에든 걸어 들어가, 어떤 퍼포먼스를 보든, 그 동작이 무엇이든 상관없이 공정하고 전문가 수준의 점수를 줄 수 있는 미래를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →