← 최신 논문
💬 NLP

Can Vision Language Models Judge Action Quality? An Empirical Evaluation

본 논문은 Gemini 3.1 Pro, Qwen3-VL 등 최신 비전 - 언어 모델 (VLM) 이 운동 수행도 평가 (AQA) 에서 무작위 추측 수준에 머무르며, 다양한 전략에도 불구하고 미세한 동작의 질을 판단하는 데 근본적인 한계가 있음을 실증적으로 규명합니다.

원저자: Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"최첨단 AI(비전 언어 모델) 가 정말로 운동 동작을 잘하고 나쁘게 판단할 수 있을까?"**라는 질문을 던지며, 여러 가지 실험을 통해 그 답을 찾은 연구입니다.

결론부터 말씀드리면, **"아직은 AI 가 운동 코치로 쓰이기엔 너무 초보 수준"**이라는 것이 이 논문의 핵심입니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 연구의 배경: "AI 코치"를 기대했지만...

우리는 AI 가 사람의 운동을 보고 "허리가 너무 굽었어요", "무릎이 안으로 찌그러졌어요"라고 정확한 피드백을 줄 수 있기를 바랐습니다. 마치 프로 운동 코치가 옆에서 지켜보며 조언하는 것처럼요.

하지만 연구자들은 최신 AI 모델들 (Gemini, Qwen, InternVL 등) 을 시험해 보니, AI 가 운동 동작을 평가하는 능력은 거의 '주사위 던지기' 수준이라는 것을 발견했습니다.

2. 실험 방법: AI 를 어떻게 시험했나?

연구자들은 AI 들에게 다양한 운동을 보여주고 평가를 요청했습니다.

  • 운동 종류: 헬스장 운동 (스쿼트, 푸쉬업), 피겨스케이팅 점프, 다이빙 등.
  • 시험 방식:
    • 기본 시험: 그냥 영상을 보여주고 "잘했나요?"라고 물음.
    • 보조 도구 사용: 사람의 뼈대 (스켈레톤) 그림을 입혀서 더 잘 보이게 함.
    • 지시어 변경: "잘하는 법"을 설명해 주거나, "잘못하는 법"을 설명해 주는 등 질문 방식을 바꿔봄.
    • 비교 시험: "이 두 동작 중 누가 더 잘했나요?"라고 두 영상을 동시에 보여줌.

3. 주요 발견: AI 가 가진 두 가지 치명적인 버그

실험 결과, AI 는 몇 가지 재미있지만 치명적인 버그 (오류) 를 가지고 있었습니다.

🐻 버그 1: "무조건 잘했어요" (긍정 편향)

AI 는 영상을 보지 않고도 대부분의 동작을 "잘 수행되었다"고 판단하는 경향이 있었습니다.

  • 비유: 마치 매너 좋은 식당 웨이터가 손님이 음식을 다 먹어치우고 난 뒤에도 "음식이 정말 맛있으셨죠?"라고 무조건 칭찬하는 것과 같습니다. AI 는 운동이 어떻게 '잘' 해야 하는지 알고는 있지만, 실제 영상에서 '잘못'된 부분을 찾아내기는 너무 어려워, 그냥 "다 잘했어요"라고 넘어가는 것입니다.

🗣️ 버그 2: "말투에 너무 민감함" (언어적 편향)

질문하는 말투만 바꿔도 AI 의 답변이 뚝뚝 바뀌었습니다.

  • 비유: 같은 음식에 대해 "이 음식은 맛이 어때요?"라고 물으면 "맛있어요"라고 답하다가, "이 음식에 실수가 있었나요?"라고 물으면 갑자기 "아, 실수가 있었네요"라고 답하는 기분 좋은 친구와 같습니다. AI 는 영상 속 실제 동작보다는 질문 문장의 뉘앙스에 더 반응했습니다.

4. 해결 시도와 실패: "비교"를 시켜도 소용없었다

연구자들은 "그럼 두 동작을 비교해서 더 나은 것을 고르게 하면 어떨까?"라고 생각했습니다. (예: "A 와 B 중 누가 더 잘했나요?")

  • 결과: 두 동작의 차이가 아주 극명할 때는 AI 가 잘 맞췄지만, 미세한 차이가 있는 경우에는 여전히 주사위 던지기 수준으로 망쳤습니다. 이는 AI 가 운동의 '세부적인 질'을 이해하는 데 근본적인 한계가 있음을 보여줍니다.

5. 결론: 아직은 인간 코치가 필요합니다

이 논문은 우리에게 중요한 메시지를 줍니다.

"지금 당장 AI 를 운동 코치나 심판으로 쓰기는 너무 이르다."

AI 는 아직 운동 동작의 미세한 뉘앙스 (무릎 각도, 몸의 균형 등) 를 눈으로 보고 판단하는 능력이 부족합니다. 대신 AI 는 이미 알고 있는 지식을 바탕으로 "대체로 잘했겠지"라고 추측하거나, 질문하는 말투에 맞춰 답변을 만들어내는 데 더 능숙할 뿐입니다.

요약하자면:
AI 는 운동에 대해 '지식'은 많지만, '눈'은 아직 제대로 뜨지 못한 상태입니다. 우리가 AI 를 믿고 운동 교정이나 경기 심판에 쓸 수 있으려면, 아직은 훨씬 더 많은 발전이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →