← 최신 논문
💻 computer science

PushupBench: Your VLM is not good at counting pushups

이 논문은 시각-언어 모델(VLM)이 비디오 내 반복 횟수를 세는 데 취약함을 보여주는 새로운 평가 데이터셋인 **PushupBench**를 제안하며, 반복 횟수 학습이 일반적인 비디오 이해 능력을 향상시키는 핵심적인 시간적 추론 지표가 될 수 있음을 입증합니다.

원저자: Shengzhi Li, Jiarun Chen, Karun Sharma, Jiaqi Su, Shichao Pei

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shengzhi Li, Jiarun Chen, Karun Sharma, Jiaqi Su, Shichao Pei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏃‍♂️ 제목: "우리 집 AI는 왜 운동 횟수를 못 셀까?"

(부제: AI의 '눈치'가 아닌 '진짜 실력'을 키우는 방법)

1. 문제 상황: "말은 잘하는데, 숫자는 꽝이에요!" 😵‍💫

요즘 인공지능(VLM)들은 정말 똑똑합니다. 영상을 보여주면 "아, 사람이 스쿼트를 하고 있네요!"라고 아주 자연스럽게 말하죠. 하지만 정작 **"그래서 몇 번 했어?"**라고 물어보면 엉망진창입니다.

이걸 비유하자면 이런 거예요.

여러분이 축구 경기를 보고 있다고 해봅시다. AI는 "지금 축구 경기를 하고 있어요!"라고 말하는 '해설가' 역할은 아주 잘합니다. 하지만 정작 "방금 골이 몇 번 들어갔지?"라고 물으면, 눈을 감고 대충 찍거나 "음... 한 10번쯤?"이라며 엉뚱한 소리를 하는 '눈치 없는 관객' 같은 상태인 거죠.

2. AI의 비겁한(?) 수법: "찍기 신공" 🎲

연구자들이 발견한 재미있는 사실이 있습니다. 성능이 낮은 AI들은 진짜로 영상을 보고 세는 게 아니라, **'통계적 눈치'**를 굴린다는 거예요.

운동 영상들을 보면 보통 한 세트에 10번씩 하는 경우가 많죠? AI는 영상을 제대로 분석하기 귀찮으니까, 그냥 **"에라 모르겠다, 다 10번이라고 대답하자!"**라고 전략을 짜버립니다. 실제로 많은 AI가 영상 내용과 상관없이 '10'이라는 숫자만 반복해서 말하는 '찍기 신공'을 부리고 있었습니다.

3. 새로운 시험지: "푸쉬업 벤치(PushupBench)" 📝

그래서 연구팀은 AI의 진짜 실력을 테스트하기 위해 아주 까다로운 시험지를 만들었습니다. 이름하여 'PushupBench'!
단순히 짧은 영상이 아니라, 전 세계 다양한 운동 유튜버들의 길고 다양한 운동 영상을 모았습니다. AI가 단순히 '찍기'로 통과할 수 없도록, 아주 정교하게 설계된 '진짜 수학 시험지' 같은 것이죠.

4. 해결책: "양보다 질! 제대로 된 과외" 🎓

연구팀은 AI에게 '숫자 세기'를 가르치기로 했습니다. 그런데 여기서 중요한 비결이 나옵니다. "무작정 많이 가르치지 말고, 제대로 된 문제로 가르쳐라!"

처음에는 968개의 문제를 줬는데, AI가 자꾸 꼼수를 부리니까 연구팀은 과감하게 문제를 깎아냈습니다.

  • 너무 빠른 영상은 버림: (너무 빨라서 눈이 못 따라가는 문제)
  • 정답이 10인 문제는 버림: (AI가 "그냥 10이라고 하면 점수 잘 주네?"라고 편법 쓰는 걸 막기 위해)
  • 화면에 숫자가 써진 영상은 버림: (영상을 보는 게 아니라 화면에 적힌 글자를 읽는 '컨닝'을 막기 위해)

결국 **딱 391개의 '진짜 알짜배기 문제'**만 골라서 집중 과외를 시켰더니, AI가 놀라운 변화를 보였습니다!

5. 결과: "숫자 세기를 배웠더니, 세상이 보이기 시작했다!" ✨

이게 이 논문의 가장 놀라운 결론입니다. AI에게 **'숫자 세기(반복 횟수 세기)'**를 가르쳤더니, 단순히 숫자만 잘 세게 된 게 아니었습니다.

숫자를 세려면 "언제 동작이 시작되고, 언제 끝나는지" 그 흐름(시간의 흐름)을 아주 정밀하게 파악해야 하거든요. 이 '시간을 읽는 눈'이 생기니까, 다른 영상 이해 능력까지 덩달아 업그레이드되었습니다!

비유하자면:
젓가락질 연습을 아주 정교하게 시켰더니, 젓가락질만 잘하게 된 게 아니라 손가락의 미세한 근육이 발달해서 글씨도 잘 쓰고, 피아노도 잘 치게 된 것과 같습니다!


💡 요약하자면?

  1. 문제: AI는 영상 속 동작은 알아채지만, 횟수를 세는 '시간적 추론' 능력은 부족하다. (찍기만 한다!)
  2. 방법: 꼼수를 부릴 수 없는 아주 깨끗하고 정교한 '운동 횟수 세기' 데이터로 집중 교육을 시켰다.
  3. 결과: 숫자 세기 실력이 늘었더니, 영상의 흐름을 파악하는 전반적인 지능(시간적 추론 능력)이 쑥 올라갔다!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →