Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
이 논문은 비디오 이해 시나리오에서 복잡하고 사용자가 지정한 제약 조건을 따르는 멀티모달 거대 언어 모델의 미개척 능력을 평가하기 위해 1.5K개의 샘플과 다양한 지시어 분류 체계를 특징으로 하는 포괄적인 벤치마크인 Video-IFBench를 소개하며, 현재의 모델들이 다중 제약 및 조건부 지시 사항을 수행하는 데 상당한 어려움을 겪고 있음을 밝힙니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 진화하는 세상에서, 보고 듣고 말할 수 있는 새로운 세대의 시스템이 등장했습니다. 이러한 멀티모달 모델은 방대한 양의 텍스트, 이미지, 비디오를 학습하여 장면을 묘사하거나, 영화에 관한 질문에 답하거나, 뉴스 클립을 요약할 수 있습니다. 수년 동안 연구자들은 "답이 맞는가?"라는 단순한 질문을 통해 이들의 성공을 측정해 왔습니다. 만약 모델이 요리 프로그램 영상을 보고 재료를 정확히 맞혔다면 높은 점수를 받았습니다. 하지만 현실 세계에서는 정답을 맞히는 것만으로는 충분하지 않은 경우가 많습니다. 사용자는 모델에게 영상을 설명하라고 요청하면서도 특정한 규칙을 고수할 수 있습니다: "물이 끓은 후에 일어나는 일만 말해줘", "단계별로 순서대로 나열해줘", "냄비의 색깔은 언급하지 마", 또는 "스페인어로만 말해줘"와 같은 요청들입니다. 이러한 요청은 시스템이 콘텐츠를 이해할 뿐만 아니라, 알고 있는 사실이라 할지라도 무시하라고 지시받은 정보는 걸러내는 복잡한 일련의 지침을 따를 것을 요구합니다. 지금까지 이러한 첨단 시스템들이 비디오 시나리오에서 이토록 상세하고 인간다운 제약 조건을 따르는 능력은 거의 테스트되지 않은 채 남아 있었습니다.
연구진은 Video-IFBench라는 새로운 테스트 환경을 구축함으로써 이 간극을 해결했습니다. 이 벤치마크는 비디오 이해 인공지능이 까다로운 지침을 받았을 때 실제로 시키는 대로 할 수 있는지 확인하기 위해 특별히 설계되었습니다. 연구진은 스포츠, 과학, 뉴스, 일상생활 등 10가지 다른 영역을 아우르는 700개 이상의 영상을 공공 소스에서 수집했습니다. 이 클립들은 10초에서 10분 길이이며, 총 영상 길이는 약 49시간에 달합니다. 이 컬렉션으로부터 연구진은 1,500개의 고유한 테스트 케이스를 구성했습니다. 각 테스트 케이스는 비디오와 특정 요청을 쌍으로 묶으며, 이 요청에는 다양한 작업과 제약 조건이 포함됩니다. 어떤 요청은 "화면에 있는 텍스트는 무엇인가요?"와 같이 단일 정보를 요구하는 반면, 다른 요청은 "동작들을 나열하되, 2초보다 오래 지속되는 동작들만 포함하고, 이를 번호가 매겨진 목록으로 제시하라"와 같이 여러 단계를 요구하기도 합니다. 가장 어려운 테스트는 모델이 경로를 결정하기 위해 먼저 영상을 시청해야 하는 조건부 논리를 포함합니다. 예를 들어, 프롬프트가 "만약 영상이 노트북 수리에 관한 제목으로 시작한다면 수리 단계를 설명하고, 그렇지 않다면 마지막 10초 동안의 인물의 행동을 설명하라"라고 할 수 있습니다. 모델은 올바른 지침 세트를 선택하기 위해 시작 조건을 정확히 식별해야 합니다.
테스트의 공정성과 정확성을 보장하기 위해 연구진은 질문과 정답 확인 규칙을 생성하는 반자동 시스템을 구축했습니다. 연구진은 인공지능을 사용하여 존재하는 사물이나 특정 사건이 발생한 시점과 같은 사실들을 영상에서 추출한 다음, 그 사실들을 이용해 복잡한 지침을 작성했습니다. 결정적으로, 모든 지침에는 체크리스트가 따라붙었습니다. 체크리스트의 일부 항목은 답변이 JSON 형식인지 또는 정확히 5개의 불렛 포인트로 구성되었는지와 같이 컴퓨터 프로그램에 의해 확인할 수 있는 것들이었습니다. 의미론적 이해를 필요로 하는 다른 항목들은 별도의 고성능 언어 모델이 판사 역할을 수행하며 확인했습니다. 이러한 하이브리드 접근 방식 덕분에 연구진은 모델이 단순히 주요 과업뿐만 아니라 요청된 모든 제약 조건을 충족했는지 평가할 수 있었습니다.
이 평가 결과는 오늘날 사용 가능한 가장 진보된 비디오 모델들조차 상당한 약점을 가지고 있음을 드러냈습니다. 벤치마크 전체를 대상으로 테스트했을 때, 가장 성능이 좋은 모델의 종합 점수는 단 54.5%에 불과했습니다. 이는 모델이 비디오 내용을 올바르게 이해했더라도, 거의 절반에 가까운 경우에서 전체 지침을 완벽히 따르는 데 실패했음을 의미합니다. 연구에 따르면 모델들은 한 번에 많은 제약 조건이 포함되어 있거나, 답변하기 전에 비디오 콘텐츠를 바탕으로 결정을 내려야 하는 요청을 받을 때 가장 어려움을 겪었습니다. 예를 들어, 영상에서 일어난 일을 바탕으로 서로 다른 경로 중 하나를 선택하라는 요청을 받았을 때, 모델들은 자주 잘못된 경로를 선택하거나 조건을 완전히 무시했습니다. 지침이 복잡해질수록 난이도는 높아졌습니다. 즉, 깊은 단계의 "만약-그러면(if-then)" 논리가 포함된 요청의 경우 성공률이 급격히 떨어졌습니다.
연구진은 또한 제약 조건의 유형이 매우 중요하다는 것을 발견했습니다. 모델들은 특정 언어를 사용하거나 단어 수를 제한하는 것과 같은 형식 규칙을 따르는 데는 비교적 능숙했습니다. 그러나 비디오의 의미를 이해하여 정보를 필터링해야 하는 의미론적 제약 조건에는 취약한 모습을 보였습니다. 예를 들어, 특정 인물의 행동만을 설명하고 다른 사람들은 무시하라는 요청을 받거나, 정밀한 시간 범위 내에서 발생한 사건들을 나열하라는 요청을 받는 경우입니다. 이 경우 모델들은 제외하라고 지시받은 정보를 포함하거나 찾아내야 할 세부 사항을 놓치는 경우가 많았습니다. 연구는 단순히 모델을 더 크게 만들거나 더 많은 컴퓨팅 파워를 제공하는 것이 문제를 해결하지 못한다는 것을 보여주었습니다. 규모가 큰 모델들이 일반적으로 더 나은 성능을 보이기는 했지만, 여전히 엄격한 지침을 일관되게 따르는 데는 실패했습니다. 이는 비디오 콘텐츠를 이해하는 능력과 복잡한 규칙을 따르는 능력이 현재의 기술로는 아직 완전히 결합되지 않은 두 가지 서로 다른 기술임을 시사합니다.
이 연구는 인공지능이 진정으로 현실 세계의 응용 분야에서 유용해지기 위해서는 보는 것만큼이나 주의 깊게 듣는 법을 배워야 한다는 점을 시사합니다. 연구 결과는 현재의 시스템이 사용자가 자신의 구체적인 요구사항을 정확히 준수하기를 기대하는 시나리오에 배치되기에는 아직 충분히 신뢰할 만한 수준이 아님을 나타냅니다. 연구진은 Video-IFBench가 이러한 능력을 측정할 수 있는 명확한 척도를 제공함으로써, 향로의 세계를 볼 수 있을 뿐만 아니라 그것을 사용하는 사람들의 미묘하고 때로는 모순적인 지침까지 따를 수 있는 모델 개발을 가이드하기를 희망합니다. 앞으로 나아갈 길은 단순히 정답을 맞히는 것에서 벗어나, 사용자가 요청한 바로 그 방식으로 정답을 얻는 데 초점을 맞추는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.