← 최신 논문
💬 NLP

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

이 논문은 인간과 AI의 협업을 통해 생성된 미국 및 중국 TV 프로그램으로부터 추출한 3,000개 이상의 문화적 규범 주석을 담은 데이터셋인 VideoNorms를 소개하며, 이는 현재의 VideoLLM들이 중국의 문화적 맥락과 비언어적 증거를 다루는 데 더 큰 어려움을 겪고 있음을 드러내어 문화적으로 근거 있는 훈련과 평가의 필요성을 강조한다.

원저자: Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

게시일 2026-07-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 인간의 행동을 이해하도록 가르치고 있다고 상상해 보세요. 당신은 두 사람이 만나는 영상을 보여주며 이렇게 묻습니다. "그들이 예의 바르게 행동하고 있나요?" 인공지능의 세계에서 이것은 거대한 도전입니다. 우리는 '비디오 거대 언어 모델(VideoLLMs)'을 구축했습니다. 이는 영상을 보고 그 안에 무엇이 있는지 말할 수 있는 매우 똑똑한 컴퓨터입니다. 하지만 대부분의 로봇은 세계의 특정 구석, 주로 미국에서 온 데이터로만 학습되었습니다. 이들은 고양이나 자동차를 포착하는 데는 뛰어나지만, 우리가 악수를 하거나, 사과하거나, 작별 인사를 할 때 따르는 보이지 않는 사회적 규칙에 있어서는 종종 비틀거립니다. 어떤 나라에서는 왼손으로 가리키는 것이 무례하다는 것을 모르는 관광객처럼, 이 AI 모델들은 다른 문화권에서는 사실 중대한 결례가 될 수 있는 행동을 정상이라고 생각할 수도 있습니다. 이 논문은 비판적인 질문을 던집니다. 이 비디오를 보는 로봇들이 서로 다른 사회의 문화적 '분위기'를 이해할 수 있을까요, 아니면 그저 그들이 본 미국 영화를 바탕으로 추측하고 있는 것일까요?

이를 해결하기 위해, 연구진은 VIDEONORMS라는 새로운 테스트를 만들었습니다. 이 데이터셋을 거대한 글로벌 버전의 '틀린 그림 찾기' 게임이라고 생각하세요. 다만 숨겨진 물체를 찾는 대신, AI는 사람들이 사회적 규칙을 따르고 있는지 아니면 어기고 있는지를 찾아내야 합니다. 연구진은 단순히 AI에게 추측하라고 요구한 것이 아닙니다. 그들은 '인간-AI 팀'을 구성했습니다. 먼저, 매우 강력한 AI(Gemini라고 불리는)가 미국과 중국의 인기 TV 프로그램에서 가져온 수천 개의 15초 분량 클립을 시청하고, 자신이 생각하는 사회적 규칙이 무엇인지 기록했습니다. 그 다음, 해당 특정 문화권에서 자란 실제 인간 전문가들이 편집자 역할을 하기 위해 개입했습니다. 그들은 AI의 작업을 검토하며, 로봇이 놓쳤을지도 모르는 몸짓이나 어조에 대한 세부 사항을 수정하고 추가했습니다. 이 과정을 통해 TV 쇼 속 캐릭터들이 예의 바른지 무례한지에 대한 3,000개 이상의 인간 검증된 판단이 담긴 방대한 라이브러리가 만들어졌습니다.

연구진이 일곱 가지 서로 다른 오픈 소스 비디오 AI 모델을 이 새로운 데이터셋으로 테스트했을 때, 로봇들의 문화적 지능에서 놀라운 격차를 발견했습니다. 첫째, 모델들은 중국의 규범보다 미국의 규범을 이해하는 데 훨씬 더 뛰어났습니다. 마치 로봇들이 미국 문화에 대한 시험 공부는 열심히 했지만, 중국 문화에 대해서는 교과서를 거의 펼쳐보지도 않은 것과 같았습니다. 구체적으로, 모델들은 중국 캐릭터가 규칙을 '따르고' 있을 때를 예측하는 데 어려움을 겪었으며, 그 맥락에서 '예의 바름'이 무엇을 의미하는지 혼동하곤 했습니다. 둘째, 로봇들은 만약 단서가 비언어적일 경우, 그것이 왜 무례하거나 예의 바른지에 대해 설명하는 데 훨씬 더 큰 어려움을 겪었습니다. 만약 캐릭터가 팔짱을 끼거나 시선을 피한다면, AI는 그 신호를 놓치는 경우가 많았던 반면, "죄송합니다"나 "감사합니다"와 같은 언어적 단서를 포착하는 데는 훨씬 더 뛰어났습니다.

연구는 단순히 AI를 더 '크게' 만들거나 더 똑똑하게 만드는 것이 이러한 문제를 해결할 수 있는지도 테스트했습니다. 그들은 더 큰 모델을 사용하고 더 많은 비디오 프레임을 입력해 보았지만, 결과는 크게 개선되지 않았습니다. 이는 문제가 단순히 로봇이 얼마나 많은 데이터를 암기했느냐의 문제가 아니라, 어떤 '종류'의 데이터를 가지고 있느냐의 문제임을 시사합니다. 또한 연구진은 대본(말하는 내용)만 읽어서는 장면을 이해할 수 없으며, 실제로 영상을 시청해야 한다는 것을 증명했습니다. 문화적 맥락을 제대로 파악하기 위해서는 시각적 단서가 필수적입니다.

요약하자면, 이 논문은 비디오를 보는 AI가 세상을 보는 능력은 향상되고 있지만, 다양한 문화권에서 인간이 행동하는 다양한 방식들을 진정으로 이해하기까지는 아직 갈 길이 멀다는 것을 보여줍니다. 현재의 로봇들은 사전은 알지만 현지 관습은 배우지 못한 관광객과 같으며, 단순히 덩치를 키운다고 해서 도로 위의 규칙을 배울 수는 없습니다. 진정으로 문화적 인지 능력을 갖춘 AI를 만들기 위해서는, 단지 할리우드 이야기뿐만 아니라 훨씬 더 다양한 인간의 이야기를 바탕으로 그들을 훈련시켜야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →