← 최신 논문
⚡ electrical engineering

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

이 논문은 방대한 규모의 새로운 데이터셋, 단계적인 3단계 학습 커리큘럼, 그리고 새로운 시간적 인터리브드 사고 사슬(temporal interleaved chain-of-thought) 프레임워크를 활용하여 길고 복잡한 실제 세계의 비디오에 대한 공동 이해 및 추론을 수행하도록 설계된 완전 개방형 최첨단 대규모 언어 모델인 Audio-Visual Flamingo(AV-Flamingo)를 소개한다.

원저자: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon K
게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 보고 있다고 상상해 보세요. 배우들의 얼굴, 배경, 그리고 액션을 보지만, 동시에 대화 소리, 배경 음악, 발자국 소리, 그리고 나뭇잎이 바스락거리는 소리도 듣습니다. 오랫동안 컴퓨터는 눈을 꼭 감은 채 오디오 트랙만 듣거나, 반대로 소리만 듣고 영상은 보지 못하는 사람과 같았습니다. 컴퓨터는 사진 속의 고양이를 인식하거나 연설을 받아쓰는 데는 뛰어났지만, 고양이가 화면을 가로질러 달려가며 야옹 하고 우는 전체적인 장면을 이해하는 데는 어려움을 겪었습니다. 이 연구 분야를 "멀티모달(multimodal)" 지능이라고 부르는데, 이는 기계가 인간처럼 세상을 이해하기 위해 시각과 청각 같은 서로 다른 감각들을 결합하려고 시도하는 것을 의미합니다. 연구자들이 던져온 핵심적인 질문은 이것입니다: 우리가 단순히 비디오를 보거나 팟캐스트를 듣는 수준을 넘어, 소리와 영상이 어떻게 함께 작용하는지, 특히 이야기가 길고 복잡할 때 그 관계를 실제로 '생각'해낼 수 있는 AI를 구축할 수 있을 것인가?

여기에 NVIDIA와 메릴랜드 대학교의 연구진이 설계한 새로운 종류의 AI 두뇌인 Nemotron-Labs-Audio-Visual Flamingo(줄여서 AV-Flamingo)가 등장했습니다. 이전의 비디오 AI를 교과서의 단 한 페이지를 읽고 간단한 질문에 답할 수 있는 학생이라고 생각해 보세요. 만약 당신이 그들에게 영화 한 편 전체를 요약하거나 15분 동안 변하는 복잡한 장면을 설명하라고 한다면, 그들은 길을 잃거나, 앞부분을 잊어버리거나, 등장인물을 혼동할 것입니다. AV-Flamingo는 다릅니다. 이 모델은 마치 영화 한 편 전체를 관람하고 사운드트랙을 들은 뒤, 음악이 어떻게 분위기를 바꾸었는지, 캐릭터가 왜 그렇게 반응했는지, 혹은 특정 소리가 시각적 사건과 관련하여 정확히 언제 발생했는지에 대해 상세한 에세이를 쓰기 위해 자리에 앉는 매우 주의 깊은 학생과 같습니다.

연구진은 이를 실현하기 위해 단순히 기존의 데이터를 더 많이 주입하는 것만으로는 부족하다는 것을 발견했습니다. 그들은 AI에게 세 가지 새로운 기술을 가르쳐야 했습니다. 첫째, 그들은 AI가 시간의 흐름에 따라 소리와 시각을 연결하는 능력을 테스트하기 위해 특별히 설계된 약 700만 개의 실제 세계 비디오 사례(여기에는 480만 개의 질의응답 쌍 포함)로 구성된 거대한 라이브러리를 만들었습니다. 그들은 이를 Audio-Visual-Skills라고 불렀습니다. 둘째, 그들은 AI를 곧바로 깊은 물 속에 던져 넣은 것이 아니라, 짧은 클립으로 기초적인 기술을 가르친 다음, 점차 더 길고 복잡한 영상으로 넘어가며 시간이 흐름에 따라 이야기를 추적하는 법을 가르치는 "커리큘럼"을 사용했습니다. 셋째, 아마도 가장 영리하게도, 그들은 AI에게 Temporal Audio-Visual Interleaved Chain-of-Thought라는 "사고 과정"을 가르쳤습니다. AI가 영상을 보면서 몇 초마다 "좋아, 바로 이 순간에 드럼 소리가 났고, 그다음에 캐릭터가 점프했어"라고 말하며 멈추는 것을 상상해 보세요. 이는 AI가 자신의 생각을 시간에 기반하여 고정함으로써, 무엇이 먼저 일어났고 무엇이 나중에 일어났는지에 대해 혼동하지 않도록 돕습니다.

결과는 꽤 인상적입니다. 음악과 언어를 이해하는 것부터 긴 영상을 분석하고 까다로운 질문에 답하는 것에 이르기까지 15가지 이상의 다양한 과제를 테스트했을 때, AV-Flamingo는 비슷한 크기의 다른 오픈 소스 모델들을 명확한 차이로 앞질렀습니다. 사실, 이 모델은 현재 세계 최고 수준인 (코드를 볼 수 없는) 훨씬 더 크고 값비싼 "폐쇄형(closed)" 모델들과도 경쟁했으며, 때로는 그들을 이기기도 했습니다. 이 논문은 이 모델이 단서들이 시간에 걸쳐 흩어져 있는 길고 복잡한 실제 세계의 영상을 처리하는 데 특히 뛰어나다는 점을 시사하며, 적절한 데이터와 훈련 방법이 있다면 오픈 소스 AI도 거인들을 따라잡을 수 있음을 증명했습니다. 이는 컴퓨터가 세상을 그저 바라보는 것을 넘어, 진정으로 "보고 듣는" 능력을 갖추기 위한 큰 도약입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →