← 최신 논문
🤖 machine learning

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

이 논문은 합성적으로 생성된 캡션을 포함하여 8,000만 개의 비디오(1,000만 시간)로 구성된 거대한 오픈 데이터셋인 LAION-BVD를 소개하며, 이는 비디오, 오디오 및 이미지-텍스트 작업 전반에 걸친 최첨단 멀티모달 사전 학습을 가능하게 한다.

원저자: Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Ma
게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Matthias Bethge

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능 시대에 컴퓨터는 규칙을 배우는 것이 아니라 방대한 양의 사례를 흡수함으로써 세상을 보고 듣는 법을 배우고 있습니다. 수년 동안 연구자들은 사진과 텍스트 설명을 짝지은 거대한 라이브러리를 구축해 왔으며, 이를 통해 기계가 강아지 사진에는 흔히 "강아지"라는 단어가 따라온다는 것을 이해하도록 가르쳤습니다. 멀티모달 학습(multimodal learning)이라고 알려진 이 과정은 컴퓨터가 보는 것과 읽는 것을 연결할 수 있게 해주며, 이미지를 설명하거나, 이미지에 관한 질문에 답하거나, 심지어 텍텍스트로부터 새로운 그림을 생성할 수 있는 시스템의 기초를 형성합니다. 그러나 이러한 정지 영상 라이브러리는 수십억 개의 항목을 포함할 정도로 성장한 반면, 움직이는 영상과 소리에 대한 상응하는 컬렉션은 놀라울 정도로 작게 유지되어 왔습니다. 영상은 정지 사진보다 훨씬 더 복잡합니다. 영상은 움직임, 변화하는 장면, 그리고 시각적 요소와 함께 이야기를 전달하는 사운드트랙을 포함하고 있습니다. 문제는 이러한 강력한 시스템을 훈련시키기 위해 충분한 영상 데이터를 수집하는 것이 매우 어렵다는 점이었는데, 영상은 종종 상업적 플랫폼의 벽 뒤에 갇혀 있고 이를 처리하기 위해 엄청난 컴퓨팅 파워를 필요로 하기 때문입니다.

한 연구팀이 이제 LAION-BVD라고 불리는 전례 없는 규모의 데이터셋을 공개함으로써 이 장벽을 깨뜨렸습니다. 이 컬렉션은 오픈 사이언스 분야의 거대한 도약을 의미하며, 1,000만 시간의 영상을 제공합니다. 이를 체감하기 위해, 만약 누군가가 쉬지 않고 이 모든 분량의 영상을 시청한다면 이를 다 보는 데 천 년 이상의 시간이 걸릴 것입니다. 이 데이터셋은 먼저 웹상에서 유튜브, 비메오, 데일리모션과 같은 주요 플랫폼으로부터 13억 개의 영상 링크를 수집함으로써 구축되었습니다. 이 방대한 목록 중에서 연구진은 8,000만 개의 고유한 영상을 성공적으로 다운로드했습니다. 그런 다음 자동화된 도구를 사용하여 이 긴 영상들을 장면 전환을 기준으로 짧고 의미 있는 클립으로 잘라냈으며, 이를 통해 각 세그먼트가 무관한 샷들의 뒤섞인 덩어리가 아니라 일관된 순간을 포착하도록 보장했습니다.

이 작업의 진정한 혁신은 연구진이 컴퓨터에게 이 클립들을 이해시키는 방법에 있습니다. 어떤 인간도 1,000만 시간의 영상을 직접 보고 모든 초마다 설명을 작성하는 것은 불가능하기 때문에, 팀은 인공지능을 사용하여 텍-텍스트 레이블을 자동으로 생성했습니다. 그들은 특화된 모델을 훈련시켜 영상 클립을 관찰하고 동작을 설명하는 짧은 합성 캡션을 작성하게 했으며, 별도의 모델은 오디오 트랙을 경청하여 음악부터 음성, 주변 소음에 이르기까지 소리를 설명하게 했습니다. 또한 영상에서 개별 프레임을 추출하여 각각의 설명이 달린 3라 3억 개의 이미지 컬렉션을 만들었습니다. 이 과정은 컴퓨터가 동일한 원천 자료로부터 비디오와 텍스트, 오디오와 텍스트, 심지어 단일 이미지와 텍스트를 연결하는 법을 배울 수 있는 풍부하고 다층적인 데이터셋을 만들어냈습니다.

연구진이 이 새로운 데이터를 사용하여 컴퓨터 모델을 훈련시켰을 때, 결과는 놀라웠습니다. 모델들은 기존의 더 작은 데이터셋으로 훈련된 모델들만큼, 혹은 어떤 경우에는 그보다 더 잘 비디오와 오디오를 이해하는 법을 배웠습니다. 연구진이 더 많은 데이터를 주입하고 더 큰 컴퓨터 아키텍처를 사용할수록 성능이 일관되게 향상되었는데, 이는 이 거대한 라이브러리가 기계를 가르치기 위한 고품질의 자원임을 시사합니다. 비디오로 훈련된 모델들은 누군가가 농구를 하거나 특정 춤을 추는 것과 같은 인간의 행동을 인식하는 능력이 향려졌으며, 텍스트 설명을 주었을 때 적절한 영상을 찾는 기술도 숙련되었습니다. 마찬가지로, 오디오 훈련 모델은 새가 지저귀는 소리나 자동차 엔진 소리 등 말한 단어나 서술된 묘사를 올바른 소리와 일치시키는 강력한 능력을 보여주었습니다.

아마도 놀라운 점은, 이 영상들에서 추출된 이미지들 또한 강력한 새로운 학습원이 되었다는 사실입니다. 비디오에서 유래된 이미지들로 훈련된 모델들이 엄격하고 교과서적인 방식으로 특정 객체를 식별하는 데 있어서는 최고가 아니었을지라도, 이들은 다른 작업, 즉 주어진 설명에 맞는 이미지를 찾는 데 탁월한 능력을 보였습니다. 이는 영상 속에 포착된 시각적 세계가 표준적인 웹 이미지와는 다른 종류의 다양성을 제공하며, 컴퓨터가 세상을 더 폭넓게 이해하는 데 도움이 되는 독특한 관점을 제공한다는 것을 시사합니다. 연구진은 자동화된 시스템이 생성한 캡션이 내용물을 정확하게 설명하는 경우가 대다수였으며, 충분히 유용할 만큼 정확하다는 것을 발견했습니다.

이 작업은 단순히 새로운 데이터셋을 제공하는 것에 그치지 않습니다. 이는 고급 비디오 및 오디오 AI를 훈련시키는 병목 현상이 더 이상 가용 데이터의 부족이 아니라, 그것을 처리하는 데 필요한 엔지니어링 노력에 있다는 것을 입증합니다. 방대하고 공개적으로 이용 가능한 웹 영상 컬렉션을 성공적으로 큐레이션하고 최첨단 모델을 훈련하는 데 사용할 수 있음을 보여줌으로써, 연구진은 새로운 세대의 인공지능을 위한 문을 열었습니다. 그들은 적절한 도구가 있다면 온라인 영상이라는 거대하고 혼란스러운 바다를 구조화된 교육적 자원으로 변모시킬 수 있으며, 이를 통해 기계가 단순히 멈춰 있는 모습뿐만 아니라 움직이고 소리 내는 인간 경험의 전체 스펙트럼으로부터 배울 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →