← 최신 논문
🤖 machine learning

BRIDLE: Generalized Self-supervised Learning with Quantization

BRIDLE은 계층적 잔차 양자화(hierarchical residual quantization)를 양방향 학습 과정에 통합함으로써 단일 코드북 벡터 양자화의 한계를 극복하고 다양한 다운스트림 작업에서 최첨단 성능을 달성하며 오디오, 이미지, 비디오 모달리티 전반에 걸쳐 표현 품질을 향상시키는 일반화된 자기지도 학습 프레임워크이다.

원저자: Hoang M. Nguyen, Satya N. Shukla, Qiang Zhang, Hanchao Yu, Sreya D. Roy, Dipesh Tamboli, Taipeng Tian, Lingjiong Zhu, Yuchen Liu

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hoang M. Nguyen, Satya N. Shukla, Qiang Zhang, Hanchao Yu, Sreya D. Roy, Dipesh Tamboli, Taipeng Tian, Lingjiong Zhu, Yuchen Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 세계에서 기계는 패턴을 인식하는 데 놀라운 능력을 보여주고 있지만, 학습을 위해 방대한 양의 인간이 라벨을 붙인 예시를 필요로 하는 경우가 많습니다. 아이에게 동물을 식별하는 법을 가르치기 위해, 인내심 강한 교사가 정성껏 이름표를 붙인 수천 장의 사진을 보여주는 상황을 상상해 보십시오. 이 방식은 효과적이긴 하지만, 느리고 비용이 많이 들며, 인간의 도움을 기다려야 한다는 점에서 기계가 배울 수 있는 범위를 제한합니다. '자기 지도 학습(self-supervised learning)'이라 불리는 더 강력한 접근 방식은 기계가 주어진 가공되지 않은 데이터를 스스로 공부하게 함으로써, 누군가 답을 적어주지 않아도 데이터 속에 숨겨진 구조와 연결 고리를 찾아내도록 합니다. 이 방법은 컴퓨터가 언어를 이해하는 방식에 이미 혁명을 일으켰으며, 이를 통해 컴퓨터는 수십억 권의 책을 읽고 빠진 단어를 추측함으로써 문장의 깊은 의미를 파악할 수 있게 되었습니다. 이제 연구자들은 이러한 자기 학습 능력을 소리, 이미지, 영상의 세계로 확장하여, 기계가 단어를 이해하는 것처럼 시각적 및 청각적 세계를 자연스럽게 이해할 수 있도록 만들고자 노력하고 있습니다.

소리와 영상에 이러한 자기 학습 방식을 적용하는 데 있어 어려움은, 이 신호들이 문장의 불연속적인 단어들과 달리 연속적이고 복잡하다는 점입니다. 컴퓨터가 이를 더 쉽게 처리할 수 있도록, 연구자들은 종종 이 신호들을 마치 매끄러운 물줄기를 일련의 개별 물방울로 나누는 것처럼 작고 뚜렷한 덩어리로 분해합니다. 이를 위한 대중적인 방법은 '토크나이저(tokenizer)'라 불리는 구성 요소를 사용하는 것인데, 이는 원시 신호를 일련의 이산적인 토큰(discrete tokens)으로 변환하는 번역가 역할을 합니다. 한동안 가장 성공적이었던 시스템들은 신호의 일부를 나타내기 위해 고정된 선택지 목록에서 단 하나의 토큰만을 선택하는 단순한 번역기를 사용했습니다. 그러나 이 방식에는 한계가 있습니다. 컴퓨터가 평면적인 목록에서 단 하나의 옵션만을 선택하도록 강제하기 때문에, 복잡한 소리나 움직이는 영상을 구성하는 미묘하고 층위가 있는 세부 사항들을 놓칠 수 있기 때문입니다. 이는 마치 복잡한 그림을 묘 여러 색조를 섞어 깊이와 질감을 포착하는 대신, 팔레트에서 단 하나의 색깔만을 골라 설명하려는 것과 같습니다.

플로리다 주립 대학교와 메타 플랫폼스(Meta Platforms Inc.)의 연구팀은 이 문제를 해결하기 위해 BRIDLE이라는 새로운 시스템을 개발했습니다. 그들의 연구는 이러한 자기 학습 시스템에 사용되는 번역기, 즉 토크나이저를 개선하는 데 초점을 맞추고 있습니다. 단일한 평면 목록에 의존하는 대신, 그들은 단계별로 작동하는 계층적 시스템을 도입했습니다. 어떤 장소를 설명할 때 전화번호부에서 단 하나의 주소를 고르는 것이 아니라, 먼저 국가를 식별하고, 그다음 주, 도시, 그리고 마지막으로 거리 순으로 식별하는 과정을 상상해 보십시오. 각 단계는 설명에 세부 사항을 더합니다. BRIDLE 시스템에서 컴퓨터는 소리나 이미지를 일련의 잔차(residuals), 즉 남은 세부 사항들로 분해하고, 각 층위를 설명하기 위해 일련의 코드북(codebooks)을 사용합니다. 첫 번째 단계는 광범위하고 일반적인 특징을 포착하며, 후속 단계들은 더 미세하고 구체적인 세부 사항들을 채워 넣습니다. 이러한 층위들을 더함으로써, 시스템은 단일 단계 방식이 결코 도달할 수 없었던 훨씬 더 풍부하고 정밀한 데이터 표현을 만들어낼 수 있습니다.

연구진은 이 새로운 접근 방식을 오디오, 이미지, 영상이라는 세 가지 다른 유형의 데이터에 대해 테스트했습니다. 그들은 유튜브의 수백만 개 소리 클립, 표준 ImageNet 컬렉션의 백만 개 이상의 이미지, 그리고 인간의 행동을 보여주는 수십만 개의 영상 클 clip 등 방대한 데이터셋을 통해 모델을 학습시켰습니다. 모든 경우에서 그들은 새로운 계층적 방식과 기존의 단일 목록 방식을 비교했는데, 이때 토큰의 총 개수는 동일하게 유지하여 오직 토큰이 어떻게 조직되었는지만이 차이점이 되도록 했습니다. 결과는 명확하고 일관적이었습니다. 이 다단계, 계층적 접근 방식을 사용하는 새로운 시스템은 기존의 방식보다 일관되게 우수한 성능을 보였습니다. 이러한 향상은 특히 연구진이 컴퓨터가 이전에 본 적 없는 새로운 것을 인식하는 능력, 즉 '선형 프로빙(linear probing)'이라 불리는 과제를 테스트했을 때 두드러졌습니다. 이는 새로운 시스템이 더 유연하고 견고한 세계 이해도를 학습하여, 다른 작업에 사용하기 더 쉬운 표현을 만들어냈음을 시사합니다.

단순한 성능 수치를 넘어, 연구진은 시스템이 더 효과적으로 학습하는 방법을 조사했습니다. 그들은 시스템이 학습을 시작하는 방식이 매우 중요하다는 것을 발견했습니다. 시작 지점을 무작위로 두는 대신, 특정 수학적 기법을 사용하여 시작 지점들을 균등하게 퍼뜨림으로써 초기화하면 시스템이 더 빠르고 안정적으로 학습한다는 것을 알아냈습니다. 또한 그들은 시스템의 모든 부분이 사용되도록 하여, 컴퓨터가 자신의 어휘 중 큰 부분을 무시하는 현상을 방지하는 방법도 개발했습니다. 이러한 기술적 개선 사항들은 새로운 계층적 구조와 결고되어, 시스템이 오디오 분류 분야에서 기존의 최고 모델들과 대등하거나 이를 능가하는 최첨단(state-of-the-art) 결과를 달-성하게 했습니다. 이 연구는 기계가 정보를 어떻게 분해하고 표현하느냐가 학습 알고리즘 자체만큼이나 중요하다는 것을 입증합니다. 평면적인 단일 선택 시스템에서 깊이 있는 계층적 시스템으로 전환함으로써, 연구진은 기계가 더 미묘하고 명확하게 세상을 보고 듣는 법을 배울 수 있음을 보여주었으며, 이는 더욱 유능하고 다재다능한 인공지능을 향한 길을 열어주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →