Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation
이 논문은 공유된 시간 그리드 상에서 완전하게 정렬된 양방향 입출력 상호작용을 달성하여, 효율적인 KV 캐시 재사용과 200ms 미만의 처리 지연 시간을 통해 저지연 및 선제적 생성을 가능하게 하는 4B 스트리밍 멀티모달 모델인 Aero Realtime을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 친구와 함께 영화를 보고 있는 상황을 상상해 보세요. 일반적인 대화에서는 상대방이 문장을 끝낼 때까지 기다렸다가 말을 합니다. 하지만 정말 자연스러운 대화에서는 상대가 말을 하는 도중에도 "와!" 하고 짧게 끼어들 수도 있고, 혹은 복잡한 줄거리를 설명하는 동안에는 조용히 듣고 있다가, 무언가 새로운 것을 이해하는 바로 그 순간에 딱 맞춰 끼어들 수도 있습니다. 이것이 바로 '실시간' 상호작용의 성배입니다. 즉, 흐름을 놓치지 않으면서 동시에 듣고 말할 수 있는 능력 말이죠.
오랫동안 컴퓨터는 이 작업에 서툴렀습니다. 대부분의 AI 모델은 매우 예의 바르지만 약간 느린 '뜨거운 감자(hot potato)' 게임처럼 작동합니다. 당신의 이야기 전체(입력)가 끝날 때까지 기다렸다가, 한꺼번에 처리한 다음, 비로소 말하기(출력)를 시작합니다. 이들은 말하는 동안 "듣는" 것을 잘 하지 못합니다. 만약 문장 중간에 새로운 정보를 입력하려고 하면, 모델은 혼란에 빠지거나 처음부터 다시 시작해야 합니다. 이 논문은 진정으로 '전이중(duplex)' 방식, 즉 인간처럼 빠르게 움직이는 비디오 스트림을 따라가면서도 새로운 것을 듣고 새로운 것을 동시에 말할 수 있는 AI를 구축하는 문제를 다룹니다.
홍콩 대학교와 다른 기관의 연구진들이 만든 Aero Realtime이라는 새로운 AI 모델은 이 문제를 해결했습니다. 이 모델을 단순히 문장 단위로 말하는 것이 아니라, 아주 작은 시간적 '비트(beat)' 단위로 움직이는 모델이라고 생각해보세요. 비디오가 끝날 때까지 기다리는 대신, Aero Realtime은 시간을 80밀리초(ms)라는 아주 작은 조각으로 나눕니다. 들려오는 모든 오디오 조각마다 모델은 찰나의 결정을 내려야 합니다. "지금 단어를 말해야 할까, 아니면 침묵해야 할까?"
이는 기존 모델들의 작동 방식과는 큰 차이점입니다. 보통 AI는 '생각'하는 단계가 끝나야 '말하는' 단계를 시작할 수 있습니다. 하지만 Aero Realtime은 이 두 가지를 동시에 수행합니다. 이 모델은 비디오, 오디오, 그리고 자신의 단어들을 하나의 공유된 타임라인 위에 정렬합니다. 모든 80밀리초마다 새로운 비디오와 오디오 조각이 도착하는 컨베이어 벨트를 상상해 보세요. 바로 그 순간, AI는 벨트 위에 단어를 떨어뜨릴지, 아니면 '침묵 토큰(조용히 있는 상태를 나타내는 자리 표시자)'을 떨어뜨릴지 결정합니다. 이를 통해 AI는 문장을 생성하는 도중에도 비디오의 새로운 부분을 계속해서 들을 수 있습니다. 흐름을 끊고 뒤처진 것을 따라잡으려 애쓸 필요가 없는 것입니다.
이 논문은 AI를 '주도적(proactive)'으로 만들려는 이전의 시도들이 투박했다고 주장합니다. 어떤 시스템들은 AI가 계속해서 "지금 말해야 하나?"라고 스스로에게 묻는 '마이크로 턴(micro-turn)' 방식을 사용했습니다. 이는 마치 매 교차로마다 지도를 확인하기 위해 차를 멈춰 세우는 운전자와 같습니다. 또 다른 방식은 외부의 '게이트'나 스위치를 사용하여 말할 타이밍을 결정했는데, 이는 시스템을 복잡하게 만들고 속도를 늦췄습니다. Aero-Realtime은 이러한 방식들을 거부합니다. 대신, 모델은 타이밍을 자연스럽게 학습합니다. 모델은 '침묵'을 "안녕"이나 "고양이"와 같은 하나의 유효한 단어로 취급하도록 훈련되었습니다. 즉, AI에게는 언제 말할지 결정하기 위한 별도의 스위치가 필요하지 않습니다. 말할지 아니면 조용히 있을지를 결정하는 과정이 단어를 선택하는 과정 속에 직접 내재되어 있기 때문입니다.
이를 구현하기 위해 연구진은 까다로운 엔지니어링 문제를 해결해야 했습니다. 그들은 실시간 비디오 데이터와 표준 비디오 질문을 혼합하여 모델을 훈련하는 특별한 방법을 고안했습니다. 또한, 메모리와 속도를 절약하며 컴퓨터에서 모델을 실행하는 새로운 방식을 설계했습니다. 모델이 새로운 프레임이 도착할 때마다 비디오 전체를 다시 읽는 대신, 이미 처리한 내용은 기억하고 새로운 '슬라이스' 정보만 추가하는 방식입니다. 이는 책을 읽을 때 페이지를 넘길 때마다 첫 장부터 다시 읽는 것이 아니라, 읽었던 곳을 기억하며 계속 나아가는 것과 같습니다.
결과는 모델의 크기에 비해 인상적입니다. 연구진은 연속적인 20분 길이의 비디오 스트림을 대상으로 Aero Realtime을 테스트했습니다. 비디오가 재생되는 동안에도 모델은 비디오에서 일어나는 일과 AI가 말하는 것 사이의 '지연(lag)'을 중앙값 기준으로 84밀리초로 유지했습니다. 이는 눈 깜빡임보다 짧은 시간입니다. 심지어 95백분위수(즉, 95%의 경우)에서도 지연 시간은 173밀리초에 불격했습니다. 이는 AI가 실제 타임라인과 200밀리초 이내의 간격을 유지하며, 실시간으로 듣고 말하고 있음을 의미합니다.
하지만 이 논문은 자신들의 모델이 비디오를 이해하는 데 있어 세계 최고라고 주장하지는 않습니다. OVOBench라는 표준 벤치마크에서 테스트했을 때, 40억 개의 파라미터를 가진 이 모델(상대적으로 작은 규모)은 좋은 점수를 받았지만, 오프라인 비실시간 작업을 위해 설계된 가장 강력한 70억 개의 파라미터 모델들을 이기지는 못했습니다. 저자들은 이러한 격차가 발생하는 이유가 모델이 '전이중(duplex)' 스타일이라는 완전히 새로운 상호작용 방식을 배워야 했고, 기존 모델들이 전통적인 질문에 대해 가졌던 것만큼 이 방식에 특화된 훈련 데이터를 충분히 갖지 못했기 때문이라고 설명합니다.
요약하자면, Aero Realtime은 자신의 차례를 기다리는 것이 아니라, 정말로 실시간으로 대화하며 숨 가쁘게 몰아치는 흐름 속에서도 동시에 듣고 말 수 있는 AI를 구축하는 것이 가능하다는 것을 증명했습니다. 이는 AI가 단순히 명령을 기다리는 로봇이 아니라, 당신과 함께 세상을 실제로 주목하고 있는 친구처럼 느껴지게 만드는 단계로 향하는 발걸음입니다. 아직은 비디오 전문가 중 가장 똑똑한 모델은 아닐지라도, 시간의 흐름을 따라가는 기술을 진정으로 마스터한 첫 번째 모델입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.