Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation
O artigo apresenta o Aero Realtime, um modelo multimodal de streaming de 4B que alcança uma interação de entrada-saída duplex totalmente alinhada em uma grade temporal compartilhada, permitindo geração proativa de baixa latência com reutilização eficiente de cache KV e um atraso de processamento inferior a 200ms.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando ter uma conversa com um amigo que também está assistindo a um filme com você. Em um chat normal, você espera que ele termine uma frase antes de falar. Mas em uma conversa verdadeiramente natural, você pode interrompê-lo com um rápido "Uau!" enquanto ele ainda está falando, ou pode permanecer em silêncio enquanto ele explica um ponto complexo da trama, apenas para intervir no exato segundo em que entende algo novo. Este é o santo graal da interação em "tempo real": a capacidade de ouvir e falar ao mesmo tempo sem perder o ritmo.
Por muito tempo, os computadores foram péssimos nisso. A maioria dos modelos de IA funciona como um jogo de "batata quente" muito educado, mas um pouco lento. Eles esperam que você termine toda a sua história (a entrada), processam tudo de uma vez e então começam a falar (a saída). Eles não conseguem realmente "ouvir" enquanto estão "falando". Se você tentar fornecer novas informações enquanto eles estão no meio de uma frase, eles ficam confusos ou precisam parar e recomeçar. Este artigo aborda o problema de construir uma IA que possa ser verdadeiramente "full-duplex" — capaz de ouvir coisas novas e dizer coisas novas simultaneamente, exatamente como um humano faz, tudo isso enquanto acompanha um fluxo de vídeo de movimento rápido.
Os pesquisadores por trás deste artigo, da Universidade de Hong Kong e outras instituições, construíram um novo modelo de IA chamado Aero Realtime. Pense nele como um modelo que não fala apenas em frases, mas em pequenos "pulsos" rítmicos de tempo. Em vez de esperar que um vídeo inteiro termine, o Aero Realtime divide o tempo em pequenos pedaços de 80 milissegundos. Para cada um desses pedaços de áudio que ouve, ele tem que tomar uma decisão de milésimos de segundo: "Devo dizer uma palavra agora ou devo permanecer em silêncio?".
Isso é uma mudança enorme em relação ao modo como outros modelos funcionam. Normalmente, uma IA tem que terminar sua fase de "pensamento" antes de começar sua fase de "fala". O Aero Realtime faz ambas ao mesmo tempo. Ele alinha o vídeo, o áudio e suas próprias palavras em uma linha do tempo única e compartilhada. Imagine uma esteira de produção onde, a cada 80 milissegundos, uma nova peça de vídeo e áudio chega. Nesse exato momento, a IA decide se solta uma palavra na esteira ou se solta um "token de silêncio" (um marcador de posição para ficar quieta). Isso permite que a IA continue ouvindo novas partes do vídeo mesmo enquanto está no meio da geração de uma frase. Ela nunca interrompe o fluxo para "alcançar" o conteúdo.
O artigo argumenta que as tentativas anteriores de tornar a IA "proativa" (pronta para falar) foram desajeitadas. Alguns sistemas usavam um método de "micro-turno", onde a IA parava constantemente para se perguntar: "Devo falar agora?". Isso é como um motorista que para em cada interseção para checar um mapa antes de seguir em frente. Outros usaram "portões" ou interruptores externos para decidir quando falar, o que complicava o sistema e o tornava lento. O Aero Realtime rejeita esses métodos. Em vez disso, ele aprende o tempo naturalmente. O modelo é treinado para tratar o "silêncio" como uma palavra válida, assim como "olá" ou "gato". Isso significa que a IA não precisa de um interruptor separado para decidir quando falar; a decisão de falar ou ficar quieta está integrada diretamente no mesmo processo que escolhe as palavras.
Para fazer isso funcionar, a equipe teve que resolver enigmas de engenharia complicados. Eles criaram uma forma especial de treinar o modelo usando uma mistura de dados de vídeo em tempo real e perguntas de vídeo padrão. Eles também projetaram uma nova maneira de executar o modelo em computadores que economiza memória e velocidade. Em vez de reler todo o vídeo cada vez que um novo quadro chega, o modelo lembra o que já processou e apenas adiciona a nova "fatia" de informação. Isso é como ler um livro onde você não precisa reler o primeiro capítulo toda vez que vira uma página; você apenas lembra onde parou e continua seguindo.
Os resultados são impressionantes para um modelo de seu tamanho. Os pesquisadores testaram o Aero Realtime em um fluxo de vídeo contínuo de 20 minutos. Mesmo conforme o vídeo era reproduzido, o modelo conseguiu manter seu "lag" — o atraso entre o que acontece no vídeo e o que a IA está dizendo — em uma mediana de 84 milissegundos. Isso é menos que um piscar de olhos. Mesmo no percentil 95 (significando que 95% do tempo), o atraso era de apenas 173 milissegundos. Isso significa que a IA permanece dentro de 200 milissegundos da linha do tempo "real", ouvindo e falando efetivamente em tempo real.
No entanto, o artigo é cuidadoso ao não afirmar que este é o melhor modelo de IA do mundo em compreensão de vídeo. Quando testado em um benchmark padrão chamado OVOBench, o modelo de 4 bilhões de parâmetros (que é relativamente pequeno) teve uma boa pontuação, mas não superou os modelos de 7 bilhões de parâmetros mais poderosos e grandes, que são projetados para tarefas offline e não em tempo real. Os autores sugerem que essa lacuna existe porque o modelo teve que aprender uma maneira completamente nova de interagir (o estilo "duplex") e não teve tantos dados de treinamento específicos para esse tipo exato de conversa em tempo real quanto os modelos antigos tiveram para perguntas tradicionais.
Em resumo, o Aero Realtime prova que é possível construir uma IA que não apenas espera sua vez de falar, mas que pode verdadeiramente conversar em tempo real, ouvindo e falando simultaneamente sem perder o fôlego. É um passo em direção a uma IA que parece menos um robô esperando por instruções e mais um amigo que está realmente prestando atenção ao mundo com você. Embora ainda não seja o especialista em vídeo mais inteligente da sala, é o primeiro a dominar verdadeiramente a arte de acompanhar o fluxo do tempo.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.