OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
OmniReasoner é um framework de pós-treinamento de uso de ferramentas que permite que LLMs omnimodais raciocinem eficientemente sobre fluxos de áudio e vídeo longos ao decidir dinamicamente quando invocar uma ferramenta de "zoom-in" para inspeção de alta fidelidade de evidências esparsas, apoiado por um novo mecanismo de TimeAnchor para consistência temporal e um Temporal Augmented Data Engine para treinamento escalável.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando resolver um mistério em uma biblioteca que nunca termina. A biblioteca é repleta de milhares de livros, mas as pistas de que você precisa para resolver o caso são minúsculas: talvez uma única palavra sussurrada na página 4.002, ou um desenho específico escondido na margem da página 12.500. Se você tentar ler cada página na mesma velocidade, seu cérebro ficará cansado e você pode perder os detalhes minúsculos porque estava correndo através de tudo. Este é exatamente o problema que os computadores enfrentam ao tentar compreender vídeos e áudios longos. Eles são modelos "omnimodais", o que significa que podem ver e ouvir, mas quando um vídeo tem uma hora de duração, a pista mais importante pode ser um som de uma fração de segundo ou uma ação visual breve. Se o computador tentar processar a hora inteira em detalhes altos, ele fica sem memória. Se ele passar rapidamente por tudo, perde as pistas. Cientistas têm tentado ensinar os computadores a serem detetives melhores: como folhear a história toda rapidamente, detectar a parte suspeita e, então, diminuir o ritmo para olhar de perto apenas onde importa.
Apresentamos o OmniReasoner, uma nova estrutura de "pensamento" que ensina esses detetives de IA a usar uma ferramenta especial: um botão de zoom. Em vez de encarar o vídeo de uma hora inteira de uma só vez, o OmniReasoner primeiro dá uma "olhada" rápida e de baixa qualidade em toda a linha do tempo, algo como folhear um livro para entender o contexto geral. Se ele achar que a resposta está bem ali, ele dá a resposta. Mas se ele sentir que uma pista está escondida em um momento específico — como um personagem dizendo uma frase específica ou um peixe aparecendo em um aquário — ele faz uma pausa e pede um zoom. Ele solicita um clipe de alta definição e alta velocidade de apenas aqueles poucos segundos. A IA então observa essa evidência "com zoom" junto com sua olhada rápida original para resolver o quebra-cabeça.
O truque de mágica aqui é como a IA sabe onde dar o zoom. No passado, os computadores tinham dificuldades porque contavam "frames" (como contar páginas), mas se você acelerar ou desacelerar o vídeo, os números das páginas mudam. O OmniReasoner usa um sistema inteligente chamado TimeAnchor. Pense nisso como uma coordenada de GPS baseada no horário do relógio (por exemplo, "olhe em 2 minutos e 49 segundos") em vez de um número de página. Dessa forma, quer a IA esteja olhando para a versão borrada e acelerada ou para a versão cristalina com zoom, "2:49" sempre apontará para o exato mesmo momento. Isso garante que a IA não se perca ao alternar entre o panorama geral e o close-up.
Para ensinar essa habilidade à IA, os pesquisadores não apenas pediram que humanos rotulassem cada vídeo; isso levaria uma eternidade. Em vez disso, eles construíram um Motor de Dados de Aumento Temporal (Temporal Augmented Data Engine). Imagine um editor de vídeo que pega clipes curtos, costura-os para formar um filme longo e esconde secretamente uma "pista" em uma das novas emendas. A IA é então treinada para encontrar essa pista escondida. Às vezes, a IA é instruída a apenas adivinhar a partir do filme inteiro e, às vezes, é forçada a usar a ferramenta de zoom. Através de um processo de tentativa e erro (aprendizado por reforço), a IA aprende que usar a ferramenta de zoom leva a pontuações melhores, mas apenas quando é realmente necessário.
Os resultados mostram que essa abordagem funciona. Quando testado em vários desafios de vídeo e áudio, o OmniReasoner tornou-se significativamente melhor em encontrar respostas, especialmente em vídeos muito longos onde as pistas são raras. Ele não apenas ficou mais inteligente ao responder; ele aprendeu a ser eficiente, gastando seu "poder cerebral" apenas nos momentos que importavam. O artigo sugere que, ao ensinar a IA a decidir quando olhar mais de perto, em vez de forçá-la a olhar para tudo igualmente, podemos resolver mistérios complexos em fluxos de áudio e vídeo longos que eram anteriormente difíceis de decifrar. É um passo em direção a uma IA que não apenas assiste a vídeos, mas que realmente pensa sobre eles, sabendo exatamente quando pausar e prestar atenção.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.