← Últimos artigos
💻 computer science

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

Este artigo introduz o OraRL, um framework de aprendizado por reforço escalável para MLLMs de vídeo que trata as anotações como rollouts de oráculo dentro de um mecanismo de estimativa de vantagem desacoplado para superar a inversão de vantagem, alcançando, assim, um desempenho superior em benchmarks temporais e espaciais com eficiência de treinamento significativamente maior e inferência mais rápida em comparação aos métodos existentes.

Autores originais: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

Publicado 2026-08-24
📖 1 min de leitura☕ Leitura rápida

Autores originais: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: Anotações como Rollouts (OraRL)

Declaração do Problema

A percepção de vídeo unificada exige que Modelos de Linguagem de Grande Escala Multimodais (MLLMs) realizem tarefas granulares, como localização temporal, grounding espacial, rastreamento de objetos e segmentação. Embora os MLLMs generalistas recentes integrem essas capacidades, eles frequentemente apresentam desempenho inferior aos especialistas em tarefas específicas, sugerindo que a escala do modelo isoladamente é insuficiente e que o alinhamento pós-treinamento é o gargalo crítico.

Os paradigmas atuais de pós-treinamento enfrentam duas limitações primárias:

  1. Ajuste Fino Supervisionado (SFT): O SFT trata as anotações como alvos de máxima verossimilhança, impondo formatos de saída, mas falhando em distinguir entre previsões quase corretas e claramente incorretas. Ele carece de supervisão ao nível da tarefa para guiar o modelo em direção a intervalos ou máscaras precisas.
  2. Aprendizado por Reforço (RL) com Otimização de Política Relativa ao Grupo (GRPO): Os métodos existentes de RL para vídeo (ex: GRPO) amostram múltiplos rollouts on-policy por prompt e comparam suas recompensas. No entanto, esses métodos dependem exclusivamente da qualidade do grupo de amostras on-policy. Como os rollouts on-policy raramente recuperam os intervalos, caixas ou máscaras precisos especificados pelas anotações de verdade fundamental (GT), muitos grupos de treinamento carecem de uma âncora positiva confiável.
  3. Limitações da Cadeia de Pensamento (CoT): Embora a geração de CoT seja usada para melhorar o raciocínio, ela prolonga os rollouts, aumentando os custos de treinamento e inferência sem garantir ganhos de desempenho em tarefas de percepção granular.

Uma tentativa direta de incorporar as anotações de GT no grupo de rollout de RL como rollouts "oráculos" falha devido à inversão de vantagem. Quando um oráculo de alta recompensa é incluído na normalização do grupo, ele eleva a recompensa de base (baseline). Consequentemente, os rollouts on-policy que são melhores que a política original (mas piores que o oráculo) recebem vantagens negativas, suprimindo a exploração útil e colapsando o aprendizado em direção à imitação simples.

Metodologia: OraRL

O artigo apresenta o OraRL (Annotation-as-Rollout Reinforcement Learning), um paradigma que trata cada anotação como um alvo positivo confiável (um "rollout oráculo") enquanto evita o deslocamento da linha de base que causa a inversão de vantagem.

Mecanismos Principais

  1. Construção de Anotação-como-Rollout:
    Em vez de usar as anotações meramente como referências de pontuação, o OraRL serializa cada anotação yy no formato de resposta do modelo para criar um rollout oráculo ogto_{gt}. Este oráculo é anexado ao grupo de nn rollouts on-policy, criando um grupo aumentado de tamanho n+1n+1. Isso fornece um alvo positivo confiável para cada consulta sem reduzir a exploração on-policy.

  2. Estimativa de Vantagem Desacoplada:
    Para resolver o problema da inversão de vantagem, o OraRL desacopla o cálculo da vantagem:

    • Linha de Base da Política: A média μop\mu_{op} e o desvio padrão são computados apenas a partir das recompensas on-policy, excluindo o oráculo. Isso garante que qualquer rollout on-policy que supere a política atual receba uma vantagem não negativa.
    • Ganho Direcional: A lacuna entre a recompensa do oráculo e a distribuição on-policy é codificada como um ganho direcional gqg_q. Este ganho escala as vantagens dos rollouts on-policy que estão acima da média on-policy, amplificando o sinal quando o oráculo é significativamente melhor que a política atual.
    • Vantagem do Oráculo Desacoplada: Um termo de vantagem separado e limitado AgtA_{gt} é computado para o próprio rollout do oráculo. Sua escala é calibrada por um peso wqw_q (baseado na lacuna restante entre a política e o oráculo) e limitada pelo sinal on-policy mais forte para evitar que o oráculo domine a atualização.
  3. Poda Equilibrada por Sinal:
    Para melhorar a eficiência, o OraRL poda o grupo de rollout antes da retropropagação. Diferente da poda baseada apenas em magnitude (que poderia reter apenas amostras positivas ou apenas negativas), o OraRL emprega poda equilibrada por sinal:

    • O oráculo é sempre retido.
    • As vagas restantes são preenchidas retendo os rollouts on-policy positivos e negativos mais fortes, garantindo que a atualização do gradiente preserve tanto os sinais de reforço quanto os de supressão.
    • Uma correção de momento pós-seleção é aplicada para recentralizar as vantagens e reescalá-las para corresponder às estatísticas pré-poda, evitando viés na magnitude da atualização.
  4. Eficiência:
    Ao podar o grupo (por exemplo, retendo 4 de 9 rollouts) e evitar a geração de CoT, o OraRL alcança um tempo de etapa de apenas 2.2×2.2\times em relação ao SFT, comparado a 4.9×4.9\times para o GRPO com CoT.

Contribuições Principais

  1. Anotação-como-Rollout: Um mecanismo independente de tarefa que converte anotações em rollouts oráculos, fornecendo supervisão positiva confiável sem exigir CoT ou sacrificar a exploração on-policy.
  2. Análise de Inversão de Vantagem: Identificação do fenômeno de "inversão de vantagem" em misturas de oráculo ingênuas e uma solução via estimativa de vantagem desacoplada que separa as vantagens da política da orientação do oráculo.
  3. Poda Equilibrada por Sinal: Uma estratégia de poda que retém tanto os sinais de vantagem quanto o oráculo, combinada com correção de momento, resultando em uma aceleração de 1.48×1.48\times sobre a otimização de grupo total.
  4. Video-ORA: Um modelo de percepção de vídeo unificado treinado com OraRL, demonstrando melhorias consistentes em todas as escalas de modelo (0.8B a 9B) e orçamentos de dados.

Resultados Experimentais

Os autores treinaram o Video-ORA (baseado em backbones Qwen3.5) e o avaliaram em sete famílias de tarefas: grounding temporal, grounding espacial, segmentação, rastreamento visual, grounding espaço-temporal, Video QA e inteligência espacial.

  • Ganhos de Desempenho:

    • Grounding Temporal: O Video-ORA-9B alcançou um mIoU de 61.8, 63.6 e 72.5 nos três benchmarks TimeLens, superando o especialista temporal TimeLens2-8B e modelos proprietários como GPT-5 e Gemini-3-Pro.
    • Rastreamento Visual: No GOT-10k, o Video-ORA-9B alcançou um Average Overlap (AO) de 78.2, superando o melhor modelo open-source anterior (OneThinker-8B) em 5.2 pontos.
    • Segmentação: Alcançou pontuações líderes no RefCOCO (cIoU 79.4) e MeViS (J&F 61.3).
    • Inteligência Espacial: No VSI-Bench, o Video-ORA-9B marcou 73.1, superando o GPT-5 (55.0) e o Gemini-3-Pro (55.1).
    • Video QA: Ficou em primeiro lugar entre os modelos open-source em cinco de sete benchmarks de Video QA.
  • Escalabilidade e Eficiência:

    • Escalonamento de Modelo: O Video-ORA melhorou em relação ao seu backbone em todas as escalas (0.8B, 2B, 4B, 9B), com ganhos médios macro aumentando com o tamanho do modelo.
    • Escalonamento de Dados: O OraRL superou o GRPO e o SFT em orçamentos de dados de até 100k prompts.
    • Latência de Inferência: Sem CoT, o Video-ORA-9B reduziu a latência mediana de ponta a ponta em vídeos de 10 minutos de 29.0s (backbone com CoT) para 24.3s.

Significância e Alegações

O artigo afirma que o OraRL estabelece a "anotação-como-rollout" como um princípio de aprendizado por reforço eficiente e escalável para percepção de vídeo unificada. Os autores argumentam que:

  • A precisão granular na percepção de vídeo é determinada principalmente pelo pós-treinamento alinhado à tarefa, e não apenas pela escala do modelo.
  • A integração direta do oráculo, quando tratada corretamente (via vantagens desacopladas), fornece um alvo positivo confiável que supera a escassez de rollouts on-policy de alta qualidade.
  • O raciocínio CoT não é necessário para essas tarefas; a supervisão direta do oráculo produz melhor precisão e eficiência.
  • O método é generalizável para diferentes famílias de backbones (Qwen3-VL, Qwen3.5) e tipos de tarefas (localização, rastreamento, QA, raciocínio espacial).

Os autores observam limitações, especificamente que a formulação atual assume que as anotações podem ser serializadas como rollouts oráculos válidos e avaliadas por recompensas escalares, e que o comportamento sob supervisão ambígua ou ruidosa não foi avaliado. Eles também reconhecem que, embora o Video-ORA lidere em muitas comparações open-source, algumas tarefas complexas de raciocínio espacial ainda ficam atrás dos modelos proprietários mais fortes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →