← Últimos artigos
🤖 AI

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

O artigo propõe o Oracle-RLAIF, um framework de ajuste fino econômico para grandes modelos de linguagem e vídeo que substitui modelos de recompensa especializados por um classificador Oracle geral e uma nova função de perda baseada em classificação (GRPOrankGRPO_{rank}) para alcançar um desempenho superior de compreensão de vídeo usando aprendizado por reforço a partir de feedback de classificação.

Autores originais: Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

Publicado 2026-06-23
📖 4 min de leitura☕ Leitura rápida

Autores originais: Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a entender vídeos. Você mostra a ele um clipe de um gato pulando de um sofá e pergunta: "O que aconteceu?"

No passado, para tornar o robô inteligente, você precisava fazer duas coisas:

  1. Mostrar exemplos a ele: Você mostraria milhares de vídeos com as respostas certas escritas — isso é o Ajuste Fino Supervisionado (Supervised Fine-Tuning).
  2. Contratar um crítico humano: Você contrataria um humano para assistir às respostas do robô e dizer: "Essa foi boa, aquela foi ruim". Isso é chamado de RLHF (Aprendizado por Reforço com Feedback Humano).

O Problema: Contratar humanos para assistir vídeos e avaliar respostas é lento, caro e entediante.

A Solução de "IA" Antiga: Pesquisadores tentaram substituir o humano por um "Juiz" de IA especial. Mas esse Juiz de IA tinha que ser treinado para dar uma pontuação específica (como 0,8 de 1,0) para cada resposta. Treinar esse "Avaliador de Pontos" era como construir um robô inteiramente novo apenas para fazer a graduação. Era complicado e muitas vezes erravava as pontuações.

A Nova Solução: Oracle-RLAIF
Os autores deste artigo propõem uma maneira mais inteligente e simples chamada Oracle-RLAIF. Veja como funciona, usando uma analogia simples:

A Analogia do "Show de Talentos"

Imagine que o robô é um competidor em um show de talentos. Em vez de precisar de um juiz para dar uma pontuação precisa (como "8,5/10"), o robô só precisa de um Diretor de Show de Talentos (o "Oracle") que possa simplesmente dizer: "Qual destas três apresentações foi a melhor? Qual foi a segunda melhor? Qual foi a pior?"

  1. O Robô se Apresenta: O robo gera cinco respostas diferentes para a mesma pergunta sobre o vídeo.
  2. O Diretor as Classifica: Uma IA pré-existente e muito inteligente (como uma versão superinteligente do ChatGPT, chamada de "Oracle") assiste às cinco respostas e simplesmente as classifica: 1º Lugar, 2º Lugar, 3º Lugar, etc. Ela não precisa dar uma nota numérica; ela só precisa saber a ordem.
  3. O Robô Aprende: O robô olha para sua própria confiança interna. Ele pergunta: "Eu achei que minha resposta de 3º lugar era a melhor? Oh não, eu estava errado!" Ele então ajusta seu cérebro para garantir que, da próxima vez, ele dê mais confiança às respostas que o Diretor classificou como nº 1.

O Segredo: GRPOrank

O artigo apresenta um novo truque matemático chamado GRPOrank. Pense nisso como o "motor de aprendizado" do robô.

  • Jeito Antigo: O robô tentava adivinhar uma pontuação numérica específica. Se a pontuação estivesse ligeiramente errada, o robô ficava confuso.
  • Novo Jeito (GRPOrank): O robô olha para a lista de classificação. Ele aprende comparando sua própria estimativa da classificação contra a classificação real do Diretor. Se o robô achou que sua pior resposta era a melhor, a matemática o pune severamente. Se ele acertou a ordem, ele recebe uma recompensa.

Isso é mais eficiente porque é mais fácil para uma IA dizer "A é melhor que B" do que concordar exatamente sobre o quanto melhor A é em relação a B.

O Que Eles Descobriram?

Os pesquisadores testaram este novo método em perguntas de vídeo (como "O que a pessoa está fazendo?" ou "Quando o carro virou?").

  • Vencendo a Competição: O novo método deles (Oracle-RLAIF) foi melhor em entender vídeos do que os métodos anteriores que usavam feedback humano ou o antigo "Avaliador de Pontos" de IA.
  • Não Precisa de um Juiz Customizado: Eles provaram que você não precisa treinar uma IA "Avaliadora de Pontos" especial e cara. Você pode simplesmente usar uma IA poderosa e de propósito geral (o Oracle) para simplesmente classificar as respostas, e isso funciona melhor.
  • Melhor em Tempo e Ação: O robô ficou significativamente melhor em entender o tempo (o que aconteceu primeiro?) e as ações (o que a pessoa está fazendo?).
  • O Limite: O robô não melhorou tanto em perguntas sobre layout espacial (onde as coisas estão na sala) ou resumo de todo o vídeo. Os autores sugerem que isso ocorre porque classificar respostas é mais difícil quando as diferenças são muito sutis ou abstratas.

Em Resumo

O artigo diz: "Pare de tentar construir uma IA complexa para dar pontuações exatas para respostas de vídeo. Em vez disso, use apenas uma IA inteligente para simplesmente classificar as respostas da melhor para a pior, e ensine seu robô de vídeo a aprender com essa ordem. É mais barato, mais rápido e torna o robô mais inteligente ao entender o que está acontecendo em um vídeo."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →