← Últimos artigos
💬 NLP

Vero: An Open RL Recipe for General Visual Reasoning

O artigo apresenta o Vero, uma família de modelos de linguagem e visão totalmente abertos que, ao utilizar um conjunto de dados de aprendizado por reforço diversificado e recompensas adaptadas a tarefas, alcança desempenho superior ao estado da arte em diversas tarefas de raciocínio visual sem depender de dados proprietários.

Autores originais: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

Publicado 2026-04-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você quer ensinar um robô superinteligente a ser um "detetive universal". Ele precisa conseguir resolver problemas de matemática, ler gráficos complexos, encontrar objetos escondidos em fotos, entender mapas e até escrever legendas criativas para fotos do Instagram.

O problema é que, até agora, os robôs mais inteligentes eram como "gênios de laboratório": sabiam fazer muita coisa, mas ninguém sabia exatamente como eles aprendiam, porque as empresas que os criavam mantinham os segredos (os dados e o método de treino) trancados.

O artigo que você pediu apresenta o Vero, que é como se fosse uma "receita de bolo totalmente aberta" para criar esse robô detetive. Aqui está a explicação simples:

1. O Grande Desafio: O Dilema do "Generalista"

Pense em um aluno que estuda apenas para passar em matemática. Ele vai ficar ótimo em equações, mas provavelmente vai ter dificuldade em escrever um poema ou entender um mapa de trânsito.
Os modelos de inteligência artificial anteriores focavam muito em uma coisa só (como matemática visual). O Vero quer ser um generalista: alguém que é bom em tudo.

2. A Solução: A "Salada de Frutas" Perfeita (Vero-600K)

Para ensinar o robô a ser versátil, os criadores do Vero não usaram apenas um tipo de exercício. Eles criaram um dataset (um conjunto de dados de treino) gigante chamado Vero-600K.

  • A Analogia: Imagine que você está treinando um atleta para ser um "superatleta". Se você fizer ele correr apenas maratonas, ele será ótimo em resistência, mas ruim em levantar peso ou nadar.
  • O que o Vero fez: Eles pegaram 59 fontes diferentes de exercícios e misturaram tudo em uma "salada de frutas" equilibrada. Essa salada tem 600.000 "bocas" (exemplos) divididas em 6 categorias principais:
    1. STEM: Matemática e ciências (como resolver um problema de física).
    2. Gráficos e Leitura: Entender tabelas, gráficos e textos em imagens (OCR).
    3. Espaço e Ação: Entender onde as coisas estão e como se mover nelas (como um robô de limpeza ou um jogo).
    4. Conhecimento: Saber o que é um objeto (ex: "Isso é um gato ou um cachorro?").
    5. Localização e Contagem: Encontrar coisas específicas na foto e contar quantas existem.
    6. Criatividade: Descrever a foto ou seguir instruções de texto.

3. O Segredo do Treino: O "Treinador Personalizado" (Recompensas)

A parte mais genial do Vero não é apenas a mistura de dados, mas como eles corrigem o robô.

  • O Problema: Se você pedir para o robô "contar maçãs" e ele responder com um poema, ele não acertou. Se você pedir para "descrever uma paisagem" e ele der apenas o número "5", ele também errou.
  • A Solução do Vero: Eles criaram um sistema de recompensas inteligentes. É como ter um treinador que sabe exatamente o que esperar de cada tipo de jogo:
    • Se é um jogo de matemática, o treinador verifica se a conta está certa.
    • Se é um jogo de localização, ele verifica se o robô apontou para o lugar certo.
    • Se é um jogo de criatividade, ele usa outro "juiz" (uma IA mais inteligente) para ver se a resposta faz sentido e é criativa.

Isso evita que o robô fique "preguiçoso" ou tente enganar o sistema para ganhar pontos fáceis.

4. O Resultado: O "Polímata" Aberto

O resultado é que o Vero, mesmo sendo um modelo de tamanho médio (8 bilhões de parâmetros), conseguiu superar modelos muito maiores e proprietários (que são fechados e caros) em 23 dos 30 testes que eles fizeram.

  • A Grande Descoberta: Eles descobriram que diversidade é a chave. Treinar o robô em todas as áreas ao mesmo tempo (misturando tudo) funciona muito melhor do que treinar em apenas uma área e esperar que ele aprenda o resto sozinho. É como aprender a tocar vários instrumentos ao mesmo tempo: você desenvolve uma musicalidade geral que ajuda em todos eles, em vez de ser apenas um virtuoso de um único instrumento.

Resumo em uma frase

O Vero é uma receita de código aberto que ensina uma inteligência artificial a ser um "faz-tudo" visual, misturando milhares de tipos diferentes de desafios e usando um sistema de correção inteligente para garantir que ela aprenda a pensar de verdade, e não apenas a memorizar respostas.

Por que isso importa?
Porque, pela primeira vez, qualquer pessoa (estudantes, pesquisadores, curiosos) pode pegar essa "receita", baixar os dados e os códigos, e tentar criar seus próprios robôs inteligentes, sem precisar pagar milhões para empresas fechadas. É como abrir a cozinha do chef para que todos possam aprender a cozinhar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →