← Últimos artigos
💻 computer science

EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards

O artigo apresenta o EvoLMM, um framework de auto-evolução para Grandes Modelos Multimodais que, utilizando dois agentes cooperativos (Propositor e Solucionador) e um processo contínuo de auto-recompensa, aprimora o raciocínio multimodal de forma totalmente não supervisionada sem depender de dados anotados ou julgamentos humanos.

Autores originais: Omkar Thawakar, Shravan Venkatraman, Ritesh Thawkar, Abdelrahman Shaker, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan, Fahad Khan

Publicado 2026-03-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Omkar Thawakar, Shravan Venkatraman, Ritesh Thawkar, Abdelrahman Shaker, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan, Fahad Khan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um gênio muito inteligente, mas que nunca foi para a escola e não tem um professor para corrigir seus exercícios. Ele sabe ler e ver imagens, mas como ele pode aprender a resolver problemas complexos de matemática ou lógica sem alguém lhe dizendo "está certo" ou "está errado"?

É exatamente esse o desafio que o EvoLMM resolve.

Aqui está a explicação do artigo, traduzida para uma linguagem simples e cheia de analogias:

O Problema: O Gênio Sem Professor

Atualmente, os modelos de inteligência artificial (chamados de Modelos Multimodais) são treinados com milhões de exemplos feitos por humanos. É como se um aluno tivesse que ler todos os livros da biblioteca para aprender, mas só passasse de ano se um professor corrigisse cada prova. Isso é caro, demorado e limita o que a IA pode aprender, pois depende de tudo o que os humanos já escreveram.

O artigo pergunta: "E se a IA pudesse se ensinar sozinha?"

A Solução: O Jogo de "Proposta e Resposta"

Os autores criaram um sistema chamado EvoLMM (Modelos Multimodais que Evoluem Sozinhos). Eles pegaram um modelo de IA e o dividiram em dois "personagens" que moram na mesma cabeça e conversam entre si:

  1. O Criador de Questões (Proposer): Ele olha para uma imagem aleatória (como um gráfico, um mapa ou um desenho geométrico) e inventa uma pergunta sobre ela.
  2. O Solucionador (Solver): Ele tenta responder à pergunta que o Criador fez.

A Mágica: O "Espelho" da Consistência

Aqui está a parte genial. Como não há professor humano para dar a resposta certa, como eles sabem se estão aprendendo?

Eles usam um conceito chamado Recompensa Contínua de Autoconsistência.

Imagine que o Solucionador tenta responder à mesma pergunta 5 vezes.

  • Se ele responder "A" cinco vezes, significa que ele tem muita certeza.
  • Se ele responder "A", "B", "C", "D" e "E", significa que ele está confuso e a pergunta pode ser ruim ou difícil demais.

O sistema dá uma "nota" baseada em quão parecidas são as respostas dele consigo mesmo.

  • Analogia: Pense em um músico tocando uma nota. Se ele tocar a mesma nota 5 vezes e todas soarem iguais, ele está afinado. Se as notas forem todas diferentes, ele precisa ajustar o ouvido.
  • O Criador de Questões recebe uma recompensa quando faz perguntas que são "difíceis, mas possíveis". Se a pergunta for muito fácil, o Solucionador acerta de cara (tédio). Se for impossível, o Solucionador fica confuso (caos). O sistema aprende a ficar no "meio-termo", onde o aprendizado acontece.

Por que "Contínuo" é melhor que "Sim/Não"?

Outros métodos tentam usar um sistema de "Sim ou Não" (como um voto de maioria). Se o Solucionador errar uma vez, a nota é zero. Isso é como tentar aprender a andar de bicicleta onde, se você cair uma vez, o professor grita "ZERO!" e você para. É frustrante e a IA para de aprender.

O EvoLMM usa uma recompensa contínua. É como um termômetro. Mesmo que o Solucionador não acerte 100%, se ele estiver perto de acertar ou se 3 das 5 respostas forem iguais, ele recebe uma pontuação parcial. Isso dá um "empurrãozinho" suave e constante, permitindo que ele melhore gradualmente, sem desistir.

O Resultado: Uma Evolução Natural

Ao fazer isso milhares de vezes, apenas olhando para imagens brutas (sem anotações humanas), o sistema cria seu próprio currículo de aprendizado:

  1. Começa fácil: Faz perguntas simples.
  2. Aumenta a dificuldade: Conforme o Solucionador fica melhor, o Criador faz perguntas mais complexas para manter o desafio interessante.
  3. Evolui: O modelo aprende a raciocinar sobre gráficos, geometria e lógica visual muito melhor do que quando começou, tudo sozinho.

Em Resumo

O EvoLMM é como colocar um aluno inteligente em uma sala com apenas livros e imagens, sem professor. Ele inventa seus próprios testes, tenta respondê-los várias vezes e usa o fato de "concordar consigo mesmo" como prova de que está aprendendo.

O resultado? O modelo ficou até 3% mais inteligente em tarefas de raciocínio matemático e visual, provando que a inteligência artificial pode, de fato, evoluir sozinha, sem depender de humanos para corrigir cada passo. É um passo gigante para criar IAs que aprendem de forma autônoma, como nós fazemos ao explorar o mundo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →