← Últimos artigos
💻 computer science

Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

O artigo apresenta o Vision2Code, um benchmark e framework de avaliação livres de código de referência e multi-domínio que avalia a geração de código a partir de imagens renderizando as saídas do modelo e pontuando-as com rubricas específicas de domínio, revelando lacunas significativas de desempenho em domínios visuais espaciais e complexos, ao mesmo tempo que demonstra que saídas filtradas podem melhorar efetivamente o treinamento do modelo.

Autores originais: Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

Publicado 2026-05-13
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um desenho complexo, como uma planta baixa de uma casa, um diagrama de química ou um gráfico financeiro. Agora, imagine pedir a um computador para olhar aquela imagem e escrever o conjunto exato de instruções (código) necessário para desenhá-la novamente a partir do zero.

É sobre isso que o artigo Vision2Code trata. É um novo "teste" (benchmark) projetado para avaliar o quão bons os modelos de IA são em transformar imagens de volta em código editável.

Aqui está uma explicação das ideias principais do artigo usando analogias simples:

1. O Problema: A Lacuna "Pixel vs. Planta Baixa"

Pense em uma imagem como uma fotografia de um bolo. Se você apenas olhar para a foto, pode ver o bolo, mas não consegue facilmente mudar o sabor do glacê ou mover uma cereja sem editar os pixels (o que fica com aparência desorganizada).

No entanto, se você tiver a receita (o código), pode facilmente mudar o glacê para chocolate ou mover a cereja.

  • Testes Antigos: Testes anteriores para IA eram como perguntar: "Você consegue desenhar um bolo que pareça com esta foto?" Eles focavam em tópicos estreitos (como apenas gráficos) ou exigiam que a IA tivesse a receita original em mãos para comparar.
  • O Novo Teste (Vision2Code): Este teste pergunta: "Você consegue olhar para esta foto de um bolo e escrever uma nova receita que, quando seguida, crie um bolo que pareça e se comporte exatamente como o original?" Crucialmente, o teste não fornece a receita original à IA; fornece apenas a foto.

2. O Desafio: Não É Apenas Um Tipo de Desenho

Os autores perceberam que desenhar um gráfico de barras é muito diferente de desenhar um ambiente 3D ou uma placa de circuito.

  • A Analogia: Imagine um teste onde você precisa desenhar um mapa.
    • Gráficos/Diagramas: Como desenhar um mapa de metrô. As linhas precisam se conectar e os nomes das estações devem estar corretos.
    • Química: Como desenhar uma molécula. Se você trocar um átomo por outro, tudo fica errado.
    • Documentos: Como copiar uma página densa de jornal. Cada palavra e coluna importa.
    • Cenas 3D: Como desenhar um ambiente com profundidade. Se a mesa parecer que está flutuando ou plana, o desenho falha.

O Vision2Code cobre 15 tipos diferentes de imagens nessas seis categorias. É como uma "multiesportiva" olímpica para desenho de IA, em vez de apenas uma corrida de velocidade para um tipo específico de imagem.

3. O Sistema de Pontuação: O "Crítico de Arte Rigoroso"

Como você avalia o desenho de uma IA?

  • Método Antigo: Alguns testes apenas comparavam a nova imagem com a antiga, pixel por pixel (como verificar se duas fotos são idênticas). Isso é ruim porque um pequeno deslocamento em uma linha pode parecer perfeito para um humano, mas falhar em uma verificação de pixels.
  • O Método Vision2Code: Eles usam um Avaliador VLM (um juiz de IA) que age como um crítico de arte rigoroso.
    • A IA gera código.
    • O código é executado e cria uma nova imagem.
    • O "Crítico" compara a nova imagem com a original.
    • O Twist: O Crítico usa livros de regras diferentes para tarefas diferentes.
      • Para um diagrama de química, o livro de regras diz: "Se os átomos estiverem errados, você recebe zero, mesmo que as cores pareçam bonitas."
      • Para um gráfico, o livro de regras diz: "Se os números no eixo estiverem errados, você reprova."
    • Eles também têm "barreiras de segurança". Se a IA cometer um erro enorme e óbvio (como desenhar uma molécula de cabeça para baixo), a pontuação é automaticamente limitada a um valor baixo, para que a IA não consiga enganar o sistema com um desenho bonito, mas errado.

4. Os Resultados: A IA É Boa em Algumas Coisas, Ruim em Outras

O artigo testou 9 modelos de IA diferentes (alguns gratuitos, outros pagos).

  • A Boa Notícia: Os melhores modelos estão ficando muito bons em desenhar gráficos e diagramas. Eles conseguem olhar para um gráfico de barras e escrever o código para recriá-lo quase perfeitamente.
  • A Má Notícia: Os modelos lutam com tarefas complexas e específicas.
    • Cenas 3D: Eles frequentemente achatam objetos 3D em 2D, perdendo a sensação de profundidade.
    • Química e Circuitos: Eles misturam símbolos ou conexões.
    • Documentos: Eles perdem texto ou bagunçam o layout.
  • A Conclusão: Apenas porque uma IA é inteligente ao desenhar um gráfico simples não significa que ela entende a estrutura profunda de um diagrama de circuito. A habilidade é "dependente do domínio".

5. O Truque de "Auto-treinamento"

O artigo também tentou um truque inteligente para melhorar a IA sem precisar de mais professores humanos.

  • A Ideia: A IA tenta desenhar uma imagem. O "Crítico" a avalia.
  • O Filtro: Se a IA obtém uma boa nota na primeira tentativa, mas depois falha em recriar seu próprio desenho quando solicitada a fazê-lo novamente, isso significa que a IA teve sorte ou memorizou um padrão em vez de realmente entender a estrutura.
  • O Resultado: Ao treinar a IA apenas nos exemplos onde ela obteve uma boa nota, mas depois tropeçou na segunda tentativa, eles ajudaram o modelo a aprender as partes "difíceis". Isso aumentou significativamente o desempenho de um modelo menor (Qwen3.5-9B), provando que esse "crítico" pode ensinar a IA a desenhar melhor.

Resumo

O Vision2Code é um teste novo, mais justo e mais abrangente para IA. Ele para de perguntar "Isso parece com a foto?" e começa a perguntar "Este código realmente reconstrói a estrutura da imagem?". Ele mostra que, embora a IA esteja ficando ótima em gráficos simples, ainda tem um longo caminho a percorrer antes de poder recriar perfeitamente diagramas científicos complexos, cenas 3D ou documentos densos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →