← Últimos artigos
💬 NLP

OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models

Este artigo apresenta o OMGEval, o primeiro benchmark de avaliação generativa multilíngue de código aberto, apresentando 804 perguntas de resposta aberta rigorosamente verificadas e culturalmente localizadas em cinco idiomas para avaliar e melhorar as capacidades multilíngues de grandes modelos de linguagem.

Autores originais: Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

Publicado 2026-02-02
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você construiu um bibliotecário brilhante e onisciente que consegue falar todas as línguas do mundo. Você quer testar se esse bibliotecário é verdadeiramente inteligente em todas as culturas, ou se ele é apenas um "especialista local" que só entende a cultura dos Estados Unidos.

Este artigo apresenta o OMGEval, que é essencialmente um teste de "carteira de habilitação" multicultural para esses bibliotecários de IA (Large Language Models).

Aqui está a divisão do que os autores fizeram, usando analogias simples:

1. O Problema: O Viés da "TV Americana"

A maioria dos testes atuais para IA é como assistir a um programa de TV que só é exibido em inglês e fala sobre feriados, comidas e história americana.

  • O Problema: Se você perguntar a uma IA: "Qual é a comida tradicional do Dia de Ação de Graças?", ela dirá corretamente "Peru". Mas se você perguntar a um falante de chinês: "Qual é a comida tradicional do Festival do Barco do Dragão?", uma IA treinada apenas com dados americanos pode ficar confusa ou dar uma resposta errada porque não entende a cultura local.
  • A Alegação do Artigo: A maioria dos testes existentes é focada demais no inglês. Eles não verificam se a IA entende que, na Rússia, a Páscoa envolve bolos específicos, ou que na Espanha existem guloseimas específicas para o Dia de Todos os Santos.

2. A Solução: OMGEval (O Teste do "Guia Turístico Local")

Os autores criaram um novo teste chamado OMGEval. Em vez de apenas traduzir perguntas do inglês para outras línguas (o que é como colocar legendas em inglês em um filme russo), eles reescreveram as perguntas para que se ajustassem à cultura local.

  • A Analogia: Imagine uma pergunta de teste sobre "Férias de Verão".
    • O Jeito Antigo (Tradução): "Para onde os americanos vão nas férias de verão?" (Resposta: Havaí).
    • O Jeito OMGEval (Localização): "Para onde os chineses vão nas férias de verão?" (Resposta: Sanya).
    • Por que isso importa: Ambas as perguntas tratam de "lugares de férias de verão", mas o contexto cultural é diferente. O OMGEval garante que a IA conheça a versão local da história, não apenas a americana.

3. Como Eles Construíram Isso

A equipe não usou apenas um robô para traduzir coisas; eles usaram uma equipe de especialistas humanos (linguistas) para atuar como editores culturais.

  • O Processo: Eles pegaram 804 perguntas abertas (como enigmas, fatos ou prompts de escrita criativa) e as adaptaram para 5 línguas: chinês, russo, francês, espanhol e árabe.
  • O "Toque Humano": Se uma pergunta mencionava uma celebridade americana específica, eles a substituíam por uma figura local famosa. Se mencionava um feriado específico dos EUA, eles o substituíam por um festival local. Eles fizeram isso para garantir que a IA estivesse sendo testada em sua capacidade de entender aquela cultura específica, e não apenas sua capacidade de traduzir palavras.

4. Como Eles Avaliaram a IA

Como os humanos não conseguem ler milhares de respostas em cinco línguas instantaneamente, eles usaram o GPT-4 (uma IA muito avançada) como o juiz.

  • O Jogo: Eles pediram aos modelos de IA que respondessem às perguntas. Depois, pediram ao GPT-4 para analisar duas respostas lado a lado e decidir qual era a melhor.
  • A Verificação: Eles também fizeram com que humanos reais avaliassem uma pequena amostra para garantir que o "Juiz de IA" fosse justo. Os resultados mostraram que o Juiz de IA era muito preciso (cerca de 90% de concordância com os humanos).

5. Os Resultados: Quem Passou no Teste?

Eles testaram vários modelos de IA, incluindo grandes modelos comerciais (como o GPT-4) e modelos de código aberto (modelos gratuitos que qualquer pessoa pode baixar).

  • O Vencedor: O GPT-4 foi o único modelo que pontuou consistentemente acima de 50% (o que significa que venceu a linha de base mais da metade das vezes). Ele foi o "aluno de destaque".
  • A Dificuldade: Os modelos de código aberto (como Guanaco, Phoenix e outros) tiveram dificuldades significativas.
    • A Lacuna: Enquanto o GPT-4 conseguia lidar bem com as nuances culturais, os modelos de código aberto frequentemente cometiam erros fatuais ou perdiam o contexto cultural. Por exemplo, ao serem questionados sobre o primeiro filme de um diretor chinês famoso, alguns modelos de código aberto deram o ano errado ou o título do filme errado, enquanto o GPT-4 acertou.
  • A Conclusão: Existe uma enorme lacuna entre os modelos comerciais de alto nível e os modelos de código aberto quando se trata de entender diferentes culturas. Os modelos de código aberto são como alunos que estudaram o livro didático, mas falharam em entender o dialeto local.

Resumo

OMGEval é um teste novo e mais justo que verifica se os modelos de IA entendem as diversas culturas do mundo, e não apenas a versão americana do mundo. O artigo mostra que, embora a melhor IA (GPT-4) seja muito boa nisso, muitos outros modelos ainda estão lutando para entender o "sabor" local de diferentes línguas e culturas. Os autores esperam que este teste ajude a comunidade a construir IAs melhores e mais conscientes culturalmente no futuro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →