(Towards) Scalable Reliable Automated Evaluation with Large Language Models
Este artigo apresenta uma estrutura escalável e agnóstica ao domínio que aproveita comparações pareadas entre múltiplos LLMs e um sistema de classificação Elo para gerar avaliações confiáveis, de nível especialista, das saídas de LLMs com limiares de confiança ajustáveis, reduzindo significamente a necessidade de intervenção humana.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é o editor de uma biblioteca massiva e caótica onde milhares de novos livros estão sendo escritos todos os dias por uma frota de robôs superinteligentes. Esses robôs, conhecidos como Grandes Modelos de Linguagem (LLMs), podem escrever histórias, responder perguntas e resumir ideias complexas com uma velocidade incrível. Mas há um porém: como você sabe qual robô escreveu a melhor história? Nos velhos tempos, você precisaria de uma equipe de bibliotecários humanos para ler cada página, compará-las e discutir sobre quem era o melhor. Isso leva uma eternidade, custa uma fortuna e diferentes bibliotecários podem discordar sobre o que significa ser "bom". Este é o problema que cientistas na área de Inteligência Artificial estão tentando resolver: criar uma maneira de julgar a escrita dos robôs que seja rápida, justa e que não exija que um humano leia cada palavra. Para fazer isso, eles usam alguns truques engenhosos. Primeiro, eles pedem aos robôs que julguem uns aos outros, como um painel de críticos. Segundo, eles usam um sistema de pontuação emprestado do xadrez, chamado classificação Elo, que classifica jogadores com base em quem vence quem em confrontos diretos. Finalmente, eles observam o quão bem os juízes robôs concordam com especialistas humanos reais para ver se o sistema funciona.
Este artigo apresenta uma nova maneira escalável de avaliar a qualidade do texto gerado por esses robôs de IA. Em vez de pedir a um único robô que dê uma nota (o que pode ser tendencioso ou inconsistente), os autores estabeleceram um torneio massivo. Eles pegam uma série de diferentes saídas de texto — como resumos de pesquisas científicas — e fazem com que vários modelos de IA diferentes disputem partidas "cabeça a cabeça" entre si. Em cada partida, dois textos são apresentados a um juiz de IA, que deve decidir qual deles é melhor com base em regras específicas. Para garantir que o juiz não esteja apenas escolhendo o texto que aparece por último ou o que é mais prolixo, o sistema inverte a ordem dos textos e utiliza vários modelos de IA diferentes para votar no vencedor.
Depois que todas as partidas são jogadas, os resultados são alimentados em um sistema de classificação Elo. Pense nisso como um ranking de xadrez: se um texto vence um oponente forte, ele ganha muitos pontos; se perde, perde pontos. Com o tempo, isso cria uma lista clara e classificada do "melhor" texto para o "pior". Os autores testaram isso fazendo com que modelos de IA gerassem "perfis de competência" (resumos do que um pesquisador é bom em fazer) com base em resumos científicos. Eles então compararam os rankings gerados pela IA com os rankings feitos por 20 especialistas humanos. Os resultados sugerem que, quando múltiplos modelos de IA votam juntos, seus rankings coincidem surpreendentemente bem com os especialistas humanos. Na verdade, usar uma votação de maioria simples (onde a IA só precisa de 50% de concordância para declarar um vencedor) funcionou melhor do que exigir unanimidade total, o que frequentemente levava a muitos "empates" e nenhum vencedor claro. O estudo mostra que este método pode reduzir significamente a necessidade de humanos fazerem o trabalho pesado, oferecendo uma maneira confiável e automatizada de filtrar vastas quantidades de conteúdo gerado por IA. No entanto, os autores observam que este processo ainda é computacionalmente caro, exigindo muitas comparações, e que funciona melhor quando múltiplos modelos de IA diferentes são usados para equilibrar as peculiaridades e vieses uns dos outros.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.