ELMER: Evolutionary Language Model that Explores and Refines
O artigo apresenta o ELMER, um modelo de linguagem evolutivo que utiliza um Qwen3-8B ajustado via Otimização de Preferência Direta para direcionar mutações de política em linguagem natural por força, demonstrando que representações baseadas em linguagem oferecem calibração comportamental e eficiência de busca superiores em comparação com métricas de edição sintática tradicionais na evolução de programas.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você esteja tentando ensinar um robô a jogar um videogame, mas em vez de dar a ele um joystick, você tem que escrever um novo conjunto de regras para ele toda vez que ele comete um erro. Este é o mundo da evolução de programas, um campo onde cientistas usam computadores para "procriar" softwares melhores ao fazer pequenas mudanças, testá-las e manter os vencedores. Por muito tempo, esse processo foi um pouco como lançar dardos no escuro. Os cientistas conseguiam dizer se uma nova versão do código era melhor ou pior, mas não tinham como controlar o quanto ele mudava. Um pequeno ajuste em uma única palavra no código poderia acidentalmente transformar um robô que caminha suavemente em um desastre caótico e colidindo, enquanto uma reescrita massiva poderia deixar o robô fazendo exatamente a mesma coisa. A grande questão que os pesquisadores têm feito é: Podemos construir um sistema que entenda não apenas o que mudar, mas o quanto mover o comportamento do robô, para que possamos guiá-lo precisamente em direção a um objetivo?
É aqui que entra o artigo "ELMER: Evolutionary Language Model that Explores and Refines". Os pesquisadores, Matthew Siper, Ahmed Khalifa e Julian Togelius, construíram um novo e inteligente sistema que usa um grande modelo de linguagem (uma IA superinteligente que entende a linguagem humana) para atuar como um "operador de mutação". Em vez de editar cegamente o código de computador, a IA edita uma descrição em linguagem natural de uma estratégia de negociação — como uma receita para comprar e vender ações. A IA é treinada para entender três tarefas específicas: traduzir uma receita em código, traduzir o código de volta para uma receita e, o mais importante, mutar a receita com base em um comando de "força". Se você disser à IA para fazer uma mudança de "baixa força", ela ajusta a receita levemente. Se você disser "alta força", ela reescreve tudo.
A equipe testou isso em negociações financeiras, usando dados históricos de mercado para ver o quão bem as novas estratégias se saíram. Eles descobriram que, ao treinar a IA para prestar atenção em quanto as ações reais do robô mudavam (seu "deslocamento comportamental"), eles conseguiram fazer com que os comandos de "força" funcionassem. Quando pediam uma pequena mudança, a IA geralmente fazia uma pequena mudança; quando pediam uma grande mudança, ela fazia uma grande mudança. Isso é algo importante porque transforma o processo caótico da evolução de programas em algo mais parecido com dirigir um carro. O artigo mostra que usar descrições em linguagem natural ajuda a IA a fazer movimentos mais inteligentes e controlados do que apenas editar o código bruto diretamente. Em seus testes, o sistema baseado em linguagem encontrou a estratégia de negociação de melhor desempenho de todos os métodos que tentaram, e fez isso de forma mais eficiente, alcançando bons resultados com menos tentativas. Embora o sistema não seja perfeito e ainda tenha algum grau de aleatoriedade, os resultados sugerem que ensinar a IA a "falar" sobre suas mudanças em linguagem humana nos dá uma maneira muito melhor de guiá-la através do vasto espaço de possíveis programas de computador.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.