← Últimos artigos
🤖 machine learning

ESSA: Evolutionary Strategies for Scalable Alignment

O ESSA introduz um framework de alinhamento online livre de gradiente e apenas de inferência que otimiza os valores singulares de adaptação de baixo posto usando estratégias evolutivas para alcançar um ajuste escalável, eficiente em comunicação e de alto desempenho de grandes modelos de linguagem, igualando ou superando métodos baseados em gradiente como PPO e GRPO enquanto reduz significativamente o tempo de treinamento e os custos de hardware.

Autores originais: Daria Korotyshova, Boris Shaposhnikov, Alexey Malakhov, Alexey Khokhulin, Nikita Surnachev, Kirill Ovcharenko, George Bredis, Alexey Gorbatovski, Viacheslav Sinii, Daniil Gavrilov

Publicado 2026-09-10
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Daria Korotyshova, Boris Shaposhnikov, Alexey Malakhov, Alexey Khokhulin, Nikita Surnachev, Kirill Ovcharenko, George Bredis, Alexey Gorbatovski, Viacheslav Sinii, Daniil Gavrilov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial moderna, os grandes modelos de linguagem são como vastas bibliotecas de conhecimento humano, capazes de escrever histórias, resolver equações e responder perguntas. No entanto, essas bibliotecas não são naturalmente organizadas para serem úteis, seguras ou obedientes às instruções humanas. Para corrigir isso, pesquisadores utilizam um processo chamado alinhamento, que atua como um estágio final de treinamento para ensinar o modelo a se comportar como um bom assistente. O método padrão para isso envolve uma técnica conhecida como aprendizado por reforço, onde o modelo tenta diferentes respostas, recebe uma pontuação sobre o quão boas elas são e, em seguida, utiliza matemática complexa para ajustar suas configurações internas para obter uma pontuação melhor na próxima vez. Esse processo é poderoso, mas também é incrivelmente pesado. Ele requer quantidades massivas de poder computacional, hardware especializado e comunicação constante entre muitos processadores, tornando-o caro e difícil de escalar para os maiores modelos.

Uma equipe de pesquisadores da T-Tech e da Yandex propôs um caminho diferente, um que ignora os pesados ajustes matemáticos inteiramente. Eles chamam seu novo método de ESSA, que significa Estratégias Evolutivas para Alinhamento Escalável (Evolutionary Strategies for Scalable Alignment). Em vez de calcular como dar um empurrão no modelo na direção certa, o ESSA trata o modelo como um organismo vivo em uma simulação. Ele cria muitas versões ligeiramente diferentes do modelo, testa todas de uma vez para ver qual performa melhor e, então, mantém os melhores traços enquanto descarta o restante. Essa abordagem remove a necessidade dos complexos cálculos de retropropagação que atrasam os métodos tradicionais. Ao focar apenas em uma parte pequena e específica das configurações do modelo e usar uma estratégia que mimetiza a seleção natural, os pesquisadores descobriram que poderiam alinhar modelos massivos muito mais rápido e com muito menos poder computacional do que antes, alcançando resultados que igualam ou até superam os métodos de ponta atuais.

A ideia central por trás do ESSA é parar de tentar ajustar cada número individual dentro do modelo. Grandes modelos de linguagem contêm bilhões desses números, e mudar todos de uma vez é como tentar manobrar um superpetroleiro movendo cada parafuso do casco. Os pesquisadores perceberam que, após uma fase inicial de treinamento, o modelo já sabe como realizar a tarefa básica. O que ele precisa é de um ajuste fino, um pequeno ajuste em seu comportamento. Para alcançar isso, eles utilizaram uma técnica chamada Adaptação de Baixo Posto (Low-Rank Adaptation), que adiciona uma camada pequena e flexível ao modelo, e então decompôs essa camada em seus componentes mais essenciais. Eles congelaram a direção desses componentes e permitiram apenas que o tamanho, ou magnitude, de alguns números-chave mudasse. Isso reduziu o problema de ajustar bilhões de variáveis para ajustar apenas alguns milhares, criando um espaço compacto onde uma estratégia de busca pudesse funcionar eficientemente.

Nesta nova configuração, o computador gera uma população de modelos candidatos, cada um com configurações ligeiramente diferentes para esses poucos milhares de números. Cada candidato é testado em um conjunto de problemas, como resolver equações matemáticas ou seguir instruções estritas, e recebe uma pontuação. O sistema então analisa as pontuações para decidir quais candidatos foram os mais bem-sucedidos. Em vez de calcular gradientes, que são inclinações matemáticas complexas usadas para encontrar a melhor direção para se mover, o sistema simplesmente seleciona os vencedores e usa suas configurações como o ponto de partida para a próxima rodada de variações. Esse processo se repete, com a população evoluindo lentamente para um melhor desempenho. Como o sistema só precisa executar o modelo para frente para obter uma pontuação, ele pode rodar em computadores que utilizam um formato de números de precisão reduzida e simplificada, o que economiza ainda mais memória e velocidade.

Os pesquisadores testaram este método em uma grande variedade de tarefas, incluindo seguir instruções, agir como um assistente útil e resolver problemas matemáticos difíceis. Eles compararam o ESSA contra os principais métodos que utilizam a abordagem matemática tradicional e pesada. Em tarefas envolvendo raciocínio matemático, o ESSA teve um desempenho tão bom quanto os melhores métodos existentes e, em alguns casos, foi significativamente mais rápido. Por exemplo, ao treinar um modelo grande em um cluster de 128 processadores gráficos potentes, o ESSA atingiu um nível específico de precisão quase oito vezes mais rápido que o método padrão. Esse aumento de velocidade não ocorreu porque o ESSA precisou de menos exemplos para aprender, mas porque cada etapa de seu processo era muito mais leve e podia ser executada em paralelo sem os gargalos que atrasam a abordagem tradicional.

O estudo também explorou o quão bem esse método funciona com diferentes tamanhos de modelos e diferentes tipos de tarefas. Eles descobriram que o ESSA permaneceu eficaz mesmo quando o modelo foi escalado para 72 bilhões de parâmetros, um tamanho que é tipicamente muito difícil de alinhar de forma eficiente. Nesses testes de larga escala, o método foi capaz de rodar com um modelo candidato por processador gráfico, um feito que seria impossível com o método tradicional devido às restrições de memória. Os pesquisadores também verificaram se o método funcionava quando o treinamento inicial era feito em um tópico diferente do objetivo final, como treinar em conversação geral, mas testar em seguimento estrito de regras. O método resistiu bem, mostrando que a busca evolutiva poderia encontrar os ajustes corretos mesmo partindo de uma fundação ligeiramente diferente.

Uma das descobertas mais surpreendentes foi que o método não exigia as configurações complexas e refinadas que os métodos tradicionais demandam. Os pesquisadores testaram diferentes tamanhos para a população de candidatos e descobriram que um número moderado era geralmente suficiente para obter excelentes resultados. Eles também descobriram que o método era robusto a mudanças em quanto das configurações do modelo eram permitidas para mudar. Essa estabilidade sugere que a abordagem evolutiva é menos sensível às escolhas específicas do engenheiro, tornando-a mais fácil de usar na prática. Além disso, o método funcionou bem mesmo quando o computador utilizava uma precisão menor para seus cálculos, perdendo apenas uma fração ínfima de precisão enquanto ganhava eficiência de velocidade e memória.

O artigo também abordou o que acontece quando o método é comparado a outras formas de buscar as melhores configurações. Os pesquisadores testaram diferentes tipos de estratégias evolutivas e descobriram que, embora algumas fossem ligeiramente melhores no final, a estratégia específica que escolheram era a mais confiável para obter bons resultados rapidamente. Eles também compararam seu método com uma versão que tentava usar as mesmas configurações simplificadas, mas com a abordagem matemática tradicional. O método evolutivo superou consistentemente este híbrido, provando que a maneira como a busca era conduzida era tão importante quanto as próprias configurações sendo buscadas. Isso sugere que a antiga ideia de usar a seleção natural para treinar máquinas não é apenas um plano de reserva, mas uma alternativa poderosa que pode superar as ferramentas padrão nas condições certas.

No fim, o trabalho demonstra que a maquinaria pesada e complexa do alinhamento moderno não é o único caminho a seguir. Ao simplificar o problema para uma busca pelas melhores configurações entre um pequeno grupo de candidatos, e ao aproveitar o poder da computação paralela, os pesquisadores mostraram que grandes modelos podem ser alinhados de forma rápida e eficiente. O método não substitui o treinamento inicial que dá ao modelo seu conhecimento básico, mas fornece uma maneira nova e mais leve de moldar esse conhecimento para torná-lo um assistente útil. À medida que os modelos continuam a crescer, esta abordagem oferece um caminho prático para mantê-los alinhados sem exigir uma quantidade impossível de poder computacional, sugerindo que o futuro do alinhamento de IA pode residir em estratégias mais simples e diretas, em vez de fórmulas matemáticas cada vez mais complexas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →