Amortizing intractable inference in large language models
Este artigo propõe o uso de GFlowNets para amortizar a inferência intratável em grandes modelos de linguagem, permitindo que eles amostrem de distribuições posteriores complexas para tarefas como geração com restrições e raciocínio de cadeia de pensamento como uma alternativa eficiente em termos de dados ao treinamento tradicional de máxima verossimilhança ou maximização de recompensa.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Os grandes modelos de linguagem são vastas bibliotecas de conhecimento humano, comprimidas em redes digitais que preveem a próxima palavra em uma frase com base no que veio antes. Eles são treinados para serem excelentes em continuar uma história ou responder a uma pergunta quando recebem um ponto de partida, um processo que flui naturalmente da esquerda para a direita. No entanto, muitas das tarefas mais interessantes que queremos que esses modelos realizem exigem pensar de trás para frente ou preencher o meio de uma história. Imagine receber o início e o fim de um conto e ser solicitado a inventar o meio, ou ser solicitado a explicar o raciocínio por trás de uma resposta específica. Nesses cenários, o modelo não pode simplesmente adivinhar a próxima palavra; ele deve pesquisar através de uma paisagem massiva e complexa de possibilidades para encontrar o caminho específico que conecta o início ao fim. Este é um problema matemático difícil porque o número de caminhos possíveis é tão enorme que verificar um por um é impossível, e os métodos padrão para navegar nessa paisagem frequentemente ficam presos em apenas uma ou duas rotas comuns, perdendo a rica variedade de soluções válidas que existem.
Pesquisadores do Instituto Mila – Quebec AI e da Universidade de Oxford desenvolveram uma nova maneira de ensinar esses modelos a navegar nessa paisagem complexa. Em vez de treinar o modelo para simplesmente maximizar uma pontuação para a "melhor" resposta, o que frequentemente leva a um pensamento repetitivo e estreito, eles usaram um método chamado inferência amortizada. Essa abordagem trata o problema como uma busca por um conjunto diversificado de caminhos corretos, em vez de um único caminho perfeito. Para fazer isso, eles empregaram uma técnica conhecida como rede de fluxo generativo, que atua como um guia que aprende a amostrar toda a gama de soluções possíveis, garantindo que o modelo explore diferentes cadeias de raciocínio válidas em vez de colapsar em um único padrão excessivamente utilizado.
A equipe demonstrou isso ajustando modelos de linguagem de grande escala para resolver problemas que exigem raciocínio de múltiplas etapas, como cálculos aritméticos ou classificar se uma crítica de filme expressa uma opinião ou um fato. Em um experimento, eles pediram ao modelo para preencher a frase intermediária ausente de uma história curta, dado o início e o fim. Os métodos padrão produziam frases que eram gramaticalmente corretas, mas que não se encaixavam no fluxo narrativo. O novo método, no entanto, gerou com sucesso frases intermediárias que ligavam o início e o fim de forma coerente, mostrando uma capacidade muito maior de compreender o contexto completo. Em outro teste envolvendo problemas matemáticos simples, o modelo foi equipado com uma ferramenta de calculadora e solicitado a decompor o cálculo em etapas. Enquanto outros métodos de treinamento faziam o modelo repetir números ou falhar ao usar a ferramenta corretamente, a nova abordagem ensinou o modelo a planejar suas etapas cuidadosamente, levando a uma melhoria dramática na precisão, especialmente em problemas que ele nunca tinha visto antes.
Os resultados sugerem que este método é particularmente poderoso quando os dados são escassos. Em um teste com apenas dez exemplos de críticas de filmes para aprender, o novo método alcançou uma precisão significativamente maior do que as técnicas de treinamento padrão, e continuou a superá-las mesmo com cinquenta exemplos. Os pesquisadores descobriram que, ao incentivar o modelo a amostrar uma ampla variedade de caminhos de raciocínio e, em seguida, combinar suas conclusões, o sistema tornou-se mais robusto e confiável. Esta é uma distinção crucial porque significa que o modelo não está apenas memorizando uma única maneira de resolver um problema, mas está aprendendo a estrutura subjacente de como raciocinar sobre ele. O estudo indica que, ao mudar o objetivo de encontrar a resposta única mais provável para explorar a total diversidade de respostas corretas, podemos tornar essas ferramentas poderosas mais flexíveis e mais adequadas para tarefas de raciocínio complexo.
O trabalho também destaca uma limitação na forma como os modelos atuais são frequentemente treinados. Quando os modelos são pressionados a maximizar uma recompensa, eles tendem a encontrar atalhos, como repetir a mesma frase ou ignorar a lógica real de um problema, apenas para obter uma pontuação alta. Os pesquisadores mostraram que seu método evita essa armadida ao corresponder à distribuição inteira de soluções possíveis, garantindo que o modelo não colapse em um único modo de pensamento falho. Essa abordagem permite que o modelo generalize melhor para novas situações, como resolver problemas aritméticos com mais números do que ele foi treinado, onde outros métodos falharam. As descobertas oferecem um caminho promissor para tornar a inteligência artificial mais capaz de um raciocínio genuíno, indo além do simples reconhecimento de padrões para uma compreensão mais matizada de como construir argumentos e resolver problemas passo a passo.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.