SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding
O artigo apresenta o SyRuP, um framework de tempo de decodificação que aumenta a adesão de Grandes Modelos de Linguagem ao prompts de sistema ao treinar uma cabeça de recompensa de atenção cruzada para gerar pontuações de adesão ao nível de token para reclassificar candidatos sem exigir o ajuste do modelo base.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está conversando com um robô muito inteligente e culto, que leu quase todos os livros da biblioteca. Este robô é um Modelo de Linguagem Grande (LLM). Normalmente, quando você faz uma pergunta a ele, ele responde com base em seu treinamento. Mas, às vezes, você quer dar a ele um conjunto específico de regras antes de ele começar a falar. Você pode dizer: "Aja como um pirata rabugento", ou "Responda apenas em rimas", ou "Nunca mencione violência". Essas regras são chamadas de prompts de sistema. Elas são como a descrição do cargo ou a fantasia que o robô veste para uma conversa específica.
O problema é que esses robôs estão acostumados a seguir instruções que aparecem dentro da conversa, não regras estabelecidas em pedra antes do chat começar. Quando as regras ficam complicadas — como "seja um pirata, mas também use a gramática do século XIX, evite a letra 'e' e mantenha o tom engraçado" — o robô frequentemente esquece as regras no meio do caminho. Ele pode começar a falar como um pirata, mas de repente mudar para um adolescente moderno, ou esquecer de evitar a letra 'e'. Cientistas tentaram corrigir isso retreinando o robô (o que é caro e lento) ou tentando adivinhar a melhor resposta depois que ela já foi escrita (o que é como editar um romance depois que o autor já terminou). A grande questão é: Podemos guiar o robô para seguir essas regras complexas enquanto ele está escrevendo, sem mudar seu cérebro ou esperar até o fim?
É aqui que um novo método chamado SYRUP entra em cena. Pense no cérebro do robô como uma biblioteca massiva e congelada que não temos permissão para reorganizar. O SYRUP é como um bibliotecário minúsculo e superinteligente que fica parado ao lado do robô enquanto ele escreve. Cada vez que o robô escolhe a próxima palavra para dizer, este bibliotecário verifica duas coisas: "Esta palavra se encaixa na história?" e "Esta palavra se encaixa na fantasia de pirata?".
Eis como funciona na prática. O robô tem uma lista das suas 10 palavras favoritas para dizer a seguir. Normalmente, ele apenas escolhe a sua favorita número um. O SYRUP intervém. Ele olha para o "prompt de sistema" (a fantasia de pirata) como um cartão de memória separado e especial. Ele usa uma ferramenta especial chamada cabeça de recompensa de atenção cruzada (cross-attention reward head) para perguntar aos pensamentos atuais do robô: "Ei, se você disser esta palavra, ela combina com a vibe de pirata?". O bibliotecário então dá uma pontuação para cada uma das 10 palavras favoritas. Se o robô quiser dizer "Olá", mas a fantasia de pirata exigir "Ahoy", o bibliotecário aumenta a pontuação de "Ahoy" e diminui a de "Olá". O robô então escolhe a palavra com a maior pontuação combinada.
O artigo sugere que esta abordagem é muito melhor do que as formas antigas. Os pesquisadores testaram o SYRUP em três cérebros de robôs diferentes e descobriram que ele consistentemente ajudou a seguir regras complexas melhor do que apenas dar um prompt melhor ao robô ou tentar reclassificar as respostas depois que foram escritas. De fato, em um teste, o SYRUP melhorou o desempenho do robô em cerca de 5,6% em comparação com o próximo melhor método. Isso pode parecer pouco, mas no mundo da IA, esse é um salto enorme.
O artigo também descarta outras ideias. Ele mostra que simplesmente fundir as regras no texto principal da conversa (como esconder as instruções de pirata dentro da pergunta do usuário) não é suficiente; o robão precisa que as regras sejam tratadas como uma memória separada e distinta para realmente segui-las. Também descobriu que, embora possamos fazer o robô seguir as regras melhor ao retreiná-lo do zero, isso leva muito tempo e dinheiro. O SYRUP é um método de "tempo de decodificação", o que significa que ele funciona enquanto o robô está pensando, mantendo o cérebro original congelado e treinando apenas um complemento minúsculo e leve.
Curiosamente, os pesquisadores descobriram que o SYRUP funciona mesmo em regras que ele ainda não viu. Eles treinaram o método em um conjunto de instruções complexas e depois o testaram em um conjunto completamente diferente de regras (como formatação rigorosa ou contagem de palavras), e ele ainda teve um bom desempenho. Isso sugere que o método ensina ao robô uma habilidade geral de "ouvir o chefe", em vez de apenas memorizar respostas específicas.
No entanto, o artigo é cuidadoso ao notar que o SYRUP não é uma varinha mágica que resolve tudo. O método adiciona um pouco de tempo extra ao processo de pensamento do robô porque o bibliotecário tem que verificar as palavras. Mas os autores sugerem que esse custo é muito pequeno em comparação com outros métodos complexos que tentam fazer a mesma coisa. Eles também alertam que, se você forçar demais o "seguimento de regras", o robô pode começar a soar estranho ou não natural, portanto, deve haver um equilíbrio.
Em suma, o SYRUP sugere que, se você quer que um robô siga um conjunto complexo de regras sem retreinar todo o seu céreão, você não deve apenas esperar que ele se lembre. Em vez disso, você deve dar a ele um guia dedicado em tempo real que verifica cada única palavra que ele quer dizer contra as regras, garantindo que a história final permaneça fiel à fantasia que ele estava vestindo desde o início.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.