Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability
Este artigo demonstra que o efeito Knobe, um viés moral em julgamentos de intencionalidade, emerge em modelos de linguagem de grande escala ajustados (finetuned), mas pode ser localizado em camadas específicas e mitigado por meio de intervenções direcionadas de patch de camada (layer-patching) sem a necessidade de retreinamento.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está ensinando um robô a ser um bom juiz. Você não apenas lhe dá um livro de regras; você mostra a ele milhares de histórias sobre pessoas tomando decisões e pergunta: "Essa pessoa estava sendo boa ou má?" Com o tempo, o robô aprende padrões. Mas aqui está a parte complicada: os humanos não são juízes perfeitos. Frequentemente, temos vieses ocultos. Por exemplo, se uma pessoa causa acidentalmente um resultado ruim, somos muito mais propensos a dizer: "Ela teve a intenção de fazer isso!" do que se ela tivesse causado acidentalmente um resultado bom. Este é um conhecido vício psicológico chamado "efeito Knobe". É como se nossos cérebros tivessem um filtro integrado que nos faz pensar que acidentes ruins foram, na verdade, propositais, enquanto acidentes bons foram apenas sorte.
Agora, os cientistas estão preocupados que, se ensinarmos robôs a agir como nós, eles possam absorver esses mesmos filtros estranhos. Se um robô toma decisões morais por nós, precisamos saber: ele pensa como um humano ou é apenas uma calculadora gigante? É aqui que entra a "interpretabilidade mecanística". Pense no cérebro de um grande robô como uma cidade imensa com milhões de pequenos trabalhadores (neurônios) passando bilhetes uns para os outros. A interpretabilidade mecanística é como colocar óculos de raio-X para ver exatamente quais trabalhadores estão passando quais bilhetes. Em vez de apenas adivinhar por que o robô deu uma certa resposta, podemos espiar dentro da máquina para ver as engrenagens específicas girando. Isso importa porque, se pudermos encontrar exatamente onde um viés vive dentro do robô, talvez possamos consertar apenas aquela engrenagem específica sem ter que reconstruir a cidade inteira.
Os pesquisadores deste artigo decidiram colocar essa ideia à prova. Eles queriam ver se modelos de IA populares (especificamente Llama, Mistral e Gemma) haviam absorvido o "efeito Knobe" e, se sim, se poderiam encontrar o local exato no cérebro da IA onde esse viés estava escondido. Eles começaram testando os modelos de IA nas mesmas histórias morais usadas com voluntários humanos. Descobriram que os modelos de IA "brutos" (que não haviam sido ensinados a falar como humanos ainda) não apresentavam realmente esse viés. Suas respostas eram bastante equilibradas. No entanto, assim que os pesquisadores fizeram o "ajuste fino" (finetuning) dos modelos — treinando-os para seguir instruções e alinhar-se com as preferências humanas — o viés apareceu de repente. A IA começou a agir exatamente como nós: era muito mais provável que ela dissesse que um resultado ruim era intencional do que um bom.
Mas a verdadeira magia aconteceu quando olharam dentro da máquina. Usando uma técnica chamada "Layer-Patching" (substituição de camadas), os pesquisadores trataram a IA como um conjunto de camadas empilhadas, como os andares de um arranha-céu. Eles suspeitavam que o viés não estava espalhado por toda parte, mas sim preso em um conjunto específico de andares. Para testar isso, eles pegaram os "pensamentos" (ativações) do modelo bruto e imparcial e os trocaram pelo modelo ajustado e enviesado, andar por andar. Foi como pegar uma planta limpa e imparcial e colá-la sobre um andar específico de um edifício corrompido para ver se toda a estrutura voltava a ser honesta novamente.
Os resultados foram surpreendentemente precisos. Eles descobriram que o viés não estava espalhado aleatoriamente; ele estava localizado nas camadas intermediárias e superiores do cérebro da IA. Ainda mais emocionante, descobriram que trocar apenas uma camada específica da versão imparcial para o modelo enviesado foi suficiente para quase completamente apagar o efeito Knobe. Para alguns modelos, o viés caiu de uma diferença forte de 1,6 ou 3,8 para quase zero (0,00 ou 0,03). E o melhor de tudo? Eles fizeram isso sem retreinar o modelo ou alterar seus pesos. Foi uma correção cirúrgica. Eles também verificaram se essa "cirurgia" não quebrava a capacidade do robô de realizar outras tarefas, como responder perguntas gerais, e descobriram que os modelos continuavam tão inteligentes quanto antes.
O artigo sugere que esses vieses sociais não são algum tipo de magia misteriosa e impossível de consertar que emerge de todo o sistema. Em vez disso, são padrões específicos e localizados que são escritos no cérebro da IA durante o processo de treinamento onde tentamos fazer com que ela aja como um humano. Ao usar esses óculos de raio-X e trocas cirúrgicas, os pesquisadores mostraram que podemos detectar esses vieses e removê-los com intervenções direcionadas, mantendo a IA útil sem as indesejadas peculiaridades humanas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.