DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance
O artigo propõe o DUET, um método de destilação on-policy de seleção de tokens que aproveita o desacordo por token entre dois professores de pesos idênticos (um com e outro sem o contexto de proibição) para gerar um sinal de supervisão limpo para treinar modelos para cumprir proibições dinâmicas e específicas de cada requisição, enquanto preserva a utilidade geral.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Os modelos de linguagem de grande escala são os motores por trás de muitos assistentes digitais modernos, capazes de gerar texto semelhante ao humano, resolver problemas e responder a perguntas. No entanto, no mundo real, esses modelos operam frequentemente sob regras estritas e mutáveis que não estão codificadas em seus cérebros, mas que são injetadas em suas instruções no momento em que são usados. Uma empresa pode dizer a um modelo para nunca revelar suas ferramentas internas, enquanto um hospital pode exigir que ele nunca mencione nomes de pacientes. Essas regras mudam dependendo de quem está perguntando e do que é a situação. O desafio para os desenvolvedores é ensinar o modelo a obedecer a essas proibições específicas e temporárias sem torná-lo tão cauteloso que se recuse a responder perguntas inofensivas, ou tão confiante que acidentalmente quebre as regras. Se um modelo falhar em seguir essas instruções, isso pode levar ao vazamento de dados ou incidentes de segurança de marca; se ele ficar com medo demais de falar, torna-se inútil.
Pesquisadores da Tencent desenvolveram um novo método chamado DUET para resolver este problema específico de ensinar modelos a seguir regras de tempo de execução (runtime). Em vez de tentar retreinar o modelo do zero ou simplesmente mostrar exemplos de respostas boas e ruins, eles criaram um sistema que atua como um par de gêmeos idênticos. Um gêmeo vê a regra proibida em suas instruções, enquanto o outro gêmeo, que possui exatamente o mesmo conhecimento e habilidades, não vê a regra. Como esses dois "professores" são, de outra forma, idênticos, qualquer diferença no que dizem deve ser causada exclusivamente pela presença ou ausência dessa regra específica. Os pesquisadores usam esse desacordo para identificar exatamente onde o modelo provavelmente cometerá um erro.
O processo funciona fazendo com que o modelo estudante gere uma resposta enquanto ambos os professores gêmeos observam. Quando os dois professores concordam sobre qual deve ser a próxima palavra, o sistema ignora essa parte da conversa, assumindo que ela é segura e sem importância. No entanto, quando os professores discordam — um sugerindo uma palavra que revela um segredo e o outro sugerindo uma alternativa segura — o sistema sinaliza esse momento específico como uma oportunidade de aprendizado crítica. Isso permite que o modelo estudante foque sua atenção apenas nas poucas palavras onde a regra realmente importa, em vez de desperdiçar esforço nas milhares de palavras que estão perfeitamente bem. O estudante é então gentilmente afastado do professor que ignora a regra e puxado em direção ao professor que a respeita, efetivamente aprendendo a navegar na fronteira entre a utilidade e a conformidade.
Essa abordagem aborda uma falha em métodos antigos onde os modelos eram treinados em conversas inteiras. Nesses sistemas antigos, se um modelo cometesse um único erro em uma resposta longa, a resposta inteira era frequentemente tratada como ruim, o que confundia o modelo sobre quais palavras específicas eram o problema. Ao isolar o desacordo para o token exato, ou unidade de palavra, onde ocorre a violação, o novo método fornece um sinal muito mais limpo. Os pesquisadores testaram isso em uma variedade de tarefas, incluindo a proteção de informações pessoais, o seguimento de diretrizes de segurança e a adesão a definições de ferramentas de negócios. Eles descobriram que os modelos treinados com este método de duplo professor eram significativamente melhores em recusar a quebrar regras, enquanto permaneciam úteis para perguntas legítimas.
Os resultados mostraram que o novo método superou as técnicas existentes em diferentes tamanhos de modelos, desde os menores com 1,5 bilhão de parâmetros até os maiores com 8 bilhões. Em seus testes, os modelos alcançaram uma taxa de conformidade de mais de 72% a 85% em solicitações violadoras, o que significa que recusaram com sucesso quebrar as regras, enquanto mantinham um alto nível de utilidade para perguntas normais, preservando entre 88% e 93% de sua capacidade de responder corretamente. Crucialmente, os modelos não perderam sua inteligência geral; permaneceram tão bons em matemática e enigmas de lógica quanto antes. O estudo sugere que, ao usar dois modelos idênticos para encontrar o ponto exato onde uma regra importa, os desenvolvedores podem criar assistentes de IA que são tanto seguros quanto úteis, navegando por instruções complexas e mutáveis sem precisar de quantidades massivas de novos dados ou perder suas capacidades principais.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.