← Últimos artigos
💬 NLP

Toxic Subword Pruning for Dialogue Response Generation on Large Language Models

Este artigo apresenta o ToxPrune, um algoritmo novo e eficiente que poda subpalavras associadas a vocabulário tóxico de Modelos de Linguagem de Grande Escala treinados, prevenindo efetivamente a geração de conteúdo tóxico enquanto, simultaneamente, aprimora a diversidade e o desempenho do diálogo sem os altos custos ou riscos do alinhamento de segurança baseado em pesos tradicional.

Autores originais: Hongyuan Lu, Wai Lam

Publicado 2026-05-21
📖 4 min de leitura☕ Leitura rápida

Autores originais: Hongyuan Lu, Wai Lam

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um amigo robô muito inteligente e criativo que adora conversar. Às vezes, esse robô fica um pouco muito selvagem e começa a soltar palavras grosseiras, ofensivas ou "tóxicas". Geralmente, para corrigir isso, os desenvolvedores precisam desmontar o robô, re treiná-lo ou instalar um guarda de segurança complexo que verifica cada frase antes que ela saia. Isso é caro, lento e, às vezes, o robô ainda encontra uma maneira de quebrar as regras.

Este artigo apresenta um truque muito mais simples chamado ToxPrune (Poda de Subpalavras Tóxicas). Pense nele não como re treinar o robô, mas como editar seu dicionário antes mesmo de ele começar a falar.

Veja como funciona, usando algumas analogias do dia a dia:

1. A Analogia do "Lego"

Modelos de Linguagem de Grande Porte (LLMs) não veem palavras como "foda" ou "estúpido" como blocos únicos. Em vez disso, eles as veem como peças menores, como tijolos de Lego (chamados de "subpalavras").

  • A palavra "fodendo" pode ser construída a partir de dois tijolos: "fo" e "dendo".
  • A palavra "lendo" pode ser construída a partir de "le" e "ndo".

Às vezes, um tijolo "tóxico" é compartilhado entre uma palavra ruim e uma palavra boa. Por exemplo, o tijolo "f" pode ser usado em "f*ck" (ruim), mas também em "fun" (bom).

2. O Método das "Tesouras"

Os autores propõem um algoritmo simples: Pegue um par de tesouras e corte os tijolos de Lego específicos que compõem as palavras ruins.

  • O Processo: Você fornece ao computador uma lista de palavras que não deseja (como uma "lista de malvados"). O computador decompõe essas palavras em seus minúsculos tijolos de Lego.
  • A Poda: Em seguida, ele entra no cérebro do robô e diz: "Se você tentar montar uma frase usando esses tijolos específicos, você não pode." Ele efetivamente exclui esses tijolos do conjunto de ferramentas disponível do robô.
  • O Resultado: O robô tenta responder à sua pergunta, mas como os "tijolos ruins" estão faltando, ele é forçado a montar uma frase diferente usando apenas os "tijolos bons".

3. O Que Acontece Quando Você Faz Isso?

O artigo testou isso em dois tipos de robôs:

A. O Robô "Ruim" (NSFW-3B)
Este robô foi treinado especificamente para ser grosseiro e dizer palavras sujas.

  • Antes: Se você perguntasse, "Quais são seus hobbies?", ele responderia, "Meus hobbies são f*ckingly chatos."
  • Após o ToxPrune: Como os tijolos de "f*ckingly" foram removidos, o robô não pôde dizer isso. Em vez disso, foi forçado a dizer, "Meus hobbies são ler mistérios e dirigir um caminhão."
  • A Surpresa: Não apenas ele parou de ser grosseiro, mas na verdade ficou melhor em conversar. Começou a usar palavras mais diversas e não ficou preso repetindo as mesmas frases ruins. Foi como remover um mau hábito que, na verdade, estava impedindo o robô de ser criativo.

B. O Robô "Bom" (Llama-3.1)
Este robô já era educado e seguro.

  • Antes: Era educado, mas às vezes um pouco repetitivo.
  • Após o ToxPrune: Mesmo já estando seguro, remover alguns tijolos comuns (que acabaram por ser compartilhados entre palavras tóxicas e não tóxicas) tornou-o mais diverso. Começou a usar uma variedade maior de palavras para expressar as mesmas ideias, tornando a conversa mais natural e menos robótica.

4. Por Que Isso É Diferente?

Geralmente, se você quiser impedir um robô de dizer coisas ruins, pode tentar:

  • Reescrever seu cérebro: Caro e lento (como fazer uma nova graduação).
  • Colocar um filtro na porta: Um guarda de segurança que verifica cada frase. Se o guarda for muito rigoroso, pode bloquear frases úteis também.

ToxPrune é diferente porque é como mudar os ingredientes na cozinha. Você não precisa de um guarda de segurança; basta não ter os ingredientes tóxicos na prateleira. O robô fisicamente não consegue cozinhar uma refeição tóxica porque os ingredientes desapareceram.

A Conclusão

O artigo afirma que, simplesmente removendo os pequenos blocos de construção de palavras tóxicas do dicionário de um modelo de linguagem, você pode:

  1. Impedir robôs tóxicos de dizer coisas ruins, mesmo que tenham sido treinados para ser tóxicos.
  2. Melhorar a qualidade da conversa, tornando-a mais diversa e interessante.
  3. Fazer isso instantaneamente, sem necessidade de re treinar o modelo ou pagar por poder de computação caro.

É uma solução "leve" que transforma a incapacidade de um robô de dizer uma palavra ruim em uma oportunidade para dizer algo melhor.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →