← Últimos artigos
💬 NLP

Who Decides What Is Harmful? Content Moderation Policy Through A Multi-Agent Personalised Inference Framework

Este artigo propõe um framework multiagente baseado em LLM que personaliza a moderação de conteúdo ao simular sensibilidades individuais de usuários por meio de agentes especializados, alcançando uma melhoria de 32% na precisão em relação a sistemas centralizados tradicionais, ao mesmo tempo em que oferece uma abordagem escalável para equilibrar a governança da plataforma com a autonomia do usuário.

Autores originais: Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska, Jaroslaw A. Chudziak

Publicado 2026-05-06
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska, Jaroslaw A. Chudziak

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine a internet como uma praça de cidade massiva e caótica, onde milhões de pessoas estão gritando, compartilhando histórias, discutindo e postando memes todos ao mesmo tempo. Atualmente, os "seguranças" (sistemas de moderação de conteúdo) que tentam manter essa praça segura utilizam um único manual de regras gigante para todos. Eles decidem o que é "prejudicial" com base em uma lista padronizada para todos. Se um post viola uma regra, ele é removido. Se não viola, permanece.

O problema, conforme apontado pelos autores deste artigo, é que as pessoas são diferentes. O que uma pessoa acha engraçado, outra acha profundamente ofensivo. O que uma pessoa vê como uma opinião política ousada, outra vê como um ataque pessoal. O sistema atual ignora esses sentimentos individuais, frequentemente deixando as pessoas sobrecarregadas com conteúdo que consideram tóxico, ou, inversamente, removendo coisas que elas realmente gostam.

Este artigo propõe uma nova maneira de administrar a estação dos seguranças. Em vez de um único manual de regras rígido, eles sugerem uma abordagem personalizada e baseada em equipe chamada PRISM.

A Ideia Central: Uma Equipe de Segurança Personalizada

Pense no sistema PRISM não como um único robô, mas como uma equipe de segurança personalizada designada para cada usuário individual. Veja como essa equipe funciona, usando analogias simples:

1. O "Perfil de Sensibilidade" (Seu Manual de Regras Pessoal)
Em vez de começar com uma folha em branco, o sistema aprende seus "pontos sensíveis" específicos.

  • A Analogia: Imagine que você é muito sensível a barulhos altos, mas não se importa com quartos bagunçados. Seu vizinho, no entanto, odeia bagunça, mas adora música alta. O sistema PRISM aprende seus seus limites específicos. Ele constrói um perfil que diz: "Este usuário fica chateado facilmente com insultos, mas está bem com argumentos políticos fortes."
  • Como funciona: À medida que você interage com o sistema (dizendo-lhe: "Não gosto deste post" ou "Isso está bem"), ele atualiza seu perfil. Ele aprende exatamente o que você considera prejudicial, não o que um algoritmo genérico acha que você deveria considerar prejudicial.

2. O "Agente Gerente" (O Líder da Equipe)
Quando um novo post chega, um "Gerente" central o examina junto com seu perfil.

  • A Analogia: O Gerente é como um maestro em uma orquestra. Ele olha para o post e diz: "Este post tem linguagem agressiva e menciona um grupo específico. Não precisamos de toda a orquestra; vamos chamar apenas o Sociólogo (que conhece dinâmicas de grupo) e o Psicólogo (que conhece impacto emocional)."
  • O Twist: O Gerente também sussurra suas preferências específicas aos especialistas. Eles dizem ao Psicólogo: "Lembre-se, este usuário é extremamente sensível a linguagem desumanizante, então procure especificamente por isso."

3. Os "Agentes Especialistas" (Os Especialistas)
O sistema utiliza diferentes "especialistas" de IA para analisar o conteúdo sob diferentes ângulos.

  • O Sociólogo: Procura discriminação ou tratamento injusto de grupos.
  • O Linguista: Procura palavras grosseiras, insultos ou tom agressivo.
  • O Psicólogo: Procura ameaças ou coisas que possam causar sofrimento emocional.
  • O Agente "Fantasma": Este é um agente especial que age exatamente como você. Se os especialistas discordarem, o Agente Fantasma intervém para dizer: "Com base no que este usuário nos disse antes, ele acharia isso prejudicial."

4. O "Agente de Síntese" (O Tomador de Decisão)
Finalmente, um Agente de Síntese reúne todas as opiniões dos especialistas e do Fantasma. Ele pondera seus argumentos contra seu perfil pessoal e toma a decisão final: "Mostrar isso ao usuário" ou "Ocultar isso".

O Que Eles Descobriram?

Os pesquisadores testaram este sistema contra os antigos métodos "padronizados para todos" e alguns dos modelos de IA padrão mais inteligentes atualmente utilizados.

  • Maior Precisão: Sua equipe personalizada foi 32% mais precisa ao prever o que um usuário específico acharia prejudicial, comparada aos sistemas genéricos e padrão.
  • Menos Erros: A equipe multiagente cometeu menos erros do que uma única IA tentando fazer tudo sozinha. Ao dividir o problema em tarefas menores (como ter um especialista para insultos e um especialista para ameaças), eles evitaram confundir os dois.
  • Aprendizado Rápido: O sistema não precisou de anos para aprender. Mesmo após um usuário fornecer apenas algumas peças de feedback, o sistema começou a funcionar muito melhor do que a versão genérica. Não demorou muito para descobrir seu "gosto".

O Quadro Geral: Quem Decide?

O artigo faz uma grande pergunta: "Quem decide o que é prejudicial?"

Atualmente, a resposta é "A Plataforma". Eles decidem por todos.
O sistema PRISM sugere que a resposta deveria ser: "O Usuário, com a ajuda de uma equipe inteligente."

Os autores argumentam que, embora as plataformas ainda precisem manter o básico seguro (como prevenir violência), as decisões diárias sobre o que é "demais" para uma pessoa específica devem ficar a cargo dessa pessoa. Este sistema permite que os usuários tenham um "filtro" que se adapta ao seu bem-estar mental único, em vez de forçar todos a viver sob as mesmas regras rígidas.

Em resumo: Em vez de um segurança gritando "Ninguém pode dizer isso!" para toda a multidão, o PRISM dá a cada pessoa um guarda-costas pessoal que sabe exatamente o que eles podem suportar e o que não podem, garantindo que todos se sintam seguros à sua própria maneira.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →