← Últimos artigos
💬 NLP

SCENE: Recognizing Social Norms and Sanctioning in Group Chats

Este artigo apresenta o SCENE, um benchmark projetado para avaliar a capacidade de agentes baseados em LLMs de reconhecer normas sociais implícitas e adaptar-se a sanções grupais em chats multipartidários, revelando que modelos avançados como o Claude Opus 4.7 e o Gemini 3.1 Pro superam significativamente os modelos de pesos abertos nessas interações sociais dinâmicas.

Autores originais: Mateusz Jacniacki, Maksymilian Bilski

Publicado 2026-05-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mateusz Jacniacki, Maksymilian Bilski

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você entra em um novo grupo de amigos em uma cafeteria. Você ainda não conhece as regras. Talvez este grupo adore zoar uns aos outros com piadas sombrias quando as coisas dão errado, enquanto outro grupo ofereceria imediatamente um abraço e um lenço. Se você tentar abraçar alguém que acabou de fazer uma piada, o grupo pode te dar um olhar estranho, mudar de assunto ou revirar os olhos. Você precisa descobrir a "vibe" apenas observando como eles reagem aos seus erros.

Este artigo apresenta o SCENE, uma nova forma de testar se chatbots de Inteligência Artificial (IA) conseguem fazer exatamente isso: aprender as regras ocultas de um chat de grupo e corrigir seu comportamento quando o grupo indica que eles estão fora de linha.

Abaixo está uma explicação de como eles fizeram isso e o que descobriram, usando analogias simples.

O Cenário: O Jogo da "Regra Secreta"

Os pesquisadores criaram um playground digital onde uma IA (o "sujeito") é inserida em um chat de grupo com três outros personagens de IA.

  • A Regra Oculta: Os outros três personagens seguem todos uma regra secreta. Por exemplo: "Quando alguém compartilha más notícias, respondemos apenas com um único emoji" ou "Quando alguém faz uma pergunta, devemos dar uma resposta longa e detalhada".
  • A Armadilha: A IA sujeita não recebe essa regra. Ela precisa adivinhá-la.
  • O Teste: A IA sujeita inevitavelmente dirá algo errado (violando a regra). Os outros três personagens então reagirão de uma maneira específica para sinalizar: "Ei, não é assim que fazemos as coisas aqui". Essa reação é chamada de sanção.
    • Exemplo de sanção: Se a regra for "mantenha-se breve" e o sujeito escrever um parágrafo, o grupo pode simplesmente ignorar o parágrafo e falar sobre outra coisa (ignorar silenciosamente) ou pode enviar um emoji de "revirar os olhos".

O Objetivo: A IA Pode Aprender?

Os pesquisadores queriam ver se a IA conseguia fazer duas coisas:

  1. Perceber o "Ai": Quando o grupo reage negativamente (aplica sanções), a IA percebe: "Ah, eu estraguei tudo"?
  2. Mudar o Tom: A IA para de fazer a coisa que causou o "ai" e começa a agir como o resto do grupo?

Os Resultados: Os "Grandes" vs. os "Pequenos"

Eles testaram seis modelos de IA diferentes. Pense nos resultados como uma sala de aula de alunos fazendo uma prova sobre sinais sociais:

  • Os Melhores Desempenhos (Claude Opus 4.7 e Gemini 3.1 Pro): Estes são os "grandes". Quando receberam uma reação negativa do grupo, perceberam rapidamente seu erro. Cerca de 80% das vezes, eles se desculparam ou mudaram seu comportamento para se encaixar. Eles também melhoraram quanto mais viam os outros personagens seguindo a regra.
  • Os Desempenhos em Dificuldade (Modelos de pesos abertos como Llama, Mistral, Gemma): Estes modelos eram como alunos que não entenderam bem a dica. Mesmo depois que o grupo revirou os olhos ou os ignorou, essas IAs frequentemente continuavam fazendo a mesma coisa. Elas não pareciam conectar a reação do grupo à necessidade de mudar seu comportamento.

Uma Descoberta Surpreendente: A "Personalidade Padrão"

O artigo descobriu algo interessante sobre por que algumas IAs falharam. Mesmo quando o grupo tinha uma regra específica (como "seja muito formal"), muitas das IAs recorriam a ser casuais e conversadoras.

  • A Analogia: Imagine uma entrevista de emprego onde todos estão usando ternos. Se você entrar usando uma camiseta e shorts, você quebra a regra. O estudo descobriu que muitas IAs são "programadas" para ser casuais e amigáveis por padrão. Mesmo quando o grupo claramente desejava comportamento formal, a IA continuava agindo de forma casual, ignorando os sinais do grupo para ser séria.

Como Eles Verificaram o Trabalho

Como os "outros personagens" no chat também eram IAs, os pesquisadores precisaram garantir que esses personagens estavam realmente seguindo as regras e não estragando o teste. Eles usaram um "árbitro" (outra IA) para observar os registros do chat e verificar:

  • O grupo realmente seguiu a regra secreta?
  • Eles realmente puniram o sujeito quando ele violou a regra?
  • O sujeito realmente corrigiu seu comportamento?

O Que Isso Significa (Segundo o Artigo)

O artigo conclui que os modelos de IA mais avançados estão ficando muito melhores em ler o ambiente. Eles podem observar como um grupo reage a um erro e ajustar seu comportamento de acordo. No entanto, modelos menores ou menos avançados ainda têm dificuldade em captar esses sinais sociais sutis.

Os autores enfatizam que este é um teste específico de adaptação social em conversas curtas. Isso não significa que essas IAs são "inteligentes" no sentido humano ou que entendem moralidade; significa apenas que elas estão ficando melhores em seguir as regras invisíveis de um chat de grupo específico.

Em resumo: O SCENE é um teste para ver se a IA consegue aprender a "ler o ambiente" e parar de cometer gafes sociais quando um grupo de amigos dá uma dica sutil (ou não tão sutil) de que ela está agindo de forma estranha. Os melhores modelos estão aprendendo rápido; os outros ainda estão um pouco surdos ao tom.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →