← Últimos artigos
💬 NLP

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

Este artigo introduz um framework de interpretabilidade de caixa-preta que aprende "constituições" de linguagem natural verificáveis ao aplicar sistematicamente edições de conceitos atômicos a prompts, permitindo insights profundos e controle eficaz de comportamentos de modelos em tarefas como geração de texto para imagem e raciocínio matemático.

Autores originais: Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

Publicado 2026-02-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um artista robô ou uma calculadora superinteligente, muito poderosa, mas um tanto misteriosa. Você dá a ela um comando (um conjunto de instruções) e ela te dá uma resposta ou uma imagem. Às vezes, você quer saber: "Por que ela errou isso?" ou "Como posso enganá-la para que ela acerte?"

Este artigo apresenta uma nova maneira de falar com esses modelos de "caixa preta" sem precisar ver seu código interno. Eles chamam este método de Edições de Conceitos Atômicos (ACEs) guiadas por Constituição.

Aqui está o detalhamento usando analogias simples:

1. O Problema: O Mistério da "Caixa Preta"

Imagine que você está tentando consertar um carro, mas o motor está escondido dentro de um bloco sólido de aço. Você não consegue ver as engrenagens. Você só pode girar a chave (o comando) e ver se o carro liga (o resultado).

  • O Desafio: Se o carro não ligar, como você sabe se é o combustível, as velas de ignição ou a bateria? Na IA, se um modelo dá uma resposta ruim, é difícil saber qual palavra específica no seu comando causou a falha.

2. A Ferramenta: "Edições de Conceitos Atômicos" (ACEs)

Os pesquisadores tratam o comando como uma estrutura de LEGO.

  • Conceito Atômico: Um único tijolo de LEGO distinto (por exemplo, a palavra "gato", a cor "vermelho" ou a ação "correndo").
  • A Edição (ACE): Em vez de reconstruir todo o carro, você apenas troca um único tijolo.
    • Remover: Tire o tijolo "gato".
    • Adicionar: Coloque um tijolo "cachorro".
    • Substituir: Troque "vermelho" por "azul".

Eles tentam sistematicamente trocar esses tijolos individuais para ver o que acontece. O carro liga agora? A imagem mudou? Isso os ajuda a mapear exatamente quais "tijolos" controlam comportamentos específicos.

3. A Solução: A "Constituição"

Depois de testar milhares dessas trocas de tijolos individuais, os pesquisadores não apenas guardam os dados; eles escrevem um Livro de Regras (ou uma "Constituição").

Pense nesta Constituição como a Receita Secreta de um Chef para mudar o sabor de um prato.

  • Sem uma Constituição: Você adivinha aleatoriamente. "Talvez se eu adicionar sal? Talvez se eu remover a pimenta?" Leva muito tempo para descobrir o que funciona.
  • Com uma Constituição: Você tem um guia escrito que diz: "Para deixar esta sopa apimentada, sempre adicione pimentas malaguetas. Para deixá-la insossa, remova o sal. Nunca adicione açúcar."

Esta "Constituição" é uma lista de Boas Estratégias e Más Estratégias escritas em linguagem clara. Ela resume os padrões que os pesquisadores encontraram.

  • Exemplo: "Se você quiser que a imagem pareça errada, adicione um 'ambiente conflitante' (como colocar um peixe em um deserto)."
  • Exemplo: "Se você quiser que a resposta matemática esteja errada, adicione uma 'variável de distração' (um número que parece importante, mas não é)."

4. Como Funciona na Prática

Os pesquisadores testaram isso em três "jogos" diferentes:

  • Jogo 1: O Desafio da Contagem de Palavras

    • Objetivo: Fazer a IA escrever uma resposta muito curta (menos de 50 palavras).
    • A Percepção da Constituição: A IA ignora palavras vagas como "seja breve". Ela só ouve números rígidos (ex: "Escreva exatamente 10 palavras") ou limites estruturais (ex: "Escreva apenas uma frase").
    • Resultado: Usando a Constituição, a IA seguiu as regras de contagem de palavras muito melhor do que sem ela.
  • Jogo 2: O Truque Matemático

    • Objetivo: Fazer a IA falhar em um problema matemático simples.
    • A Percepção da Constituição: Alguns modelos de IA (como o GPT-5) ficam confusos se você adicionar uma "variável de distração" (um número falso que parece pertencer ao contexto). Outros modelos (como o Gemini) são inteligentes o suficiente para ignorar o número falso e ainda assim chegar à resposta correta.
    • Resultado: A Constituição revelou que diferentes modelos têm diferentes "pontos cegos".
  • Jogo 3: O Desajuste de Imagem

    • Objetivo: Fazer a IA desenhar uma imagem que não corresponde à descrição.
    • A Percepção da Constituição:
      • Um modelo (GPT-Image) quebra se você remover o relacionamento entre objetos (ex: dizer "um homem e seu filho", mas remover "filho"). Ele depende de uma gramática estrita.
      • Outro modelo (Imagen) quebra se você adicionar um cenário conflitante (ex: um "parque" com "resíduos industriais"). Ele se importa mais com a "vibe" ou atmosfera geral.

5. A Grande Vitória

O artigo afirma que, ao usar esta Constituição (o livro de regras) para guiar as Edições Atômicas (as trocas de tijolos individuais), eles conseguem controlar o comportamento da IA 1,86 vez melhor do que apenas adivinhar aleatoriamente.

Em resumo:
Em vez de adivinhar cegamente como mudar a mente de uma IA, este método permite que você desmonte as instruções da IA palavra por palavra, aprenda as regras do que a faz funcionar e escreva uma "Constituição" simples que diz exatamente como direcioná-la para o seu objetivo. Isso transforma uma misteriosa caixa preta em uma máquina com um manual de instruções claro e compreensível.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →