← Últimos artigos
💻 computer science

When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences

Este artigo introduz um arcabouço experimental baseado em simetria para medir sistematicamente como os grandes modelos de linguagem resolvem conflitos entre especificações concorrentes, revelando uma hierarquia de preferência consistente onde linguagens formais e formais naturalizadas são favorecidas em relação à linguagem natural pura e a exemplos de entrada-saída através de diversos domínios.

Autores originais: Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

Publicado 2026-07-31
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está pedindo ajuda a um amigo muito inteligente e muito culto para resolver um enigma difícil. Mas aqui está o detalhe: seu amigo recebeu dois manuais de instrução diferentes para o mesmo enigma, e os manuais se contradizem. Um diz: "Gire o botão vermelho para a esquerda", enquanto o outro insiste: "Gire o botão vermelho para a direita". No mundo da Inteligência Artificial, esses "amigos" são Modelos de Linguagem de Grande Escala (LLMs) — programas de computador gigantes treinados em quase todo o texto da internet. Eles são incríveis para escrever histórias, resolver problemas matemáticos e até programar, mas muitas vezes ficam confusos quando a informação que recebem é bagunçada ou conflitante.

Este artigo mergulha em um canto específico da ciência da IA: a Resolução de Conflitos. Ele faz uma pergunta simples, mas profunda: quando uma IA recebe duas instruções conflitantes, qual delas ela realmente escuta? Ela prefere uma fórmula matemática rigorosa? Uma frase casual em inglês comum? Uma lista de exemplos? Ou um trecho de código formal? Compreender isso é crucial porque, à medida que começamos a usar a IA para tarefas importantes — como escrever códigos de computador, diagnosticar problemas médicos ou tomar decisões jurídicas — precisamos saber se a IA está seguindo as "regras rígidas" ou apenas adivinhando com base em como as palavras soam. Se não soubermos qual instrução a IA prioriza, não podemos confiar em suas respostas.

O Grande Confronto de Instruções

Os pesquisadores da University College London decidiram tratar este problema como um experimento de feira de ciências. Em vez de apenas fazer perguntas aleatórias à IA, eles construíram uma arena controlada onde poderiam forçar a IA a escolher entre duas regras específicas e conflitantes. Eles chamaram isso de um "framework baseado em simetria", que é uma maneira sofisticada de dizer que eles configuraram o jogo de forma tão perfeita que a única coisa que mudava era como as regras eram escritas, não as regras em si.

Para fazer isso, criaram uma enorme "Arena de Batalha Matemática" com 550 diferentes cenários de conflito. Em cada cenário, a IA tinha que resolver um problema matemático (como calcular uma sequência ou encontrar um caminho em um grafo), mas recebia duas maneiras diferentes de descrever a solução. Eles testaram quatro "linguagens" distintas de instrução:

  1. Linguagem Natural Pura: Apenas frases normais em inglês (ex: "Some os números.").
  2. Linguagem Formal: Símbolos e equações matemáticas rigorosas (ex: f(x)=x+1f(x) = x + 1).
  3. Linguagem Formal Naturalizada: Uma mistura, usando símbolos matemáticos envoltos em frases em inglês (ex: "A função é definida como f(x)=x+1f(x) = x + 1.").
  4. Exemplos de Entrada-Saída: Uma lista de exemplos mostrando entradas e seus resultados (ex: "Se 2 entra, 3 sai. Se 5 entra, 6 sai.").

A IA tinha que escolher uma dessas descrições para resolver uma questão de teste específica. Os pesquisadores então observaram para ver qual descrição a IA "confiava" o suficiente para seguir.

Os Resultados: A Hierarquia da Confiança

As descobertas foram surpreendentemente consistentes. A IA não escolheu aleatoriamente; ela tinha um favorito muito claro. Acontece que os modelos de IA amam estrutura e odeiam ambiguidade.

Os pesquisadores descobriram uma estrita "ordem de preferência" de confiança:

  1. Nível Superior: As linguagens Formal e Formal Naturalizada foram as grandes vencedoras. A IA seguiu essas regras cerca de 87% a 93% das vezes quando confrontadas com linguagem natural pura ou exemplos. Parece que, quando a IA vê uma fórmula matemática limpa, ela a trata como a "lei".
  2. Nível Intermediário: A Linguagem Natural Pura ficou em segundo lugar. Era mais confiável que os exemplos, mas menos confiável que a matemática. A IA seguiu essas instruções cerca de 78% das vezes ao competir contra exemplos.
  3. Nível Inferior: Exemplos de Entrada-Saída foram os menos confiáveis. Quando a IA tinha que escolher entre uma lista de exemplos e uma regra clara, ela quase sempre ignorava os exemplos.

Pense da seguinte forma: Se você disser a um robô, "Aqui está uma lista de vezes que eu almocei: 12:00, 12:15, 12:30", ele pode adivinhar que você almoça às 12:45. Mas se você disser a ele, "Eu almoço às 12:00 PM todos os dias", ele seguirá as 12:00 PM. A IA prefere a regra explícita em vez do padrão que ela tem que adivinhar.

Não é Apenas Matemática: Testes no Mundo Real

A equipe não parou na matemática. Eles queriam ver se essa "hierarquia de confiança" se sustentava em situações mais complexas do mundo real. Eles testaram a IA em outras três áreas:

  • Álgebra Booleana (Portas Lógicas): Eles colocaram uma fórmula matemática compacta contra uma "Tabela Verdade" gigante (uma lista massiva de todos os resultados possíveis). Mesmo que a Tabela Verdade fosse exaustiva e impossível de errar, a IA ainda preferiu a fórmula compacta 88% das vezes. Parece que a IA gosta de atalhos "inteligentes" em vez de listas de "força bruta".
  • Geração de Código: Eles deram à IA um conflito entre uma descrição escrita do que um programa de computador deve fazer e um conjunto de testes automatizados (código que verifica se o programa funciona). Aqui, os resultados dependeram do "poder cerebral" da IA. Modelos menores e menos capazes tendiam a seguir a descrição escrita, enquanto os modelos mais poderosos preferiam fortemente os testes automatizados, seguindo-os em até 97% das vezes. Isso sugere que, conforme a IA se torna mais inteligente, ela aprende a confiar nas "evidências concretas" dos testes de código em vez de descrições humanas.
  • Regras Clínicas (Conselhos Médicos): Eles testaram a IA com regras médicas reais sobre dosagens de medicamentos. Curiosamente, a IA não se importou com o formato (inglês vs. exemplos) tanto quanto se importou com o conteúdo. Neste domínio, a IA consistentemente escolheu a regra mais estrita (a que dizia "não faça isso") em vez da mais permissiva, independentemente de como a regra estava escrita. Isso sugere que, em campos de alto risco, a IA possui um viés intrínseco para a segurança.

O Que Isso Significa Para Nós

O artigo conclui que a IA não é apenas um adivinhador aleatório; ela tem uma maneira sistemática de decidir quais instruções seguir. Ela geralmente prefere regras explícitas e estruturadas (como fórmulas matemáticas) em vez de padrões implícitos (como exemplos).

No entanto, os pesquisadores também descobriram que isso não é uma lei perfeita e imutável. A preferência da IA pode mudar dependendo de quão inteligente é o modelo e de que tipo de tarefa ele está realizando. Por exemplo, nos testes médicos, a IA ignorou o formato e apenas buscou a resposta "mais segura".

Este estudo nos dá uma nova ferramenta para medir como a IA pensa. Ao entender que a IA tem um "tipo favorito" de instrução, podemos projetar melhores sistemas. Se quisermos que uma IA siga uma regra específica, devemos provavelmente escrevê-la como uma declaração clara e formal, em vez de esperar que ela a deduza a partir de uma lista de exemplos. É um lembrete de que, embora a IA esteja ficando mais inteligente, ela ainda precisa que falemos sua língua com clareza — especialmente quando as instruções estão em conflito.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →