← Últimos artigos
💬 NLP

Do LLMs Adhere to Label Definitions? Examining Their Receptivity to External Label Definitions

O estudo demonstra que, embora definições de rótulos externas possam melhorar a precisão e a explicabilidade dos LLMs, sua integração não é garantida nem consistente, pois os modelos tendem a recorrer a seus conhecimentos paramétricos internos, especialmente em tarefas gerais, enquanto tarefas específicas de domínio se beneficiam mais das definições explícitas.

Autores originais: Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

Publicado 2026-02-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um grupo de assistentes muito inteligentes, mas que cresceram lendo milhões de livros e aprendendo sozinhos. Eles já sabem muita coisa "de cabeça" (isso é o que chamamos de conhecimento interno). Agora, você quer dar a eles uma tarefa específica e entrega um "manual de instruções" (as definições das etiquetas) para ajudá-los a classificar coisas corretamente.

A grande pergunta deste artigo é: Esses assistentes realmente leem e seguem o manual que você deu, ou eles simplesmente ignoram e fazem o que acham que é certo baseado no que já sabem?

Os pesquisadores decidiram testar isso de uma forma criativa, como se estivessem fazendo um "teste de realidade" para esses assistentes.

O Experimento: O Jogo das Etiquetas Trocadas

Imagine que você tem três caixas: "Verdadeiro", "Falso" e "Talvez".
Normalmente, você diz ao assistente: "Se a frase A implica a B, coloque na caixa 'Verdadeiro'".

Mas os pesquisadores fizeram algo malandro:

  1. Cenário Perfeito: Eles deram a definição correta para cada caixa.
  2. Cenário Bagunçado: Eles trocaram as etiquetas. Agora, a caixa que deveria ser "Verdadeiro" estava escrita como "Falso", e a definição dentro dela também foi trocada.
  3. Cenário Confuso: Eles deram definições meio erradas, meio certas, para ver se o assistente notava a diferença.

O que eles descobriram?

1. O Assistente "Teimoso" vs. O Assistente "Obediente"

  • Em tarefas do dia a dia (como entender se uma frase faz sentido): Os assistentes grandes e experientes (como o GPT-4) muitas vezes ignoram o manual se ele contradizer o que eles já sabem. É como se você dissesse a um cozinheiro experiente: "Hoje, sal é doce". Ele provavelmente vai provar o sal, achar que você está errado, e continuar usando o sal como sal. Eles confiam mais no que aprenderam sozinhos do que no papel que você entregou.
  • Em tarefas especializadas (como saúde mental ou detectar discurso de ódio): Aqui, a história muda. Como esses assistentes não são especialistas nesses temas específicos, eles olham desesperadamente para o manual. Se você der uma definição clara e precisa, eles seguem à risca. É como dar um manual de instruções para alguém que nunca viu um motor de carro; eles vão seguir cada passo porque não têm conhecimento prévio.

2. O Efeito "Mágico" das Definições Personalizadas

Os pesquisadores descobriram que, às vezes, definir as regras de forma genérica não funciona tão bem quanto criar uma definição sob medida para cada caso.

  • Analogia: É a diferença entre dar a um aluno um livro de regras de matemática inteiro (definição fixa) versus mostrar a ele três exemplos de problemas parecidos com o que ele está resolvendo agora e dizer: "Olha, é assim que funciona neste caso específico" (definição ajustada).
  • Resultado: As definições personalizadas ajudaram muito a melhorar a qualidade das explicações que os assistentes davam. Eles conseguiam explicar o "porquê" de forma muito melhor.

3. O Paradoxo: Explicar Bem ≠ Acertar a Resposta

Aqui está a parte mais curiosa. Em alguns casos, os assistentes conseguiam escrever explicações perfeitas e muito inteligentes (dizendo exatamente por que algo era verdadeiro ou falso), mas ainda assim escolhiam a resposta errada na hora de marcar a caixa.

  • Metáfora: Imagine um advogado que escreve um argumento jurídico brilhante e convincente, mas, no final, vota no cliente errado. O cérebro dele consegue raciocinar sobre o conceito (explicação), mas a decisão final (classificação) foi tomada por um "instinto" antigo que não foi apagado pelo manual.

O Que Isso Significa para o Mundo Real?

  1. Não existe "Tamanho Único": Se você está usando um modelo pequeno e barato em um celular (edge device) para tarefas específicas (como analisar sentimentos em redes sociais), você precisa escrever definições muito claras e específicas. O modelo vai seguir suas instruções.
  2. Modelos Grandes são "Céticos": Modelos gigantes e caros (como o GPT-4) são tão confiantes no que sabem que, se você der uma definição estranha, eles podem até se recusar a responder ou dar uma resposta errada porque acham que você está confuso.
  3. Explicações são Úteis, mas não Garantem Precisão: Mesmo que o modelo não acerte a resposta final, pedir que ele siga definições ajuda a gerar explicações melhores, o que é ótimo para entender o raciocínio da máquina e ganhar confiança do usuário.

Resumo em uma Frase

Os modelos de Inteligência Artificial são como estudantes: em assuntos que eles já dominam, eles ignoram suas dicas; mas em assuntos novos, eles dependem totalmente do que você escreve no quadro. E às vezes, eles conseguem explicar o raciocínio perfeitamente, mas ainda assim erram a resposta final.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →