← Últimos artigos
💬 NLP

Retrieved In-Context Principles from Previous Mistakes

O artigo propõe os Princípios de Contexto Recuperado (RICP), um framework professor-aluno que analisa e agrupa erros de modelos-aluno para gerar princípios personalizados em nível de tarefa destinados a melhorar o desempenho de Modelos de Linguagem Grandes em diversos benchmarks de raciocínio.

Autores originais: Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

Publicado 2026-05-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um estudante (o Modelo Estudante) a resolver quebra-cabeças complicados. Geralmente, ensinamos mostrando exemplos perfeitos de como fazer corretamente. Mas este artigo argumenta que podemos ensiná-los ainda melhor mostrando onde eles erraram e explicando por quê.

Os autores chamam seu novo método de RICP (Princípios Recuperados em Contexto). Pense nele como um sistema de tutoria inteligente, em duas etapas, envolvendo um Professor e um Estudante.

Veja como funciona, usando uma analogia simples:

O Problema: O Livro Didático "Tamanho Único"

Métodos anteriores tentaram aprender com erros, mas eram como entregar ao estudante um capítulo genérico de livro didático intitulado "Como Evitar Erros".

  • A Falha: Se o estudante estiver travado em um problema de matemática sobre pizza, ler uma regra genérica sobre "verificar seu trabalho" pode não ajudar o suficiente. Por outro lado, se o estudante estiver resolvendo um quebra-cabeça lógico, uma regra sobre "matemática de pizza" é inútil.
  • O Resultado: O conselho era ou muito vago ou não cobria tipos suficientes de erros diferentes.

A Solução: O "Tutor Personalizado" (RICP)

O método RICP atua como um professor mestre que observa o estudante fazendo uma prova prática, analisa seus erros específicos e, em seguida, cria um guia de estudos personalizado para a próxima prova.

Etapa 1: A "Autópsia do Erro" (Geração de Insights)

Primeiro, o Modelo Estudante tenta resolver um monte de problemas práticos. O Modelo Professor (uma IA mais inteligente) examina aqueles que o Estudante errou.

  • O que o Professor faz: Em vez de apenas dizer "Errado", o Professor escreve um relatório. Ele identifica a Causa Raiz (por exemplo: "Você esqueceu de adicionar a gorjeta ao preço da pizza") e fornece Insights específicos (por exemplo: "Sempre verifique se incluiu todas as partes do custo total").

Etapa 2: A "Biblioteca de Lições" (Formulação de Princípios)

É aqui que a mágica acontece. O Professor organiza esses erros em dois tipos de conselho:

  1. As "Regras Gerais" (Princípios de Nível de Tarefa):

    • Analogia: Imagine um Capítulo de Livro Didático.
    • O Professor agrupa erros semelhantes (por exemplo, todos os erros matemáticos sobre proporções). A partir desses grupos, ele escreve regras amplas que se aplicam a qualquer problema de matemática.
    • Exemplo: "Sempre verifique duas vezes suas operações aritméticas."
  2. O "Cola Pessoal" (Princípios de Nível de Pergunta):

    • Analogia: Imagine um Post-it no problema específico que você está olhando agora.
    • Para a exata pergunta que o Estudante está prestes a responder, o Professor pesquisa na biblioteca os erros passados mais semelhantes. Em seguida, ele extrai o conselho específico que se aplica apenas a essa situação.
    • Exemplo: "Para este problema específico de pizza, lembre-se de adicionar a gorjeta ao preço base, não apenas calcular a gorjeta."

Etapa 3: O "Dia da Prova" (Utilização dos Princípios)

Quando o Estudante enfrenta uma nova pergunta:

  1. Ele recebe as Regras Gerais (o capítulo do livro didático) para mantê-lo no caminho certo.
  2. Ele recebe o Cola Pessoal (o post-it) adaptado àquela pergunta específica.
  3. Ele combina essas informações com suas instruções normais para resolver o problema.

Crucialmente: O Professor não precisa estar presente durante a prova. O Estudante apenas usa as anotações que o Professor preparou anteriormente. Isso torna a execução rápida e barata.

Por que isso é melhor?

O artigo testou isso em sete diferentes "conselhos de exames" (conjuntos de dados) envolvendo matemática, senso comum e lógica.

  • Personalização: Ao contrário de métodos antigos que davam o mesmo conselho a todos, o RICP dá o conselho certo para a pergunta específica.
  • Cobertura: Ao agrupar erros, garante que o Estudante aprenda com uma ampla variedade de erros, não apenas dos mais comuns.
  • Resultados: Quando adicionaram essas "Anotações de Erro" aos métodos padrão de prompt de IA, os Modelos Estudantes ficaram significativamente mais inteligentes e precisos, especialmente em problemas difíceis de lógica e matemática.

Em Resumo

Em vez de apenas mostrar a uma IA como fazer as coisas certas, este método ensina-a como evitar fazer as coisas erradas analisando suas falhas passadas. Cria um guia híbrido que oferece tanto sabedoria ampla (para segurança geral) quanto dicas específicas (para o problema imediato), ajudando a IA a raciocinar muito mais como um humano que aprende com seus próprios erros.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →