← Últimos artigos
🤖 AI

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

O artigo apresenta o Theoria, uma arquitetura de verificação que aumenta a confiabilidade das respostas de IA ao reescrever soluções em transições de estado tipadas e auditáveis com justificativas explícitas, superando, assim, juízes de LLM holísticos na detecção de premissas ocultas e citações fabricadas, ao mesmo tempo em que mantém alta precisão em problemas de nível especialista.

Autores originais: Ben Slivinski, Michael Saldivar

Publicado 2026-07-02
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ben Slivinski, Michael Saldivar

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um arquiteto brilhante, mas às vezes excessivamente confiante, para projetar uma ponte. Você não quer apenas a planta final; você precisa saber por que cada viga está colocada onde está. Se o arquiteto disser: "Esta viga vai aqui porque parece certo", você não pode confiar na ponte. Mas se ele disser: "Esta viga vai aqui por causa da Lei X, e aqui está o cálculo provando isso", você pode conferir a matemática.

Este é o problema que o Theoria resolve para a Inteligência Artificial.

O Problema: Duas Formas Falhas de Confiar na IA

Atualmente, temos duas formas principais de verificar se a resposta de uma IA é boa, e ambas possuem lacunas:

  1. A Abordagem do "Matemático" (Assistentes de Prova Formal): Isso é como contratar um robô que fala apenas em um código matemático estrito e inquebrável. É perfeito, mas só consegue entender problemas que já foram traduzidos para esse código. A maioria dos problemas do mundo real (como argumentos jurídicos ou teorias científicas) é desordenada e informal, então o robô não consegue lê-los.
  2. A Abordagem do "Pressentimento" (Juízes Escalares): Isso é como pedir a um humano para ler a redação de uma IA e dar uma nota de 1 a 10. Cobre muita coisa, mas a pontuação é uma caixa preta. Você não sabe por que ela tirou 7. Ela esqueceu alguma premissa oculta? Ela inventou uma citação? Você apenas recebe um número, e não pode auditá-lo posteriormente.

A Solução: O Detetive de "Reescrita de Estado"

O Theoria introduz uma terceira via. Em vez de pedir à IA para escrever uma longa redação ou traduzir tudo para código matemático, o Theoria força a IA a reescrever sua resposta como um log de mudança de estado passo a passo.

Pense nisso como um arquivo de salvamento de videogame ou um sistema de controle de versão (como o Git) para o raciocínio.

  • A Configuração: A IA começa com um "Estado 0" (o enunciado do problema).
  • O Movimento: Para chegar à resposta, a IA deve fazer um movimento para o "Estado 1", depois para o "Estado 2", e assim por diante.
  • A Regra: Para cada movimento, a IA deve fornecer um ticket (uma justificativa). O ticket só pode ser de um dos três tipos:
    1. Uma Citação: "Estou usando o Teorema X."
    2. Um Cálculo: "Eu fiz a conta: 2+2=4."
    3. Um Fato Dado: "O problema me informou isso."

O Truque de Mestre: "Completude da Mudança"

Aqui está o ingrediente secreto. O Theoria tem uma regra estrita: Cada mudança entre o Estado A e o Estado B deve ser explicada pelo ticket.

Se a IA tentar introduzir uma premissa oculta (como "Assuma que a ponte é feita de ouro") sem um ticket, o sistema a pega. A "mudança" (adicionar a premissa do ouro) aparece no log, mas o ticket (a justificativa) não cobre essa mudança. O sistema grita: "Espere! Você mudou o estado, mas não nos mostrou o recibo!"

Isso força a IA a ser honesta. Ela não pode esconder uma mentira em um longo parágrafo de texto; ela tem que mostrar o momento exato em que a mentira entrou na conversa.

Como Funciona na Prática

  1. O Solucionador (Solver): Uma IA tenta resolver um problema.
  2. O Formalizador: Uma segunda IA reescreve essa solução no "Log de Mudança de Estado" descrito acima. Se o solucionador deu um salto na lógica, o formalizador tem que registrar isso como um passo específico.
  3. Os Juízes: IAs especializadas auditam cada passo.
    • Um "Juiz de Matemática" verifica os cálculos.
    • Um "Juiz de Citação" verifica se o teorema referenciado realmente existe e se se aplica.
    • Um "Juiz de Fatos" verifica se aquele fato estava presente no problema original.
  4. O Veredito: Se todos os passos tiverem um ticket válido, a resposta é Certificada. Se mesmo um único passo estiver sem um ticket ou com um ticket falso, a resposta é Rejeitada.

O Que o Artigo Descobriu

Os autores testaram isso em problemas difíceis (como os encontrados em exames de especialistas) e descobriram:

  • Alta Confiança: Quando o Theoria diz que uma resposta está correta, ela está correta 91,4% das vezes.
  • Melhor em Pegar Mentiras Espertas: Quando a IA tenta esconder uma premissa (uma premissa oculta) ou inventar uma citação, o Theoria a pega 90,6% das vezes. Um juiz padrão de "pressentimento" só pega isso 62,5% das vezes.
  • Não é Mágico para Erros Matemáticos: Se a IA apenas errar um cálculo simples (como dizer que 2+2=5), tanto o Theoria quanto o juiz padrão o pegam quase a mesma quantidade de vezes. A vantagem especial do Theoria é especificamente para detectar lógica oculta e fontes falsas.
  • Complementaridade: O Theoria e os juízes padrão falham em problemas diferentes. Se você usar ambos, pode capturar quase todos os erros.

A Conclusão

O Theoria não tenta tornar a IA mais inteligente; ele tenta tornar o raciocínio da IA auditável.

Ele transforma uma redação vaga e pouco confiável em um livro de contabilidade transparente de mudanças. Ele não promete que todas as respostas estarão certas (ele rejeita cerca de 43% das respostas porque não consegue verificá-las), mas para as respostas que ele aprova, você pode olhar o recibo, conferir a matemática e saber exatamente por que é seguro confiar.

Em um mundo onde a IA pode alucinar fatos, o Theoria é o sistema que diz: "Mostre-me o recibo de cada passo, ou eu não assinarei embaixo disso."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →