← Últimos artigos
🤖 AI

Probabilistic Circuits for Knowledge Graph Completion with Reduced Rule Sets

Este artigo apresenta uma estrutura baseada em circuitos probabilísticos para a completude de grafos de conhecimento que aprende conjuntos de regras compactos e de alto desempenho, alcançando uma redução de até 96% na contagem de regras enquanto preserva 91% do desempenho da linha de base e superando as linhas de base completas em até 31×\times com regras mínimas equivalentes.

Autores originais: Jaikrishna Manojkumar Patil, Nathaniel Lee, Al Mehdi Saadat Chowdhury, YooJung Choi, Paulo Shakarian

Publicado 2026-08-11
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Jaikrishna Manojkumar Patil, Nathaniel Lee, Al Mehdi Saadat Chowdhury, YooJung Choi, Paulo Shakarian

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a entender o mundo. Você não apenas despeja uma enciclopédia gigante em seu cérebro; em vez disso, você lhe dá um conjunto de regras lógicas de "se-então", como "Se estiver chovendo, então o chão está molhado". Este é o mundo dos Grafos de Conhecimento, que são mapas digitais massivos conectando fatos sobre pessoas, lugares e coisas. O objetivo da Completagem de Grafos de Conhecimento é ajudar o robô a adivinhar fatos ausentes, como descobrir que se "Alice é irmã de Bob" e "Bob é irmão de Charlie", então "Alice é irmã de Charlie".

Por muito tempo, os robôs mais inteligentes usaram matemática de "caixa preta" que era ótima para adivinhar, mas terrível para explicar o porquê de ter adivinhado. Por isso, os cientistas voltaram à abordagem clássica baseada em regras porque ela é transparente: você pode ver a cadeia exata de lógica. Mas aqui está o problema: para fazer esses robôs baseados em regras serem tão inteligentes quanto as caixas pretas, eles precisavam memorizar dezenas de milhares de regras. É como tentar resolver um mistério lendo uma biblioteca de 20.000 livros quando você só precisa ler três. A maioria desses livros está apenas sentada na prateleira, acumulando poeira, tornando o robô lento, confuso e difícil de entender.

Este artigo faz uma pergunta simples e ousada: Podemos ensinar o robô a ser tão inteligente usando uma biblioteca de regras pequena e curada em vez de um armazém enorme? Os autores, trabalhando com grafos de conhecimento e lógica, propõem um novo método inteligente usando algo chamado "Circuitos Probabilísticos". Pense nisso não como um livro de regras, mas como um bibliotecário superinteligente que sabe exatamente quais regras funcionam bem juntas. Em vez de tratar cada regra como um fato isolado, este bibliotecário aprende como as regras "convivem" umas com as outras. Eles descobriram que, ao usar este método, conseguiram reduzir o número de regras necessárias em 70% a 96%, mantendo o mesmo (ou até melhor) resultado. Na verdade, quando usaram o mesmo pequeno número de regras que o seu novo método selecionou, ele foi 31 vezes mais preciso do que o método antigo tentando usar esse mesmo pequeno número. Eles provaram que sua abordagem é matematicamente sólida e não depende de suposições frágeis, oferecendo uma maneira de tornar a IA incrivelmente inteligente e surpreendentemente simples de entender.

O Problema: A "Explosão de Regras"

Imagine que você é um detetive tentando resolver um caso. A maneira antiga de fazer isso (usada por sistemas como o AnyBURL) é reunir todos os detalhes e teorias já escritos — talvez 20.000 deles. Quando você tenta resolver um mistério específico, o sistema verifica todas as 20.000 pistas. O problema? A maioria delas é inútil para aquele caso específico. Em um conjunto de dados chamado UMLS (que lida com termos médicos), o sistema antigo precisava de 20.000 regras para obter uma pontuação alta, mas apenas cerca de 12.938 delas eram realmente usadas. Isso são mais de 7.000 regras desperdiçadas apenas ocupando espaço na mesa!

Isso cria três grandes dores de cabeça:

  1. Confusão: Se você perguntar ao sistema "Como você chegou a essa conclusão?", ele apontará para uma pilha bagunçada de 20.000 regras, tornando impossível dizer quais delas realmente importaram.
  2. Sobrecarga de Memória: Armazenar e gerenciar dezenas de milhares de regras consome muita memória do computador, o que é um problema se você quiser alimentar essas regras em outros sistemas inteligentes, como Grandes Modelos de Linguagem (LLMs), que têm espaço limitado.
  3. Pensamento Lento: Verificar a consistência ou responder a perguntas complexas de "e se" torna-se incrivelmente lento e difícil quando você tem que pesquisar através de uma montanha de regras majoritariamente inúteis.

A Solução: O "Bibliotecário Inteligente" (Circuitos Probabilísticos)

Os autores introduziram um novo framework que atua como um Bibliotecário Inteligente. Em vez de apenas listar regras, este bibliotecário aprende uma "distribuição de probabilidade" sobre conjuntos de regras. Em termos simples, o sistema aprende quais regras tendem a trabalhar juntas como uma equipe.

Veja como funciona:

  • O Interruptor Indicador: Para cada regra que o sistema aprende, eles adicionam um pequeno "interruptor" (chamado de indicador) que decide se aquela regra está ativa para uma situação específica.
  • Aprendendo a Equipe: O sistema observa os dados de treinamento (os fatos que ele já conhece) e aprende quais interruptores costumam ser acionados juntos. Ele utiliza uma estrutura chamada Circuito Probabilístico (PC). Pense em um PC como um fluxograma que calcula as chances de diferentes combinações de regras serem verdadeiras, sem assumir que cada regra age de forma independente.
  • Sem Suposição de Independência: Um erro comum em sistemas mais antigos é assumir que a Regra A não tem nada a ver com a Regra B. Este artigo prova que as regras influenciam umas às outras. O PC aprende essas relações complexas, permitindo que ele escolha uma equipe pequena e de alto desempenho.

Os Resultados: Menos é Mais

A equipe testou isso em 8 diferentes conjuntos de dados de referência, variando de registros médicos (UMLS) a árvores genealógicas (Kinship) e conhecimento geral (WN18RR). Os resultados foram impressionantes:

  • Redução Massiva: Eles reduziram o número de regras necessárias para atingir o pico de desempenho em 70% a 96%. Por exemplo, no conjunto de dados UMLS, eles passaram de precisar de 20.000 regras para apenas 1.000 para obter o mesmo topo de pontuação de 0,964 (Hits@10).
  • O Impulso de "31x": Quando compararam seu pequeno conjunto de regras otimizado contra o sistema de linha de base usando o mesmo pequeno número de regras, o método deles foi até 31 vezes melhor. Isso mostra que o sistema antigo era péssimo em escolher as poucas regras certas, enquanto o novo método era um mestre da seleção.
  • Alta Eficiência: No sistema antigo, no conjunto de dados UMLS, apenas cerca de 64% das regras eram realmente usadas. No novo sistema, 86,8% das 1.000 regras estavam ativas. Eles pararam de desperdiçar espaço com regras inúteis.
  • Preservação de Desempenho: Mesmo com esses pequenos conjuntos de regras, o sistema preservou 91% do desempenho máximo do conjunto de regras massivo e completo da linha de base.

Eles testaram três maneiras diferentes de usar este novo sistema:

  1. SingletonLB: Usa apenas uma regra por vez para fazer um palpite (uma abordagem simples e rápida).
  2. SingletonExact: Calcula a probabilidade exata para uma única regra (muito preciso).
  3. GreedyLB: Constrói um pequeno grupo de regras passo a passo (um meio-termo).

O método "SingletonExact" foi o grande destaque, frequentemente superando a linha de base mesmo quando a linha de base tinha permissão para usar sua biblioteca completa e massiva de regras. Por exemplo, no conjunto de dados CODEX-S, o novo método alcançou 99,95% da melhor pontuação da linha de base usando apenas 5% das regras (1.000 vs 20.000).

Por Que Isso Importa

Isso não é apenas sobre economizar memória do computador; é sobre tornar a IA confiável. Se um médico de IA disser que um paciente tem uma condição específica, você quer saber o porquê. Se o motivo for uma lista bagunçada de 20.000 regras, você não pode confiar. Se o motivo for uma cadeia clara e concisa de 50 regras que o sistema sabe que são as melhores, você pode entender e verificar a lógica.

Os autores mostraram que seu método é fundamentado em matemática sólida (especificamente na lógica probabilística de Nilsson), o que significa que não é apenas um palpite de sorte; é uma maneira rigorosa de lidar com a incerteza sem inventar fatos. Eles também observaram que esta abordagem não depende de nenhum tipo específico de gerador de regras, o que significa que pode funcionar com regras aprendidas de qualquer sistema, não apenas o que eles usaram.

Em suma, este artigo prova que você não precisa de uma biblioteca de 20.000 livros para resolver um mistério. Com o "Bibliotecário Inteligente" certo, você pode resolvê-lo com uma única estante perfeitamente escolhida, tornando a IA mais rápida, clara e tão inteligente quanto sempre.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →