Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits
Este artigo apresenta o Baobab, um framework de aprendizagem neuro-simbólica que compila ontologias completas OWL 2 DL em Diagramas de Decisão Sentencial diferenciáveis para treinar redes de percepção sob supervisão parcial, superando efetivamente atalhos de raciocínio e alcançando desempenho Bayes-ótimo em tarefas de lógica de descrição não-Horn.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Na vasta paisagem da inteligência artificial, duas tradições distintas têm competido há muito tempo para fazer com que as máquinas compreendam o mundo. Uma tradição, conhecida como aprendizado profundo (deep learning), destaca-se no reconhecimento de padrões em dados brutos, como identificar um gato em uma fotografia ou ler um número escrito à mão. Ela aprende ajustando milhões de botões internos até obter a resposta correta, mas o faz sem uma compreensão clara das regras que regem o mundo. A outra tradição, enraizada na lógica e na representação do conhecimento, constrói sistemas que raciocinam com regras estritas, como uma enciclopédia digital que sabe que um "poodle" é um tipo de "cachorro" e que "cachorros" são "mamíferos". Este sistema é preciso e confiável, mas muitas vezes tem dificuldade em se conectar com a realidade desestruturada e caótica de imagens e sons. Durante anos, pesquisadores tentaram fundir essas duas abordagens, criando sistemas "neuro-simbólicos" que podem tanto ver quanto raciocinar. O desafio tem sido que as linguagens lógicas mais poderosas usadas para descrever conhecimentos complexos são incrivelmente difíceis de traduzir para a linguagem matemática que as redes neurais usam para aprender.
Uma equipe de pesquisadores da Universidade de Ciência e Tecnologia King Abdullah desenvolveu um novo método chamado Baobab, que consegue preencher essa lacuna para um tipo específico e altamente complexo de sistema lógico. Eles criaram um compilador que pega uma descrição lógica detalhada de um mundo — completa com regras sobre como as coisas se relacionam, quantas coisas podem existir e como as categorias se sobrepõem — e a traduz em uma estrutura que uma rede neural pode usar para aprender. Ao contrário de tentativas anteriores que simplificavam demais as regras lógicas ou as abandonavam inteiramente, este método preserva a complexidade total das regras originais. Os pesquisadores testaram seu sistema pedindo a uma rede neural para olhar imagens de dígitos escritos à mão e descobrir não apenas os números, mas também propriedades lógicas ocultas, como se um número é primo ou par, baseando-se apenas em um conjunto de regras lógicas fornecidas à máquina. O sistema aprendeu a identificar esses conceitos ocultos com alta precisão, mesmo quando as próprias imagens não forneciam pistas diretas sobre eles.
O cerne desta conquista reside em como os pesquisadores lidaram com o processo de tradução. Eles pegaram uma base de conhecimento lógica, que é essencialmente uma coleção de afirmações sobre como os conceitos se relacionam uns com os outros, e a compilaram em um tipo específico de diagrama de circuito. Este diagrama atua como um filtro, verificando se as previsões feitas pela rede neural fazem sentido de acordo com as regras lógicas. Se a rede prevê que um número é ao mesmo tempo par e primo (o que só é verdade para o número dois), o circuito permite isso. Se ela prevê que um número é ao mesmo tempo par e ímpar, o circuito rejeita essa possibilidade. Ao executar esta verificação milhões de vezes, o sistema pode guiar a rede neural para aprender as relações lógicas corretas, mesmo quando as imagens que ela vê não rotulam explicitamente essas relações. Os pesquisadores provaram que esta tradução é matematicamente sólida, o que significa que o circuito reflete fielmente as regras lógicas originais sem perder qualquer informação ou introduzir erros.
Uma das descobertas mais significativas do estudo diz respeito a um problema comum nestes sistemas híbridos conhecido como um "atalho de raciocínio". Quando uma máquina recebe uma tarefa com múltiplas respostas corretas possíveis, ela frequentemente encontra uma maneira de resolver o problema escolhendo apenas uma resposta e ignorando as outras, efetivamente contornando o sistema lógico. Por exemplo, se uma regra permite várias configurações diferentes de uma cena, uma rede neural padrão pode fixar-se em uma única configuração e falhar em reconhecer que outras configurações válidas existem. Os pesquisadores descobriram que seu novo método, quando combinado com uma técnica específica de semear a rede com todas as configurações válidas possíveis, pode superar esse atalho. Em vez de colapsar em uma única resposta potencialmente errada, o sistema aprendeu a manter uma distribuição de probabilidade sobre todas as possibilidades corretas, alcançando um nível de precisão que nenhum método anterior havia atingido para este tipo de lógica complexa.
A equipe demonstrou o poder de sua abordagem usando dois conjuntos de dados distintos. Em um experimento, utilizaram imagens de dígitos escritos à mão do conjunto de dados MNIST. Eles configuraram um sistema lógico onde os dígitos estavam ligados em uma cadeia, de modo que, se um número fosse seguido por outro, uma relação específica deveria ser mantida. A rede neural foi apresentada a pares de imagens, mas nunca lhe foi dito os números reais. Em vez disso, recebeu algumas pistas lógicas, como saber que um número era par e o outro era primo. Através do circuito lógico, a rede aprendeu a inferir a identidade exata dos dígitos com quase perfeita precisão, subindo de uma taxa de acerto aleatória de 25 por cento para 99 por cento. Em um segundo experimento, aplicaram o mesmo método a um conjunto de dados de imagens sintéticas de pizzas. O sistema aprendeu a identificar categorias ocultas de pizzas, como "vegetariana" ou "apimentada", com base nos ingredientes visíveis na imagem e nas regras lógicas que definem essas categorias, superando novamente os sistemas que não utilizavam o circuito lógico.
Os pesquisadores também mostraram que seu método funciona com a versão completa e complexa da linguagem lógica usada em bases de dados biomédicas e na Web Semântica, que inclui características como regras sobre quantos itens podem estar conectados e regras sobre a direção das relações. Tentativas anteriores de usar redes neurais com este nível de complexidade tiveram que simplificar as regras de tal forma que perderam seu significado. O Baobab, no entanto, lidou com a complexidade total sem simplificações. A equipe verificou a correção de seu compilador utilizando um sistema de prova formal, uma verificação matemática rigorosa que garante que a tradução da lógica para o circuito seja impecável. Eles também compararam seu sistema com métodos existentes e descobriram que uma parte significativa das regras lógicas usadas em seus experimentos não poderia ser tratada pelos métodos antigos, que eram limitados a formas de lógica mais simples e menos expressivas.
Uma parte crítica do estudo envolveu abordar a questão de múltiplas respostas válidas. Em muitos cenários do mundo real, a informação fornecida não é suficiente para determinar uma solução única. Por exemplo, se uma regra estabelece que uma pessoa é ou homem ou mulher, e sabemos que ela é casada com alguém do sexo oposto, ainda existem duas possibilidades válidas para os gêneros do casal. Redes neurais padrão frequentemente falham aqui, escolhendmente arbitrariamente uma possibilidade e tratando-a como a única verdade. Os pesquisadores descobriram que, ao utilizar uma mistura de diferentes caminhos lógicos, cada um correspondendo a uma possibilidade válida, seu sistema poderia representar todas as respostas corretas simultaneamente. Isso permitiu que o sistema fornecesse uma probabilidade calibrada para cada resultado, refletindo a incerteza real nos dados em vez de forçar uma certeza falsa. Esta capacidade é essencial para aplicações em campos como a medicina, onde entender o intervalo de possíveis diagnósticos é tão importante quanto identificar um único diagnóstico.
O trabalho também destacou os limites práticos de tais sistemas. Embora o método seja poderoso, o tamanho do circuito lógico cresce rapidamente à medida que a complexidade do problema aumenta. Em um teste envolvendo uma ontologia completa de tipos de pizza, os pesquisadores descobriram que compilar o conjunto completo de regras em um circuito exigia mais memória do que a disponível em um computador padrão, forçando-os a usar um subconjunto simplificado das regras para o treinamento final. Isso sugere que, embora o método seja teoricamente sólido e eficaz para muitos problemas, escalar para as bases de conhecimento mais amplas e complexas exigirá novos avanços de engenharia. No entanto, a aplicação bem-sucedida ao conjunto de dados de pizza simplificado e à tarefa de reconhecimento de dígitos prova que a abordagem é viável e eficaz para dados do mundo real.
As implicações desta pesquisa estendem-se para além de um melhor reconhecimento de imagens. Ela oferece um caminho para a inteligência artificial integrar o conhecimento rico e estruturado encontrado em bases de dados científicas diretamente no processo de aprendizado. Isso significa que futuros sistemas de IA poderão aprender a partir de imagens enquanto aderem simultaneamente às regras estritas e verificadas da biologia, química ou física. Ao garantir que as previsões da máquina sejam sempre consistentes com o conhecimento científico estabelecido, esta abordagem pode levar a uma IA mais confiável e digna de confiança, particularmente em campos de alto risco onde erros podem ter consequências graves. Os pesquisadores disponibilizaram seu código e ferramentas ao público, convidando outros a construir sobre este fundamento e a explorar até onde esta integração de lógica e aprendizado pode chegar.
Em última análise, o estudo demonstra que o abismo entre o reconhecimento de padrões e o raciocínio lógico pode ser fechado sem sacrificar os pontos fortes de nenhuma das abordagens. Ao traduzir regras lógicas complexas para um formato que as redes neurais possam processar, os pesquisadores criaram um sistema que aprende não apenas com dados, mas com a própria estrutura do conhecimento. A capacidade de recuperar conceitos ocultos, evitar atalhos de raciocínio e lidar com a complexidade total das linguagens lógicas modernas marca um passo significativo na busca por construir máquinas que realmente compreendam o mundo que observam. Os resultados sugerem que, com as ferramentas certas, a inteligência artificial pode ir além do simples reconhecimento de padrões para raciocinar genuinamente sobre as relações e regras que as governam.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.