Neural-Symbolic Reasoning over Knowledge Graphs: A Survey from a Query Perspective
Esta pesquisa fornece uma revisão abrangente do raciocínio neuro-simbólico sobre grafos de conhecimento, focando em tipos de consulta e classificação, ao mesmo tempo em que explora a integração inovadora de grandes modelos de linguagem para preencher a lacuna entre o aprendizado profundo e o raciocínio simbólico.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine uma vasta biblioteca digital onde cada fato sobre o mundo é armazenado não em livros, mas como uma imensa teia de conexões. Nesta biblioteca, uma pessoa está ligada ao seu emprego, uma cidade está ligada ao seu país e um filme está ligado ao seu diretor. Esta estrutura, conhecida como grafo de conhecimento, atua como um mapa do entendimento humano, permitindo que computadores naveguem de uma peça de informação para outra. Durante décadas, cientistas tentaram ensinar máquinas a raciocinar através deste mapa, para fazer uma pergunta e encontrar uma nova verdade escondida nas conexões. No entanto, o mundo real é bagunçado. Os fatos são frequentemente incompletos e os dados podem ser ruidosos ou contraditórios. Métodos tradicionais, que dependem de regras rígidas e estritas como um código jurídico, muitas vezes falham diante dessa imperfeição. Eles não conseguem lidar com as áreas cinzentas da realidade.
Para resolver isso, pesquisadores vêm desenvolvendo um novo tipo de inteligência que combina duas formas diferentes de pensar. Uma forma é como um programa de computador seguindo uma receita estrita, precisa, mas frágil. A outra é como um cérebro humano aprendendo com padrões, flexível, mas às vezes vago. Ao fundir essas abordagens, cientistas estão criando sistemas que podem raciocinar através da teia bagunçada de conhecimento com precisão e adaptabilidade. Um levantamento recente realizado por pesquisadores da Wayne State University e da University of Illinois at Urbana-Champaign analisa profundamente como isso está sendo feito. Eles examinam como esses sistemas respondem a perguntas, desde consultas simples de um passo até quebra-cabeças complexos e de múltiplas camadas, e como eles estão agora sendo unidos por uma ferramenta nova e poderosa: modelos de linguagem de grande escala, a mesma tecnologia que alimenta os chatbots modernos.
Os pesquisadores organizaram sua revisão analisando os tipos de perguntas que esses sistemas são solicitados a responder. As perguntas mais simples são consultas de salto único (single-hop), onde a resposta está a apenas um passo de distância. Se você perguntar: "Quem é o CEO da Empresa X?", o sistema procura por um link direto. Para essas tarefas, métodos antigos usavam regras estritas escritas por especialistas, mas estes frequentemente falhavam quando os dados eram incompletos. Métodos mais novos usam redes neurais, que são modelos computacionais que aprendem através de exemplos, para adivinhar os elos ausentes. A abordagem mais promissora combina ambos: utiliza o poder de aprendizado das redes neurais para lidar com a incerteza, mantendo a estrutura lógica das regras para garantir que as respostas façam sentido. Este método híbrido permite que o sistema infira que, se uma pessoa trabalha para uma empresa em uma cidade específica, ela provavelmente vive nessa cidade, mesmo que esse fato específico nunca tenha sido explicitamente escrito.
Quando as perguntas se tornam mais complexas, envolvendo múltiplos passos ou condições lógicas como "e", "ou" e "não", o desafio cresce significamente. Não se trata apenas de encontrar um único elo, mas de navegar por um caminho através da teia. O levantamento explica que os pesquisadores desenvolveram maneiras de tratar essas perguntas como problemas matemáticos que podem ser resolvidos movendo-se através de um espaço geométrico. Em vez de apenas verificar se um fato é verdadeiro ou falso, o sistema atribui um grau de verdade a diferentes possibilidades. Alguns métodos visualizam essas possibilidades como formas, como caixas ou esferas, em um espaço multidimensional. Ao observar como essas formas se sobrepõem ou se encaixam, o computador pode determinar a resposta para uma pergunta complicada, como: "Encontre todos os atores que trabalharam com um diretor da França, mas que não ganharam um Oscar". Os pesquisadores descobriram que, embora esses métodos sejam poderosos, eles ainda lutam com as estruturas lógicas mais intrincadas, sugerindo que o campo ainda está amadurecendo.
O levantamento também explora como esses sistemas lidam com perguntas feitas em linguagem cotidiana, em vez de um código formal. Quando um humano pergunta: "Quem interpretou o vilão no filme que ganhou mais prêmios no ano passado?", o sistema deve primeiro entender a frase, decompô-la e então pesquisar no grafo de conhecimento. Tentativas iniciais tentaram traduzir a frase em um comando rígido, mas isso frequentemente falhava se o fraseado fosse incomum. Abordagens mais novas utilizam o aprendizado por reforço, uma técnica onde o sistema aprende por tentativa e erro, para navegar no grafo e encontrar a resposta. Em conversas onde um usuário faz uma pergunta de acompanhamento, o sistema deve lembrar o contexto da interação anterior. Os pesquisadores observaram que, embora progressos tenham sido feitos, esses sistemas ainda às vezes se perdem em longas cadeias de raciocínio ou falham em distinguir entre caminhos semelhantes nos dados.
Talvez o desenvolvimento mais empolgante discutido no levantamento seja a integração de modelos de linguagem de grande escala com grafos de conhecimento. Esses modelos são incrivelmente bons em entender a linguagem humana, mas frequentemente inventam coisas, um problema conhecido como alucinação, porque carecem de acesso a um banco de dados de fatos verificados. Por outro lado, os grafos de conhecimento são cheios de fatos, mas são péssimos em entender a linguagem natural. Os pesquisadores descobriram que combinar ambos cria uma parceria poderosa. Em uma abordagem, o modelo de linguagem atua como um guia, ajudando a traduzir uma pergunta humana em uma consulta de busca para o grafo de conhecimento. Em outra, o grafo de conhecimento atua como um verificador de fatos, fornecendo ao modelo de linguagem informações verificadas para evitar que ele invente coisas. Os métodos mais avançados permitem que os dois trabalhem juntos em um ciclo, onde o modelo de linguagem ajuda o grafo a encontrar informações relevantes, e o grafo ajuda o modelo de linguagem a refinar sua resposta. Essa assistência mútua cria um sistema que é tanto fluente na conversação quanto fundamentado na realidade.
Olhando para o futuro, os pesquisadores sugerem que a próxima fronteira reside na expansão desses sistemas para além do texto. Eles vislumbram grafos de conhecimento que incluam imagens, vídeos e áudio, permitindo que o computador raciocine sobre o mundo de uma forma mais próxima da percepção humana. Eles também veem um futuro onde esses sistemas possam fazer a ponte entre diferentes idiomas, encontrando conexões entre fatos expressos em inglês, chinês ou espanhol sem a necessidade de um tradutor humano. Embora a tecnologia atual tenha feito progressos significativos para tornar as máquinas mais inteligentes e confiáveis, o levantamento conclui que ainda há muito trabalho a ser feito. O objetivo é construir sistemas que possam não apenas recuperar informações, mas verdadeiramente compreender a natureza complexa e interconectada do conhecimento humano, lidando com a bagunça do mundo real com a mesma graça de uma mente humana.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.