ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering
Este artigo apresenta o ENTLORE, um benchmark fundamentado em grafos que avalia sistemas de resposta a perguntas empresariais em sua capacidade de realizar raciocínio organizacional latente ao reconstruir mundos empresariais auditados a partir de documentos rotineiros para testar a recuperação de relações implícitas além da simples recuperação de fatos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é um detetive tentando resolver um mistério dentro de uma biblioteca gigante e caótica. Esta não é apenas uma biblioteca comum; é o "cérebro" de uma empresa massiva, repleta de milhões de documentos como e-mails, relatórios de projetos, notas de reuniões e planilhas. No mundo da Inteligência Artificial (IA), existe um jogo popular chamado "Question Answering" (Resposta a Perguntas). Geralmente, a IA recebe uma pergunta e uma pilha de documentos, e seu trabalho é encontrar a frase exata que contém a resposta. Pense nisso como um jogo de "Eu Vejo" onde a resposta está escondida à vista de todos, esperando para ser capturada.
Mas a vida real em uma empresa é muito mais bagunçada do que um jogo. Frequentemente, a resposta para uma pergunta não está escrita em uma única frase. Em vez disso, a verdade está escondida nas relações entre diferentes documentos. Talvez um e-mail diga "Alice trabalhou no Módulo X", e outro relatório diga "O Módulo X faz parte do Projeto Y", mas nenhum documento individual jamais diz "Alice trabalhou no Projeto Y". Para encontrar a resposta, a IA tem que conectar os pontos por conta própria, usando as regras invisíveis de como a empresa é organizada. Este artigo, escrito por pesquisadores da ScitiX.ai, é sobre ensinar computadores a fazer esse tipo de trabalho de detetive, em vez de serem apenas bons em encontrar palavras.
O Problema: A Armadilha da "Verdade Oculta"
A maioria dos benchmarks de IA (testes para IA) são como uma caça ao tesouro onde o mapa já está desenhado. Os criadores do teste escrevem uma pergunta e, então, garantem que a resposta esteja explicitamente escrita nos documentos que entregam à IA. É como perguntar "Qual é a cor da bola vermelha?" e entregar à IA uma foto de uma bola vermelha. A IA só precisa encontrar a palavra "vermelha".
Os autores deste artigo argumentam que isso é fácil demais e não reflete como as empresas reais funcionam. No mundo real, a "bola vermelha" pode ser mencionada em um arquivo, e o fato de ela ser uma "bola" pode estar em outro, mas a conexão entre eles nunca é declarada. A IA tem que deduzir que o "Módulo X" pertence ao "Projeto Y" com base em como a empresa é estruturada, mesmo que nenhum documento os vincule explicitamente. Os pesquisadores chamam essa habilidade ausente de Raciocínio Organizacional Latente. É a capacidade de inferir as regras invisíveis de uma organização a partir dos subprodutos desordenados do trabalho diário.
A Solução: ENTLORE, o "Grafo da Verdade"
Para testar se a IA consegue realmente fazer isso, a equipe construiu um novo benchmark chamado ENTLORE. Imagine que eles pegaram todo o histórico digital de uma empresa real e privada — milhares de documentos, organogramas e registros operacionais — e construíram um enorme e secreto "Grafo da Verdade" nos bastidores. Este grafo é como um modelo mestre que sabe exatamente como cada pessoa, projeto e módulo se conecta, baseado em regras estritas e auditadas.
Em seguida, eles criaram um "mundo liberado" para a IA jogar. Este mundo liberado contém os mesmos documentos, mas todos os nomes foram alterados para proteger a privacidade (como transformar "Alice" em "Funcionário nº 42" e "Projeto Alpha" em "Projeto Beta"). Crucialmente, a IA não pode ver o segredo do Grafo da Verdade. Ela vê apenas os documentos desordenados e anonimizados.
A equipe então fez 907 perguntas. Eles dividiram essas perguntas em três níveis de dificuldade:
- Nível 1 (A Busca): A resposta está ali mesmo, em um documento. (ex: "Quem é o gerente do Projeto Beta?")
- Nível 2 (A Composição): A resposta exige a leitura de dois documentos e a combinação de fatos. (ex: "Quem gerencia a equipe que construiu o Módulo X?")
- Nível 3 (O Raciocínio Latente): A resposta exige conectar pontos que não estão explicitamente ligados. (ex: "Quem é responsável pelo sucesso geral do Projeto Beta?" — embora nenhum documento diga "Funcionário nº 42 é responsável pelo Projeto Beta", o Grafo da Verdade sabe disso porque ele gerenciava o módulo dentro dele.)
As Descobertas: A IA é Boa em Ler, Mas Ruim em Conectar
Os pesquisadores testaram 8 modelos de IA usando vários métodos, desde busca simples por palavras-chave até sistemas complexos de "agentes" que podem navegar por documentos como um humano. Aqui está o que eles descobriram:
1. A "Verdade Oculta" é Difícil de Encontrar
Quando a resposta estava explicitamente escrita nos documentos (Níveis 1 e 2), os modelos de IA se saíram razoavelmente bem. Mas quando chegaram ao Nível 3 (Raciocínio Latente), o desempenho caiu drasticamente. Mesmo os melhores modelos acertaram apenas cerca de 36,2% dessas perguntas difíceis.
2. A Estrutura Importa Mais do que a Velocidade
Os pesquisadores tentaram diferentes formas de ajudar a IA a encontrar informações.
- Busca Simples (BM25): Apenas procurar por palavras correspondentes. Isso foi surpreendentemente bom.
- Busca Densa (RAG Flat): Usar matemática avançada para encontrar ideias semelhantes. Isso na verdade foi pior do que a busca simples.
- Sistemas Baseados em Grafos (GraphRAG): Esses sistemas tentam construir um mapa de conexões entre documentos antes de responder. Este acabou sendo a abordagem mais forte, superando as outras em média. Isso sugり que a IA precisa entender a estrutura da empresa, não apenas as palavras.
3. Mesmo com os "Documentos de Ouro", a IA Falha
A descoberta mais chocante veio quando os pesquisadores deram à IA os "Documentos de Ouro" — os arquivos exatos necessários para responder à pergunta, pulando a parte da busca.
- Para perguntas fáceis (Nível 1), a IA acertou quase tudo.
- Para perguntas médias (Nível 2), ela ainda se saiu bem.
- Mas para as perguntas latentes e difíceis (Nível 3), 30,4% das respostas ainda estavam erradas, mesmo que a IA tivesse os documentos perfeitos à sua frente!
Isso significa que o problema não é apenas que a IA não consegue encontrar o arquivo certo; é que ela não consegue raciocinar através das regras organizacionais invisíveis, mesmo tendo todas as evidências. É como dar a um detetive as fotos da cena do crime, mas ainda assim fazê-lo falhar em perceber que o mordomo e o jardineiro são, na verdade, a mesma pessoa porque as fotos não dizem isso explicitamente.
Por Que Isso Importa
O artigo conclui que não podemos apenas construir melhores mecanismos de busca para empresas. Precisamos de uma IA que possa entender a "alma" de uma organização — as regras não ditas, as hierarquias de projetos e as conexões ocultas. O ENTLORE prova que a IA atual ainda está lutando com isso. Ela é ótima em ler o que está escrito, mas ainda está aprendendo a pensar sobre o que é implicado.
Os pesquisadores tornaram seus dados e código públicos para que outros cientistas possam tentar resolver este enigma. Até que a IA consiga dominar esse "raciocínio organizacional latente", ela sempre será um pouco como um novo funcionário que sabe ler o manual, mas ainda não entende como a empresa realmente funciona.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.