EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge
Este artigo apresenta o EntSQL, um novo benchmark chinês-inglês composto por 1.066 exemplos em cinco domínios de negócios, projetado para avaliar os desafios de fundamentar a geração de Text-to-SQL em conhecimento empresarial de contexto longo, onde os modelos atuais têm dificuldade em alcançar alta precisão devido à necessidade de compreensão proprietária de negócios.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um bibliotecário muito inteligente e culto (uma IA) que sabe falar a linguagem humana e também sabe falar a "linguagem de banco de dados" (SQL). Normalmente, se você perguntasse a esse bibliotecário: "Quantos livros vendemos no mês passado?", ele conseguiria olhar para o catálogo de fichas da biblioteca (o esquema do banco de dados) e escrever uma nota perfeita para o assistente do bibliotecário buscar a resposta.
Mas, no mundo real das grandes empresas, não é tão simples. A empresa possui um livro de regras secreto que ninguém fora do prédio conhece. Talvez "mês passado" signifique, na verdade, "o trimestre fiscal encerrado em junho", ou "produtos principais" exclui itens que estão atualmente em liquidação. Sem esse livro de regras secreto, o bibliotecário irá adivinhar, e sua nota estará errada.
Apresentando o "EntSQL": O Teste para o Livro de Regras Secreto
Este artigo apresenta um novo teste chamado EntSQL. Pense nele como um exame final para bibliotecários de IA, mas em vez de apenas pedir que eles leiam um catálogo de livros, o exame entrega a eles um enorme manual de uma empresa privada de 50 páginas e pede que escrevam uma consulta baseada nele.
Aqui está o detalhamento do que o artigo descobriu, usando analogias simples:
1. O Problema: O "Manual Ausente"
Os testes existentes para esses bibliotecários de IA (como Spider ou BIRD) são como dar a eles um catálogo de biblioteca genérico. Eles são bons em encontrar livros se o catálogo estiver claro. Mas, em um negócio real, o "catálogo" (o banco de dados) é inútil sem o "manual do funcionário" (as regras de negócio privadas).
- A Analogia: Imagine perguntar a uma IA: "Quanto gastamos com o 'Projeto X'?" O banco de dados tem apenas uma coluna chamada
custo. Ele não sabe que o "Projeto X" é, na verdade, um codinome para "Marketing", ou que só conta custos após uma data específica. Sem o manual privado, a IA está voando às cegas.
2. O Teste: EntSQL
Os pesquisadores construíram um teste usando dados reais (mas anonimizados) de cinco departamentos diferentes de uma empresa: Finanças, Tesouraria, RH, Gestão de Negócios e Construção do Partido.
- A Configuração: Eles deram à IA uma pergunta, a estrutura do banco de dados e um documento longo e bagunçado contendo as regras específicas da empresa.
- A Dificuldade: As perguntas eram complicadas. Elas exigiam que a IA lesse um documento longo, encontrasse a regra específica sobre "anos fiscais" ou "cálculos de bônus" e, então, combinasse isso com o banco de dados para escrever uma instrução de computador complexa.
- A Escala: O teste tinha mais de 1.000 perguntas. As respostas "padrão ouro" (as instruções corretas) eram muito longas e complexas, como um parágrafo de código de 400 palavras.
3. Os Resultados: A IA Ainda Está Lutando
Os pesquisadores testaram os modelos de IA mais inteligentes do mundo (como Claude, GPT-4 e outros) neste exame.
- A Pontuação: Mesmo a melhor IA conseguiu apenas cerca de 16% das respostas corretamente quando recebeu os documentos longos.
- A Analogia: É como dar a um aluno brilhante um livro didático de 500 páginas e pedir que ele resolva um problema de matemática. Ele sabe fazer matemática, mas não consegue encontrar a regra específica no livro que se aplica a este problema específico. Eles se perdem no texto.
- A Dica da "Evidência": Quando os pesquisadores deram à IA uma versão destacada do livro (apenas as 2 ou 3 frases que importavam), a pontuação subiu para cerca de 21%. Isso prova que a IA não é ruim em matemática; ela é apenas ruim em encontrar a agulha no palheiro.
4. Onde Eles Falharam
Os pesquisadores observaram por que a IA errou. Não foi geralmente porque a IA esqueceu como escrever o código.
- O Erro Principal (54%): A IA perdeu o "filtro". Foi como pedir "carros vermelhos" e a IA trazer "todos os carros" ou "carros azuis". Ela não conseguiu aplicar corretamente as regras específicas do documento aos dados.
- O Erro de Escopo (14%): A IA olhou para o período de tempo errado ou para o departamento errado. Foi como calcular o orçamento para "2023" quando a pergunta pedia "2024".
5. A Lacuna Humana
Os pesquisadores também pediram a um especialista humano para fazer o mesmo teste.
- A Lacuna: O especialista humano acertou cerca de 84% quando recebeu as notas destacadas. A IA obteve 20%.
- A Conclusão: Existe uma enorme lacuna entre o que um humano pode fazer com um manual da empresa e o que a IA atual consegue fazer. A IA ainda é muito ruim em entender as "regras não escritas" de um negócio específico.
Resumo
EntSQL é um novo benchmark que diz: "Pare de apenas testar se a IA consegue ler um banco de dados. Teste se ela consegue ler o livro de regras secreto de uma empresa e aplicá-lo."
O artigo conclui que, embora a IA esteja ficando melhor em escrever código, ela é atualmente péssima em fundamentar esse código no conhecimento de contexto longo, privado e bagunçado em que as empresas reais dependem. É um lembrete de que, para a IA realmente ajudar no escritório, ela precisa se tornar muito melhor em ler as letras miúdas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.