← Últimos artigos
🤖 AI

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

Este artigo apresenta o STEF, um framework de avaliação agnóstico a esquemas que permite monitoramento contínuo e nativo de produção de sistemas Text-to-SQL, gerando pontuações de precisão interpretáveis a partir de entradas em linguagem natural e SQL gerado, sem exigir esquemas de banco de dados ou consultas de verdade fundamental.

Autores originais: Taslim Jamal Arif, Kuldeep Singh

Publicado 2026-05-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Taslim Jamal Arif, Kuldeep Singh

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico muito inteligente que fala "Humano" (como "Mostre-me as vendas do ano passado") e traduz isso para "Linguagem de Banco de Dados" (código SQL) para extrair informações dos registros de uma empresa.

O grande problema que este artigo aborda é: Como você sabe se o robô está fazendo um bom trabalho quando está trabalhando para pessoas reais em uma empresa real?

O Jeito Antigo: O Problema do "Gabarito"

No passado, para testar esses robôs, os pesquisadores usavam um método semelhante a corrigir uma prova de matemática com um gabarito.

  • O Cenário: Você dá uma pergunta ao robô, ele dá uma resposta e você a compara com uma resposta "Padrão Ouro" escrita por um especialista humano.
  • A Falha: No mundo real, você não tem um gabarito para cada pergunta que um cliente faz. Além disso, o banco de dados da empresa é frequentemente secreto, está em constante mudança ou é complexo demais para ser compartilhado com a equipe de testes.
  • O Resultado: Uma vez que o robô é implantado em um escritório real, ninguém sabe se ele está piorando com o tempo. É como dirigir um carro com um velocímetro quebrado; você não sabe se está excedendo a velocidade até bater.

A Nova Solução: STEF (O Inspetor "Tradutor Inteligente")

Os autores criaram um novo sistema chamado STEF (Framework de Avaliação Text-to-SQL Agnóstico de Esquema). Pense no STEF como um editor superinteligente que não precisa do livro original ou do banco de dados para verificar se a tradução é boa.

Veja como o STEF funciona, usando analogias simples:

1. A Regra "Sem Referência"

O STEF não precisa da resposta "Padrão Ouro" nem do mapa do banco de dados. Ele olha apenas para três coisas:

  • O que o humano perguntou.
  • Como o robô reescreveu essa pergunta internamente.
  • O código que o robô escreveu.
    É como um tradutor verificando se uma frase em francês faz sentido em inglês, sem precisar conhecer o texto original em espanhol.

2. A "Desconstrução" (Tirando a Sopa de Pedaços)

Em vez de apenas comparar o código caractere por caractere (o que é como verificar se duas frases têm exatamente as mesmas letras), o STEF desmonta a solicitação em ingredientes:

  • O que estamos procurando? (As colunas)
  • O que estamos contando ou somando? (A matemática)
  • O que estamos filtrando? (A parte "mostre-me apenas usuários ativos")
  • Como estamos agrupando? (Por país, por ano, etc.)

O STEF verifica se o robô incluiu os ingredientes certos. Se o humano pediu "Usuários Ativos" e o robô esqueceu de filtrar os "Inativos", o STEF identifica o ingrediente faltante imediatamente.

3. O Juiz "Humano" (O LLM)

O STEF usa outra IA (um "Juiz") para olhar os ingredientes e decidir: "Este código realmente responde à pergunta?"

  • A Pontuação de Confiança: O Juiz não diz apenas "Sim" ou "Não". Ele diz: "Tenho 90% de certeza de que isso está certo" ou "Tenho apenas 50% de certeza".
  • A Penalidade: Se o Juiz não tiver certeza, a pontuação final recebe uma pequena penalidade. Isso impede que o sistema dê uma pontuação perfeita para um palpite.

4. As Regras do "Mundo Real" (Normalização)

Esta é a parte mais inteligente. No mundo real, os robôs às vezes adicionam etapas extras que são realmente úteis, não erradas. O STEF sabe disso.

  • A Regra "Ordenar": Se um robô ordenar os resultados do maior para o menor (mesmo que o humano não tenha pedido), o STEF diz: "Isso é um toque agradável, não um erro".
  • A Regra "Segurança": Se um robô adicionar um limite como "Mostre-me os 10.000 primeiros resultados" apenas para evitar que o computador trave, o STEF diz: "Bom trabalho, isso é seguro", em vez de "Errado, você não pediu 10.000".
  • A Regra "Agrupar": Se a matemática exigir agrupar dados para fazer sentido, o STEF aceita isso, mesmo que o humano não tenha dito explicitamente "agrupar por".

5. A "Customização da Empresa" (O Livro de Regras)

Cada empresa é diferente. Uma empresa pode chamar uma coluna de "Região", enquanto outra a chama de "Território".
O STEF tem um livro de regras configurável. Você pode dizer ao STEF: "Ei, nesta empresa, 'Região' e 'Território' significam a mesma coisa" ou "Ignore sempre o filtro 'Status' porque ele é adicionado automaticamente". Isso permite que o STEF se adapte a qualquer empresa sem precisar ser reprogramado.

A Pontuação Final

O STEF dá uma pontuação de 0 a 100.

  • 90-100: Excelente. O robô está pronto para o horário nobre.
  • 50-75: Marginal. O robô está adivinhando demais; humanos devem verificá-lo.
  • Abaixo de 50: Ruim. O robô está falhando e precisa de ajuda imediata.

Por Que Isso Importa

Antes do STEF, as empresas estavam voando às cegas com seus assistentes de IA. Elas não conseguiam dizer se a IA estava ficando lentamente mais burra ou se estava cometendo erros perigosos. O STEF atua como um monitor de saúde contínuo para esses agentes de IA. Ele permite que as empresas corrijam problemas antes que afetem decisões reais de negócios, tudo sem precisar espiar dentro do banco de dados secreto ou escrever novos gabaritos para cada pergunta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →