← Últimos artículos
💬 NLP

EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge

Este artículo presenta EntSQL, un nuevo referente chino-inglés que consta de 1.066 ejemplos a través de cinco dominios de negocios diseñado para evaluar los desafíos de la fundamentación de la generación de Text-to-SQL en el conocimiento empresarial de contexto largo, donde los modelos actuales tienen dificultades para lograr una alta precisión debido a la necesidad de una comprensión empresarial propietaria.

Autores originales: Chengxi Liao, Tao Xu, Zulong Chen, Chuanfei Xu, Yiyan Wang, Xinyun Wang, Yanlong Zhang, Xiaojun Chen, Zhibo Yang, Zeyi Wen

Publicado 2026-06-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chengxi Liao, Tao Xu, Zulong Chen, Chuanfei Xu, Yiyan Wang, Xinyun Wang, Yanlong Zhang, Xiaojun Chen, Zhibo Yang, Zeyi Wen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un bibliotecario muy inteligente y culto (una IA) que sabe hablar lenguaje humano y también sabe hablar "lenguaje de bases de datos" (SQL). Normalmente, si le preguntas al bibliotecario: "¿Cuántos libros vendimos el mes pasado?", él puede mirar el catálogo de fichas de la biblioteca (el esquema de la base de datos) y escribir una nota perfecta para que el asistente del bibliotecario vaya a buscar la respuesta.

Pero en el mundo real de las grandes empresas, no es tan sencillo. La empresa tiene un libro de reglas secreto que nadie fuera del edificio conoce. Tal vez "el mes pasado" significa en realidad "el trimestre fiscal que termina en junio", o "los productos estrella" excluye los artículos que están actualmente en liquidación. Si el bibliotecario no tiene ese libro de reglas secreto, adivinará, y su nota será incorrecta.

Entra "EntSQL": La prueba del libro de reglas secreto

Este artículo presenta una nueva prueba llamada EntSQL. Piensa en esto como un examen final para bibliotecarios de IA, pero en lugar de pedirles simplemente que lean un catálogo de libros, el examen les entrega un enorme manual privado de 50 páginas y les pide que escriban una consulta basada en él.

Aquí está el desglose de lo que encontró el artículo, utilizando analogías sencillas:

1. El problema: El "manual faltante"

Las pruebas existentes para estos bibliotecarios de IA (como Spider o BIRD) son como darles un catálogo de biblioteca genérico. Son buenos encontrando libros si el catálogo es claro. Pero en una empresa real, el "catálogo" (la base de datos) es inútil sin el "manual del empleado" (las reglas comerciales privadas).

  • La analogía: Imagina preguntarle a una IA: "¿Cuánto gastamos en el 'Proyecto X'?". La base de datos solo tiene una columna llamada costo. No sabe que el "Proyecto X" es en realidad un nombre en clave para "Marketing", o que solo cuenta los costos después de una fecha específica. Sin el manual privado, la IA está volando a ciegas.

2. La prueba: EntSQL

Los investigadores construyeron una prueba utilizando datos reales (pero anonimizados) de cinco departamentos de una empresa: Finanzas, Tesorería, Recursos Humanos, Gestión Empresarial y Construcción del Partido.

  • La configuración: Le dieron a la IA una pregunta, la estructura de la base de datos y un documento largo y desordenado que contenía las reglas específicas de la empresa.
  • La dificultad: Las preguntas eran complicadas. Requerían que la IA leyera un documento largo, encontrara la regla específica sobre los "años fiscales" o los "cálculos de bonos", y luego combinara eso con la base de datos para escribir una instrucción informática compleja.
  • La escala: La prueba tenía más de 1,000 preguntas. Las respuestas de "estándar de oro" (las instrucciones correctas) eran muy largas y complejas, como un párrafo de código de 400 palabras.

3. Los resultados: La IA todavía tiene dificultades

Los investigadores probaron a los modelos de IA más inteligentes del mundo (como Claude, GPT-4 y otros) en este examen.

  • La puntuación: Incluso la mejor IA solo acertó aproximadamente el 16% de las respuestas cuando se le dieron los documentos largos.
  • La analogía: Es como darle a un estudiante brillante un libro de texto de 500 páginas y pedirle que resuelva un problema matemático. Sabe hacer matemáticas, pero no puede encontrar la regla específica en el libro que se aplica a este problema particular. Se pierde en el texto.
  • La pista de la "evidencia": Cuando los investigadores le dieron a la IA una versión resaltada del libro (solo las 2 o 3 frases que importaban), la puntuación subió a aproximadamente el 21%. Esto demuestra que la IA no es mala en matemáticas; es solo mala encontrando la aguja en el pajar.

4. Dónde fallaron

Los investigadores analizaron por qué la IA cometía errores. No era usualmente porque la IA olvidara cómo escribir el código.

  • El error principal (54%): La IA omitió el "filtro". Era como pedir "coches rojos" y la IA traía "todos los coches" o "coches azules". No podía aplicar correctamente las reglas específicas del documento a los datos.
  • El error de alcance (14%): La IA miró el período de tiempo o el departamento equivocado. Era como calcular el presupuesto para "2023" cuando la pregunta pedía "2024".

5. La brecha humana

Los investigadores también pidieron a un experto humano que realizara la misma prueba.

  • La brecha: El experto humano acertó aproximadamente el 84% cuando se le dieron las notas resaltadas. La IA obtuvo un 20%.
  • La conclusión: Existe una gran brecha entre lo que los humanos pueden hacer con un manual de empresa y lo que la IA actual puede hacer. La IA sigue siendo muy mala entendiendo las "reglas no escritas" de un negocio específico.

Resumen

EntSQL es un nuevo punto de referencia que dice: "Deja de probar solo si la IA puede leer una base de datos. Prueba si puede leer el libro de reglas secreto de una empresa y aplicarlo".

El artículo concluye que, si bien la IA está mejorando en la escritura de código, actualmente es terrible fundamentando ese código en el conocimiento desordenado, privado y de contexto largo en el que dependen las empresas reales. Es un recordatorio de que, para que la IA realmente ayude en la oficina, debe mejorar mucho en la lectura de la letra pequeña.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →