← Últimos artículos
💬 NLP

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Este artículo presenta Spider 2.0-AIFunc, un nuevo benchmark de 465 instancias verificadas a través de 125 bases de datos del mundo real diseñado para evaluar la capacidad de los grandes modelos de lenguaje para generar consultas SQL nativas de IA en la plataforma Snowflake, revelando que, si bien los principales modelos propietarios alcanzan una precisión del 67-70%, los marcos de agentes actuales optimizados para tareas tradicionales de text-to-SQL no se transfieren eficazmente a este entorno emergente.

Autores originales: Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva y de alta tecnología (una base de datos en la nube) donde la gente almacena de todo, desde reseñas de clientes hasta registros de ventas. Durante años, hacer preguntas sobre esta biblioteca requería un lenguaje muy estricto y robótico llamado SQL. Era como intentar pedir una comida compleja en un restaurante hablando únicamente mediante un código de números y símbolos.

Recientemente, los dueños de la biblioteca (como Snowflake) añadieron una nueva función: Funciones de IA. Piensa en ellas como "asistentes inteligentes" integrados directamente en el sistema de pedidos. Ahora, en lugar de solo pedir "todas las manzanas rojas", puedes pedirle al sistema que "lea las reseñas de estas manzanas y me diga si la gente está feliz o enojada", o "encuentra reseñas que sean similares a esta". Esto convierte a la base de datos en un sistema Nativo de IA, donde puedes mezclar comandos de datos estándar con un pensamiento basado en el lenguaje y la inteligencia en una sola frase.

El Problema: El Mapa Antiguo No Funciona

Los investigadores notaron que, aunque estos nuevos "asistentes inteligentes" son poderosos, las pruebas utilizadas para entrenar y verificar los cerebros computacionales (modelos de IA) estaban obsoletas. Las pruebas antiguas solo verificaban si la computadora podía hablar el estricto lenguaje robótico. No verificaban si la computadora podía usar estos nuevos "asistentes inteligentes". Era como probar a un conductor solo en una carretera recta y vacía, cuando el mundo real ahora tiene tráfico, peatones y zonas de construcción.

La Solución: Spider 2.0-AIFunc

Para solucionar esto, el equipo creó una nueva y más difícil prueba de conducción llamada Spider 2.0-AIFunc.

  1. La Transformación: Tomaron 513 "pruebas de conducción" existentes (preguntas sobre datos) y las reescribieron. Obligaron a que las preguntas requirieran el uso de los nuevos "asistentes inteligentes".
    • Pregunta Antigua: "Muestra todas las reseñas negativas". (Requiere que un humano las lea primero).
    • Nueva Pregunta: "Muestra todas las reseñas donde el asistente de IA dice que el sentimiento es negativo". (La IA realiza la lectura dentro de la base de datos).
  2. El Equipo de Construcción: Utilizaron un equipo de agentes de IA (trabajadores digitales) para reescribir estas preguntas. Estos agentes actuaron como editores y mecánicos:
    • Verificaron que las instrucciones fueran claras (por ejemplo, "¿Qué quieres decir exactamente con 'negativo'?").
    • Se aseguraron de que el "asistente inteligente" tuviera todas las herramientas (parámetros) adecuadas para hacer el trabajo.
    • Ejecutaron las pruebas una y otra vez para asegurarse de que las respuestas fueran estables y no cambiaran solo porque el asistente de IA tuviera un mal día.
  3. El Examen Final: El resultado es un benchmark de 465 preguntas verificadas a través de 125 bases de datos diferentes. Cubre seis tipos de tareas de "asistentes inteligentes", como clasificar reseñas por emoción, encontrar textos similares o extraer detalles específicos de un párrafo.

Los Resultados: ¿Quién Pasó la Prueba?

Los investigadores sometieron a 10 modelos de IA diferentes (los "conductores") a este nuevo examen para ver qué tan bien podían escribir estas consultas complejas potenciadas por IA.

  • Los Mejores Conductores (Modelos Propietarios): Los grandes modelos de código cerrado (como Claude Opus y Gemini) fueron los mejores. Obtuvieron entre un 67% y un 70% de las respuestas correctas. Fueron buenos para determinar qué "asistente inteligente" usar y cómo hacerle la pregunta adecuada.
  • Los Conductores de Código Abierto: Los mejores modelos de código abierto (como Kimi K2.5) puntuaron alrededor del 58%. Eran decentes, pero cometieron más errores.
  • La Brecha: La razón principal por la que los modelos de código abierto tuvieron dificultades no fue que no pudieran escribir el código básico. Tropezaron con las partes "inteligentes":
    • Malentendidos de las reglas: Elegir la tabla o columna incorrecta.
    • Instrucciones deficientes: Olvidar decirle al asistente de IA exactamente qué buscar (por ejemplo, no enumerar todas las categorías posibles para una tarea de clasificación).
    • Errores de lógica: Confundir el orden de las operaciones (por ejemplo, filtrar datos después de preguntarle a la IA en lugar de hacerlo antes).

El Descubrimiento Sorprendente: Menos es Más

Los investigadores también probaron si el uso de "frameworks de agentes" complejos (kits de herramientas elaborados que ayudan a la IA a planificar sus pasos) ayudaba.

  • El Hallazgo: Sorprendentemente, los kits de herramientas más complejos no ayudaron mucho. De hecho, una configuración mínima —solo una herramienta simple para mirar la base de datos y una herramienta para ejecutar la consulta— funcionó tan bien como, o incluso mejor que, los frameworks sofisticados.
  • La Metáfora: Es como darle a un maestro chef un cuchillo pequeño y simple frente a un enorme y complicado cuchillo suizo. Para este tipo de cocina específica (SQL Nativo de IA), el maestro chef no necesitaba los accesorios extra; solo necesitaba saber cómo usar el cuchillo. Los frameworks complejos diseñados para tareas de datos de la vieja escuela en realidad estorbaban o no aportaban valor para estas nuevas tareas inteligentes.

Resumen

Este artículo presenta un nuevo y realista test para modelos de IA que verifica si pueden utilizar las funciones modernas de las bases de datos "potenciadas por IA". Encontró que, si bien los mejores modelos de IA se están volviendo buenos en esto, todavía hay una brecha entre los modelos de alto nivel y los de código abierto. La clave del éxito no es usar herramientas de planificación más complejas, sino obtener las instrucciones básicas y los parámetros para las funciones de IA de manera exacta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →