← Últimos artículos
💬 NLP

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

Este artículo presenta BacktestBench, el primer benchmark a gran escala para la retroprueba cuantitativa automatizada que comprende más de 18.000 tareas anotadas derivadas de 6 millones de registros de mercado, junto con AutoBacktest, un marco multiagente diseñado para traducir estrategias en lenguaje natural a retropruebas reproducibles y evaluar las capacidades de 23 LLMs principales.

Autores originales: Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un chef que quiere crear una nueva receta para un plato que te hará rico. En el mundo de las finanzas, este "plato" es una estrategia de trading. Antes de servirla al mundo (o invertir tu propio dinero), debes backtestearla. Esto significa que tomas tu receta y la cocinas usando una olla masiva de datos históricos (lo que sucedió en el mercado de valores durante los últimos años) para ver si realmente habría generado dinero o si habría quemado la cocina.

Tradicionalmente, hacer esta prueba de backtesting es como intentar construir un robot complejo desde cero cada vez que quieres probar una nueva receta. Necesitas ser un mecánico maestro (programador), un bibliotecario de datos (para encontrar los ingredientes históricos adecuados) y un mago financiero, todo al mismo tiempo. Es lento, costoso y solo unos pocos expertos pueden hacerlo.

BacktestBench es un nuevo proyecto que pregunta: "¿Puede la Inteligencia Artificial (IA) aprender a ser ese mecánico maestro, bibliotecario y mago, todo al mismo tiempo?"

Aquí tienes un desglose simple de lo que hace el artículo:

1. El Problema: La "Caja Negra" de las Finanzas

Los autores argumentan que, aunque la IA (específicamente los Modelos de Lenguaje Grandes o LLM) es excelente escribiendo código y conversando, nadie ha probado realmente si puede manejar el trabajo específico y de alto riesgo de la cuantificación automatizada de backtesting.

  • El Desafío: No se trata solo de escribir código. La IA debe entender una solicitud humana vaga como: "Compra cuando el precio suba durante 5 días", y luego:
    1. Encontrar los datos exactos de la acción correcta desde una base de datos.
    2. Escribir un programa que calcule la regla de "5 días de subida" sin hacer trampa (usando datos futuros).
    3. Ejecutar la simulación.
    4. Calcular la puntuación final (como un "Ratio de Sharpe", que es una forma elegante de decir "cuánta ganancia obtuvimos por el riesgo que asumimos").

Si la IA comete un pequeño error en el paso 2, todo el resultado es basura.

2. La Solución: Un "Examen de Práctica" Gigante (BacktestBench)

Para probar si la IA puede hacer esto, los investigadores construyeron BacktestBench. Piensa en esto como un examen de licencia de conducir estandarizado y masivo para la IA, pero en lugar de conducir un coche, la IA está conduciendo una estrategia de trading.

  • Los Datos: Utilizaron más de 6 millones de registros reales del mercado de los mercados bursátiles chinos (como una biblioteca gigante de historia).
  • Las Preguntas: Crearon 18,246 preguntas de prueba específicas. Estas no son problemas matemáticos simples; son escenarios complejos como:
    • "Calcula la ganancia para esta estrategia específica en esta acción específica".
    • "¿Qué acción tuvo el mejor rendimiento con esta estrategia?"
    • "¿Qué configuración (parámetro) funciona mejor?"
  • La Verdad Terrenal: Como construyeron las preguntas a partir de código real que escribieron ellos mismos, conocen la respuesta exacta correcta. Esto les permite calificar a la IA estrictamente: Correcto o Incorrecto.

3. El Sujeto de Prueba: "AutoBacktest" (El Equipo de IA)

Los investigadores no pidieron a una sola IA que hiciera todo. Construyeron un equipo de tres agentes de IA especializados llamados AutoBacktest, trabajando juntos como un equipo de cocina:

  1. El Resumen (El Traductor): Le das una oración humana desordenada. Lo traduce en una lista precisa de "ingredientes" financieros (indicadores) que necesita el sistema.
  2. El Recuperador (El Bibliotecario): Toma esa lista y va a la base de datos para obtener los datos crudos exactos (como "Precio de Apertura" y "Volumen") necesarios. Escribe una consulta (SQL) para obtener los datos.
  3. El Codificador (El Chef): Toma los datos y las instrucciones, escribe el código Python para ejecutar la simulación, lo ejecuta y da el número final.

4. Los Resultados: ¿Quién Aprobó el Examen?

Probaron 23 modelos de IA diferentes (tanto de código abierto como de pago "cerrados") en este examen.

  • Los Ganadores: Los modelos cerrados superiores (como Gemini 3 Pro) obtuvieron los mejores resultados, pero incluso ellos solo acertaron alrededor del 67%. Esto significa que incluso la IA más inteligente actualmente lucha con la lógica compleja de las finanzas.
  • La "Brecha Lógica": Descubrieron que muchas IAs son buenas escribiendo código que parece correcto (sintaxis) pero falla en la lógica. Por ejemplo, una IA podría escribir código que calcula la "Volatilidad" (una medida de riesgo) pero se equivoca en las matemáticas porque no entiende la definición financiera.
  • La Lucha de los "Modelos Pequeños": Los modelos de IA más pequeños (con menos "células cerebrales" o parámetros) eran terribles en las partes pesadas de matemáticas. Si la pregunta requería razonamiento estadístico complejo, los modelos pequeños a menudo fallaban por completo, mientras que los modelos más grandes se desempeñaban mejor.
  • El Secreto: Descubrieron que darle a la IA una "chuleta" de códigos cortos estandarizados (como un diccionario que dice "Volatilidad = esta fórmula específica") ayudó a la IA a escribir código mucho mejor.

5. La Conclusión

El artículo concluye que, aunque la IA está mejorando en la automatización de la investigación financiera, aún no hemos llegado allí.

  • Los modelos de IA actuales son como estudiantes brillantes que pueden escribir un gran ensayo pero a menudo reprueban el examen de matemáticas.
  • El conjunto de datos BacktestBench ahora está disponible para que todos lo usen para entrenar y probar sus propios modelos de IA, asegurando que la IA financiera futura sea realmente confiable y no solo esté "alucinando" números.

En resumen: El artículo construyó un "examen final" riguroso para la IA para demostrar que puede manejar el mundo complejo y propenso a errores del backtesting del mercado de valores. Los resultados muestran que, aunque la IA es prometedora, aún necesita aprender a hacer las matemáticas perfectamente antes de confiarle dinero real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →