← Últimos artículos
💬 NLP

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

Este trabajo presenta QuantCode-Bench, un benchmark diseñado para evaluar la capacidad de los modelos de lenguaje grandes para generar estrategias de trading algorítmico ejecutables en el framework Backtrader, revelando que sus principales limitaciones no son sintácticas, sino la correcta operacionalización de la lógica financiera y la adherencia a la semántica de la tarea.

Autores originales: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

Publicado 2026-04-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que tienes un chef de inteligencia artificial (un modelo de lenguaje grande) al que le pides que cocine un plato muy específico: una receta de inversión financiera. No quieres solo que escriba la receta en un papel bonito; quieres que la cocine de verdad, que el plato sepa bien y que, al probarlo, realmente alimente a alguien.

Este artículo presenta QuantCode-Bench, que es básicamente un examen de cocina muy estricto para ver si estos chefs de IA pueden crear estrategias de trading (planes para comprar y vender acciones) que funcionen de verdad.

Aquí te lo explico paso a paso, con analogías sencillas:

1. El Problema: Escribir vs. Cocinar

Antes, los exámenes para estas IAs se centraban en si sabían escribir código (la "receta") sin errores de ortografía. Si el código compilaba (se entendía), se consideraba un éxito.

Pero en el mundo del dinero, escribir la receta no es suficiente.

  • El escenario: Le dices a la IA: "Haz una estrategia que compre acciones cuando el precio suba y las venda cuando baje".
  • El fallo común: La IA puede escribir un código perfecto gramaticalmente. Pero cuando intentas "cocinarlo" (probarlo con datos históricos), resulta que:
    • La olla no enciende (el código falla al ejecutarse).
    • La olla enciende, pero nunca echa comida (la estrategia nunca hace ninguna compra).
    • Echa comida, pero es un pastel de chocolate cuando pediste una sopa (la estrategia hace operaciones, pero no sigue tus instrucciones).

QuantCode-Bench es el examen que castiga a la IA si el plato no sale bien, no importa lo bonita que sea la receta.

2. La Prueba: Los 4 Filtros de Seguridad

Para aprobar este examen, la estrategia generada por la IA tiene que pasar cuatro filtros consecutivos, como si fuera un control de seguridad en un aeropuerto:

  1. Filtro de Gramática (Compilación): ¿La receta está escrita correctamente? ¿Se entiende el idioma? (Aquí casi todas las IAs modernas aprueban).
  2. Filtro de la Cocina (Ejecución): ¿Puedes meter la receta en la cocina (Backtrader, el software de pruebas) y encender el fuego sin que explote?
  3. Filtro del Plato (Operaciones): ¿El chef realmente puso comida en el plato? Es decir, ¿la estrategia hizo al menos una compra o venta real con los datos históricos?
  4. Filtro del Comedor (El Juez): Aquí entra un "juez" (otra IA muy inteligente) que prueba el plato. ¿Sabe a lo que pediste? ¿Es realmente una estrategia de "comprar al alza" o simplemente inventó algo que funciona por suerte pero no es lo que tú querías?

3. Los Resultados: ¿Quién es el mejor chef?

Los autores probaron a los "chefs" más famosos del mundo (como Claude, GPT-5, Gemini, etc.) en dos situaciones:

  • Intento Único (Sin ayuda): Tienes que cocinarlo perfecto a la primera.

    • Resultado: ¡Es muy difícil! Incluso los mejores chefs solo aprueban el 70-76% de las veces. La mayoría falla en los filtros 3 y 4: o no hacen operaciones, o hacen operaciones que no tienen nada que ver con lo que pediste.
    • La moraleja: Escribir código es fácil; entender la lógica financiera y aplicarla es lo difícil.
  • Intento con Ayuda (Modo Agente): Si fallas, el profesor te dice: "Oye, se te quemó la sopa" o "Mezclaste los ingredientes al revés". La IA puede corregir y reintentar hasta 10 veces.

    • Resultado: ¡Milagro! Los mejores chefs suben su nota al 95-98%.
    • La moraleja: La mayoría de los errores no son porque la IA sea "tonta", sino porque necesita un poco de corrección. Con un poco de feedback, pueden arreglar casi todo.

4. ¿Dónde fallan realmente?

El estudio descubrió que el problema no es la ortografía (el código se ve bien). El problema es la lógica de la cocina:

  • Condición falsa: La IA pone una regla tan estricta que el precio nunca la cumple (ej: "Compra si el precio sube 100 dólares en un segundo").
  • Confusión de herramientas: Usa las herramientas del software de la manera incorrecta (como intentar usar un tenedor para cortar un filete).
  • Alucinación: Crea una estrategia que funciona, pero es totalmente diferente a lo que el usuario pidió.

5. Conclusión: ¿Qué nos dice esto?

Este examen nos enseña tres cosas importantes:

  1. Las IAs ya saben escribir código, pero aún están aprendiendo a pensar como financieros.
  2. La corrección es clave: Darle a la IA la oportunidad de corregir sus errores (modo agente) es mucho más efectivo que esperar que acierte a la primera.
  3. No basta con que funcione: En finanzas, no sirve de nada tener un código que funciona si no hace lo que tú querías. Necesitamos evaluar si la estrategia es semánticamente correcta (tiene sentido), no solo si no tiene errores técnicos.

En resumen, QuantCode-Bench es un nuevo estándar de oro que nos dice: "No nos importa solo si tu código no tiene errores de sintaxis; nos importa si tu estrategia de inversión realmente funciona y hace lo que le pediste".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →