← Últimos artículos
💬 NLP

Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics

Este artículo presenta MARKET-BENCH, un benchmark que evalúa a los modelos de lenguaje de gran tamaño en tareas de trading cuantitativo introductorio al requerirles que generen backtesters ejecutables a partir de descripciones en lenguaje natural, revelando que, si bien los modelos actuales pueden construir de manera confiable la infraestructura básica de trading, todavía tienen dificultades con el razonamiento robusto sobre precios, inventario y riesgo.

Autores originales: Abhay Srivastava, Sam Jung, Spencer Mateega

Publicado 2026-01-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Abhay Srivastava, Sam Jung, Spencer Mateega

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un equipo de robots muy inteligentes y muy rápidos. Estos robots son excelentes leyendo libros, escribiendo historias y respondiendo preguntas de trivia. Pero ahora, quieres ver si pueden hacer algo mucho más difícil: gestionar un puesto de limonada donde el precio de los limones cambia cada segundo, y tienes que ganar dinero sin perder hasta la camisa.

Este artículo presenta una nueva prueba llamada MARKET-BENCH para ver si estos "cerebros robóticos" (llamados Modelos de Lenguaje Extensos o LLMs) pueden realmente hacer las matemáticas y la lógica necesarias para dirigir un negocio de trading sencillo.

Así es como funciona la prueba, desglosada en términos cotidianos:

1. La Prueba: "Construye la máquina, no solo hables de ella"

La mayoría de las pruebas preguntan a estos robots cómo describirían el comercio. "¡Si el precio sube, compra!", podrían decir.
MARKET-BENCH es diferente. Dice: "Aquí hay una receta y una lista de ingredientes. Escribe el código de computadora que realmente ejecute el negocio".

Los robots tuvieron que escribir código que:

  • Rastree cuánto dinero tienen.
  • Compre y venda acciones (como Microsoft, Coca-Cola y Pepsi) basándose en reglas específicas.
  • Calcule exactamente cuánta ganancia o pérdida obtuvieron.
  • Crucialmente: Las matemáticas del robot debían coincidir exactamente con una respuesta de "estándar de oro". Si el robot decía que ganó $100, pero el estándar de oro decía que ganó $95, el robot fallaba.

2. Los Tres Desafíos (Los "Niveles")

La prueba tenía tres niveles de dificultad, como niveles de un videojuego:

  • Nivel 1: El Horario Simple (Microsoft)

    • El Trabajo: Comprar o vender acciones de Microsoft en momentos específicos, como un brazo robótico en una línea de ensamblaje.
    • El Truco: Tienes que llevar la cuenta de cada centavo y de cada acción perfectamente.
    • Resultado: La mayoría de los robots pudieron construir la máquina (el código se ejecutó), pero muchos cometieron pequeños errores matemáticos que se sumaron para crear grandes errores. Algunos robots fueron perfectos; otros estaban totalmente errados.
  • Nivel 2: El Compañero de Baile (Coca-Cola vs. Pepsi)

    • El Trabajo: Este es un juego de "Trading de Pares" (Pairs Trading). Apuestas en la diferencia entre Coca-Cola y Pepsi. Si Coca-Cola se vuelve demasiado cara en comparación con Pepsi, compras Pepsi y vendes Coca-Cola, esperando que vuelvan a la normalidad.
    • El Truco: Tienes que hacer malabares con dos acciones a la vez, calcular un "spread" (brecha) complejo entre ellas y gestionar tu dinero total a través de ambas.
    • Resultado: Esto fue mucho más difícil. Varios robots rompieron la máquina por completo (el código no se ejecutaba). Un robot (Qwen3 Max) construyó una máquina que funcionaba perfectamente, pero calculó las ganancias como 400 millones de dólares cuando debería haber sido unos pocos cientos. Era como un robot que construyó un coche que conducía perfectamente, pero pensaba que estaba conduciendo en la luna.
  • Nivel 3: El Equilibrio en la Cuerda Floja (Cobertura de Opciones)

    • El Trabajo: Este es el nivel más difícil. Tienes una póliza de seguro compleja (una opción) sobre las acciones de Microsoft, y tienes que comprar o vender constantemente las acciones para mantenerte neutral al riesgo. Es como caminar por una cuerda floja mientras haces malabares.
    • El Truco: El tiempo lo es todo. Si esperas una fracción de segundo de más, pierdes dinero.
    • Resultado: Este fue el nivel más difícil. Muchos robots ni siquiera pudieron lograr que la máquina arrancara. Los que sí funcionaron, a menudo tenían errores matemáticos enormes.

3. Las Grandes Conclusiones

El artículo encontró tres cosas principales:

  • Fiabilidad vs. Precisión: Algunos robots son buenos siguiendo instrucciones para construir el código (la máquina arranca), pero terribles haciendo las matemáticas dentro de él. Otros son buenos con las matemáticas pero ni siquiera pueden construir la máquina.
  • El Problema de las "Alucinaciones": En el mundo real, si un robot piensa que ganó un millón de dólares cuando en realidad perdió dinero, te vas a la quiebra. El artículo muestra que estos robots a menudo "alucinan" (inventan) números que parecen buenos pero que son completamente erróneos.
  • No están listos para el mundo real: Los autores concluyen que, en este momento, estos robots no son seguros para ser usados como el cerebro principal de trading. Son como un pasante muy inteligente que puede redactar un borrador de un informe, pero necesita que un humano revise cada uno de los números antes de enviárselo al jefe.

La Conclusión Final

Piensa en estos Modelos de Lenguaje Extensos como aprendices muy talentosos pero inexpertos. Pueden escribir el código para iniciar un negocio de trading, pero a menudo arrugan la contabilidad. Hasta que mejoren en las matemáticas y la lógica, no puedes confiar en ellos para que gestionen tu dinero por su cuenta.

Los autores lanzaron esta prueba (MARKET-BENCH) y un tablero de puntuación público para que otros científicos puedan intentar construir mejores robots y ver quién está mejorando realmente en las matemáticas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →