← Últimos artículos
💰 quantitative finance

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

Este artículo presenta UniFinEval, el primer referente multimodal unificado que cubre texto, imágenes y videos a través de cinco escenarios financieros principales, lo cual revela que, si bien los modelos actuales como Gemini-3-pro-preview lideran en rendimiento, todavía están significativamente por detrás de los expertos financieros en el manejo de información de alta densidad y razonamiento complejo.

Autores originales: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin
Publicado 2026-02-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un nuevo asistente para ayudar a dirigir una firma de inversión masiva y de alto riesgo. Este asistente debe ser un "superanalista" capaz de leer informes financieros densos, interpretar gráficos complejos, ver horas de videos de análisis de mercado y luego tomar decisiones inteligentes sobre dónde colocar el dinero.

Durante mucho tiempo, hemos estado probando estos asistentes de IA con cuestionarios simples —como pedirles que lean un párrafo único o identifiquen un gráfico sencillo. Pero en el mundo real, las finanzas son caóticas. Es como intentar navegar en un océano tormentoso mientras lees un mapa, escuchas una transmisión de radio y observas una transmisión de video en vivo, todo al mismo tiempo. Las pruebas antiguas eran demasiado fáciles y no reflejaban el caos del trabajo real.

Entra "UniFinEval": El Bootcamp Financiero Definitivo

Los autores de este artículo crearon una nueva prueba súper desafiante llamada UniFinEval. Piensa en esto como un "curso de supervivencia" para modelos de IA, diseñado específicamente para ver si pueden manejar el entorno de alta presión y sobrecarga de información de las finanzas reales.

Así es como construyeron este bootcamp:

1. Los cinco niveles del Bootcamp

En lugar de solo hacer un tipo de pregunta, la prueba se divide en cinco escenarios realistas, volviéndose más difíciles a medida que avanzas:

  • Nivel 1: El Detective (Auditoría de Estados Financieros): Imagina a un detective examinando la escena de un crimen desordenada. La IA tiene que encontrar pequeñas inconsistencias en un informe financiero que está repleto de texto, gráficos y diseños confusos. Es como encontrar un solo error tipográfico en un documento de 100 páginas mientras alguien te grita distracciones en el oído.
  • Nivel 2: El Investigador (Razonamiento Fundamental de la Empresa): Ahora la IA tiene que determinar si una empresa es realmente saludable. Debe extraer números de diferentes informes, realizar cálculos complejos y conectar los puntos entre una descripción textual y un gráfico. Es como resolver un rompecabezas donde las piezas están en diferentes idiomas.
  • Nivel 3: El Detector de Tendencias (Perspectivas de Tendencias de la Industria): La IA hace un zoom hacia afuera. Ya no mira una sola empresa, sino a toda una industria. Tiene que comparar docenas de empresas a lo largo del tiempo para detectar grandes patrones. Es como observar un partido de fútbol y predecir al ganador basándose en el desempeño de cada uno de los jugadores en el campo, no solo en la estrella del equipo.
  • Nivel 4: El Radar (Detección de Riesgos Financieros): Esta es la parte aterradora. La IA tiene que ver un video de un analista de mercado hablando mientras lee un informe y observa un gráfico. Debe detectar peligros ocultos (riesgos) que están enterrados en el ruido. Es como intentar escuchar un susurro en medio de un huracán.
  • Nivel 5: El General (Análisis de Asignación de Activos): El nivel del jefe final. La IA tiene que tomar todo lo aprendido en los cuatro niveles anteriores para tomar una decisión final sobre cómo invertir dinero, equilibrando todos los riesgos y reglas. Es el momento en que el General debe decidir a dónde enviar a las tropas.

2. Las reglas del juego

  • Sin trampas: Las preguntas de la prueba no fueron escritas por otras IA (que pueden cometer errores o mentir). Fueron escritas por expertos humanos reales, personas con títulos avanzados y años de experiencia en finanzas.
  • La mezcla: La prueba utiliza texto, imágenes y videos juntos. No puedes simplemente leer la respuesta; tienes que "ver" el gráfico y "observar" el video para entender el contexto.
  • El tamaño: Crearon casi 4,000 de estas preguntas difíciles tanto en inglés como en chino.

3. Los resultados: ¿Quién aprobó?

Los investigadores sometieron a 10 de los modelos de IA más inteligentes (los "estudiantes") a este bootcamp. Esto fue lo que sucedió:

  • El mejor desempeño: Un modelo, Gemini-3-pro-preview, resultó ser el ganador. Obtuvo correctamente cerca del 74% de las respuestas. Eso suena bien, pero recuerda, esta es una prueba muy difícil.
  • La brecha: Incluso la mejor IA cometió muchos errores en comparación con un experto humano, quien obtuvo entre un 90% y 95% de aciertos. La IA es buena leyendo el texto, pero tiene dificultades cuando debe conectar los puntos entre un video, un gráfico y un informe.
  • Las dificultades:
    • Problemas matemáticos: Muchos modelos erraron en cálculos matemáticos simples.
    • Alucinaciones: Algunos modelos inventaron hechos que no estaban ahí (como un estudiante que adivina la respuesta porque tiene miedo de decir "no lo sé").
    • El problema del "Video": Cuando se involucraban videos, la mayoría de los modelos se perdían. No podían mantener el hilo de la historia a través del tiempo.
    • El Jefe Final: En el nivel más difícil (Asignación de Activos), el desempeño de la IA cayó significativamente. Podían reunir la información, pero no podían tomar la decisión final y compleja sin confundirse.

4. La gran conclusión

El artículo concluye que, si bien la IA se está volviendo muy buena leyendo y entendiendo datos financieros simples, aún no está lista para reemplazar a los expertos financieros humanos en situaciones complejas del mundo real.

Piénsalo de esta manera: la IA es como un estudiante brillante que puede memorizar una biblioteca entera de libros de texto. Pero cuando lo pones en una sala de guerra real con una transmisión de video en vivo, una mano temblorosa y un reloj que corre, comienza a entrar en pánico y a cometer errores.

Los autores construyeron UniFinEval para mostrarnos exactamente dónde falla la IA, de modo que los desarrolladores puedan corregir esas debilidades específicas antes de confiar estos modelos con dinero real. Ellos no dijeron que la IA pronto estará dirigiendo el mercado de valores; dijeron: "Aquí hay un mapa de los acantilados, para que sepamos dónde es probable que la IA se caiga".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →