← Últimos artículos
🤖 AI

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

El artículo introduce SeePhys Pro, un benchmark que revela que los modelos multimodales actuales tienen dificultades con la transferencia de modalidad de texto a imágenes, y demuestra que las ganancias aparentes del entrenamiento multimodal RLVR a menudo provienen de pistas textuales residuales en lugar de un razonamiento visual genuino.

Autores originales: Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhe
Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhen, Dandan Tu, Yinya Huang, Xiaodan Liang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un estudiante cómo resolver un problema de física. Tienes dos formas de darle la información:

  1. El Método del Libro de Texto: Escribes el problema con palabras, describiendo la configuración, los números y las reglas.
  2. El Método del Diagrama: Dibujas una imagen de la configuración, etiquetas las partes y escribes los números directamente en el dibujo.

Intuitivamente, esperarías que un estudiante inteligente resolviera el problema igual de bien, ya sea que le des las palabras o la imagen, siempre que la información sea la misma. Pero este artículo, SEEPHYS PRO, descubrió que para los modelos de IA actuales, esto no es cierto. De hecho, les va significativamente peor cuando cambias de palabras a imágenes.

Aquí tienes un desglose de lo que encontraron los investigadores, usando analogías simples.

1. La Prueba de "La Misma Historia, Formato Diferente"

Los investigadores crearon una prueba especial llamada SEEPHYS PRO. Piénsalo como un "reto de traducción" para la IA.

Para cada problema de física individual, crearon cuatro versiones que cuentan exactamente la misma historia pero cambian cómo se presenta la información:

  • Nivel 1 (Solo Texto): "Un bloque pesa 5 kg y está en una rampa". (Toda la información está en palabras).
  • Nivel 2 (Estructura en Imagen): Dibujan la rampa y el bloque, pero el texto sigue diciendo "5 kg". (La forma es una imagen, los números son palabras).
  • Nivel 3 (Variables en Imagen): Dibujan la rampa, el bloque y escriben "5 kg" directamente sobre el bloque en la imagen. (La forma y los números ahora están en la imagen).
  • Nivel 4 (Imagen Completa): Todo el problema, incluidas las instrucciones y los números, está escrito a mano en un papel y escaneado como una sola imagen.

El Descubrimiento:
Cuando los modelos de IA intentaron estas pruebas, su rendimiento cayó como una piedra a medida que la información pasaba de texto a imágenes.

  • El Cuello de Botella de "Leer la Etiqueta": La mayor caída en el rendimiento ocurrió en el Nivel 3. Esto es cuando la IA tenía que mirar la imagen y "anclar" las variables (por ejemplo: "Bien, esa línea ondulada es un cable, y el número '12' al lado significa 12 Voltios").
  • La Analogía: Imagina a un chef que puede seguir perfectamente una receta escrita (Nivel 1). Si le entregas una foto de los ingredientes con etiquetas (Nivel 3), de repente olvida cómo cocinar. Puede ver la foto, pero no puede conectar la etiqueta "2 tazas de harina" con el verdadero saco de harina en la foto. Se confunde por el enlace visual.

2. El Experimento de "Entrenamiento con Vendaje"

Los investigadores luego plantearon una segunda pregunta: ¿Si entrenamos estas IAs usando Aprendizaje por Refuerzo (RL) en miles de problemas de física con imágenes, mejorarán en la lectura de las imágenes?

Para probar esto, diseñaron un experimento de "Entrenamiento Ciego".

  • Entrenamiento Normal: La IA ve el texto del problema y la imagen.
  • Entrenamiento Ciego: La IA ve el texto del problema, pero la imagen está completamente oscurecida (enmascarada). Es como entrenar a un estudiante para resolver problemas de física mientras lleva una venda en los ojos, pero el profesor sigue dándole las mismas recompensas de "respuesta correcta".

El Resultado Sorprendente:
Aunque la IA fue entrenada sin ninguna imagen (solo pantallas negras), aún así mejoró en resolver las pruebas sin enmascarar donde las imágenes estaban presentes.

  • La Analogía: Imagina a un estudiante que practica para un examen de conducir sentado en un coche con las ventanas pintadas de negro. Nunca ve la carretera. Sin embargo, cuando finalmente realiza el examen real con las ventanas abiertas, conduce mejor.
  • ¿Por qué? Los investigadores descubrieron que la IA no estaba aprendiendo a "ver" la carretera. En cambio, estaba aprendiendo atajos. Memorizaba patrones en el texto, el estilo de las preguntas o las respuestas típicas. Aprendió a adivinar la respuesta correcta basándose en la "vibra" del texto, no analizando realmente el diagrama visual.

3. El "Truco de Magia" de la Precisión

El artículo concluye que cuando vemos que la puntuación de una IA sube, no debemos simplemente celebrar. Necesitamos preguntar: ¿Realmente aprendió a ver, o simplemente mejoró en adivinar basándose en pistas del texto?

  • La "Ganancia Ciega": La IA mejoró su puntuación incluso cuando las imágenes de entrenamiento eran inútiles (negras). Esto demuestra que la mejora provino del texto y los patrones del conjunto de datos, no de la comprensión visual.
  • La Brecha Persiste: Incluso después del entrenamiento, la IA aún tuvo más dificultades con las versiones cargadas de imágenes (Nivel 3 y 4) que con las versiones solo de texto. La "brecha de modalidad" (la diferencia entre el rendimiento en texto y el rendimiento en imagen) no se cerró.

Resumen

  • El Problema: Los modelos de IA actuales son "pesados en texto". Son excelentes leyendo problemas de física pero terribles en "verlos", especialmente cuando tienen que leer números y etiquetas directamente de un diagrama.
  • La Trampa: Los métodos de entrenamiento estándar (Aprendizaje por Refuerzo) pueden hacer que la IA parezca más inteligente al mejorar sus habilidades de adivinanza basadas en texto, incluso si nunca aprende realmente a interpretar la evidencia visual.
  • La Lección: Para hacer que la IA "vea" realmente, no podemos solo medir si obtiene la respuesta correcta. Tenemos que probar si obtiene la respuesta correcta específicamente porque miró la imagen, y no solo porque reconoció el patrón del texto.

El artículo esencialmente dice: No te dejes engañar por puntuaciones altas. Si una IA puede resolver un problema sin mirar la imagen, no ha aprendido realmente a ver.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →