← Últimos artículos
💬 NLP

Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

Este artículo demuestra que, para los modelos multilingües de visión y lenguaje de pequeño tamaño, las ganancias de escalado en tiempo de prueba son impulsadas principalmente por asegurar la capacidad de análisis del prompt y presupuestos de decodificación suficientes, más que por mecanismos complejos de búsqueda o verificación, siendo el modelo de política subyacente el factor más significativo para alcanzar un rendimiento de vanguardia en evaluaciones visuales de opción múltiple.

Autores originales: Spiros Baxevanakis, Peng-Jian Yang

Publicado 2026-07-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Spiros Baxevanakis, Peng-Jian Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas complejo y multilingüe donde las pistas están ocultas dentro de imágenes. Tienes un equipo de pequeños y listos robots (llamados Modelos de Visión y Lenguaje) para ayudarte. Durante mucho tiempo, la gente pensó que el secreto para resolver estos rompecabezas era construir una máquina supercompleja que pudiera revisar cada uno de los pasos del pensamiento del robot, o hacer que el robot reescribiera sus propias respuestas hasta que fueran perfectas.

Pero este artículo, escrito por investigadores de la Universidad de Ámsterdam para el concurso ImageCLEF 2026, dice: "¡Para un poco! El secreto no es una máquina sofisticada; es simplemente darle a los robots más tiempo para terminar sus frases".

El Gran Descubrimiento: Más Palabras, Menos Pensamiento

Los investigadores probaron un montón de estrategias diferentes en un conjunto masivo de preguntas de exámenes (11 idiomas diferentes, 20 materias) para ver qué es lo que realmente ayuda a estos pequeños robots a mejorar su razonamiento. Descubrieron que lo más importante no era qué tan inteligente fuera el método de búsqueda, sino qué tan largo se le permitía hablar al robot antes de tener que detenerse.

Piénsalo como un estudiante tomando un examen.

  • La Forma Antigua: Le dices al estudiante: "Piensa muy duro, revisa tu trabajo y escribe un ensayo perfecto", pero solo le das 1,000 palabras para hacerlo. Puede que haya descifrado la respuesta correcta en su mente, pero se queda sin espacio antes de que pueda escribir la letra final (A, B, C, D o E). Su razonamiento es correcto, pero reprueba el examen porque nunca llegó a comprometerse con una respuesta.
  • La Nueva Forma: Le dices al estudiante: "Simplemente escribe tus pensamientos, pero puedes usar hasta 2,048 palabras". De repente, tiene suficiente espacio para terminar su historia y realmente escribir la letra de la respuesta.

El artículo midió esto cuidadosamente. Cuando duplicaron el límite de palabras de 1,000 a 2,048 tokens, la precisión aumentó 3.7 puntos porcentuales. ¡Esa es una gran victoria! Pero cuando intentaron obtener más respuestas pidiéndole al robot que generara 16 cadenas de pensamiento distintas en lugar de 8 (duplicando el número de intentos), la puntuación solo subió un ínfimo 0.15 puntos porcentuales. Es como pedirle a un estudiante que escriba el mismo ensayo 16 veces en lugar de una; no ayuda mucho si ya estaba atrapado por el límite de palabras.

Lo que No Funcionó (Las Ideas "Geniales" que Fallaron)

Los investigadores probaron algunos trucos muy sofisticados que suenan como si deberían funcionar, pero los datos demostraron que no fue así.

  1. El Entrenador "Paso a Paso": Intentaron usar un modelo especial de Recompensa de Proceso (PRM) para actuar como un entrenador, revisando cada uno de los pasos del razonamiento del robot y guiándolo como una búsqueda de haz (beam search). Pensaron que esto sería mejor que dejar que el robot adivinara libremente. Resultado: En realidad funcionó peor que el método simple, bajando la puntuación en 0.39 puntos porcentuales mientras consumía 8.7 veces más potencia de cómputo. Resulta que el entrenador se confundía con las imágenes y no podía redirigir al robot por el camino correcto.
  2. El Robot "Juez": Intentaron añadir un segundo robot para que actuara como juez, leyendo todas las respuestas y eligiendo la mejor. Probaron dos tipos: uno entrenado para ser un crítico y otro que era simplemente un modelo generativo inteligente. Resultado: Ninguno superó al método simple de tomar una "votación por mayoría" (elegir la respuesta que aparecía con más frecuencia). De hecho, con el robot más inteligente, los jueces hicieron que las cosas fueran ligeramente peores. El artículo sugiere que esto se debe a que los jueces no podían distinguir entre una respuesta correcta y una incorrecta cuando las respuestas eran muy similares.
  3. Autocorrección: Analizaron si dejar que el robot corrigiera sus propios errores ayudaba. Resultado: No. A esta escala, dejar que el robot reescribiera sus propias respuestas a menudo lo hacía peor.

El Verdadero Héroe: El Robot en sí Mismo

El mayor impulso no vino de una nueva estrategia en absoluto; vino de cambiar el robot. Cuando cambiaron de un modelo antiguo (Qwen2.5-VL-7B) a uno nuevo y más pequeño (Qwen3.5-4B), la puntuación saltó 11.4 puntos porcentuales. Esto sugiere que tener un "cerebro" más inteligente (el modelo de política) importa mucho más que tener un "proceso de pensamiento" (el método de búsqueda) sofisticado.

El Truco de "Reparación"

Hubo un pequeño fallo: a veces, incluso con suficientes palabras, el robot escribía una gran explicación pero olvidaba escribir la letra final (A, B, C, etc.). Los investigadores encontraron un sencillo truco de "reparación guiada": si el robot no escribía una letra, simplemente lo forzaban a decir "Respuesta: [A/B/C/D/E]" por un solo token. Esto solucionó el problema para el 2.67% restante de las preguntas que estaban fallando, cerrando efectivamente la brecha.

La Puntuación Final

Al combinar el nuevo robot (Qwen3.5-4B), darle un límite de palabras generoso (2,048 tokens), pedirle 16 intentos diferentes y usar el truco simple de "reparación", el equipo alcanzó un 84.1% de precisión en la prueba final. Esto los colocó en el primer lugar de la tabla de clasificación.

La Conclusión

La lección principal aquí es que para los modelos pequeños de visión y lenguaje, los detalles de ingeniería importan más que los algoritmos complejos. Si le das al modelo suficiente espacio para terminar su pensamiento (el presupuesto de tokens) y un prompt que lo obligue a comprometerse con una respuesta, obtendrás mejores resultados que si intentas superarlo con árboles de búsqueda complicados o jueces. El artículo sugiere que, hasta que tengamos mejores modelos, la mejor estrategia es simplemente dejar que el modelo hable más tiempo y corregir su formato, en lugar de intentar ser más listo que él con procesos de búsqueda o jueces complicados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →