← Últimos artículos
🤖 AI

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

Este artículo demuestra que, si bien la Selección Basada en Perturbaciones (Pgs) parece superar al voto de mayoría en el escalado en tiempo de prueba de visión y lenguaje, sus ganancias aparentes son en gran medida un artefacto de formatos de decodificación no controlados, ya que un control con formato emparejado revela que la consistencia de la perturbación por sí sola no es una señal de selección fiable una vez que los presupuestos y formatos de decodificación están debidamente alineados.

Autores originales: Puzhuo Zheng, Hasan Kurban

Publicado 2026-08-04
📖 4 min de lectura☕ Lectura para el café

Autores originales: Puzhuo Zheng, Hasan Kurban

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot superinteligente cómo resolver acertijos. En el mundo de la inteligencia artificial, existe un truco ingenioso llamado "escalado en tiempo de prueba" (test-time scaling). En lugar de pedirle al robot que resuelva un problema una sola vez y esperar lo mejor, le pides que intente muchas soluciones diferentes al mismo tiempo. Luego, tú actúas como un juez y eliges la mejor respuesta del montón. Para los robots que solo procesan texto, esto funciona como por arte de magia: si el robot piensa profundamente y genera diez respuestas diferentes, la que aparece con más frecuencia suele ser la correcta. Es como hacerle una pregunta de matemáticas a una sala llena de personas; si nueve personas dicen "42" y una dice "43", probablemente te quedes con el "42".

Pero cuando les das ojos a estos robots (convirtiéndolos en "Modelos de Lenguaje-Visión" o VLM), las cosas se complican. Estos robots pueden ver imágenes, pero también tienen el fuerte hábito de adivinar basándose en lo que han oído antes, ignorando la imagen real. A veces, el robot ve la foto de una hoja pero adivina "semilla" porque recuerda una historia sobre semillas que crecen hasta convertirse en árboles. El viejo truco de simplemente elegir la respuesta más común falla aquí porque el robot podría adivinar con confianza la misma cosa incorrecta diez veces seguidas. Los científicos han estado tratando de arreglar esto haciendo que el robot "vuelva a revisar" su trabajo, pero un nuevo estudio plantea una pregunta muy importante: ¿Está el robot realmente mirando la imagen, o solo está usando una forma diferente de hablar?

Este artículo investiga un nuevo método llamado Selección Basada en Perturbación (Pgs). La idea detrás de Pgs es simple y lúdica: para ver si el robot realmente está mirando la imagen, alteras ligeramente la foto —recortándola, cambiando el brillo o enmascarando el fondo— y le pides al robot que resuelva el problema de nuevo. Si el robot sigue dando la misma respuesta incluso cuando la imagen cambia un poco, el método asume que la respuesta está "fundamentada" en la imagen. Si la respuesta cambia drásticamente, el método asume que el robot solo estaba adivinando basándose en su memoria. Los investigadores querían ver si este "test de vibración" (jitter test) podía ayudar a elegir la respuesta correcta mejor que el viejo método de la "respuesta más común".

Sin embargo, los investigadores descubrieron un problema astuto en la forma en que se realizaban estas pruebas usualmente. El nuevo método (Pgs) pedía al robot dar respuestas cortas y rápidas al verificar las imágenes alteradas, mientras que el viejo método (Votación por Mayoría) pedía pasos de pensamiento largos y detallados (llamados Cadena de Pensamiento o Chain-of-Thought) para la imagen original. Resulta que pedir respuestas cortas es simplemente más fácil de acertar para el robot, independientemente de si está mirando una imagen alterada o no.

Para solucionar esto, el equipo creó una comparación justa llamada MatchedCtrl. Le dieron al robot el mismo número de respuestas cortas y rápidas, pero esta vez no alteraron la imagen en absoluto; simplemente le pidieron al robot que respondiera a la imagen original rápidamente. Cuando compararon el "método de vibración" (Pgs) contra este "método de respuesta corta justo" (MatchedCtrl), la magia desapareció. El método de vibración no eligió mejores respuestas en realidad. De hecho, en una prueba difícil llamada ViLP, el método de vibración a veces funcionó peor.

El artículo muestra que, si bien la "vibración" sí crea una diferencia mensurable en cómo se comporta el robot (el robot reacciona a los cambios en la imagen), esta reacción no ayuda realmente al robot a elegir la respuesta correcta mejor que simplemente pedirle más intentos de respuestas cortas y rápidas sobre la imagen original. La gran ganancia que algunos vieron anteriormente (hasta +31.8 puntos en una prueba) no fue porque el robot estuviera mirando la imagen con más cuidado, sino porque estaba respondiendo en un formato diferente y más corto.

Al final, los autores concluyen que simplemente pedirle a un robot que vuelva a responder una imagen ligeramente alterada no es una forma fiable de obligarlo a mirar la imagen si ya estás controlando la forma en que el robot responde. La señal de "vibración" es real, pero no es un interruptor mágico que hace al robot más inteligente. Para mejorar realmente a estos robots, es posible que necesitemos encontrar una forma de hacer que miren la imagen que no dependa solo de cómo formatean sus respuestas. El estudio sugiere que, hasta que encontremos una mejor manera, debemos ser muy cuidadosos al afirmar que un nuevo método funciona solo porque supera la vieja regla de la "respuesta más común" sin una comparación justa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →