← Últimos artículos
💻 computer science

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

El artículo presenta NC-GRPO (Noise-Contrastive GRPO), un método que diversifica los rollouts de aprendizaje por refuerzo para modelos de lenguaje y visión mediante la inyección de ruido calibrado en el espacio latente en lugar de en los píxeles, mejorando significamente el razonamiento fuera de dominio y la robustez ante alucinaciones mientras mantiene una huella de implementación mínima.

Autores originales: Michael Jerge, Joseph Pelczar, Justin Downes

Publicado 2026-08-25
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Michael Jerge, Joseph Pelczar, Justin Downes

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una computadora que puede mirar una imagen y responder una pregunta sobre ella, o leer un problema matemático escrito en palabras y resolverlo. Estos sistemas, conocidos como modelos de visión y lenguaje, son cada vez más capaces, pero aún cometen errores. A veces se equivocan porque no están pensando con suficiente cuidado; otras veces, afirman con seguridad cosas que simplemente no son ciertas, un problema llamado alucinación. Para enseñar a estos modelos a pensar mejor, los investigadores utilizan un método llamado aprendizaje por refuerzo. En este proceso, se le pide al modelo que genere muchos intentos diferentes para resolver un único problema. Si algunos intentos son correctos y otros erróneos, el modelo aprende a favorecer la trayectoria exitosa. Sin embargo, para que este aprendizaje funcione, los diferentes intentos deben ser realmente distintos entre sí. Si el modelo simplemente repite el mismo proceso de pensamiento una y otra vez, no aprende nada nuevo.

El desafío ha sido cómo obligar al modelo a explorar diferentes formas de pensar. Tradicionalmente, los investigadores han intentado agitar las cosas cambiando la temperatura del proceso de toma de decisiones de la computadora o distorsionando ligeramente la imagen de entrada, como añadir estática a una fotografía. Un nuevo estudio realizado por investigadores de Amazon Web Services sugiere que estos cambios externos podrían no ser la forma más efectiva de diversificar el pensamiento del modelo. En su lugar, proponen que la variación ocurra dentro de la propia representación interna del problema en el modelo, justo en el momento en que comienza a procesar la pregunta. Al inyectar una pequeña y controlada cantidad de ruido aleatorio en el estado mental oculto del modelo antes de que comience a generar una respuesta, descubrieron que podían crear un pensador más robusto y preciso.

Los investigadores desarrollaron una técnica que llaman Optimización de Política Relativa de Grupo de Contraste de Ruido (Noise-Contrastive Group Relative Policy Optimization). Para entender cómo funciona, imagina a un grupo de estudiantes tratando todos de resolver el mismo problema de geometría. En una sesión de entrenamiento estándar, cada estudiante podría resolverlo de forma ligeramente diferente por puro azar, pero todos parten de la misma comprensión exacta del problema. En este nuevo enfoque, la mitad de los estudiantes reciben un punto de partida ligeramente diferente. Los investigadores toman el estado interno del modelo —la forma en que ha codificado el problema en su "mente"— y añaden un pequeño sacudida aleatoria al estado para la mitad del grupo. Este sacudida no es un cambio a la imagen en sí, ni es un cambio a las palabras en la página. Es un cambio sutil en la perspectiva interna del modelo, como pedirle a un estudiante que mire el problema desde un ángulo ligeramente diferente antes de empezar a escribir.

El modelo genera entonces respuestas a partir de estos dos grupos: un grupo que parte de la comprensión normal y limpia, y el otro que parte de esta comprensión ruidosa y ligeramente desplazada. La clave reside en cómo el modelo aprende de los resultados. Si el grupo con el punto de partida ruidoso logra encontrar la respuesta correcta, a pesar de la confusión introducida al principio, el modelo es recompensado. Si el ruido hace que el modelo se desvíe y falle, esa trayectoria es penalizada. Con el tiempo, el modelo aprende a encontrar soluciones que son tan sólidas que funcionan incluso cuando el punto de partida es ligeramente inestable. No solo está aprendiendo la respuesta; está aprendiendo a ser robusto frente a pequeñas perturbaciones en su propio proceso de pensamiento.

Los resultados de este experimento fueron sorprendentes. Los investigadores probaron su método en un modelo grande de visión y lenguaje entrenado en problemas de geometría. Cuando compararon este nuevo método con el enfoque estándar y con la técnica anterior de distorsionar la imagen de entrada, el nuevo método produjo resultados significativamente mejores en problemas matemáticos difíciles e inéditos. El modelo se volvió mejor resolviendo problemas que nunca había visto, una capacidad conocida como razonamiento fuera del dominio (out-of-domain reasoning). Quizás de forma más sorprendente, también se volvió mejor evitando las alucinaciones. Mientras que el método anterior de distorsionar imágenes ayudaba al modelo a ver los detalles visuales con más claridad, a veces lo hacía peor en cuanto a adherirse a los hechos. El nuevo método, por el contrario, mejoró tanto el razonamiento como la honestidad del modelo al mismo tiempo.

El estudio también exploró qué es exactamente lo que hace que esta técnica funcione. Los investigadores probaron si el beneficio provenía de la dirección específica del ruido o simplemente del hecho de que el ruido fuera aleatorio. Descubrieron que la dirección no importaba. Ya fuera que el ruido empujara el pensamiento del modelo en una dirección u otra, el factor crítico era simplemente que cada intento partiera de un punto de vista único e independiente. También descubrieron que el tamaño del ruido actúa como un dial. Una pequeña cantidad de ruido mejoró el razonamiento del modelo sin perjudicar sus capacidades generales, pero demasiado ruido comenzó a degradar su rendimiento general. Esto sugiere que existe un punto óptimo donde el modelo se convierte en un mejor especialista en razonamiento sin perder su conocimiento general.

Uno de los hallazgos más importantes fue que este método funciona cambiando el estado interno del modelo, no alterando la imagen o el texto. Esto significa que la técnica podría aplicarse potencialmente a cualquier tipo de modelo que procese información, no solo a aquellos que miran imágenes. Los investigadores demostraron que el método es eficiente, requiriendo solo un pequeño cambio en el software que ejecuta el modelo, y no ralentiza el proceso de generación de respuestas. Al centrarse en el momento en que el modelo comienza a pensar, en lugar de en los datos que recibe, encontraron una forma de hacer que el razonamiento del modelo sea más fiable y menos propenso al error.

El estudio también analizó si este enfoque funciona para modelos de diferentes tamaños. Cuando probaron la misma técnica en una versión más pequeña del modelo, los beneficios desaparecieron. El modelo más pequeño no mejoró en su razonamiento, ni empeoró; simplemente no cambió. Esto sugiere que la técnica requiere un cierto nivel de complejidad en el modelo para ser efectiva. No es un truco de magia que funcione con cualquier computadora, sino una herramienta específica que ayuda a los sistemas más grandes y capaces a refinar su pensamiento. Los investigadores advierten cuidadosamente que, aunque los resultados son prometedores, solo han probado esto en una familia de modelos hasta ahora, y se necesita más trabajo para ver si funciona para otros.

En última instancia, esta investigación ofrece una nueva forma de pensar sobre cómo entrenamos la inteligencia artificial. En lugar de intentar que los datos de entrada sean más variados o que el proceso de toma de decisiones sea más caótico, los investigadores descubrieron que una perturbación interna precisa podía conducir a un resultado más estable e inteligente. Al enseñar al modelo a tener éxito incluso cuando su punto de partida es ligeramente erróneo, han creado un sistema que es menos propenso a ser engañado por sus propias incertidumbres. Este enfoque no solo hace al modelo más inteligente en matemáticas; hace que el modelo sea más confiable, capaz de distinguir entre una respuesta sólida y una conjetura segura. A medida que estos sistemas se integran más en nuestra vida diaria, encontrar formas de hacerlos más robustos y menos propensos al error es esencial, y este estudio proporciona un camino claro para lograr ese objetivo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →