← Últimos artículos
🤖 machine learning

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

El artículo propone "Scaffolding Minds", un método que optimiza el razonamiento multimodal mediante la introducción de un codificador de andamiaje dedicado para obtener mejores representaciones de objetivos latentes en el ajuste fino supervisado y el aprendizaje tanto de la media como de la varianza para el muestreador de aprendizaje por refuerzo para permitir una exploración efectiva, superando significativamente a los modelos de referencia existentes en diversas tareas de razonamiento visual.

Autores originales: Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi

Publicado 2026-08-21
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La inteligencia artificial ha luchado durante mucho tiempo por ver el mundo de la misma manera que lo hacen los humanos. Cuando una computadora observa una imagen, a menudo puede identificar objetos, pero con frecuencia falla al comprender las relaciones entre ellos o al razonar a través de un rompecabezas visual complejo. Durante años, los investigadores han intentado solucionar esto enseñando a las máquinas a "pensar" en voz alta, obligándolas a escribir una explicación paso a paso en texto antes de dar una respuesta. Si bien esto ayuda, a menudo obliga a la máquina a traducir información visual rica y detallada en palabras torpes, perdiendo matices importantes en el proceso. Un enfoque más reciente intenta resolver esto permitiendo que la máquina mantenga sus pensamientos en un lenguaje interno y oculto: un flujo continuo de datos que existe únicamente dentro del cerebro de la computadora. Este método, conocido como razonamiento latente, permite al modelo conservar los detalles visuales sin tener que describirlos mediante oraciones. Sin embargo, incluso esta técnica avanzada se ha topado con un muro: los pensamientos internos que genera la máquina suelen basarse en herramientas genéricas y prefabricadas que no fueron diseñadas para el problema específico en cuestión, y la máquina tiene dificultades para explorar diferentes formas de pensar para encontrar la mejor solución.

Un equipo de investigadores de Google DeepMind y la Universidad de California, San Diego, ha desarrollado un nuevo marco llamado Scaffolding Minds para superar estos obstáculos. Su trabajo se centra en dos etapas específicas donde estos sistemas de razonamiento interno suelen fallar. Primero, durante la fase inicial de aprendizaje, la máquina suele ser enseñada a imitar la salida de un codificador de visión estándar y convencional, una herramienta entrenada con millones de imágenes generales para reconocer gatos, coches y paisajes. El problema es que esta herramienta genérica no está optimizada para la tarea de razonamiento específica que la máquina intenta resolver. Podría preservar detalles visuales irrelevantes mientras omite la evidencia crucial necesaria para resolver un rompecabezas. Segundo, cuando la máquina intenta mejorar mediante el ensayo y error, los métodos existentes a menudo la obligan a ceñirse rígidamente a un único camino de pensamiento o solo permiten que ajuste sus respuestas escritas, dejando el razonamiento visual interno sin cambios. Esto impide que la máquina descubra nuevas y mejores formas de resolver el problema.

Para solucionar esto, los investigadores introdujeron un sistema de dos partes que actúa como un guía construido a medida para los pensamientos internos de la máquina. En la primera etapa, en lugar de depender de una herramienta genaria, entrenaron un "codificador de andamiaje" (scaffolding encoder) dedicado. Piense en esto como un tutor especializado que aprende exactamente qué tipo de notas internas son más útiles para la tarea específica, en lugar de simplemente copiar un diccionario general. Este tutor toma una imagen de ayuda —un apoyo visual proporcionado solo durante el entrenamiento— y la convierte en un conjunto de tokens internos optimizados que están perfectamente ajustados para el desafío de razonamiento. Una vez que la máquina aprende a generar estas notas optimizadas por sí sola, el tutor es descartado y la máquina está lista para trabajar sin ayuda.

En la segunda etapa, los investigadores reemplazaron las reglas rígidas que suelen gobernar los pensamientos internos de la máquina con un muestreador flexible basado en el aprendizaje. En lugar de obligar a la máquina a mantenerse en una única trayectoria predeterminada, este nuevo método le permite muestrear diferentes variaciones de sus pensamientos internos durante la práctica. La máquina aprende a ajustar la "media" y la "varianza" de su pensamiento, explorando efectivamente un rango más amplio de posibilidades para ver qué trayectoria interna conduce a la respuesta correcta. Esta exploración es guiada por recompensas, alentando a la máquina a encontrar la trayectoria de razonamiento más efectiva en lugar de simplemente conformarse con la primera que encuentre.

Los resultados de este enfoque fueron probados en una serie de tareas de razonamiento visual desafiantes, incluyendo un juego de planificación espacial llamado FrozenLake, donde un personaje debe navegar a través de una cuadrícula de hielo y agujeros para alcanzar una meta. En la cuadrícula estándar de 8x8, el nuevo método mejoró la precisión de la máquina en un 9,5 por ciento en comparación con los intentos previos más sólidos. A medida que los rompecabezas se volvían más difíciles, con cuadrículas que se expandían a 32x32, la ventaja creció significamente, superando al mejor método anterior por un 19 por ciento. Los investigadores también probaron el sistema en otros nueve parámetros de referencia de razonamiento visual que requieren observación y comparación de grano fino. En todas estas pruebas, el método mejoró consistentemente el rendimiento, elevando la precisión promedio en un 5,2 por ciento.

El estudio descartó explícitamente la idea de que sea necesario generar nuevas imágenes durante el proceso de razonamiento para tener éxito. Otros métodos que intentan dibujar imágenes intermedias para ayudar a la máquina a pensar suelen sufrir de altos costos computacionales y velocidades más lentas. El enfoque Scaffolding Minds logró resultados superiores sin generar ninguna imagen adicional, demostrando que optimizar la representación visual interna y oculta es más efectivo que crear pasos intermedios visibles. Los investigadores encontraron que las dos mejoras —el tutor entrenado a medida para las notas internas y la exploración flexible de esas notas— funcionaban mejor cuando se utilizaban juntas. Sin el tutor personalizado, la exploración flexible no podía alcanzar todo su potencial, y sin la exploración, el tutor personalizado no podía refinar su camino hacia la mejor solución.

Este trabajo sugiere que la calidad del objetivo interno al que la máquina aspira es tan importante como el método que utiliza para llegar allí. Al enseñar a la máquina a generar sus propias notas internas optimizadas y luego permitirle explorar diferentes variaciones de esas notas, los investigadores han creado un sistema que puede razonar a través de problemas visuales complejos con mayor precisión y fiabilidad. Los hallazgos indican que los avances futuros en el razonamiento visual pueden depender menos de hacer que las máquinas "vean" más o "hablen" mejor, y más de enseñarles cómo estructurar sus pensamientos internos y ocultos de una manera que esté perfectamente alineada con la tarea en cuestión.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →