← Últimos artículos
⚡ electrical engineering

Privileged observations enable rapid and reliable policy discovery directly in the physical world

Este artículo demuestra que las observaciones privilegiadas de un sistema físico caótico son decisivas para permitir que los agentes de aprendizaje por refuerzo descubran rápidamente políticas de alto rendimiento directamente en el mundo real, ya que los agentes que carecen de tales datos de flujo no lograron aprender estrategias de aumento de la resistencia a pesar de haber aprendido con éxito estrategias de reducción de la misma.

Autores originales: Antonio Terpin, Raffaello D'Andrea

Publicado 2026-09-15
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Antonio Terpin, Raffaello D'Andrea

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina a un nadador intentando moverse a través del agua. Si pudiera ver las corrientes girando a su alrededor, podría aprender a retorcer su cuerpo de una manera que corte la resistencia, o quizás de una manera que atrape el agua para impulsarse hacia adelante. Esta es la esencia del control de flujo activo: un campo donde los ingenieros intentan manipular el movimiento invisible y caótico de los fluidos para mejorar cómo los objetos se mueven o permanecen quietos. Durante décadas, los científicos han sabido que hacer girar un cilindro en una corriente puede cambiar cuánta agua empuja contra él. A veces, un giro constante reduce la resistencia, permitiendo que el objeto se deslice con más facilidad. Otras veces, un giro rítmico específico puede, de hecho, aumentar la resistencia, frenando al objeto. El desafío siempre ha sido determinar el tiempo y la velocidad exactos de ese giro para obtener el mejor resultado, especialmente porque el flujo del agua es caótico y difícil de predecir.

Normalmente, cuando los ingenieros quieren enseñar a una computadora cómo controlar tal sistema, construyen un modelo virtual del agua y dejan que la computadora practique allí. Pero los modelos virtuales nunca son perfectos; pierden los detalles diminutos y desordenados del agua real. Por ello, un equipo de investigadores de la ETH Zürich decidió saltarse la simulación por completo. Construyeron un canal de agua físico y enseñaron a un agente informático a aprender directamente de la verdadera y agitada agua. La pregunta que plantearon fue simple pero profunda: para aprender la mejor manera de controlar el agua, ¿necesita la computadora ver el agua girar alrededor del objeto mientras está aprendiendo? ¿O puede descubrirlo simplemente sintiendo el empuje y el tirón sobre el objeto mismo?

Los investigadores instalaron un canal de agua de mesa, un tanque transparente donde el agua circula en un bucle. Dentro, un cilindro se encuentra en el flujo, y un motor puede hacer que gire a cualquier velocidad o dirección. Para medir qué tan bien el agua empuja contra el cilindro, utilizaron un sensor de par sensible. Para ver el agua, utilizaron una técnica llamada velocimetría de imágenes de partículas. Esto implica proyectar una lámina de láser a través del agua, que contiene diminutas partículas flotantes, y tomar fotografías rápidas. Al rastrear cómo se mueven esas partículas entre las fotos, una computadora puede construir un mapa detallado y en tiempo real de la velocidad y dirección del agua justo detrás del cilindro. Este mapa es la "observación privilegiada": información adicional que la computadora puede ver durante el entrenamiento, pero que podría no necesitar después.

Entrenaron a un agente de aprendizaje de propósito general, un tipo de inteligencia artificial, para controlar el cilindro. En un conjunto de experimentos, el agente recibió tanto la sensación de la resistencia como el mapa detallado del flujo de agua. En otro conjunto, el agente recibió solo la sensación de la resistencia, con el mapa del agua oculto. El objetivo era doble: primero, encontrar una forma de hacer girar el cilindro para reducir la resistencia tanto como sea posible, y segundo, encontrar una forma de hacerlo girar para aumentar la resistencia tanto como sea posible.

Los resultados fueron impactantes y revelaron una asimetría sorprendente. Cuando el agente tuvo acceso al mapa detallado del flujo de agua, aprendió increíblemente rápido. En cuestión de minutos de interactuar con el agua real, descubrió una estrategia para reducir la resistencia en aproximadamente un 32 por ciento. También encontró rápidamente una estrategia para aumentar la resistencia en un 25 por ciento. Estas cifras igualaron o incluso superaron ligeramente el rendimiento de las mejores estrategias diseñadas por humanos, las cuales se han desarrollado tras décadas de estudio.

Sin embargo, cuando los investigadores ocultaron el mapa del agua y obligaron al agente a aprender usando únicamente la medición de la resistencia, la historia cambió por completo. El agente todavía fue capaz de aprender cómo reducir la resistencia, logrando eventualmente una reducción de aproximadamente un 31 por ciento. Solo le tomó un poco más de tiempo y fue un poco variable. Pero cuando el objetivo era aumentar la resistencia, el agente falló. Sin ver el flujo del agua, ninguna de las ejecuciones de entrenamiento logró aprender una estrategia que aumentara significamente la resistencia; el agente no pudo comprender cómo hacer que el agua empujara con más fuerza, a pesar de que la mejor estrategia existía y era físicamente posible.

Para entender por qué sucedió esto, los investigadores observaron de cerca lo que el agua estaba haciendo. Descubrieron que cada vez que el cilindro comenzaba a girar, el agua casi siempre reaccionaba primero empujando menos contra el cilindro, independientemente de si el objetivo era empujar más o menos. Esta caída inicial de la resistencia es una respuesta física natural. Para el agente que intentaba reducir la resistencia, esta caída inicial era una señal útil de que estaba en el camino correcto. Pero para el agente que intentaba aumentar la resistencia, esta caída inicial era confusa; se sentía como lo opuesto de lo que quería lograr. Sin el mapa detallado del agua para ver el panorama general y comprender que la resistencia eventualmente subiría, el agente se quedó atrapado en este descenso inicial y nunca aprendió la estrategia correcta.

Los investigadores luego probaron si las estrategias que el agente aprendió con el mapa del agua podían usarse sin él. Registraron exactamente los patrones de giro que el agente utilizó cuando tenía el mapa, y luego reprodujeron esos mismos patrones como secuencias fijas, sin ninguna nueva observación. Sorprendentemente, estas secuencias fijas funcionaron tan bien como el agente vivo y pensante. El agente había aprendido un conjunto específico de movimientos que funcionaban tan bien que no necesitaba seguir observando el agua para ejecutarlos. Esto demuestra que el mapa del agua no era necesario para realizar la tarea, pero era absolutamente esencial para descubrir la tarea.

Este hallazgo resalta una distinción crucial en el aprendizaje: lo que necesitas para encontrar una solución es a menudo diferente de lo que necesitas para usarla. En este caso, la vista rica y detallada del flujo del agua actuó como un maestro, guiando al agente a través de las reacciones iniciales confusas del fluido. Una vez que el agente encontró el camino correcto, pudo recorrerlo con los ojos vendados. El estudio sugiere que, en sistemas físicos complejos, tener acceso a información adicional durante la fase de aprendizaje puede ser el factor decisivo entre el éxito y el fracaso, incluso si esa información no está disponible cuando el sistema está funcionando realmente. Demuestra que, para que la inteligencia artificial domine el mundo real, caótico y desordenado, es posible que necesite que se le permita ver más de lo que jamás se le permitirá usar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →