← Últimos artículos
🤖 machine learning

Subspace Inference Enables Efficient Active Reward Learning from Preferences

Este artículo presenta PreferenceEKF, un método de aprendizaje activo con eficiencia de muestreo que aprovecha el filtrado de Kalman extendido dentro de un subespacio de parámetros de baja dimensión para permitir una cuantificación de la incertidumbre escalable para modelos de recompensa de redes neuronales, mejorando así la eficiencia y el rendimiento del aprendizaje por refuerzo a partir de la retroalimentación humana.

Autores originales: Yutai Zhou, Erdem Bıyık

Publicado 2026-09-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yutai Zhou, Erdem Bıyık

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, existe un desafío persistente conocido como la "ineficiencia de muestreo" del aprendizaje a partir de la retroalimentación humana. Imagine enseñar a un programa informático complejo a comportarse de una manera que se alinee con los valores humanos. El método más potente disponible actualmente consiste en pedir a las personas que comparen dos resultados diferentes —como dos movimientos de un robot o dos respuestas escritas— y que indiquen cuál prefieren. Aunque esta retroalimentación es fácil de proporcionar para los humanos, es increíblemente escasa; una sola preferencia proporciona solo una mínima fracción de información. Para construir un modelo fiable de lo que los humanos desean, un algoritmo debe realizar miles de estas preguntas. Si la computadora hace las preguntas equivocadas, pierde tiempo y dinero. Si hace las preguntas correctas, aprende mucho más rápido. La dificultad reside en saber qué preguntas serán las más informativas. Para hacer esto, la computadora necesita comprender lo que aún no sabe, un concepto llamado incertidumbre. Sin embargo, calcular esta incertidumbre para redes neuronales masivas y modernas es notoriamente difícil y computacionalmente costoso, requiriendo a menudo el entrenamiento de docenas de modelos separados solo para obtener una estimación aproximada.

Un equipo de investigadores de la Universidad del Sur de California ha desarrollado un nuevo enfoque para resolver este cuello de botella, permitiendo que las computadoras aprendan de las preferencias humanas con una velocidad y eficiencia mucho mayores. Introdujeron un método llamado PreferenceEKF, que trata el proceso de aprendizaje de preferencias como un problema de filtrado continuo y paso a paso, en lugar de un cálculo masivo y único. En lugar de intentar mapear todas las variaciones posibles de una red neuronal gigante a la vez, los investigadores se dieron cuenta de que el comportamiento de la red podía rastrearsese con precisión dentro de un espacio mucho más pequeño y de menor dimensión. Al centrar sus cálculos en este subespacio compacto, pudieron utilizar una herramienta matemática clásica, el filtro de Kalman extendido, para actualizar la comprensión del modelo en tiempo real a medida que llegaban las nuevas respuestas. Esta técnica les permitió generar miles de versiones diferentes del modelo de recompensa instantáneamente, sin el pesado costo computacional de entrenar múltiples redes independientes.

Los investigadores probaron su método contra varias técnicas existentes utilizando una variedad de estándares de referencia para el control robótico y la toma de decisiones. Encontraron que su enfoque no solo era significativamente más rápido —funcionando hasta cuarenta veces más rápido que algunas de las alternativas más avanzadas— sino también más preciso en sus predicciones. En experimentos donde el objetivo era aprender un modelo de recompensa a partir de un número limitado de comparaciones humanas, el nuevo método aprendió consistentemente las preferencias correctas utilizando menos preguntas que los otros métodos. Además, los modelos que produjo estaban mejor calibrados, lo que significa que la confianza de la computadora en sus respuestas coincidía más estrechamente con la precisión real de dichas respuestas. Esta precisión es vital para el aprendizaje activo, donde el sistema debe decidir qué pregunta hacer a continuación; si el sistema no está seguro, hace una pregunta para resolver esa incertidumbre, y si está seguro, continúa. El nuevo método destacó en este equilibrio, llevando a modelos de recompensa que podían entrenar con éxito políticas robóticas para realizar tareas complejas, igualando el rendimiento de las políticas entrenadas con métodos mucho más costosos y lentos.

Uno de los aspectos más sorprendentes de este trabajo es cómo cambia el flujo de trabajo de entrenamiento de estos sistemas. Los métodos tradicionales a menudo requieren que la computadora reentrene o reevalúe toda su comprensión del mundo cada vez que recibe una nueva pieza de retroalimentación, un proceso que se vuelve más lento a medida que el sistema crece. El nuevo método, por el contrario, actualiza su conocimiento de forma secuencial, incorporando solo la última pieza de información mientras mantiene una estimación continua de lo que ha aprendido hasta el momento. Esto permite que el sistema escale eficientemente, manejando redes neuronales más grandes y generando más muestras de posibles modelos de recompensa sin quedarse sin memoria o tiempo. Los investigadores también demostraron que este enfoque funciona incluso cuando se parte de cero datos iniciales, utilizando una técnica de proyección aleatoria para construir el subespacio necesario desde cero, y mostró potencial cuando se aplicó a tareas basadas en imágenes donde los datos de entrada son mucho más complejos que simples números.

Aunque el método muestra una gran promesa, los investigadores son cuidadosos al señalar sus límites. El marco matemático que utilizaron asume que las preferencias que se aprenden provienen de una fuente única y consistente. Cuando probaron el sistema con datos de múltiples anotadores humanos que podrían tener opiniones conflictivas, el método tuvo dificultades para capturar la complejidad total de esas opiniones divergentes. Esto sugiere que, si bien el enfoque es una herramienta poderosa para agilizar el proceso de aprendizaje, es más adecuado para escenarios donde se modela un conjunto de preferencias único y coherente. No obstante, los resultados indican un paso significativo para hacer que la inteligencia artificial sea más adaptable a la intención humana. Al hacer que el proceso de aprendizaje a partir de la retroalimentación sea más rápido y eficiente, este trabajo elimina una barrera importante para el despliegue de sistemas inteligentes en entornos del mundo real, desde recomendaciones personalizadas hasta robots autónomos, donde el costo del tiempo humano es alto y la necesidad de un aprendizaje rápido y preciso es crítica.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →