← Últimos artículos
🤖 machine learning

Corruption Robust Offline Reinforcement Learning with Human Feedback

Este artículo introduce los primeros algoritmos de aprendizaje por refuerzo fuera de línea con retroalimentación humana (RLHF) demostrablemente robustos que pueden identificar políticas casi óptimas a partir de conjuntos de datos que contienen una fracción ε\varepsilon de pares de trayectoria-retroalimentación corruptos mediante el aprendizaje de modelos de recompensa con conjuntos de confianza y el aprovechamiento de la optimización pesimista a través de oráculos de RL resistentes a la corrupción.

Autores originales: Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

Publicado 2026-07-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot a jugar un videojuego complejo. Normalmente, dejarías que el robot juegue, observarías lo que hace y le dirías: "¡Buen trabajo!" o "¡Mal trabajo!" basándote en qué tan bien se desempeña. Esto es el Aprendizaje por Refuerzo a partir de la Retroalimentación Humana (RLHF).

Sin embargo, en el mundo real, los datos que recolectas no son perfectos. A veces, la persona que da la retroalimentación está cansada y comete errores (ruido). A veces, un hacker malintencionado podría cambiar deliberadamente las etiquetas de "Bueno" y "Malo" para engañar al robot (corrupción).

Este artículo aborda un problema específico y difícil: ¿Cómo se le enseña a un robot a jugar bien utilizando un conjunto de datos que está parcialmente envenenado o corrompido, sin permitir que el robot vuelva a jugar nunca más (Offline)?

Aquí hay un desgico simple de su solución, utilizando algunas analogías creativas.

El Problema Central: El "Libro de Recetas Envenenado"

Imagina que quieres aprender a hornear el pastel perfecto. Tienes un libro de recetas (el conjunto de datos) con 1,000 recetas. Pero, un adversario se ha colado y ha cambiado el 10% de las recetas. Algunas dicen "añadir sal" cuando deberían decir "añadir azúcar", y algunos ingredientes están listados incorrectamente.

Si simplemente sigues el libro a ciegas, hornearás un pastel terrible. Si intentas aprender horneando y probando (RL Online), podrías enfermarte o desperdiciar muchos ingredientes. Los autores quieren un método para mirar este libro envenenado, determinar qué recetas son probablemente reales y enseñar al robot la mejor manera de hornear sin siquiera entrar en una cocina.

La Estrategia de Tres Pasos

Los autores proponen un proceso de "detective" de tres pasos para resolver esto:

1. El "Detector de la Verdad" (Aprendizaje de Recompensa Robusto)

Primero, el robot necesita entender qué es "bueno". En el artículo, esto se llama aprender un Modelo de Recompensa.

  • La Analogía: Imagina que estás tratando de adivinar el precio real de una casa basándote en una lista de ventas. Algunas entradas son falsas (por ejemplo, una mansión listada por $50).
  • El Método: En lugar de promediar todos los precios (lo que se vería sesgado por los falsos), los autores utilizan una técnica llamada Máxima Verosimilitud Recortada (Trimmed Maximum Likelihood). Piensa en esto como un filtro inteligente que dice: "Voy a ignorar el 10% de los números más extraños y sospechosos y solo confiaré en el 90% central". Esto les da una estimación "limpia" de lo que los humanos realmente prefieren, incluso si algunos datos están mintiendo.

2. La "Red de Seguridad" (Conjuntos de Confianza)

Una vez que tienen una "mejor suposición" de la verdadera recompensa, no confían en ella ciegamente. Construyen un Conjunto de Confianza.

  • La Analogía: Imagina que el detective dice: "Estoy 95% seguro de que el asesino está en este vecindario específico". Dibujan un círculo alrededor de ese vecindario. Saben que el asesino está en algún lugar dentro de ese círculo, pero no están seguros de su ubicación exacta.
  • El Método: Crean una "burbuja" matemática alrededor de su estimación de recompensa. Saben que la verdadera recompensa está dentro de esta burbuja, incluso si no conocen el centro exacto.

3. El "Planificador Cauteloso" (Política Pesimista)

Ahora, el robot debe decidir qué movimientos realizar. Dado que los datos están corrompidos, el robot debe ser pesimista (cauteloso).

  • La Analogía: Imagina que estás caminando por un bosque con niebla donde algunos caminos están marcados como "Seguros" pero podrían ser trampas. Un excursionista cauteloso no elegiría simplemente el camino que parece mejor; elegiría el camino que sea más seguro incluso en el peor de los escenarios dentro de la zona de niebla.
  • El Método: El robot observa cada posible camino dentro de la "Red de Seguridad" (el conjunto de confianza) y pregunta: "¿Cuál es la peor recompensa que podría obtener si tomo este camino?". Luego, elige el camino que maximiza esta peor recompensa. Esto asegura que, incluso si los datos estuvieron ligeramente corrompidos, el robot no cometa un error catastrófico.

Tres Estrategias de "Terreno" Diferentes

El artículo se da cuenta de que no todos los conjuntos de datos son iguales. Algunos son muy ricos (tienes datos para cada movimiento posible), mientras que otros son escasos (solo tienes datos para unos pocos movimientos). Diseñaron tres algoritmos diferentes dependiendo del "terreno" de los datos:

  1. Cobertura Uniforme (El "Mapa Rico"):

    • Escenario: Tienes datos que cubren cada rincón del mundo del juego.
    • Resultado: El robot puede aprender casi perfectamente, con muy poco error, incluso con corrupción. Es como tener un mapa completo de alta resolución donde puedes identificar fácilmente los caminos falsos.
  2. Número de Condición Relativo Bajo (El "Mapa Rugoso"):

    • Escenario: No tienes datos para cada rincón, pero los datos que tienes son algo representativos de todo el mundo.
    • Resultado: El robot utiliza un "oráculo de orden cero". Piensa en esto como un excursionista ciego que solo puede sentir el suelo bajo sus pies para adivinar la pendiente. Es más lento y menos preciso, pero sigue siendo seguro de forma demostrable. El error es un poco más alto (depende de la raíz cuadrada de la corrupción).
  3. Cobertura Generalizada Acotada (El "Mapa Inteligente"):

    • Escenario: Los datos son escasos pero siguen un patrón específico y predecible.
    • Resultado: El robot utiliza un "oráculo de primer orden". Esto es como un excursionista que no solo puede sentir el suelo, sino que también puede ver la pendiente adelante. Esto permite que el robot sea mucho más eficiente, logrando una tasa de error mucho mejor (proporcional a la raíz cuadrada de la corrupción) con menos puntos de datos.

La Gran Conclusión

El principal logro del artículo es demostrar que puedes garantizar matemáticamente que un robot aprenderá una buena estrategia a partir de datos corruptos, siempre que utilices estas técnicas específicas de "cautela" y "filtrado".

No se limitaron a decir: "Probablemente funciona". Construyeron un escudo matemático que demuestra: "Incluso si el 10% de tus datos te miente, nuestro método encontrará una estrategia que es casi tan buena como si tuvieras datos perfectos".

Esta es la primera vez que se hace una garantía tan rigurosa específicamente para el aprendizaje offline con retroalimentación humana en presencia de ataques adversarios. Es como darle a un robot unas "gafas de la verdad" que le permiten ver a través de las mentiras en su manual de entrenamiento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →