← Últimos artículos
💻 computer science

Risk-Aware Preference Learning for Stochastic Outcomes

Este artículo demuestra que la incorporación de la Teoría de la Perspectiva Acumulativa para modelar la sensibilidad al riesgo humano mejora significativamente la recuperación de la función de recompensa y reduce el arrepentimiento en el aprendizaje de preferencias para la navegación robótica estocástica en comparación con los supuestos tradicionales de utilidad esperada.

Autores originales: Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

Publicado 2026-07-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo comportarse como un humano educado. No puedes simplemente escribir una larga lista de reglas como "no golpees a la gente" o "camina rápido", porque la vida es desordenada y está llena de sorpresas. En su lugar, los científicos han descubierto un truco ingenioso: mostrarle al robot dos formas diferentes de moverse y preguntarle a un humano, "¿Cuál de las dos se ve mejor?". Al hacer esto miles de veces, el robot puede aprender una "tarjeta de puntuación" oculta de lo que los humanos realmente valoran. Esto se llama aprendizaje de recompensa basado en preferencias.

Sin embargo, hay un supuesto complicado escondido en segundo plano en la mayoría de estos estudios. Este asume que los humanos son como calculadoras perfectas que simplemente suman las partes buenas y malas de una situación, ponderándolas según la probabilidad de que ocurran. Esto se llama Utilidad Esperada. Pero los humanos reales no somos calculadoras; somos emocionales. Nos preocupamos demasiado por los desastres poco comunes (como un choque de autos) y odiamos perder cosas más de lo que amamos ganarlas. Este artículo plantea una pregunta simple: ¿Qué pasa si enseñamos a un robot utilizando un modelo que asume que los humanos son calculadoras perfectas, cuando los humanos son en realidad tomadores de decisiones con aversión al riesgo y emocionales?

Los investigadores de la Universidad de Colorado Boulder decidieron probar esta idea en un mundo simulado donde un robot tiene que navegar a través de una multitud de peatones. En este mundo, cada movimiento que el robot realiza no es un camino único y garantizado. En su lugar, es como lanzar un dado: el robot podría deslizarse suavemente, o podría chocar con alguien, o podría quedarse atascado. El resultado es una nube de posibilidades, no una línea recta.

El equipo configuró un experimento digital con dos tipos de "maestros" (los humanos cuyas preferencias intenta aprender el robot). Un maestro era un "calculador perfecto" que solo se preocupaba por el resultado promedio (Utilidad Esperada). El otro maestro era un humano "sensible al riesgo" que utilizaba un modelo psicológico complejo llamado Teoría de la Perspectiva Acumulativa (CPT). Este modelo tiene en cuenta cómo las personas reales sobreestiman la probabilidad de eventos raros y aterradores, y sienten el dolor de una colisión de forma mucho más aguda que la alegría de un camino fluido.

Los investigadores luego entrenaron dos tipos de "estudiantes" (los algoritmos de aprendizaje). Un estudiante asumía que el maestro era un calculador perfecto (el aprendiz de UE), mientras que el otro estudiante asumía que el maestro era un humano sensible al riesgo (el aprendiz de CPT). Alimentaron a ambos estudiantes con miles de preguntas de "¿qué camino es mejor?" generadas por los maestros y observaron qué tan bien aprendían la verdadera tarjeta de puntuación.

Esto fue lo que encontraron en sus simulaciones. Cuando el maestro era un calculador perfecto, el estudiante calculador aprendía perfectamente, mientras que el estudiante sensible al riesgo se confundía un poco por la complejidad adicional. Pero cuando el maestro era un humano sensible al riesgo, el estudiante calculador funcionaba significativamente peor. Intentaba explicar el miedo del humano a los choques poco comunes distorsionando la tarjeta de puntuación recuperada, haciendo que el robot pensara que las colisiones eran solo "un poco malas" en lugar de "catastróficas", lo que resultaba en una recompensa sesgada. El robot aprendió una lección menos precisa.

En contraste, el estudiante sensible al riesgo (el aprendiz de CPT) funcionaba mucho mejor. Se dio cuenta de que el humano no solo valoraba el resultado de manera diferente; estaba ponderando la incertidumbre de manera diferente. Al separar el "valor" del resultado de la "sensación de miedo" ante el riesgo, el aprendiz de CPT recuperó una tarjeta de puntuación con un error sustancialmente menor que el estudiante calculador.

El artículo sugiere que si queremos que los robots sean seguros y estén alineados con los valores humanos en el mundo real —donde los accidentes poco comunes son aterradores y las personas son naturalmente ansiosas por ellos— no podemos simplemente asumir que los humanos son máquinas matemáticas lógicas. Necesitamos construir robots que entiendan el miedo humano y la sensibilidad al riesgo, o de lo contrario podrían aprender a tomar atajos peligrosos porque piensan que no nos importa el riesgo. Si bien este resultado proviene de simulaciones por computadora y no de personas reales probando robots reales, la evidencia apunta a una necesidad clara: para enseñar a los robots a ser seguros, primero debemos enseñarles cómo se sienten realmente los humanos ante lo desconocido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →