Learning the Value Systems of Societies with Preference-based Multi-objective Reinforcement Learning
Este artículo propone un marco de aprendizaje por refuerzo multiobjetivo basado en preferencias que agrupa agentes para aprender conjuntamente modelos de alineación de valores derivados socialmente y sistemas de valores distintos, lo que permite la generación de políticas óptimas de Pareto que se adaptan a diversas preferencias de usuarios dentro de una sociedad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La "IA Diplomática": Cómo las máquinas aprenden a comprender los distintos valores de una sociedad
Imagínese que construye un nuevo asistente digital altamente inteligente para una ciudad entera. El problema: las personas en esta ciudad no son todas iguales.
En un grupo hay los "fans de la seguridad": quieren que la IA actúe con mucha precaución, incluso si eso lleva más tiempo. En otro grupo hay los "adictos a la eficiencia": les da igual si es un poco arriesgado, siempre que se alcance el objetivo rápidamente. Y luego están los "protectores del medio ambiente", para quienes la sostenibilidad es lo más importante.
Si la IA ahora tuviera simplemente un modo estándar, molestaría constantemente a alguien. Sería demasiado lenta para los adictos a la eficiencia o demasiado descuidada para los fans de la seguridad.
El problema: El "dilema del guiso único"
Las IAs anteriores a menudo intentan encontrar un "valor promedio". Es como si en un restaurante se cocinara para todos los huéspedes solo una sopa, que tenga un sabor "mediocre": ni demasiado salada, ni demasiado dulce, pero al final no es realmente deliciosa para nadie. En la jerga técnica, esto se llama "especificación errónea".
La solución de los investigadores: El "modelo de agrupación"
Los investigadores (Holgado-Sánchez y su equipo) han desarrollado un nuevo enfoque. En lugar de intentar meter a todas las personas en una misma olla, su IA funciona como un hábil diplomático o un sociólogo.
La IA procede en tres pasos:
- El mapa de valores (Fundamentación): Primero, la IA aprende qué significan realmente los términos. ¿Qué significa "seguridad" en una situación real? Aprende el "lenguaje de los valores".
- La formación de grupos (Agrupación): La IA observa a las personas. Se da cuenta: "Ah, el 30 % de estas personas piensa de manera similar, el otro 20 % también". Forma grupos invisibles (clústeres). No dice: "Conozco a cada individuo", sino: "Reconozco los distintos diseños de vida en esta sociedad".
- Los comportamientos a medida (Política): Para cada uno de estos grupos, la IA desarrolla su propia "estrategia". Si la IA sabe que está trabajando para el "grupo de seguridad", cambia automáticamente al modo cauteloso.
¿Cómo aprende la IA esto? (El "juego de preguntas y respuestas")
La IA no aprende mediante la memorización mecánica, sino mediante comparaciones. Muestra a las personas dos caminos diferentes (por ejemplo, dos rutas distintas para un coche autónomo) y pregunta: "¿Qué camino te parece mejor?".
Las personas no solo responden con "El camino A es mejor", sino que también dicen: "El camino A es mejor porque es más seguro". De este modo, la IA entiende no solo el qué, sino también el por qué. Es como un niño que no solo aprende que el fuego quema, sino que también entiende por qué no debería tocarlo.
¿Por qué es esto importante?
En el futuro, las IAs tomarán decisiones en nuestras ciudades, en nuestros coches y en nuestros hospitales. Para que podamos confiar en estas máquinas, no deben actuar ciegamente según un algoritmo rígido. Deben respetar la diversidad de nuestra sociedad.
Los investigadores han demostrado con este sistema que una IA puede aprender a reconocer las distintas "nubes de valores" de una sociedad y encontrar el comportamiento adecuado y justo para cada nube.
En resumen: La IA no solo aprende a resolver tareas, sino que aprende a leer el "mapa moral" de las personas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.