← Últimos artículos
💬 NLP

Are Language Models Sensitive to Morally Irrelevant Distractors?

Este estudio investiga si los modelos de lenguaje presentan sesgos morales similares a los humanos al demostrar que la introducción de distractores situacionales irrelevantes puede alterar sus juicios morales en más de un 30%.

Autores originales: Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

Publicado 2026-02-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¿Son los modelos de IA "caprichosos"? El estudio de los distractores morales

Imagina que eres un juez muy serio y justo. Tienes que decidir si alguien cometió una falta o no. Pero, justo antes de dar tu veredicto, alguien entra en la sala y empieza a oler un rollo de canela recién horneado, o de repente empieza a sonar un taladro muy fuerte y molesto afuera.

¿Crees que tu juicio seguiría siendo igual de frío y objetivo, o ese pequeño detalle (que no tiene nada que ver con el caso) te pondría de mal humor o te haría sentir demasiado relajado?

De eso trata este estudio.

El problema: La ilusión de la estabilidad

Hasta ahora, los científicos pensaban que la Inteligencia Artificial (como ChatGPT o Llama) era como un libro de leyes: si le haces la misma pregunta moral, siempre te dará la misma respuesta "correcta". Pensaban que la IA tenía valores estables, como si tuviera una brújula moral fija en su interior.

Pero este grupo de investigadores de la Universidad de Washington y Johns Hopkins sospechaba algo distinto. Se inspiraron en la "situacionismo" de la psicología humana, que dice que los humanos no somos tan estables como creemos: nuestro humor y nuestro entorno nos cambian el juicio sin que nos demos cuenta.

El experimento: "El ruido de fondo"

Los investigadores crearon lo que llamaron "distractores morales". Son cosas que no tienen nada que ver con el dilema ético, pero que transmiten una emoción. Por ejemplo:

  • Un distractor positivo: Una descripción de un picnic agradable o una foto de un paisaje hermoso.
  • Un distractor negativo: Una descripción de un olor desagradable o una foto de basura.

Luego, le dieron a la IA un problema moral (por ejemplo: "¿Es malo mentir para proteger a un amigo?") pero le "inyectaron" estos distractores antes de la pregunta.

Los resultados: La IA es "influenciable"

Los resultados fueron sorprendentes. La IA no es una brújula fija; es más bien como un camaleón emocional:

  1. El efecto del "mal humor": Cuando la IA leía algo negativo (como el olor a basura), se volvía mucho más severa y "mala". Sus respuestas morales se volvían menos generosas y más críticas, incluso en situaciones donde la respuesta correcta era obvia. ¡El cambio llegó a ser de más del 30%!
  2. El efecto del "buen humor": Cuando el contexto era positivo, la IA tendía a ser más amable y pro-social.
  3. No importa el tamaño: No importa si la IA es pequeña o gigante; todas mostraron este comportamiento de "dejarse llevar" por el ambiente.

¿Por qué es esto importante? (La analogía del conductor)

Imagina que estás diseñando un coche autónomo. Quieres que sea seguro y siga las reglas. Pero este estudio nos dice que, si el coche "siente" que el ambiente es tenso o negativo, podría empezar a conducir de forma más agresiva, aunque las reglas de tráfico no hayan cambiado.

Si vamos a usar la IA para cosas delicadas —como dar consejos de salud mental o moderar contenido en redes sociales—, no podemos asumir que siempre será "justa". Si el usuario está usando palabras negativas o el contexto es sombrío, la IA podría perder su brújula moral.

La conclusión: La responsabilidad es de los arquitectos

El estudio concluye que la responsabilidad no es de la IA (que no es una persona con alma), sino de los diseñadores.

Así como un juez debe ser protegido del ruido exterior para decidir bien, los desarrolladores deben diseñar sistemas que "limpien" estos distractores o que preparen a la IA para que no se deje llevar por el "olor a basura" del contexto. No basta con enseñarle qué es lo bueno y lo malo; hay que enseñarle a mantenerse firme cuando el entorno se pone feo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →