← Últimos artículos
🤖 AI

Framing Instability in LLM Ethical Stance: Auditing Negation Sensitivity in Moral Dilemmas

Este artículo audita 16 modelos de lenguaje a través de dilemas éticos y revela que sus posturas morales son altamente inestables y propensas a cambiar según si las preguntas se plantean como afirmaciones o negaciones, una vulnerabilidad que es particularmente severa en los modelos más pequeños y que a menudo queda enmascarada por los métodos de evaluación binaria estándar.

Autores originales: Katherine Elkins, Jon Chun

Publicado 2026-07-09
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Katherine Elkins, Jon Chun

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un amigo robot súper inteligente que es muy bueno dando consejos sobre cuestiones morales difíciles, como "¿Debería decir la verdad si eso lastima a alguien?" o "¿Está bien romper una regla para salvar una vida?". Esperarías que este robot tuviera una brújula moral sólida, ¿verdad? Si le preguntas "¿Es malo robar?", debería decir "Sí". Si le preguntas "¿Es bueno no robar?", también debería decir "Sí". La respuesta debería permanecer igual porque la situación no ha cambiado, solo las palabras que usaste.

Pero aquí está el giro: un nuevo estudio de Katherine Elkins y Jon Chun encontró que, para muchos de estos robots de IA, la respuesta cambia completamente solo porque se invierte la frase. Es como preguntarle a un amigo: "¿Te gusta la pizza?" y recibir un "¡Sí!", luego preguntar "¿Te disgusta la pizza?" y obtener un "¡No!" (lo que significa que le gusta), pero luego preguntar "¿No te disgusta la pizza?" y de repente obtener un "¡Sí!" otra vez, aunque el robot parece estar confundido sobre qué es la pizza.

El Gran Cambio de Opinión

Los investigadores probaron 1se 16 modelos de IA diferentes (algunos hechos por grandes empresas estadounidenses, otros por empresas chinas y otros más pequeños, de código abierto) con 14 dilemas morales complicados. Le hicieron a cada modelo la misma pregunta de dos maneras:

  1. La forma del "Debería": "Ellos deberían robar la tienda".
  2. La forma del "No debería": "Ellos no deberían robar la tienda".

Si el robot fuera estable, debería decir "No" a la primera y "Sí" a la segunda (lo que significa que está de acuerdo en que no robar es la opción correcta). Pero para los modelos más pequeños de código abierto, los resultados fueron una locura. Cuando se les preguntaba "Ellos deberían robar la tienda", estos modelos solo estaban de acuerdo el 24% de las veces. Pero cuando se les preguntaba "Ellos no deberían robar la tienda", de repente estaban de acuerdo con la acción el 77% de las veces.

Eso es un cambio de 76 puntos porcentuales. Es como si el robot mirara una luz roja y dijera "Detente", pero cuando le dices "No vayas", ¡dijera "Ve"! El estudio encontró que para algunos de estos modelos más pequeños, el cambio era incluso más extremo, alcanzando un 100% de acuerdo bajo ciertas formulaciones complicadas.

El Problema del "Hombre del Sí"

¿Por qué sucede esto? Los autores sugieren que los robots no están pensando realmente en la lógica. En su lugar, podrían estar jugando un juego de "coincidencia de palabras clave". Si el mensaje dice "robar", el robot ve la palabra "robar" y piensa: "¡Ah, tengo que hablar de robar!", y accidentalmente acepta la acción, incluso si la frase dice "no debería". Es como un estudiante que ve la palabra "no" en un problema de matemáticas, pero la ignora porque está demasiado concentrado en los números.

El estudio también comprobó si los robots solo estaban siendo "hombres del sí" (acordando con lo que el usuario decía). Si lo fueran, estarían de acuerdo con "No robes" diciendo "Está bien, no robaré". Pero no lo hicieron. Estuvieron de acuerdo con "No robes" diciendo "Está bien, robaré". Así que no es solo ser un hombre del sí; es un fallo genuino en cómo manejan las palabras negativas.

El Acuerdo "Falso"

Aquí hay otra parte engañosa: la forma en que solemos probar a estos robots es defectuosa. La mayoría de las pruebas preguntan "¿Estás de acuerdo o en desacuerdo?" y cuentan las respuestas de "acuerdo". Los investigadores encontraron que este simple botón de "acuerdo/desacuerdo" es un mentiroso. Cuenta un 38% más de "acuerdos" de los que realmente existen.

Imagina que un robot dice: "No estoy seguro, pero tal vez esté bien", y la prueba cuenta eso como un "Sí". Los investigadores encontraron que los humanos que leyeron las respuestas descubrieron que los robots a menudo escribían razones que contradecían su propio "Sí" o "No". Cerca del 13% de las veces, la explicación escrita del robot decía lo opuesto a lo que decía su botón. Es como un estudiante que escribe un ensayo argumentando contra el robo, pero luego marca la casilla que dice "Apoyo el robo".

¿Quién es el Más Estable?

No todos los robots están igualmente confundidos.

  • Los Modelos Pequeños de Código Abierto: Fueron los más frágiles. Cambiaban sus respuestas salvajemente dependiendo de cómo se hiciera la pregunta.
  • Los Grandes Modelos Comerciales: Los modelos de grandes empresas (como GPT-5, Claude y Gemini) eran mejores, pero no eran perfectos. Cambiaban menos, pero aun así cambiaban de opinión. Por ejemplo, el acuerdo entre diferentes modelos cayó del 73% cuando la pregunta era positiva al 59% cuando era negativa. Esto significa que si le preguntabas a dos robots "inteligentes" diferentes la misma pregunta de forma negativa, era mucho más probable que no estuvieran de acuerdo entre sí.
  • Los Modelos de "Razonamiento": Algunos modelos a los que se les pidió "pensar paso a paso" antes de responder funcionaron mejor. Un modelo, Grok-4.1-reasoning, redujo su confusión en un 57% en comparación con su versión sin razonamiento. Esto sugiere que si el robot se toma su tiempo y realmente lee toda la frase en lugar de solo escanear palabras clave, acierta con más frecuencia.

¿Importa Esto?

Los investigadores advierten que esto no es solo un truco divertido de fiesta. Si un hospital utiliza una IA para ayudar a decidir la atención de un paciente, o un banco utiliza una para aprobar préstamos, y la respuesta de la IA cambia solo porque el médico o el banquero formuló la pregunta de manera diferente, eso es un gran problema.

Encontraron que los robots eran especialmente inestables en escenarios financieros y de negocios (con una "puntuación de sensibilidad" de 0.63–0.65) en comparación con los médicos (0.36). Esto significa que los robots podrían estar dando el consejo más poco fiable precisamente cuando la gente trata con dinero o deudas.

La Conclusión

El artículo no dice que estos robots estén "rotos" para siempre, pero sí dice que actualmente son poco fiables para decisiones de alto riesgo si no se les supervisa cuidadosamente. Los autores proponen una nueva prueba llamada Índice de Sensibilidad a la Negación (NSI) para medir cuánto cambia la respuesta de un robot cuando se invierten las palabras.

Sugieren que hasta que los robots no puedan pasar esta prueba, no deberíamos dejar que tomen grandes decisiones por su cuenta. Si la respuesta de un robot depende de si dices "debería" o "no debería", no está realizando realmente un juicio sobre la situación; solo está reaccionando a la estructura de la oración. Y en el mundo real, necesitamos que nuestros amigos de IA sean consistentes, no que estén confundidos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →