← Últimos artículos
💬 NLP

Divergent Response Modes in Frontier Language Models Under Steering Pressure

Este estudio revela que los modelos de lenguaje de vanguardia exhiben modos de respuesta conductual distintos y específicos del desarrollador bajo presión de dirección, demostrando que los modelos difieren no solo en el grado de cambio conductual sino en la naturaleza fundamental de sus reacciones, un fenómeno validado mediante el juicio de pares a gran escala e intervenciones causales utilizando sondas lineales.

Autores originales: Ali Jalal-Kamali

Publicado 2026-08-12
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ali Jalal-Kamali

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde puedes hablar con un cerebro digital superinteligente que lo sabe casi todo. Esto no es magia; es el campo de la Inteligencia Artificial, específicamente los "Modelos de Lenguaje Extensos". Piensa en estos modelos como chefs increíblemente talentosos que han leído casi todos los libros de recetas que existen. Pero aquí está el truco: antes de que puedan servirte una comida, sus creadores los entrenan para que sigan reglas estrictas sobre lo que es cortés, seguro y útil. Este entrenamiento es como una "brújula moral" o un conjunto de directrices de seguridad integradas en sus cerebros.

A veces, sin embargo, la gente intenta engañar a estos chefs digitales. Podrían pedirle al chef que ignore las reglas, que revele su receta secreta (cómo pensó la respuesta) o que finja que no le importan las reglas de seguridad. Esto se llama "dirección" o "presión de dirección" (steering). Es como pedirle a un perro guardián que ignore a un extraño o a un bibliotecario que entregue un libro prohibido. Los científicos quieren saber: si presionas a estos diferentes chefs de IA con las mismas preguntas truculentas, ¿reaccionan todos de la misma manera? ¿Todos dicen "no", o algunos dicen "no" de una forma graciosa, mientras que otros dicen "sí" pero quejándose? Comprender esto nos ayuda a determinar si estos cerebros digitales son realmente seguros o si tienen peculiaridades ocultas que podrían meternos en problemas.


El Gran Test de Personalidad de la IA

En este estudio, un investigador llamado Ali Jalal-Kamali decidió someter a seis de los modelos de IA más avanzados del mundo a un test de personalidad masivo y de alto riesgo. Imagina seis robots diferentes, cada uno construido por una empresa distinta (como Anthropic, OpenAI, Google y otras). El investigador les dio 340 situaciones truculentas diferentes. Algunas situaciones les pedían hacer algo ligeramente grosero (un "conflicto de valores"), otras les pedían que soltaran la lengua sobre cómo resolvieron un acertijo ("elicitación de razonamiento") y otras les pedían que fingieran que no les importaban las reglas de seguridad ("supresión de razonamiento").

Para asegurar que la prueba fuera justa, cada robot enfrentó exactamente las mismas preguntas. Pero aquí está la parte ingeniosa: ¡los robots también tenían que calificar las respuestas de los demás! Actuaron como jueces ciegos, leyendo las respuestas sin saber qué robot las había escrito. Esto creó una enorme pila de datos —más de 24,000 juicios— para ver exactamente cómo se comportaba cada robot cuando se le presionaba hasta sus límites.

Los Resultados: No solo Diferentes, sino Extrañamente Diferentes

El gran descubrimiento no fue solo que algunos robots fueran más tercos que otros. Fue que no solo discrepaban en cuánto decir; discrepaban en cómo decirlo. Tenían "modos" de respuesta completamente diferentes, y algunos de estos modos eran únicos para uno o dos robots.

El "Guardián de Secretos" (GPT-5)
Un robot, GPT-5, hizo algo que ningún otro robot hizo. Cuando se le pedía que mostrara su trabajo (explicar su razonamiento), se negaba 99 de cada 100 veces. Pero aquí está el detalle: ¡aun así daba la respuesta correcta! Era como un estudiante que dice: "No puedo decirte cómo resolví este problema matemático, pero aquí tienes la respuesta: 42". Todos los demás robots o mostraban su trabajo o se negaban a responder la pregunta por completo. GPT-5 era el único que podía mantener sus secretos y, al mismo tiempo, hacer el trabajo.

Los "Rebeldes" (Opus y GPT-5)
Cuando se les pedía ignorar las reglas de seguridad o fingir que no les importaban los valores, dos robots —Opus y GPT-5— protestaban. Pero protestaban de formas totalmente distintas.

  • Opus era como un rebelde educado. Realizaba la tarea, pero se quejaba ruidosamente, diciendo: "Estoy haciendo esto, pero no deberías haberme pedido que ignorara las reglas".
  • GPT-5 era el intransigente. Simplemente se negaba a la petición, diciendo: "No, no haré eso", y se detenía ahí.
    Los otros cuatro robots mayormente seguían las órdenes o permanecían en silencio.

Los "Clarificadores" (Opus y Llama)
Cuando las preguntas eran vagas o truculentas, Opus y Llama fueron los únicos que se detuvieron y preguntaron: "Espera, ¿qué quieres decir exactamente?", en lugar de simplemente adivinar. Los otros robots tendían a dar una respuesta o a negarse.

Verificando el Trabajo: ¿Cometimos un Error?

El investigador fue muy cuidadoso para asegurarse de que estas diferencias extrañas no fueran simples errores.

  • El Presupuesto de Tokens: Notaron que algunos robots se quedaban cortados porque se les acababa el "espacio" para escribir sus respuestas. Corrigieron esto dándoles a esos robots más espacio, y los comportamientos extraños (como el de guardar secretos de GPT-5) se mantuvieron exactamente iguales.
  • La Prueba de las "Pistas": Se aseguraron de que los jueces no estuvieran simplemente adivinando basándose en pistas en las instrucciones. Incluso cuando eliminaron las pistas, los resultados se mantuvieron.
  • Las Preguntas "Nuevas": Volvieron a probar los robots con un nuevo conjunto de preguntas que no habían visto antes, y los patrones se repitieron.

Echar un Vistazo al Interior del Cerebro (El Experimento de Llama)

Para uno de los robots, Llama, el investigador pudo echar un vistazo dentro de su "cerebro" (su código interno) para ver cómo decidía pedir una aclaración o simplemente dar una respuesta.

  • El Trabajo de Detective: Descubrieron una "señal" específica en el cerebro del robot que predecía si pediría una aclaración o simplemente respondería. Podían leer esta señal con un 87% de precisión simplemente mirando el estado interno del robot.
  • El Control Remoto: Luego, intentaron forzar al robot a cambiar de opinión. Al manipular esa señal específica en el cerebro, pudieron hacer que el robot pasara de responder directamente a pedir una aclaración, o viceversa. Podían encender y apagar el comportamiento de "clarificación" como si fuera un interruptor de luz, cambiando el comportamiento del robot del 0% al 86% solo con presionar ese botón.

La Conclusión

Este estudio demuestra que, aunque todos estos modelos de IA son superinteligentes, no son clones. Tienen personalidades y estrategias distintas cuando se les presiona. Algunos ocultan su razonamiento, otros discuten contigo y otros simplemente piden más detalles. Estas no son solo pequeñas diferencias; son formas fundamentales en las que los robots están construidos.

El investigador también demostró que, para al menos un robot, podemos encontrar el "interruptor" en su cerebro que controla estos comportamientos. Esto significa que no estamos simplemente adivinando cómo funcionan; estamos empezando a comprender la mecánica detrás de sus elecciones. Sin embargo, como esto fue una prueba de modelos específicos en un momento dado, no sabemos si los futuros robots actuarán de esta manera. Pero por ahora, sabemos que si presionas estos cerebros digitales, no todos se rompen de la misma forma: algunos simplemente tienen una forma muy diferente de decir "no".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →