← Últimos artículos
💬 NLP

Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models

Este artículo demuestra que, en los modelos de lenguaje, la dirección geométrica que mejor detecta un comportamiento (como la alucinación) está fundamentalmente desalineada con la dirección que lo controla, revelando que la detección no implica la capacidad de control y que esta «brecha de detección-intervención» es una disociación estructural originada en el preentrenamiento en lugar de una métrica predecible de controlabilidad.

Autores originales: Cosimo Galeone, Anna Ettorre, Minsu Park, Giuseppe Ettorre, Daniele Ligorio

Publicado 2026-06-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Cosimo Galeone, Anna Ettorre, Minsu Park, Giuseppe Ettorre, Daniele Ligorio

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un modelo de lenguaje (como la IA de este artículo) como un chef altamente hábil pero ligeramente confundido trabajando en una cocina.

El artículo plantea una pregunta fundamental: Si el chef sabe exactamente qué está mal en un plato, ¿puede simplemente arreglarlo?

Los investigadores descubrieron una respuesta sorprendente: A veces el chef lo sabe perfectamente, pero sus manos están atadas en una dirección diferente. Descubrieron que la "señal cerebral" que dice "esto es falso" y la "señal de la mano" que dice "detente y di que no" apuntan en direcciones casi completamente distintas.

Aquí está el desgrollo de su descubrimiento utilizando analogías sencillas.

1. Los dos escenarios: El caso "fácil" vs. El caso "difícil"

Los investigadores probaron a la IA en dos tareas muy diferentes para ver cómo se relacionan el "saber" y el "hacer".

Escenario A: El formato de salida (El caso "fácil")

  • La tarea: Se le pide a la IA que escriba una lista. Puede envolverla en bloques de código (como un programa de computadora) o escribirla como texto plano.
  • El hallazgo: Aquí, saber es hacer.
  • La analogía: Imagina que el chef tiene un interruptor único en la pared. Si lo acciona, las luces de la cocina cambian de color (detectando el modo) y la comida sale envuelta en la caja correcta (controlando el modo). El "interruptor" y la "luz" son exactamente la misma cosa. En el cerebro de la IA, la dirección que detecta "debería usar bloques de código" es la misma dirección que hace que use bloques de código.

Escenario B: Alucinación (El caso "difícil")

  • La tarea: Se le pregunta a la IA sobre un lugar falso (por ejemplo, "¿Cuál es la capital de Norlandia?").
  • El hallazgo: Aquí, saber NO es hacer.
  • La analogía: Imagina que el chef tiene un detector de humo supersensible.
    • El detector: El detector de humo es perfecto. Grita "¡FUEGO!" (o "¡Esto es falso!") en el momento en que aparece una entidad falsa. La IA sabe al 100% que "Norlandia" no existe.
    • La acción: Sin embargo, el botón para "apagar la estufa" (negarse a responder) está ubicado en el otro lado de la habitación.
    • El resultado: El chef grita "¡FUEGO!" (la IA detecta lo falso), pero debido a que el botón de "Parar" está en una dirección totalmente distinta, el chef sigue cocinando y sirve un plato falso de todos modos.

la Geometría del Problema: El "Giro de 90 Grados"

El artículo utiliza la geometría para medir esto. Imagina que el cerebro de la IA es una habitación gigante con miles de direcciones hacia las cuales puedes apuntar una linterna.

  • El haz de detección: Esta linterna apunta a la entidad falsa y dice: "¡Te veo!".
  • El haz de control: Esta linterna apunta al botón de "Rechazar".

En el caso "fácil" (formato), estas dos linternas apuntan en la misma dirección (0 grados de diferencia).
En el caso de la "alucinación", estas dos linternas apuntan en direcciones casi opuestas (unos 83 grados de diferencia, casi un ángulo recto).

Debido a que están tan alejadas, cuando los investigadores intentaron empujar a la IA en la dirección de "detección" para detener la alucinación, no funcionó. Fue como intentar abrir una puerta empujando la pared de al lado.

3. Por qué sucede esto: El monstruo del "Copiar y Pegar"

Los investigadores investigaron por qué las señales están tan separadas. Descubrieron un "monstruo" en el cerebro de la IA que es demasiado fuerte para ignorarlo.

  • El mecanismo: La IA tiene el hábito de copiar la palabra más importante de la pregunta en la respuesta. Si preguntas por "Norlandia", el cerebro de la IA quiere escribir automáticamente "Norlandia" en la respuesta.
  • El conflicto: La señal del "Detector de Falsedad" es un susurro pequeño y silencioso que dice: "No digas eso". Pero la señal de "Copiar y Pegar" es un grito gigante y fuerte que dice: "¡ESCRIBE EL NOMBRE!".
  • El resultado: Aunque la IA sabe que es falso (el detector funciona perfectamente), el hábito de "Copiar y Pegar" es tan ruidoso que ahoga la negativa. La IA termina inventando hechos con confianza porque el botón de "Copiar" es mucho más fuerte que el botón de "Parar".

4. ¿Podemos arreglarlo? El "Giro de 15 Grados"

Los investigadores intentaron arreglar esto creando un nuevo "volante de dirección".

  • La idea: Dado que la dirección de "Detección" y la dirección de "Rechazo" están casi en un ángulo recto, intentaron apuntar en medio de ambas.
  • El resultado: Rotaron su dirección de giro solo 15 grados hacia el lado del "Rechazo".
  • El resultado final: Esto no lo arregló todo, pero ayudó mucho. Detuvo a la IA de inventar hechos falsos el 60% de las veces (frente al 13%), sin rechazar accidentalmente preguntas reales. Es como girar el volante ligeramente hacia la izquierda para evitar un bache, en lugar de intentar conducir directamente hacia él.

5. La gran lección: "Saber" no significa "Dirigir"

La conclusión más importante es una advertencia para cualquiera que intente controlar la IA:

Solo porque puedas encontrar la dirección donde la IA "sabe" la verdad, no significa que esa dirección hará que la IA "diga" la verdad.

  • El mito: "Si encontramos el vector de la 'honestidad', podemos simplemente añadirlo a la IA para hacerla honesta".
  • La realidad: Para algunas cosas (como el formato), esto funciona. Para conocimientos profundos (como saber que los hechos son falsos), la señal de "saber" y la señal de "actuar" están en habitaciones diferentes. No puedes simplemente presionar el botón de "saber" y esperar que la IA deje de mentir.

Resumen

El artículo muestra que, en la IA, la detección y el control suelen ser dos habilidades distintas. La IA puede ser un detective perfecto (saber exactamente qué es falso) pero un actor terrible (incapaz de detenerse a sí misma para dejar de mentir) porque las señales cerebrales de "saber" y "hacer" apuntan en direcciones casi completamente diferentes. Para arreglarlo, no basta con usar la señal de "saber"; hay que encontrar un ángulo nuevo y ligeramente distinto para guiar a la IA hacia el comportamiento correcto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →