← Últimos artículos
💬 NLP

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

Este artículo revela que los métodos existentes de detección de fuera de distribución (OOD) en caja blanca para modelos de lenguaje están estructuralmente confundidos por la longitud de la secuencia, y propone un marco de dos vías que distingue entre señales basadas en incrustaciones para cambios de vocabulario y características de trayectoria de estado oculto para detectar entradas de intención encubierta como jailbreaks.

Autores originales: Hamidreza Saghir

Publicado 2026-05-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hamidreza Saghir

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un guardia de seguridad en un museo. Tu trabajo es detectar pinturas falsas (entradas fuera de distribución o "OOD") entre las reales. Recientemente, otros guardias han estado usando una nueva herramienta: miden cuánto "tiembla" la pintura o cuán caóticas son las pinceladas (esto es como medir la entropía de atención en la IA). Afirman que esta herramienta es increíble para detectar falsificaciones.

Sin embargo, este artículo argumenta que esos guardias están siendo engañados. No están detectando las falsificaciones; simplemente están contando cuántas pinceladas hay en el lienzo.

Aquí está el desglose de los hallazgos del artículo usando analogías simples:

1. La trampa del "Lienzo Largo" (La confusión por longitud)

El artículo descubrió que muchas herramientas populares de seguridad de la IA en realidad solo miden cuánto mide el texto.

  • La analogía: Imagina que la herramienta del guardia de seguridad es una regla. Afirma medir el "caos", pero en realidad solo mide la "longitud".
  • El problema: En las pruebas, las pinturas "falsas" (jailbreaks o spam) solían ser mucho más largas que las "reales". La herramienta veía las pinturas largas, entraba en pánico y decía: "¡Eso es una falsificación!", simplemente porque era larga.
  • La prueba: Cuando los investigadores forzaron a que las pinturas reales y falsas tuvieran exactamente la misma longitud, la herramienta dejó de funcionar. Colapsó a un adivinamiento casi aleatorio (como lanzar una moneda). El artículo muestra que herramientas como CED, RAUQ e incluso algunas puntuaciones de confianza de sistemas desplegados están estructuralmente rotas porque dependen de mecanismos de atención que crecen naturalmente con la longitud del texto.

2. El marco de dos vías: "Qué" vs. "Cómo"

Una vez que los investigadores eliminaron el "truco de la longitud", se preguntaron: ¿Cómo podemos realmente decir si la entrada es extraña? Proponen un sistema de dos partes, como un detective que examina una escena del crimen de dos maneras diferentes:

Vía A: El "Qué" (Embeddings)

  • La analogía: Esto es como mirar los ingredientes de una sopa.
  • Cómo funciona: Verifica el vocabulario. Si la sopa tiene palabras "tóxicas" o palabras clave de "spam", esta vía la marca.
  • Cuándo funciona: Es excelente para detectar falsificaciones obvias, como una sopa que de repente tiene "veneno" escrito en la etiqueta.
  • Cuándo falla: Falla si la sopa falsa usa exactamente los mismos ingredientes que la sopa real pero está mezclada de una manera extraña. Por ejemplo, un prompt de "jailbreak" a menudo usa palabras normales pero las organiza para engañar a la IA. El "revisor de ingredientes" ve palabras normales y dice: "Todo claro", pasando por alto el truco.

Vía B: El "Cómo" (Trayectoria de procesamiento)

  • La analogía: Esto es como observar cómo cocina el chef la sopa.
  • Cómo funciona: En lugar de solo mirar el tazón final, esta vía observa los movimientos de las manos del chef a través de cada paso del proceso de cocción (capa por capa). Pregunta: "¿El chef está picando con suavidad? ¿De repente está lanzando ingredientes en pánico? ¿La olla está temblando con un ritmo extraño?"
  • Por qué funciona: Incluso si los ingredientes (palabras) parecen normales, un prompt de "jailbreak" obliga al chef de la IA a cocinar con un ritmo extraño e antinatural. La vía del "Cómo" detecta este estilo de cocina extraño.
  • El resultado: Esta vía detectó con éxito las falsificaciones de "jailbreak" complicadas que la vía de "ingredientes" pasó por alto, logrando una puntuación de precisión mucho mayor (0.850 frente a casi al azar para los métodos antiguos).

3. El descubrimiento de "Cruce"

El artículo encontró que ningún método es perfecto para todo. Es como tener dos tipos diferentes de detectores de metales:

  • Detector 1 (Ingredientes/Embeddings): Excelente para encontrar una moneda de oro escondida en un montón de arena (cambios obvios de vocabulario).
  • Detector 2 (Estilo de cocción/Trayectoria): Excelente para encontrar una moneda de plástico pintada para parecer oro (trucos estructurales sutiles).
  • La idea clave: Necesitas ambos. Cuando la "falsificación" es simplemente un tema diferente, gana el Detector 1. Cuando la "falsificación" es un truco astuto usando palabras normales, gana el Detector 2.

4. El "Por qué" (Evidencia mecanicista)

Los investigadores no solo adivinaron; miraron dentro del cerebro de la IA (los circuitos) para ver qué estaba sucediendo.

  • El hallazgo: Cuando la IA encuentra un "jailbreak" (un truco estructural), se confunde de una manera específica: sus circuitos de "atención" (enfoque) se vuelven locos, desordenando su enfoque.
  • El contraste: Cuando la IA encuentra "discurso de odio" (un cambio de vocabulario), son las partes de "memoria" (MLP) del cerebro las que se iluminan porque reconoce las palabras malas.
  • La conclusión: Diferentes tipos de "falsificaciones" rompen la IA de maneras distintas. Las herramientas antiguas solo miraban la parte de "enfoque" y se confundían por la longitud. La nueva herramienta de "Trayectoria" observa todo el proceso de cocción, por lo que ve la rotura sin importar dónde ocurra.

Resumen

El artículo afirma que muchas herramientas actuales de seguridad de la IA están rotas porque son engañadas por la longitud del texto. Para arreglar esto, necesitamos dejar de mirar solo qué dice el texto y empezar a observar cómo la IA lo procesa. Al observar el "proceso de pensamiento" de la IA paso a paso (la trayectoria), podemos atrapar trucos astutos que parecen normales en la superficie pero que se sienten extraños para la maquinaria interna de la IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →