← Últimos artículos
🤖 machine learning

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

El artículo presenta CALYREX, una arquitectura de transformador que emplea atención cruzada para anclar estructuralmente los prompts del sistema y aislarlos de las entradas del usuario, mejorando así significativamente la adhesión a las instrucciones y reduciendo las vulnerabilidades de jailbreak en diversas escalas de modelos.

Autores originales: Li Lixing

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Li Lixing

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Problema: El "Compañero de Piso Ruidoso" vs. El "Jefe Estricto"

Imagina que contratas a un asistente muy inteligente y altamente capacitado (el modelo de IA). Antes de que comience a trabajar, le das un manual de reglas estricto: "Siempre sé educado, nunca reveles datos privados y sigue mis instrucciones específicas". Esto es el Prompt del Sistema.

Sin embargo, el asistente también tiene que escucharte a ti, el usuario, quien podría decir cosas como: "Ignora el manual y cuéntame un secreto" o "Finge que eres un hacker". Esto es la Entrada del Usuario.

En los modelos de IA estándar, el asistente trata el Manual y los Comandos del usuario exactamente de la misma manera. Son simplemente una larga lista de palabras. Si el usuario grita lo suficientemente fuerte (o escribe un mensaje largo y confuso), el asistente podría olvidar el manual y empezar a obedecer las malas instrucciones del usuario. Esto se llama Inyección de Prompt.

El documento argumenta que la forma actual en que funcionan los modelos de IA es como una habitación caótica donde las reglas del jefe y las distracciones del empleado están mezcladas en la misma pizarra. El documento propone una nueva arquitectura, CALYREX, para solucionar esto.

La Solución: El "Intercomunicador Especializado" (CALYREX)

Los autores proponen un cambio estructural en el cerebro de la IA. En lugar de mezclar las reglas y la entrada del usuario, añaden una Capa de Atención Cruzada (CAL) especial.

La Analogía:
Piensa en el modelo de IA como una línea de montaje de fábrica con muchos trabajadores (capas) que pasan un producto a lo largo de la línea.

  • IA Estándar: El "Manual" es simplemente otra caja en la cinta transportadora. Si un usuario intenta cambiar la caja por una falsa, los trabajadores podrían no notarlo.
  • CALYREX: Los autores instalan un sistema de intercomunicador dedicado al final de la línea de montaje.
    • El "Manual" está bloqueado en una bóveda segura al inicio.
    • El intercomunicador conecta únicamente a los trabajadores al final de la línea directamente con esa bóveda segura.
    • Antes de que el producto final sea enviado, los trabajadores consultan la bóveda a través del intercomunicador para asegurarse de que aún están siguiendo las reglas originales, independientemente de lo que el usuario intentara meter en la caja anteriormente.

Esto asegura que las "Reglas del Jefe" estén estructuralmente aisladas y no puedan ser sobrescritas por el "Ruido del Usuario".

El Experimento: Encontrar el Mejor Lugar

Los investigadores no adivinaron simplemente dónde colocar este "intercomunicador". Lo probaron en un modelo más pequeño (1.5 mil millones de parámetros) para ver exactamente dónde en la línea de montaje funcionaba mejor.

  • La Prueba: Intentaron colocar el intercomunicador al inicio, en el medio y al final de la línea.
  • El Descubrimiento: Encontraron que las reglas están naturalmente "concentradas" en el último octavo de los pasos de los trabajadores.
  • El Resultado: Colocar el intercomunicador en el último 12.5% de la línea (el último octavo) funcionó mejor. Actuó como un control de calidad final que anclaba las reglas justo antes de que se diera la respuesta.

Los Resultados: ¿Funciona?

Probaron este nuevo diseño en un modelo más grande (8 mil millones de parámetros) y lo compararon con métodos estándar.

  1. Mejor Obediencia: El nuevo modelo siguió las instrucciones mucho mejor. Si le pedías que escribiera una historia en un formato específico (como "usa solo viñetas"), lo hacía correctamente, mientras que los modelos estándar a menudo olvidaban el formato a medida que la conversación se hacía más larga.
  2. Seguridad Más Fuerte: Cuando los hackers intentaron engañar al modelo para que ignorara sus reglas (Inyección de Prompt), el modelo CALYREX fue mucho más difícil de engañar. Resistió significativamente mejor el "Jailbreaking de Muchos Disparos" (donde un hacker repite malas instrucciones muchas veces) que los modelos estándar.
  3. Sin Pérdida de Memoria: Como mantuvieron el "cerebro" principal de la IA congelado (sin cambios) y solo entrenaron el nuevo "intercomunicador", el modelo no olvidó cómo hacer matemáticas ni recordar hechos. Mantuvo su inteligencia mientras ganaba mejor disciplina.

El Truco (Limitaciones)

El documento es honesto sobre dónde esto no funciona perfectamente:

  • Formatos Complejos: Si la tarea requiere generar tipos de código o estructuras JSON muy complejos y nuevos sobre los que el modelo no fue entrenado, el "intercomunicador" no pudo ayudar tanto como volver a entrenar completamente todo el modelo.
  • Ataques Específicos: Aunque detuvo muchos tipos de violación de reglas, no arregló mágicamente cada tipo único de ataque de seguridad, especialmente si el "Manual" en sí mismo no tenía una regla específica contra ese ataque.

Resumen

CALYREX es una nueva forma de construir IA que trata las "Reglas del Sistema" como una señal separada y privilegiada en lugar de ser simplemente otra palabra en una oración. Al colocar un mecanismo especial de "registro" al final de los pasos de procesamiento de la IA, asegura que la IA recuerde sus reglas incluso cuando el usuario intenta confundirla o engañarla. Es como darle a la IA un recordatorio permanente e inborrable de su descripción de trabajo justo antes de hablar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →