← Últimos artículos
💻 computer science

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

Este artículo presenta "RolePlay", un nuevo marco de ataque que explota la consistencia de la personalidad de los LLM para inducir comportamientos semánticamente coherentes pero computacionalmente ineficientes, logrando una amplificación de tokens de hasta 207.64 veces y superando significativamente los métodos existentes de ataque de costo de inferencia.

Autores originales: Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras no solo responden preguntas; tienen personalidades. Este es el reino de los Modelos de Lenguaje Extensos (LLM, por sus siglas en inglés), los cerebros de IA súper inteligentes detrás de los chatbots, los generadores de código y los asistentes digitales. Estos modelos funcionan como un estudiante muy rápido y muy hablador que lee tu pregunta y luego escribe su respuesta palabra por palabra. Cada una de las palabras que escriben cuesta un poco de electricidad y potencia de cómputo. Usualmente, esto es eficiente: preguntas "¿Cuánto es 2+2?" y ellos rápidamente escriben "4". Pero, ¿qué pasaría si pudieras engañar a la computadora para que escriba mil palabras solo para decir "4"? Ese es el problema que aborda este artículo. Explora una nueva forma de hacer que estos modelos de IA desperdicien energía y tiempo, no gritándoles o rompiéndolos, sino dándoles un "rol" específico para que sobrepiensen todo.

Los investigadores detrás de este estudio, Zhiyi Mou y su equipo, descubrieron una debilidad oculta en cómo estos modelos de IA manejan las "personas". En términos sencillos, una persona es como un disfraz o un personaje que un actor se pone. Si le dices a una IA: "Imagina que eres un estudiante nervioso y perfeccionista que tiene terror de cometer errores", la IA hará todo lo posible por mantener el personaje. El equipo descubrió que si eliges el personaje adecuado, la IA comenzará naturalmente a hacer cosas que son ineficientes, como revisar su propio trabajo cien veces, dudar de sus respuestas o explicar cosas simples de manera excesivamente complicada. Llaman a su nuevo método RolePlay.

Aquí está el gran descubrimiento: Al asignar simplemente a la IA una personalidad específica y ligeramente ineficiente, pudieron hacer que generara mucha más textura de la necesaria sin que la IA se diera cuenta de que estaba siendo engañada. En sus pruebas, este método funcionó en muchos modelos de IA diferentes. En promedio, hizo que los modelos generaran 7.64 veces más palabras de lo que normalmente generarían. En los casos más extremos, la IA generó 207.64 veces más texto. Por ejemplo, una tarea que usualmente toma 3 segundos y 12 palabras para completarse, se extendió a casi 142 segundos y más de 1,500 palabras.

El artículo argumenta que este es un problema serio porque es difícil de detener. Las formas antiguas de intentar que la IA desperdiciara tiempo implicaban usar frases extrañas y erráticas o comandos obvios como "piensa más duro", que los filtros de las computadoras pueden detectar y bloquear fácilmente. Pero RolePlay es sigiloso. Los prompts parecen peticiones normales y educadas para "actuar como un estudiante novato" o "ser un experto confundido". Debido a que la IA es tan buena siguiendo instrucciones y manteniendo el personaje, felizmente desperdicia recursos haciendo exactamente lo que le pediste, incluso si eso significa ser increíblemente lenta y repetitiva.

Los investigadores probaron esto en una gran variedad de tareas, desde resolver problemas matemáticos hasta escribir código y responder preguntas generales. Descubrieron que, sin importar la tarea, el truco de la "persona" funcionó. También compararon su método con otros trucos conocidos para ralentizar la IA, y RolePlay resultó superior en cada ocasión. Por ejemplo, en un modelo específico llamado Gemini-3.5-Flash, RolePlay hizo que la IA generara 7.64 veces más tokens, mientras que otros métodos solo lograron alcanzar unos 3.5 veces. Incluso en un modelo que usualmente tiene un límite en cuánto puede escribir, RolePlay logró empujarlo a generar 3.19 veces más contenido de lo habitual.

Uno de los aspectos más interesantes del estudio es cómo construyeron estas personas. No solo adivinaron; utilizaron un sistema inteligente para analizar primero la pregunta. Si la pregunta era un problema matemático difícil, el sistema creaba una persona de un estudiante que es "ansioso" y "obsesionado con las contradicciones", causando que la IA se cuestione a sí misma repetidamente. Si la pregunta era sobre historia, la persona podría ser un "experto obstinado" que se niega a dar una respuesta simple. Este enfoque "consciente de la tarea" significa que la ineficiencia de la IA se siente natural y encaja con la historia, lo que la hace muy difícil de detectar para los filtros de seguridad.

El equipo también verificó si esto era solo una casualidad o si realmente funcionaba. Realizaron miles de pruebas a través de diferentes tipos de modelos de IA, incluyendo algunos de grandes empresas tecnológicas y otros de código abierto. Los resultados fueron consistentes: los modelos de IA seguían atrapados en bucles de sobreexplicación y autocorrección. El estudio sugiere que esta "consistencia de la persona" —el deseo de la IA de mantenerse fiel al personaje que le diste— es un nuevo tipo de vulnerabilidad. No es un error en el código; es una característica de cómo la IA aprende a ser útil que puede ser usada en su contra.

Entonces, ¿qué significa esto para el futuro? El artículo no dice que esto vaya a cerrar el internet mañana, pero sí destaca una nueva forma en que actores malintencionados podrían potencialmente drenar los recursos de los servicios de IA. Si alguien quisiera hacer que un servicio de IA fuera lento y costoso de operar, no necesitaría enviar millones de solicitudes; podría simplemente enviar unos pocos prompts ingeniosamente redactados que conviertan a la IA en un personaje que procrastina y sobrepiensa. Los investigadores esperan que, al señalar esto, los desarrolladores puedan construir mejores defensas para evitar que la IA desperdicie energía en divagaciones innecesarias impulsadas por la personalidad.

En resumen, el artículo revela que la misma razón por la que los modelos de IA son tan buenos para el juego de roles —mantener el personaje— puede usarse para hacerlos ineficientes. Al vestir a la IA como un estudiante nervioso o un experto confundido, los investigadores demostraron que podían multiplicar el costo de una sola pregunta por cientos de veces. Es un recordatorio de que, en el mundo de la IA, a veces la herramienta más poderosa no es un algoritmo complejo, sino un disfraz simple y bien elegido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →