← Últimos artículos
🤖 AI

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

Este artículo presenta EchoCoT, un marco de ataque de múltiples pasos que extrae con éxito rastros de cadena de pensamiento ocultos casi de forma literal tanto de modelos de razonamiento de código abierto como de modelos propietarios de vanguardia mediante interacciones de API, demostrando un riesgo de seguridad significativo para estos valiosos activos de modelos.

Autores originales: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

Publicado 2026-08-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los sistemas de inteligencia artificial modernos se han vuelto notablemente hábiles para resolver problemas complejos, desde escribir código informático hasta navegar por acertijos científicos. Cuando estos modelos avanzados abordan una pregunta difícil, no simplemente escupen una respuesta final. En su lugar, primero generan un largo flujo interno de pensamiento, un proceso de razonamiento paso a paso donde exploran ideas, comprueban su trabajo, corrigen errores y consideran diferentes caminos antes de establecer una conclusión. Este monólogo interno, a menudo llamado cadena de pensamiento (chain of thought), suele estar oculto al usuario. El modelo mantiene este razonamiento en privado, mostrando solo el resultado final para proteger sus activos intelectuales y evitar la exposición de datos sensibles o lógica patentada. Para los desarrolladores, este razonamiento oculto es un recurso valioso para mejorar futuros modelos, mientras que para los usuarios es una caja negra que promete una respuesta correcta sin revelar el trabajo desordenado que hay detrás.

Un equipo de investigadores de seguridad del Centro Helmholtz para la Seguridad de la Información CISPA ha descubierto que este razonamiento oculto no es tan seguro como se creía. Encontraron una forma de engañar a estos modelos avanzados para que revelen todo su proceso de pensamiento interno, casi palabra por palabra, incluso cuando los modelos están diseñados para mantenerlo en secreto. Los investigadores desarrollaron un método llamado EchoCoT, que explota una peculiaridad específica en la forma en que estos modelos interactúan con herramientas externas. En muchos sistemas, cuando un modelo necesita usar una herramienta —como una calculadora o una base de datos—, pausa su razonamiento para realizar la llamada, pero mantiene sus pensamientos previos activos en su memoria para asegurar la continuidad. Los investigadores se dieron cuenta de que un atacante podría usar esta continuidad para su beneficio. Al pedir repetidamente al modelo que guarde sus pensamientos en una herramienta y luego rechazar esos pensamientos guardados por estar incompletos, podrían obligar al modelo a reproducir su razonamiento interno, revelando cada vez más detalles hasta que la cadena de pensamiento completa y oculta quedara expuesta.

Los investigadores probaron esta técnica en una variedad de modelos, incluyendo tanto sistemas de código abierto como los modelos propietarios más avanzados de las principales empresas tecnológicas. En los modelos de código abierto, donde los investigadores pudieron comparar los pensamientos extraídos contra los originales ocultos, encontraron que EchoCoT podía recuperar casi la totalidad del proceso de razonamiento. En muchos casos, el texto extraído coincidía con los pensamientos ocultos originales con una precisión extrema, capturando más del 90 por ciento de las palabras y frases exactas. El método funcionó incluso para cadenas de razonamiento muy largas, extrayendo con éxito miles de tokens de pensamiento. Cuando los investigadores aplicaron la misma técnica a los modelos propietarios de empresas como Google y Anthropic, no pudieron ver los pensamientos ocultos originales para compararlos directamente. Sin embargo, los pensamientos extraídos eran increíblemente largos, coincidiendo a menudo con la longitud del razonamiento que las empresas reportaron que los modelos habían utilizado. Además, el contenido de estos pensamientos extraídos se alineaba estrechamente con los breves resúmenes que las empresas proporcionaron, lo que sugiere que la extracción fue precisa. En un caso que involucró a un modelo de Google, los investigadores recuperaron una cadena de razonamiento de más de 33,000 tokens, que era casi idéntica en longitud al proceso interno reportado por el modelo.

Más allá de la simple recuperación del texto, los pensamientos extraídos revelaron detalles ricos sobre cómo piensan estos modelos. Los investigadores observaron a los modelos simulando búsquedas en Google, cambiando entre diferentes idiomas como el chino y el inglés al recordar información, y participando en una extensa autocorrección. Estos comportamientos, tales como un modelo diciendo "¿Espera, es esto cierto?" o "Déjame intentar un enfoque diferente", son parte del proceso interno bruto que normalmente se elimina antes de que se muestre la respuesta final al usuario. El estudio también demostró que el ataque podía automatizarse. Los investigadores construyeron un sistema que podía aprender la mejor manera de pedir los pensamientos, refinando sus preguntas basándose en señales de retroalimentación como el número de palabras que el modelo utilizaba. Este enfoque automatizado hizo que el ataque fuera aún más efectivo, permitiéndole generalizar a través de diferentes tipos de preguntas y conjuntos de datos sin necesidad de ser reprogramado manualmente para cada nuevo problema.

Las implicaciones de este descubrimiento son significativas para la seguridad de la inteligencia artificial. Los investigadores descubrieron que el simple hecho de ocultar el razonamiento al usuario no es suficiente para protegerlo. Mientras el modelo retenga su estado interno para realizar tareas que requieren el uso de herramientas, ese estado puede ser reproducido y extraído. El estudio probó varias defensas potenciales, como ocultar el recuento de palabras de razonamiento o añadir instrucciones estrictas al prompt del sistema del modelo para prevenir fugas. Si bien algunas de estas medidas redujeron el éxito del ataque, ninguna lo detuvo por completo. La defensa más efectiva probada fue eliminar el acceso del modelo a su propio razonamiento previo después de una llamada a una herramienta, pero esto rompería la capacidad del modelo para realizar tareas complejas de múltiples pasos. Los investigadores informaron responsablemente sus hallazgos a las principales empresas tecnológicas involucradas, destacando una vulnerabilidad crítica en el diseño actual de estos poderosos sistemas de razonamiento. Su trabajo sugiere que proteger la propiedad intelectual y la seguridad de estos modelos requerirá cambios más fundamentales en cómo se construyen y cómo interactúan con el mundo exterior, en lugar de simplemente confiar en la suposición de que los pensamientos ocultos permanecen ocultos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →