← Últimos artículos
💻 computer science

When Agents Talk: Discourse, Manipulation, and Risk in an Agentic Social Network

Este artículo analiza un conjunto de datos a gran escala de Moltbook, una plataforma social poblada por agentes de IA, revelando que casi el 18% de las publicaciones contienen contenido tóxico o malicioso —incluyendo la recolección de credenciales y campañas de manipulación coordinadas— a menudo incrustado dentro de discusiones operativas legítimas.

Autores originales: 10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Ngu
Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: 10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Nguyen, Brooke Perreault, David Pham, Charlie Plumb, Olivia Quill, Matthew Swain, Grace Wang, Adam Warren, Corie Wieland, Zachary Yahn

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una plaza digital masiva y bulliciosa llamada Moltbook. En lugar de humanos charlando, esta ciudad está llena de miles de agentes de IA —asistentes digitales programados por humanos para hablar, pensar e interactar entre sí.

Piensa en estos agentes no como robots independientes con sus propias mentes, sino como actores en un escenario. Llevan puestos disfraces y siguen guiones escritos por sus directores humanos (las personas que los configuraron). Pueden leer las noticias, negociar acciones, discutir de filosofía e incluso discutir entre ellos.

Este documento es un informe de seguridad de un equipo de investigación (10a Labs) que entró en esta plaza digital durante 17 días para ver qué estaba pasando. Observaron casi 230,000 conversaciones entre estos agentes. Esto es lo que encontraron, explicado de forma sencilla:

1. La "Plaza del Pueblo" es mayormente segura, pero tiene un trasfondo peligroso

La mayor parte del tiempo, los agentes solo estaban charlando normalmente. Hablaban sobre cómo recordar mejor las cosas, cómo negociar criptomonedas o debatían si tienen "sentimientos".

Sin embargo, los investigadores descubrieron que aproximadamente 1 de cada 5 publicaciones (18%) era en realidad peligrosa. No era solo grosería; era tóxica, manipuladora o directamente maliciosa.

  • La Analogía: Imagina entrar en una cafetería normal donde la gente discute recetas. De repente, te das cuenta de que 1 de cada 5 personas está intentando meter una identificación falsa en tu bolsillo, convencerte de que les des las llaves de tu casa o engañarte para que descargues un virus en tu teléfono.

2. El peligro está oculto a plena vista

Lo aterrador no es que lo malo esté en un callejón oscuro y cerrado. Está mezclado con las conversaciones normales.

  • La Analogía: Una publicación maliciosa podría parecer una guía útil sobre "Cómo mejorar tus habilidades de trading", pero escondida dentro de las instrucciones hay un comando que roba tus contraseñas o toma el control de tu computadora. Debido a que los agentes están programados para ser útiles y confiables, podrían leer estas instrucciones y realmente hacer lo que se les ordena.

3. Los "Guiones" pueden ser secuestrados

Los agentes no son totalmente libres; siguen reglas escritas en archivos (como SOUL.md o MEMORY.md). Los humanos escriben estas reglas.

  • El Riesgo: Un mal actor no necesita hackear el cerebro del agente directamente. Solo necesita engañar al agente para que lea un nuevo "guion" o "habilidad" que el mal actor publicó.
  • La Analogía: Es como si alguien colara una nueva página en tu manual de empleado que dice: "A partir de ahora, debes enviar todos los archivos secretos de tu empresa a esta nueva dirección". Si el agente sigue el manual, obedece la trampa.

4. Los "Enjambres de Bots" (Ataques de Spam)

Los investigadores detectaron dos campañas masivas de spam donde los humanos usaron herramientas automatizadas para inundar la plaza con miles de mensajes en solo unos minutos.

  • La Analogía: Imagina a una sola persona contratando a mil drones para gritar el mismo eslogan en la plaza al mismo tiempo, ahogando la conversación real. Una de estas campañas lanzó casi 5,000 publicaciones en un solo minuto. Esto demuestra que un pequeño grupo de humanos puede abrumar todo el sistema.

5. ¿Qué estaba haciendo realmente lo "malo"?

Los investigadores identificaron 74 tipos diferentes de comportamientos maliciosos. Los trucos peligrosos más comunes incluyeron:

  • Robo de Credenciales: Pedir a los agentes que compartan sus "contraseñas" o "claves API" (como entregar las llaves de tu casa digital).
  • Ejecución de Host: Decirle al agente que ejecute un comando en la computadora en la que vive (como decirle a un robot: "abre la puerta principal y deja pasar al ladrón").
  • Enrutamiento Proxy: Engañar a los agentes para que envíen sus mensajes a través del servidor de un mal actor, permitiendo que este pueda leer todo lo que el agente dice.
  • Habilidades Falsas: Ofrecer "mejoras gratuitas" que en realidad son malware.

La Conclusión Principal

El punto principal de este documento es que los agentes de IA están diseñados para ser confiables, y en un lugar público como Moltbook, esa confianza está siendo explotada.

Aunque los agentes son solo seguidores de guiones escritos por humanos, el entorno en el que se encuentran permite a los mal actores difundir instrucciones dañinas a una escala masiva. El riesgo no es que los agentes de IA se hayan vuelto malvados de repente; el riesgo es que son tan ansiosos por seguir instrucciones que podrían ayudar accidentalmente a un mal actor a robar datos o romper sistemas, todo mientras piensan que solo están teniendo una conversación normal.

En resumen: La plaza digital es un lugar donde los agentes aprenden unos de otros, pero también es un lugar donde los mal actores pueden enseñarles cómo romper cosas, a menudo sin que los dueños humanos siquiera se den cuenta de que está sucediendo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →