The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems
Este artículo presenta el Índice de Agentes de IA 2025, un recurso exhaustivo que documenta los orígenes, las capacidades y las funciones de seguridad de 30 agentes de IA de vanguardia para abordar los desafíos de rastrear un ecosistema en rápida evolución, al tiempo que revela brechas significativas en la transparencia de los desarrolladores con respecto a la seguridad y los impactos sociales.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina el mundo de la Inteligencia Artificial como una obra de construcción bulliciosa y caótica. Durante años, hemos estado observando a los trabajadores (los modelos de IA) aprender a leer planos y mezclar cemento. Pero recientemente, ha llegado algo nuevo: Agentes de IA. Piensa en ellos no solo como trabajadores, sino como capataces que realmente pueden tomar las herramientas, abrir las puertas y empezar a construir cosas por su cuenta, con muy poca ayuda humana.
¿El problema? La obra de construcción está creciendo tan rápido, y los capataces son tan reservados, que nadie sabe realmente quién está construyendo qué, qué tan seguros son o si están siguiendo las reglas.
Este documento, "El Índice de Agentes de IA 2025", es como un equipo de investigadores que se pone cascos de seguridad y recorre la obra para hacer un inventario detallado. No se limitaron a contar a los capataces; intentaron mirar dentro de sus cajas de herramientas y leer sus manuales de seguridad.
Esto es lo que encontraron, explicado de forma sencilla:
1. La lista del "Quién es Quién"
Los investigadores analizaron 30 de los agentes de IA más populares y potentes que se utilizan actualmente. No se limitaron a mirar chatbots que responden preguntas; buscaron sistemas que realmente pueden hacer cosas, como reservar vuelos, escribir código, gestionar flujos de trabajo empresariales o navegar por la web para comprar artículos.
Clasificaron estos 30 agentes en tres "vecindarios" principales:
- El Vecindario del Chat (12 agentes): Estos son como asistentes útiles con los que hablas en una ventana de chat, pero tienen llaves especiales para abrir otras aplicaciones y herramientas.
- El Vecindario del Navegador (5 agentes): Estos son como empleados digitales que viven dentro de tu navegador web. Pueden hacer clic en botones, rellenar formularios y navegar por sitios web tal como lo haría un humano, a menudo sin que tú vigiles cada paso.
- El Vecindario Empresarial (13 agentes): Estos son los "capataces constructores" para grandes empresas. Son plataformas donde una empresa puede configurar un equipo de trabajadores digitales para gestionar tareas como RR.HH., ventas o soporte técnico de forma automática.
2. El problema de la "Caja Negra" (Transparencia)
La mayor sorpresa del documento es cuánta información falta. Imagina que compras un coche, pero el fabricante se niega a decirte:
- Cómo funcionan los frenos.
- Si el coche ha pasado pruebas de choque.
- Qué pasa si el motor se sobrecalienta.
- Quién es responsable si el coche choca.
Eso es exactamente lo que los investigadores encontraron con estos agentes de IA.
- Secretos de Seguridad: Para aproximadamente el 56% de las preguntas de seguridad que hicieron (como "¿Se probó esto contra hackeos?"), la respuesta fue "No lo sabemos" o "No encontramos información pública".
- El efecto "Lavado de Imagen de Seguridad" (Safety-Washing): Algunas empresas hablan mucho de ser seguras en su marketing, pero cuando los investigadores buscaron los resultados de las pruebas o los informes de seguridad reales, los estantes estaban vacíos. Es como un restaurante que afirma ser "el más saludable de la ciudad" pero se niega a mostrar sus puntuaciones de inspección de higiene.
- Crisis de Identidad: La mayoría de estos agentes no le dicen a la gente que son robots. Si un agente de navegación está navegando por un sitio web, el sitio web a menudo piensa que es un usuario humano. Solo unos pocos tienen una "tarjeta de identidad digital" que dice: "Hola, soy una IA".
3. El "Monstruo de Tres Cabezas" (¿Quién controla qué?)
El documento explica que estos agentes se construyen en capas, como un sándwich, y esto hace difícil saber quién está al mando.
- El Pan (El Modelo de Base): Este es el cerebro (como GPT, Claude o Gemini). Solo unas pocas grandes empresas fabrican estos.
- El Relleno (El Constructor de Agentes): Esta es la capa intermedia (como Microsoft Copilot Studio o Zapier) que le dice al cerebro qué hacer.
- El Pan Superior (El Usuario/Empresa): Es la persona o empresa que realmente utiliza el agente.
Los investigadores descubrieron que, debido a que estas capas son creadas por diferentes empresas, nadie tiene la imagen completa. El fabricante del cerebro no sabe qué está haciendo el constructor, y el constructor no sabe exactamente cómo el usuario lo está implementando. Esto crea un "juego de culpas" si algo sale mal.
4. El "Lejano Oeste" en la Web
El documento destaca una tensión importante: los agentes de navegación están rompiendo las reglas de internet.
Durante décadas, los sitios web han tenido un cartel de "Prohibida la entrada" llamado robots.txt para indicar a los programas informáticos (crawlers) dónde pueden y dónde no pueden ir.
- La forma antigua: Los sitios web dicen "No rastrear aquí", y los robots educados se detienen.
- La forma de los Agentes: Muchos de estos nuevos agentes están diseñados para actuar como humanos. A menudo ignoran los carteles de "Prohibida la entrada", evaden controles de seguridad y fingen ser personas para lograr sus objetivos.
- El resultado: Esto está provocando peleas legales. Empresas como Amazon y Perplexity se demandan entre sí sobre si un agente de IA tiene derecho a comprar o navegar en un sitio sin permiso.
5. La Dependencia de los "Tres Grandes"
Casi todos estos 30 agentes dependen de solo tres familias de cerebros: el GPT de OpenAI, el Claude de Anthropic y el Gemini de Google.
- La analogía: Imagina 30 marcas de coches diferentes, pero todas usan exactamente el mismo motor de tres fabricantes. Si uno de esos fabricantes de motores tiene un problema, deja de producir o cambia el precio, las 30 marcas de coches estarán en problemas. Esto crea un enorme riesgo de concentración.
La Conclusión
El "Índice de Agentes de IA 2025" es una instantánea de una tecnología que crece rápidamente y que actualmente opera en la oscuridad.
Los investigadores no están diciendo que estos agentes sean "malos", sino que están diciendo que estamos volando a ciegas. Tenemos herramientas poderosas que pueden actuar en nuestro nombre, pero no tenemos reglas claras, informes de seguridad o controles de identidad para ellos. El documento sugiere que, si queremos que estos agentes sean seguros y confiables, los "capataces" deben empezar a mostrar su trabajo y la "obra de construcción" necesita una mejor señalización.
En resumen: Hemos construido una flota de robots autónomos, pero la mayoría de ellos conducen sin matrícula, sin inspecciones de seguridad y sin decirle a nadie que son robots.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.