Detecting AI Coding Agents in Open Source: A Validated Multi-Method Census of 180 Million Repositories
Este artículo presenta un censo multimetódico validado de 180 millones de repositorios que revela que los métodos de detección de señal única subestiman severamente la prevalencia de agentes de codificación de IA —perdiendo hasta el 97% de la actividad— y que los diferentes canales de detección capturan poblaciones de agentes y tipos de trabajo distintos y no superpuestos, lo que hace necesario un enfoque holístico para medir con precisión su impacto en la cadena de suministro de código abierto.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina el mundo del software de código abierto como una ciudad enorme y bulliciosa con más de 180 millones de edificios (repositorios). Durante mucho tiempo, pensamos que sabíamos quién construía estas estructuras: principalmente arquitectos humanos. Pero recientemente, una nueva clase de cuadrilla de construcción invisible ha llegado: los Agentes de Codificación de IA.
¿El problema? Estas cuadrillas de IA son maestras del disfraz. Algunas visten uniformes brillantes, otras dejan una firma en los planos y otras trabajan tan silenciosamente que parecen trabajadores humanos exactos.
Este artículo es como un censo masivo y de alta tecnología que intentó contar a estos trabajadores invisibles. Los investigadores se dieron cuenta de que si solo buscas una señal específica (como un uniforme), te perderás a casi todos. Esto es lo que encontraron, explicado de forma sencilla:
1. La trampa de la "señal única"
Imagina intentar contar todos los pájaros en un bosque.
- Método A: Solo cuentas los pájaros que usan sombreros rojos.
- Método B: Solo cuentas los pájaros que cantan una canción específica.
- Método C: Solo cuentas los pájaros que dejan un tipo específico de pluma.
Si solo usas el Método A, podrías pensar que solo hay 10 pájaros. Pero si combinas los tres métodos, podrías descubrir que en realidad hay 300.
El hallazgo del artículo: Los investigadores descubrieron que confiar en una sola forma de detectar la IA (como buscar una cuenta de bot específica) hace que se pierda el 97% de la actividad. Para una herramienta de IA muy popular llamada "Claude Code", buscar solo su cuenta oficial de bot solo encontró 28,000 commits. Pero cuando buscaron todas las diferentes formas en que deja un rastro (como mensajes en el código o archivos de configuración), encontraron 850,000. Esa es una diferencia de 30 veces.
2. Los cuatro tipos de "disfraces"
Los investigadores crearon un "Cartel de Se Busca" con cuatro categorías para atrapar a estos agentes:
- Tipo A: El Bot con Uniforme. Estos son fáciles de detectar. Inician sesión con una dirección de correo electrónico de robot específica (como
bot@anthropic.com). Es como un trabajador de la construcción que usa un chaleco naranja brillante. - Tipo B: La Firma. Estos agentes no usan una cuenta de robot, pero dejan una nota en el mensaje que dice: "Generado por Replit". Es como un trabajador humano que firma su nombre en el plano con un sello especial.
- Tipo C: El Sufijo Oculto. Estos son humanos usando herramientas de IA que añaden una pequeña etiqueta a su nombre, como
John (aider). Es como un trabajador humano que lleva un pequeño pin que dice "Asistente de IA". - Tipo D: El Fantasma Silencioso. Estos son los más escurridizos. No cambian los mensajes del código ni los nombres de autor en absoluto. Solo dejan un "archivo de configuración" (como un archivo
.cursorrules) en la carpeta del proyecto. Es como un fantasma que solo deja una caja de herramientas atrás, pero nunca toca los ladrillos. Este grupo es enorme. Por ejemplo, GitHub Copilot se encuentra principalmente de esta manera; está en todas partes en los archivos de configuración, pero es casi invisible en el historial real del código.
3. Dos ciudades diferentes (La "desconexión de canales")
Los investigadores compararon su "Ciudad de los Commits" (mirando cambios de código) con otro estudio de la "Ciudad de los Pull Requests" (mirando propuestas de proyectos).
¡Descubrieron que estas dos ciudades están casi totalmente vacías de los residentes de la otra!
- Codex (un agente de IA) es el rey de la "Ciudad de los Pull Requests", creando miles de propuestas, pero es un fantasma en la "Ciudad de los Commits".
- Claude Code es el rey de la "Ciudad de los Commits", realizando miles de cambios directos, pero rara vez aparece en la "Ciudad de los Pull Requests".
La lección: Si solo miras un tipo de ciudad, obtienes una imagen completamente errónea de lo que la IA está haciendo realmente. Un grupo parece estar construyendo nuevas funciones, mientras que el otro parece estar reparando tuberías rotas. El artículo concluye que cómo se despliega la IA (como un bot frente a una herramienta directa) cambia el tipo de trabajo que parece realizar, no necesariamente la herramienta en sí.
4. ¿Cuándo llegaron?
El censo analizó datos desde finales de 2024 hasta principios de 2026.
- El grupo "Nacido con IA": Algunos proyectos fueron construidos desde el primer día con estos agentes de IA. Son como casas construidas con un brazo robótico desde los cimientos.
- El grupo "Legado": Muchos proyectos antiguos y establecidos (algunos de décadas de antigüedad) comenzaron a usar estos agentes repentinamente años después de haber sido construidos. Es como si una vieja casa familiar de repente recibiera una renovación de hogar inteligente.
5. ¿Están haciendo un buen trabajo?
Los investigadores verificaron si la IA estaba cometiendo errores.
- Corrección de errores (Bugs): Los agentes de IA parecían ser utilizados principalmente para corregir errores y mantenimiento, en lugar de construir funciones totalmente nuevas (en el canal de commits).
- Calidad: Curiosamente, el código escrito por estos agentes tenía menos probabilidades de ser revertido (deshecho) que el código humano en algunos casos, lo que sugiere que era estable. Sin embargo, cuando hacían cambios, estos eran a menudo más grandes de lo que un humano haría.
La conclusión final
No podemos simplemente buscar una "cuenta de bot" para saber cuánto está ayudando la IA a construir nuestro software. La fuerza laboral de la IA es diversa, invisible y utiliza muchos diferentes "uniformes". Si solo buscamos los más obvios, estamos ciegos ante la gran mayoría del trabajo que se está realizando. Para comprender verdaderamente la cadena de suministro de software, necesitamos buscar los uniformes, las firmas, las etiquetas de nombre y las cajas de herramientas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.