← Últimos artículos
🤖 AI

An Exploratory Study on LLM-Generated Code and Comments in Code Repositories

Este estudio exploratorio analiza el código y los comentarios generados por LLM en repositorios mantenidos tanto por empresas como por la comunidad desde 2021 hasta 2025, revelando que, si bien el código detectado de LLM ha disminuido con el tiempo y es prevalente en casos de prueba con altas tasas de clonación, los comentarios generados por LLM se mantienen estables pero a menudo presentan fallos gramaticales, y los errores etiquetados por humanos muestran solo una pequeña asociación con el código generado por LLM.

Autores originales: Yongyi Ji, Jiaji Wang, Yi Zhou, Fuxiang Chen, Hongji Yang

Publicado 2026-07-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yongyi Ji, Jiaji Wang, Yi Zhou, Fuxiang Chen, Hongji Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una biblioteca enorme y bulliciosa donde se escriben millones de libros (código de software) cada día. Recientemente, un nuevo tipo de "escritor fantasma" ha entrado en escena: la Inteligencia Artificial (LLM). Estos escritores fantasmas pueden elaborar frases e historias (código y comentarios) a la velocidad del rayo.

Este artículo es como un equipo de bibliotecarios que decidió investigar: "¿Cuánto de lo que se escribe en nuestra biblioteca es realmente hecho por estos escritores fantasmas y cómo es esa escritura?"

Aquí está lo que encontraron, desglosado en historias sencillas:

1. El misterio de la escritura "fantasma"

Los bibliotecarios utilizaron "detectores de metales" especiales (herramientas de software) para escanear los libros. Estos detectores no saben con certeza si un humano o un robot escribió una página, pero pueden detectar patrones que parecen escritura de robot.

  • El Código (Las Instrucciones): Encontraron que la cantidad de código "escrito por robots" parece estar disminuyendo con el tiempo. Es como si los escritores fantasmas estuvieran mejorando para sonar humanos, o quizás los bibliotecarios humanos están editando tanto el trabajo del robot que la huella digital del robot desaparece. Curiosamente, la mayor parte del código escrito por robots que encontraron estaba en los "Casos de Prueba" (Test Cases)—piensa en ellos como los cuestionarios de práctica o guiones de ensayo. A los robots les encanta escribir estos ejercicios de práctica repetitivos.
  • Los Comentarios (Las Notas): Mientras que el código de robot está desapareciendo, las notas escritas por robots (comentarios que explican qué hace el código) se han mantenido estables. Parece que los robots siguen siendo muy buenos escribiendo las "notas adhesivas" que explican las instrucciones, pero los humanos se están haciendo cargo de la construcción real de la máquina.

2. Bibliotecas de Empresas vs. Bibliotecas Comunitarias

Los investigadores compararon dos tipos de bibliotecas:

  • Bibliotecas de Empresas: Son gestionadas por grandes gigantes tecnológicos (como Google o Meta).
  • Bibliotecas Comunitarias: Son gestionadas por grupos de voluntarios (proyectos de código abierto).

El Hallazgo: Las Bibliotecas de Empresas tenían un porcentaje mucho mayor de material "escrito por fantasmas". Es como si las grandes empresas estuvieran utilizando a los escritores fantasmas de manera más intensiva para mantener sus sistemas internos funcionando de manera fluida y consistente. Las Bibliotecas Comunitarias tenían menos escritura de robot, y cuando encontraban algo, las notas eran a menudo gramaticalmente más limpias y pulidas que las de las bibliotecas de las empresas.

3. El problema del "Copiar y Pegar"

Los investigadores notaron algo extraño sobre el código del robot: Estaba lleno de clones.
Imagina si un escritor fantasma escribiera una historia y luego copiara y pegara esa misma historia en el 70% de los libros de la biblioteca. Eso es lo que pasó con el código. Los robots generaron código que se veía casi idéntico a otro código en la misma biblioteca. Sin embargo, cuando lo compararon con una base de datos de código "puro de robot" conocido, encontraron muy poca superposición. Esto sugiere que los humanos no solo están copiando y pegando la salida bruta del robot; probablemente la están retocando, lo que la hace parecer única pero aún deja tras de sí esos patrones repetitivos.

4. ¿Rompieron los Escritores Fantasmas algo?

Una gran preocupación es que, si los robots escriben el código, podrían introducir errores (bugs) que rompan el software.

  • El Hallazgo: Los investigadores buscaron en una lista de libros conocidos por estar "rotos" (bugs) y preguntaron: "¿Escribió un robot esto?"
  • El Resultado: Sorprendentemente, muy pocos de los libros rotos fueron escritos por robots. Solo entre el 5% y el 10% de los errores conocidos parecían provenir de los escritores fantasmas.
  • La Metáfora: Es como si los escritores fantasmas tuvieran permitido escribir el borrador, pero los editores humanos son muy estrictos. Ellos atrapan los errores antes de que el libro se imprima. Los humanos probablemente están corrigiendo los errores del robot antes de que el código se guarde.

5. La Gran Advertencia (La "Advertencia del Detective")

Los autores son muy honestos sobre sus limitaciones. Admiten que no tienen un "suero de la verdad" para saber con certeza si un humano o un robot escribió una línea específica. Sus "detectores de metales" solo están adivinando basándose en patrones.

  • La Analogía: Es como intentar adivinar si una pintura fue hecha por un humano o un robot mirando las pinceladas. A veces el robot es tan bueno que parece humano, y a veces un humano pinta de una manera muy repetitiva que parece un robot.
  • La Conclusión: Debido a esto, llaman a sus hallazgos "observaciones de proximidad" (proxy observations). No están diciendo: "Esto es definitivamente código de robot". Están diciendo: "Esto se parece mucho al código de robot según nuestras herramientas".

Resumen

En resumen, este estudio sugiere que, si bien la IA está ayudando a escribir software, los humanos siguen siendo los capitanes del barco. La IA está haciendo mucho de la "prueba de conducción" repetitiva y de la toma de notas, especialmente en las grandes empresas. Pero los humanos están editando fuertemente el trabajo, corrigiendo los errores y asegurándose de que el producto final no parezca escrito por un robot. La "huella digital del robot" es en realidad cada vez más difícil de encontrar en el código mismo, aunque los robots siguen ocupados escribiendo las explicaciones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →