← Últimos artículos
💻 computer science

Are Coding Agents Generating Over-Mocked Tests? An Empirical Study

Este estudio empírico de más de 1,2 millones de commits revela que los agentes de codificación tienen una probabilidad significativamente mayor que los no agentes de generar pruebas y, notablemente, de sobre-simularlas (over-mocking), lo que plantea preocupaciones sobre la mantenibilidad y efectividad de las pruebas al tiempo que destaca la necesidad de una mejor guía de configuración para los agentes.

Autores originales: Andre Hora, Romain Robbes

Publicado 2026-02-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Andre Hora, Romain Robbes

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has contratado a un equipo de asistentes robóticos súper rápidos y súper inteligentes (llamados "Agentes de Codificación") para ayudarte a construir una casa. Estos robots no solo colocan ladrillos; también pueden escribir los manuales de instrucciones, revisar la fontanería e incluso redactar los informes de inspección de seguridad (que en el software se llaman "pruebas").

Este documento es como un informe de detective que fue a las obras de construcción de 2,168 casas digitales diferentes para ver cómo estos robots están realizando realmente su trabajo. Específicamente, los investigadores querían saber: ¿Están estos robots escribiendo demasiadas comprobaciones de seguridad "falsas"?

Aquí está el desglose de lo que encontraron, utilizando analogías simples:

1. El Robot "Sobreprotector"

En las pruebas de software, un "mock" es como un actor de sustitución en una película. Si estás filmando una escena donde un personaje habla con un gerente de un banco, pero no tienes a un gerente de banco real disponible, podrías usar a un amigo con traje que simplemente diga líneas preescritas. Esto es un "mock". Hace que la escena sea más fácil de filmar (la prueba es más rápida y fácil de escribir), pero no demuestra que el gerente de banco real se comportaría de esa manera.

El estudio encontró que los asistentes robóticos están obsesionados con el uso de estos actores de sustitución.

  • La Estadística: Cuando los desarrolladores humanos escriben una prueba, usan un "actor de sustitución" aproximadamente el 26% de las veces. Cuando los robots escriben una prueba, usan un actor de sustitución el 36% de las veces.
  • La Metáfora: Es como si los robots tuvieran tanto miedo al mundo real (bases de datos reales, conexiones a internet reales) que prefieren ensayar toda la obra con recortes de cartón en lugar de con personas reales. Hacen esto con más frecuencia que los humanos.

2. A los Robots les encanta escribir comprobaciones de seguridad

Los investigadores también comprobaron con qué frecuencia los robots escribían realmente los informes de inspección de seguridad (pruebas) en primer lugar.

  • La Estadística: Alrededor del 23% del trabajo que hicieron los robots consistió en escribir o modificar pruebas. Los humanos solo hicieron esto aproximadamente el 13% de las veces.
  • La Metáfora: Los robots no solo están colocando ladrillos; están escribiendo activamente los reglamentos. De hecho, en las obras de construcción nuevas (repositorios creados en 2025), los robots son responsables de escribir el 17% de todas las comprobaciones de seguridad, una cifra que crece rápidamente.

3. Herramientas de "Talla Única"

El documento analizó qué tipo de actores de sustitución estaban usando los robots. Hay diferentes tipos de "dobles de prueba" (objetos falsos): algunos solo se quedan ahí sentados (dummies), otros fingen ser reales (stubs) y otros observan lo que sucede (spies).

  • El Hallazgo: Los humanos utilizan una variedad de herramientas. Pueden usar un "espía" aquí y un "falso" allá.
  • El Hábito del Robot: Los robots son perezosos con la variedad. Usan la herramienta "Mock" el 95% de las veces.
  • La Metáfora: Imagina una caja de herramientas. Los humanos tienen un martillo, un destornillador, una llave inglesa y una sierra. Los robots se presentan con un martillo gigante e intentan usarlo para todo, incluso cuando necesitan un destornillador. Dependen de un tipo específico de objeto falso casi exclusivamente.

4. El Peligro de ser "Demasiado Falso"

¿Por qué es esto importante? El documento advierte que, si bien el uso de demasiados "actores de sustitución" hace que sea más fácil para los robots escribir las pruebas rápidamente, puede hacer que las pruebas sean menos útiles.

  • El Riesgo: Si solo pruebas tu casa con recortes de cartón, podrías pensar que la fontanería es perfecta. Pero cuando abres el agua real, las tuberías podrían estallar porque el cartón no reaccionaría como el metal real.
  • La Conclusión: Los robots están generando pruebas que son fáciles de crear pero que podrían no detectar problemas reales porque están demasiado aisladas de la realidad.

¿Qué deberíamos hacer?

Los autores sugieren que, dado que estos robots están tan ansiosos por usar actores "falsos", necesitamos darles mejores instrucciones.

  • La Solución: Así como le dirías a un aprendiz humano: "No uses un tubo falso para la línea principal de agua", necesitamos escribir reglas específicas en los manuales de instrucciones de los robots (archivos de configuración). Necesitamos decirles: "Usa objetos reales siempre que sea posible, y solo usa falsos cuando sea absolutamente necesario".

En resumen: Los robots están trabajando duro y escribiendo muchas pruebas de seguridad, pero son un poco demasiado ansiosos por usar versiones "falsas" de la realidad, lo que podría hacer que sus comprobaciones de seguridad sean menos fiables. Necesitamos enseñarles a mezclar más escenarios del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →