← Últimos artículos
💻 computer science

How Do Software Professionals Evaluate AI-Generated Code? (Registered Report)

Este informe registrado describe un estudio de teoría fundamentada constructivista que combina una encuesta completada con entrevistas iterativas para desarrollar una teoría sobre cómo los profesionales del software evalúan el código generado por IA.

Autores originales: Samuli Määttä, Hera Arif, Burak Turhan, Paul Ralph, Markus Kelanti

Publicado 2026-07-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Samuli Määttä, Hera Arif, Burak Turhan, Paul Ralph, Markus Kelanti

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que acabas de entregarle a un robot chef una receta para un pastel de chocolate. El robot zumba, hace ruidos y escupe un pastel de aspecto perfecto. Pero aquí está el giro: tú no lo horneaste. Tienes que probarlo, revisar los ingredientes y decidir si es seguro comerlo antes de servírselo a tus amigos.

Eso es exactamente lo que los profesionales del software están haciendo ahora mismo con la IA Generativa. Herramientas como GitHub Copilot y ChatGPT están actuando como esos robots chefs, preparando líneas de código a la velocidad del rayo. Pero mientras los robots se vuelven más rápidos, los humanos siguen atrapados en la cocina, tratando de averiguar: ¿Es este código realmente bueno? ¿O es una trampa deliciosa?

Este documento no es un informe sobre un pastel terminado; es una receta para un nuevo estudio (llamado "Informe Registrado") que los autores apenas están empezando a hornear. Quieren entender cómo los humanos están actualmente probando, testeando y confiando en estas creaciones hechas por IA.

El gran misterio: ¿Estamos probando el pastel?

Los autores sospechan que las cosas se están complicando. Cuando escribes código por ti mismo, conoces cada ingrediente. Pero cuando la IA escribe el código, este podría tener errores ocultos, sabores extraños o ingredientes que no pediste.

El documento sugiere que, debido a que todo el mundo tiene prisa (plazos de entrega, competencia, jefes respirándoles en el cuello), los desarrolladores podrían verse tentados a tomar atajos. En lugar de probar cuidadosamente cada bocado, podrían simplemente asumir que el robot chef hizo un buen trabajo. Esto es como confiar en una varita mágica para arreglar tu tarea sin leer la respuesta. Los autores temen que esto pueda llevar a una sobre-dependencia, donde los humanos dejan de pensar críticamente y simplemente dejan que la IA haga el trabajo, lo que potencialmente conduce a un software desastroso y roto.

El plan: Un kit de herramientas de detective

Para resolver este misterio, los investigadores no solo están adivinando. Están construyendo una teoría basada en historias reales de personas reales. Este es su plan de juego:

  1. La primera pista (La encuesta): Ya le preguntaron a 163 profesionales del software en Finlandia qué piensan. Preguntaron cosas como: "¿Revisas el código de la IA de manera diferente al código humano?" y "¿Ha cambiado tu confianza en estas herramientas?". Obtuvieron 51 respuestas sobre validación, 79 sobre mantenerse productivo y 103 sobre cómo ha cambiado su confianza.
  2. La inmersión profunda (Las entrevistas): Ahora, quieren hablar con 20 a 50 de estos profesionales. No solo están preguntando "¿Te gustó el pastel?". Están utilizando una técnica especial llamada "escalonamiento" (laddering).
    • Imagina una escalera: Comienzan con una acción específica (el peldaño inferior), como "Ejecuto una prueba en el código". Luego preguntan, "¿Por qué es eso importante?" (el siguiente peldaño hacia arriba). Tal vez la respuesta sea "Porque necesito sentirme seguro". Luego preguntan, "¿Por qué es importante sentirse seguro?" (el peldaño superior). Tal vez la respuesta sea "Porque no quiero perder mi trabajo" o "Porque me importa mi reputación".
    • Esto les ayuda a escalar desde los hábitos simples hasta los valores y miedos profundos que impulsan esos hábitos.

¿Con quién están hablando?

Buscan a personas que realmente utilicen estas herramientas. De su encuesta inicial, encontraron una mezcla de 163 personas. Cerca del 48.5% tenía menos de 10 años de experiencia, mientras que el 12.9% tenía 30+ años. El grupo incluyó Desarrolladores Full-Stack, Arquitectos, Científicos de Datos e incluso CEOs. Quieren escuchar de todos, desde los recién graduados hasta los veteranos.

Lo que NO están haciendo

Es importante saber de qué no trata este estudio:

  • No están intentando demostrar que la IA es mala o buena.
  • No están midiendo exactamente cuántos errores comete la IA (ese es un estudio diferente).
  • No están diciendo que tienen la respuesta final todavía. De hecho, admiten que no saben exactamente qué encontrarán hasta que comiencen las entrevistas. Mantienen sus mentes abiertas para dejar que las respuestas los sorprendan.

El "porqué" detrás del estudio

Los investigadores son un poco escépticos. Uno de los autores principales es un estudiante de doctorado que nunca ha trabajado en una empresa de software real. Tiene curiosidad pero es cauteloso, preocupado de que la gente esté dejando que la IA reemplace sus propias habilidades sin darse cuenta. Otro autor ha estudiado cómo medimos la calidad del código durante años y le preocupa que estemos aplicando reglas antiguas a herramientas nuevas y mágicas.

Ellos creen que el conocimiento no se "encuentra" como una moneda perdida; se construye hablando con las personas y entendiendo sus historias. Quieren construir una teoría que explique cómo los profesionales del software construyen su propia realidad de confianza y seguridad al trabajar con la IA.

La conclusión

Este documento es una invitación a observar un experimento científico desarrollarse. Los investigadores están reuniendo a un grupo de 20–50 expertos para escalar la "escalera" de sus pensamientos, con la esperanza de descubrir por qué confían (o no confían) en el código que escriben los robots. No prometen un milagro para el mal código, pero sí prometen una mirada profunda y honesta sobre cómo los humanos están tratando de mantenerse al día con las máquinas.

Como dicen, quieren entender las experiencias subjetivas de las personas en la cocina. Porque hasta que sepamos qué sienten respecto al pastel, no podemos estar seguros de si el robot chef es un genio o solo un golpe de suerte.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →