← Últimos artículos
💻 computer science

Predicting Program Comprehension with Foundation Models of Human Cognition

Este artículo demuestra que Centaur, un modelo fundacional de la cognición humana entrenado en datos psicológicos generales, supera a su modelo base Llama 3.1 en la predicción del comportamiento de los desarrolladores durante la comprensión de programas, lo que sugiere que las regularidades cognitivas aprendidas de experimentos psicológicos amplios pueden transferirse eficazmente a tareas complejas de ingeniería de software.

Autores originales: Yannick Lehmen, Marvin Wyrich, Anna-Maria Maurer, Norman Peitek, Marvin Wyrich

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yannick Lehmen, Marvin Wyrich, Anna-Maria Maurer, Norman Peitek, Marvin Wyrich

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que intentas adivinar qué dirá un amigo a continuación en una conversación. Podrías intentar memorizar cada una de las conversaciones que ha tenido en la vida, o podrías intentar comprender las reglas generales de cómo los humanos piensan, hablan y reaccionan. Durante décadas, los investigadores que intentaban predecir cómo los desarrolladores de software entienden el código se han quedado estancados en el primer grupo: han construido modelos diminutos y específicos para tareas concretas, o han intentado medir la "complejidad" del código contando cosas como el número de comas en una oración. Pero estos métodos son como intentar predecir una película entera mirando únicamente el color de los zapatos de los actores: o no escalan bien o simplemente no coinciden con la realidad.

Entra en escena una nueva idea del mundo de la psicología. En lugar de construir un modelo solo para la programación, ¿qué pasaría si entrenáramos un modelo sobre cómo actúan los humanos en todo tipo de situaciones? Eso es exactamente lo que hicieron los investigadores en este artículo. Tomaron una IA superinteligente llamada Centaur, que había sido entrenada con datos de 160 experimentos psicológicos diferentes (como juegos de memoria o acertijos de toma de decisiones), y le plantearon una gran pregunta: ¿Puede este "simulador del cerebro humano general" entender cómo los desarrolladores leen código, a pesar de que nunca vio una sola línea de código durante su entrenamiento?

El Gran Descubrimiento
La respuesta, sugiere el artículo, es un rotundo "sí". Cuando probaron a Centaur frente a 9 estudios diferentes que involucraban a desarrolladores reales leyendo código, Centaur predijo cómo responderían los humanos mucho mejor que su "modelo padre", Llama 3.1, que no había sido entrenado con esos experimentos psicológicos. De hecho, en todos los ensayos, las predicciones de Centaur estuvieron significativamente más cerca del comportamiento humano. Piénsalo de esta manera: Llama 3.1 es un estudiante brillante que sabe muchos datos, pero no ha aprendido cómo piensa la gente realmente. Centaur es ese mismo estudiante, pero después de cursar un semestre de "Comportamiento Humano 101", de repente entiende cómo reacciona la gente, incluso en un tema totalmente nuevo como la programación.

Lo que NO es
Aquí está la parte más importante: El artículo descarta explícitamente algunas cosas.

  1. No se trata solo de adivinar la respuesta. Los investigadores temían que Centaur pudiera ser bueno simplemente adivinando respuestas comunes (como "Sí" o "No") porque las vio muchas veces en su entrenamiento. Pero demostraron que esto era falso. Cuando eliminaron el código y las instrucciones de la tarea, Centaur no se limitó a depender de los "sesgos de respuesta". De hecho, mejoró su capacidad para utilizar el propio código y las descripciones de la tarea para hallar la respuesta.
  2. No es un oráculo mágico. El artículo tiene cuidado en decir que esto es una "sugerencia" y una "transferencia" de patrones, no una teoría final y resuelta de la mente humana. Encontraron que, para algunos patrones de código complicados y confusos (llamados "Átomos de Confusión"), Centaur no fue tan bueno como Llama. Esto sugiere que, si bien el pensamiento humano general ayuda, todavía existen algunas peculiaridades de la programación muy específicas que el modelo aún no ha aprendido.

Cómo lo Probaron
Para estar seguros, los investigadores jugaron al juego de "quitar elementos". Alimentaron a los modelos con el mismo código y las mismas preguntas, pero eliminaron diferentes piezas de información:

  • El Código: Los fragmentos de programación reales.
  • Las Instrucciones: El texto que explica qué hacer.
  • El Historial: Lo que el desarrollador hizo en preguntas anteriores.

Descubrieron que Centaur dependía menos del historial de respuestas previas (que a Llama le encantaba usar) y más del código y las instrucciones reales. Esta es una pista enorme: significa que Centaur aprendió una forma más profunda de entender la tarea, en lugar de simplemente seguir un patrón de "¿qué dije la última vez?".

Los Números
Los resultados se midieron utilizando una puntuación llamada "log-verosimilitud negativa" (negative log likelihood), donde un valor menor es mejor. En todos los estudios, Centaur logró un promedio de 1.63, mientras que Llama 3.1 obtuvo un 1.85. En 7 de los 9 estudios analizados, Centaur fue significativamente mejor. La diferencia no fue solo un pequeño error fortuito; el "tamaño del efecto" estadístico fue de 0.17, algo que el artículo señala como una mejora real y mensurable.

La Conclusión
Este artículo no pretende haber resuelto el misterio de cómo piensan los desarrolladores. En cambio, sugiere un nuevo y poderoso camino a seguir. Demuestra que la forma en que los humanos entienden el código no es un superpoder extraño e aislado; está construida sobre las mismas reglas cognitivas generales que nos ayudan a jugar juegos de memoria o a tomar decisiones en otras partes de la vida. Al entrenar a la IA con el comportamiento humano general, podríamos finalmente obtener una herramienta que pueda predecir cómo los desarrolladores tendrán dificultades con el código, no solo contando líneas, sino comprendiendo la mente humana detrás del teclado. Es un paso hacia un futuro donde podamos construir herramientas de software que sean verdaderamente "conscientes del humano", fundamentadas en la ciencia de cómo pensamos realmente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →