← Nieuwste papers
💻 computer science

Predicting Program Comprehension with Foundation Models of Human Cognition

Dit artikel toont aan dat Centaur, een fundatiemodel van menselijke cognitie getraind op algemene psychologische data, het basismodel Llama 3.1 overtreft in het voorspellen van ontwikkelaarsgedrag tijdens programma-begrip, wat suggereert dat cognitieve regelmatigheden geleerd uit brede psychologische experimenten effectief kunnen worden overgedragen naar complexe software engineering-taken.

Oorspronkelijke auteurs: Yannick Lehmen, Marvin Wyrich, Anna-Maria Maurer, Norman Peitek, Marvin Wyrich

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yannick Lehmen, Marvin Wyrich, Anna-Maria Maurer, Norman Peitek, Marvin Wyrich

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te raden wat een vriend als volgende zal zeggen in een gesprek. Je zou kunnen proberen elke individuele conversatie die ze ooit hebben gehad uit je hoofd te leren, of je zou de algemene regels kunnen proberen te begrijpen van hoe mensen denken, praten en reageren. Decennialang hebben onderzoekers die probeerden te voorspellen hoe softwareontwikkelaars code begrijpen, vastgezeten in dat eerste kamp: ze bouwden kleine, specifieke modellen voor specifieke taken, of ze probeerden de "complexiteit" van code te meten door bijvoorbeeld het aantal komma's in een zin te tellen. Maar deze methoden zijn als het proberen te voorspellen van een hele film door alleen naar de kleur van de schoenen van de acteurs te kijken — ze schalen ofwel niet op, of ze sluiten simpelweg niet goed aan bij de werkelijkheid.

Maak kennis met een nieuw idee uit de wereld van de psychologie. In plaats van een model te bouwen dat alleen over programmeren gaat, wat als we een model zouden trainen op hoe mensen handelen in alle soorten situaties? Dat is precies wat de onderzoekers in dit artikel deden. Ze namen een superintelligente AI genaamd Centaur, die getraind was op data van 160 verschillende psychologische experimenten (zoals geheugenspelletjes en beslissingspuzzels), en stelden een grote vraag: kan deze "algemene simulator van het menselijk brein" begrijpen hoe ontwikkelaars code lezen, ook al heeft het tijdens de training nog nooit een regel code gezien?

De Grote Ontdekking
Het antwoord, suggereert het artikel, is een volmondig "ja". Toen ze Centaur testten tegenover 9 verschillende studies waarbij echte ontwikkelaers code lazen, voorspelde Centaur hoe mensen zouden reageren veel beter dan het "ouderlijke" model, Llama 3.1, dat niet getraind was op die psychologische experimenten. Sterker nog, over alle proeven heen waren de voorspellingen van Centaur aanzienlijk dichter bij het menselijke gedrag. Denk er zo over na: Llama 3.1 is een briljante student die veel feiten kent, maar niet heeft geleerd hoe mensen echt denken. Centaur is diezelfde student, maar nadat hij een semester "Menselijk Gedrag 1.01" heeft gevolgd, begrijpt hij plotseling hoe mensen reageren, zelfs in een totaal nieuw onderwerp zoals programmeren.

Wat het NIET is
Dit is het belangrijkste deel: het artikel sluit expliciet een aantal zaken uit.

  1. Het gaat niet alleen om het raden van het antwoord. De onderzoekers maakten zich zorgen dat Centaur misschien gewoon goed is in het raden van veelvoorkomende antwoorden (zoals "Ja" of "Nee") omdat die vaak in de training voorkamen. Maar ze bewezen dit onjuist. Wanneer ze de code en de taakinstructies verwijderden uit de test, vertrouwde Centaur niet simpelweg op "responsbias" (antwoordspecifieke voorkeuren). Het werd daadwerkelijk beter in het gebruiken van de code zelf en de taakbeschrijvingen om het antwoord te achterhalen.
  2. Het is geen magische kristallen bol. Het artikel is voorzichtig en noemt dit een "suggestie" en een "overdracht" van patronen, en geen definitieve, opgeloste theorie van de menselijke geest. Ze ontdekten dat Centaur voor sommige lastige, verwarrende codepatronen (genaamd "Atoms of Confusion") niet zo goed was als Llama. Dit suggereert dat hoewel algemeen menselijk denken helpt, er nog steeds zeer specifieke programmeer-eigenaardigheden zijn die het model nog niet heeft geleerd.

Hoe ze het testten
Om er zeker van te zijn, speelden de onderzoekers een spel van "wegnemen". Ze voerden de modellen dezelfde code en vragen, maar verwijderden verschillende stukken informatie:

  • De Code: De eigenlijke programmeercode.
  • De Instructies: De tekst die uitlegt wat er moet gebeuren.
  • De Geschiedenis: Wat de ontwikkelaar in eerdere vragen deed.

Ze ontdekten dat Centaur minder vertrouwde op de geschiedenis van vorige antwoorden (waar Llama dol op was) en meer op de eigenlijke code en instructies. Dit is een enorme aanwijzing: het betekent dat Centaur een dieper begrip van de taak heeft geleerd, in plaats van simpelweg een patroon te volgen van "wat zei ik de vorige keer?".

De Cijfers
De resultaten werden gemeten met een score genaamd "negative log likelihood", waarbij lager beter is. Over alle studies heen behaalde Centaur een gemiddelde score van 1,63, terwijl Llama 3.1 een score van 1,85 behaalde. In 7 van de 9 onderzoeken die ze bekeken, was Centaur significant beter. Het verschil was geen klein toeval; de statistische "effectgrootte" was 0,17, wat het artikel noteert als een echte, meetbare verbetering.

De Conclusie
Dit artikel beweert niet het mysterie van hoe ontwikkelaars denken te hebben opgelost. In plaats daarvan suggereert het een krachtig nieuw pad voorwaarts. Het laat zien dat de manier waarop mensen code begrijpen geen vreemde, geïsoleerde superkracht is; het is gebouwd op dezelfde algemene cognitieve regels die ons helpen bij het spelen van geheugenspelletjes of het maken van beslissingen in andere delen van het leven. Door AI te trainen op algemeen menselijk gedrag, kunnen we eindelijk een hulpmiddel krijgen dat kan voorspellen waar ontwikkelaars tegenaan lopen bij code, niet door simpelweg regels te tellen, maar door de menselijke geest achter het toetsenbord te begrijpen. Het is een stap naar een toekomst waarin we softwaretools kunnen bouwen die echt "mensbewust" zijn, geworteld in de wetenschap van hoe wij daadwerkelijk denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →