← 최신 논문
💻 computer science

Predicting Program Comprehension with Foundation Models of Human Cognition

이 논문은 일반적인 심리학 데이터를 학습한 인간 인지의 파운데이션 모델인 Centaur가 프로그램 이해 과정 중 개발자의 행동을 예측하는 데 있어 기반 모델인 Llama 3.1보다 뛰어난 성능을 보임을 입증하며, 이는 광범위한 심리학 실험으로부터 학습된 인지적 규칙성이 복잡한 소프트웨어 공학 과업으로 효과적으로 전이될 수 있음을 시사한다.

원저자: Yannick Lehmen, Marvin Wyrich, Anna-Maria Maurer, Norman Peitek, Marvin Wyrich

게시일 2026-07-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yannick Lehmen, Marvin Wyrich, Anna-Maria Maurer, Norman Peitek, Marvin Wyrich

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구의 대화에서 다음에 무슨 말을 할지 추측하려고 한다고 상상해 보세요. 친구가 지금까지 했던 모든 대화를 암기할 수도 있고, 혹은 인간이 어떻게 생각하고, 말하고, 반응하는지에 대한 일반적인 규칙을 이해하려고 노력할 수도 있습니다. 수십 년 동안 소프트웨어 개발자가 코드를 어떻게 이해하는지 예측하려던 연구자들은 첫 번째 방식에 갇혀 있었습니다. 그들은 특정 작업만을 위한 아주 작은 전용 모델을 만들거나, 문장의 쉼표 개수를 세는 것처럼 코드의 "복잡성"을 측정하려고 시도했습니다. 하지만 이러한 방법들은 마치 배우의 신발 색깔만 보고 영화 전체를 예측하려는 것과 같습니다. 규모를 키울 수 없거나, 현실과 잘 맞지 않기 때문입니다.

심리학 세계에서 온 새로운 아이디어가 등장했습니다. 오직 코딩만을 위한 모델을 만드는 대신, 인간이 모든 상황에서 어떻게 행동하는지를 학습시킨다면 어떨까요? 이것이 바로 이 논문의 연구진이 수행한 작업입니다. 그들은 기억력 게임이나 의사결정 퍼즐 같은 160가지의 서로 다른 심리학 실험 데이터를 학습한 초지능 AI인 Centaur를 가져와서 다음과 같은 질문을 던졌습니다. 이 "일반적인 인간 뇌 시뮬레이터"가 학습 과정에서 코드 한 줄도 본 적이 없음에도 불구하고, 개발자들이 코드를 읽는 방식을 이해할 수 있을까?

위대한 발견
논문에 따르면 그 답은 강력한 "예"입니다. 연구진이 실제 개발자들이 코드를 읽는 과정을 담은 9가지의 서로 다른 연구를 대상으로 Centaur를 테스트했을 때, Centaur는 해당 심리학 실험들을 학습하지 않은 "부모" 모델인 Llama 3.1보다 인간의 반응을 훨씬 더 잘 예측했습니다. 실제로 모든 실험에 걸쳐 Centaur의 예측은 인간의 행동에 훨씬 더 가까웠습니다. 이렇게 생각해 보세요. Llama 3.1은 많은 사실을 알고 있는 똑똑한 학생이지만 사람들이 실제로 어떻게 '생각'하는지는 배우지 못한 상태입니다. 반면 Centaur는 동일한 학생이지만, "인간 행동학 101" 학기를 마친 후, 프로그래밍이라는 완전히 새로운 주제에서도 사람들이 어떻게 반응하는지를 갑자기 깨닫게 된 상태와 같습니다.

이것이 '아닌' 것들
여기 가장 중요한 부분이 있습니다. 논문은 몇 가지 사항을 명시적으로 배제합니다.

  1. 단순히 정답을 맞히는 것이 아닙니다. 연구진은 Centaur가 학습 데이터에서 자주 보았던 흔한 답변(예: "예" 또는 "아니오")을 단순히 추측하는 데 능숙한 것이 아닌지 우려했습니다. 하지만 그들은 이것이 틀렸음을 증명했습니다. 테스트에서 코드와 작업 지침을 제거했을 때, Centaur는 단순히 "응답 편향"에 의존하지 않았습니다. 오히려 정답을 찾아내기 위해 코드 자체작업 설명을 사용하는 능력이 향상되었습니다.
  2. 마법의 수정구슬이 아닙니다. 논문은 이것이 하나의 "제안"이자 패턴의 "전이"일 뿐, 인간 정신에 대한 최종적인 해결책이 아니라고 조심스럽게 밝히고 있습니다. 연구진은 일부 까다롭고 혼란스러운 코드 패턴(이를 "혼란의 원자(Atoms of Confusion)"라고 부릅니다)에 대해서는 Centaur가 Llama만큼 뛰어나지 못하다는 것을 발견했습니다. 이는 일반적인 인간의 사고가 도움이 되긴 하지만, 모델이 아직 배우지 못한 매우 특정한 코딩의 독특한 특성들이 여전히 존재함을 시사합니다.

어떻게 테스트했는가
확실히 하기 위해, 연구진은 "제거하기" 게임을 진행했습니다. 그들은 모델에 동일한 코드와 질문을 제공하되, 서로 다른 정보들을 삭제했습니다:

  • 코드: 실제 프로그래밍 스니펫.
  • 지침: 무엇을 해야 하는지 설명하는 텍text.
  • 이력: 이전 질문에서 개발자가 했던 행동들.

그 결과, Centaur는 (Llama가 즐겨 사용했던) 이전 답변의 이력에는 적게 의존하고, 실제 코드와 지침에는 더 많이 의존한다는 것을 발견했습니다. 이는 매우 중요한 단서입니다. 즉, Centaur가 단순히 "지난번에 뭐라고 했지?"라는 패턴을 따르는 것이 아니라, 과업을 이해하는 더 깊은 방식을 학습했다는 것을 의미합니다.

수치적 결과
결과는 "음의 로그 가능도(negative log likelihood)"라는 점수를 사용하여 측정되었으며, 이 점수는 낮을수록 좋습니다. 모든 연구에 걸쳐 Cent로(Centaur)는 평균 1.63을 기록한 반면, Llama 3.1은 1.85를 기록했습니다. 9개의 연구 중 7개에서 Centaur가 유의미하게 더 뛰어난 성적을 보였습니다. 이 차이는 단순한 우연이 아니었습니다. 통계적 "효과 크기(effect size)"는 0.17이었으며, 논문은 이것이 실질적이고 측정 가능한 개선임을 명시했습니다.

핵심 요약
이 논문은 개발자의 사고방식에 대한 미스터리를 풀었다고 주장하는 것이 아닙니다. 대신, 강력한 새로운 경로를 제시합니다. 이는 개발자가 코드를 이해하는 방식이 기이하고 고립된 초능력이 아니라, 우리가 기억력 게임을 하거나 삶의 다른 부분에서 결정을 내릴 때 사용하는 것과 동일한 일반적인 인지 규칙 위에 구축되어 있음을 보여줍니다. AI를 일반적인 인간 행동에 대해 학습시킴으로써, 우리는 드디어 코드를 단순히 줄 수로 세는 것이 아니라, 키보드 뒤에 있는 인간의 마음을 이해함으로써 개발자가 코드에서 어디를 어려워할지 예측할 수 있는 도구를 갖게 될지도 모릅니다. 이는 우리가 실제로 어떻게 생각하는지에 대한 과학에 기반하여, 진정으로 "인간을 인식하는(human-aware)" 소프트웨어 도구를 구축할 수 있는 미래를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →