← 최신 논문
🤖 AI

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

이 논문은 대규모 언어 모델이 진화하는 라이브러리 API를 처리하는 능력을 평가하기 위한 멀티태스크 벤치마크인 LibEvoBench와 소프트웨어 진화 이해 점수(SEUS) 지표를 도입하며, 현재의 모델들이 명시적인 버전 지정에도 불구하고 대체로 버전에 무관심하고 시대착오적인 오류를 범하기 쉽다는 점을 밝히고 있습니다.

원저자: Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 "PyTorch"라는 인기 있는 도구에 대해 쓰인 모든 책, 매뉴얼, 그리고 코드 조각을 전부 읽은 아주 명석한 신입 소프트웨어 엔지니어를 채용한다고 상상해 보십시오. 그들은 믿을 수 없을 정도로 똑똑하며 누구보다 빠르게 코드를 작성할 수 있습니다.

하지만, 함정이 하나 있습니다: 그들에게는 시간 개념이 없습니다.

이것이 바로 Daniele Cipollone와 그의 팀이 연구한 "LibEvoBench" 논문의 핵심 문제입니다. 그들은 오늘날의 AI 코딩 어시스턴트들이 마치 그 '시간 개념이 없는 엔지니어'와 같다는 사실을 발견했습니다. 즉, 자신이 어떤 버전의 소프트웨어 라이브러리를 사용해야 하는지 구분하는 데 어려움을 겪으며, 구버전의 규칙과 신버전의 규칙을 혼동하곤 한다는 것입니다.

다음은 이들의 연구 결과를 쉬운 비유를 통해 정리한 내용입니다.

1. 문제점: "시간 개념이 없는" 요리사

라이브러리(PyTorch나 NumPy 같은)가 거대한 요리책이라고 상상해 보십시오. 출판사는 몇 달마다 새로운 판본을 출시합니다.

  • 구판: "소금을 취향껏 넣으세요"라고 적혀 있습니다.
  • 신판: "소금과 후추를 함께 넣되, 음식이 매울 경우에만 넣으세요"라고 적혀 있습니다.

실제 소프트웨어 프로젝트는 메뉴 전체를 바꾸는 것이 비용이 많이 들고 위험하기 때문에, 종종 구판 요리책을 그대로 사용하는 레스토랑과 같습니다.

연구진은 현재의 AI 모델들이 이 모든 요리책을 한데 섞어 만든 "스무디"로 학습되었다는 것을 발견했습니다. AI에게는 "잠깐, 이 레스토랑은 2021년 판을 사용하고 있으니, 나는 2021년의 규칙을 따라야 해"라고 말할 수 있는 메커니즘이 없습니다. 대신, 가장 흔하거나 최신인 규칙을 바탕으로 추측하며, 이로 인해 시대착오적인 오류(anachronistic errors)—존재하지 않았던 명령어를 사용하거나, 삭제된 규칙을 무시하는 등의 오류—를 범하게 됩니다.

2. 해결책: LibEvoBench ("시간 여행 테스트")

이를 증명하기 위해 연구팀은 LibEvo2Bench라는 새로운 테스트를 구축했습니다. 이것은 AI 요리사들을 위한 엄격한 시험이라고 생각하면 됩니다.

  • 설정: 연구진은 특정 버전의 인기 라이브러리(PyTorch, NumPy, SciPy)를 사용하는 실제 프로젝트의 실제 코드를 기반으로 수천 개의 테스트 질문을 만들었습니다.
  • 세 가지 과제:
    1. API 호출 (API Calling): "여기 반쯤 작성된 레시피가 있습니다. 빠진 재료를 채워 넣으세요." (AI가 이 특정 버전에 맞는 도구를 제대로 고를 수 있는가?)
    2. API 식별 (API Identification): "여기 도구에 대한 설명이 있습니다. 이 도구의 이름은 무엇입니까?" (코드를 보지 않고도 올바른 도구를 식별할 수 있는가?)
    3. 시그니처 회상 (Signature Recall): "이 도구의 정확한 재료와 측정량은 무엇입니까?" (버전 간에 변하는 구체적인 세부 사항을 기억할 수 있는가?)

3. 결과: AI는 "버전 망각적"이다

결과는 놀라웠고, 가장 똑똑한 모델들(GPT-4/5, Claude, Gemini 등)에서도 일관되게 나타났습니다.

  • "안정적 API" vs "진화하는 API"의 격차: AI에게 변하지 않는 도구(Stable APIs)에 대해 물었을 때는 훌륭한 성적을 보였습니다. 하지만 버전 간에 변화가 있는 도구(Evolving APIs)에 대해 물었을 때는 성능이 현저히 떨어졌습니다. 이는 AI가 칼을 사용하는 법은 잘 알지만, 작년에 출시된 특정 새로운 도구를 사용하는 데는 서툴다는 것과 같습니다.
  • "버전 태그"의 환상: 연구진은 AI에게 "버전 2.0을 사용하세요"라고 명시적으로 알려주며 도움을 주려 했습니다. 하지만 효과가 없었습니다. 이는 시간 개념이 없는 사람에게 "지금은 1990년이야"라고 말해도, 그 사람이 여전히 존재하지도 않았던 스마트폰을 사용하려고 하는 것과 같습니다. AI는 "버전 2.0"이라는 단어를 보지만, 실제로 그 버전이 무엇을 포함하고 있는지는 알지 못합니다.
  • "매뉴얼"의 효과: 그러나 연구진이 질문 바로 옆에 실제 문서(레시피 북)를 놓아주자, AI의 성능은 10~20포인트 급상승했습니다. 이는 AI가 옆에 책이 있다면 규칙을 배울 수 있다는 것을 증명합니다. 즉, AI가 스스로의 뇌 속에 그 규칙들을 기억하고 있는 것은 아니라는 뜻입니다.

4. 새로운 점수표: SEUS

연구팀은 SEUS라는 새로운 점수를 만들었습니다. 이는 단순히 "정답을 몇 개 맞혔는가?"를 묻는 대신 다음과 같이 묻습니다.

  • "모델이 구버전과 신버전 모두에 대해 정답을 맞혔는가?"
  • "모델이 혼동하여 시대를 뒤섞어 버리지는 않았는가?"

이 점수를 통해, 그들은 최고의 모델들조차 여전히 상당 부분 "버전 망각적(version-oblivious)"이라는 사실을 발견했습니다. 그들은 똑똑하지만, 시간이 흐름에 따라 변화하는 소프트웨어를 탐색하는 데 필요한 특정한 종류의 "시간적 인지 능력"이 부족합니다.

요약

이 논문은 현재의 코딩 AI 모델들이 모든 교과서를 다 읽었지만 출판 날짜를 적어두는 것을 잊어버린 명석한 학생들과 같다고 결론짓습니다. 그들은 코드를 작성할 수는 있지만, 종종 "과거"의 프로젝트에 "미래"의 기능을 사용하거나, "미래"의 프로젝트에 "과거"의 기능을 사용하는 실수를 저지릅니다.

연구진은 이를 해결하기 위해서는 단순히 모델을 더 크게 만들거나 더 똑똑하게 만드는 것만으로는 부족하며, 어떤 규칙이 어떤 버전에 적용되는지 정확히 알 수 있도록 지식을 시간순으로 조직하는 법을 가르쳐야 한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →