← 최신 논문
🤖 AI

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

이 논문은 Python 태스크를 변환함으로써 LiveCodeBench 데이터셋을 12개의 프로그래밍 언어로 확장한 오염 인지형 벤치마크인 Multi-LCB를 소개하며, 이를 통해 대규모 언어 모델의 교차 언어 코드 생성 능력을 엄격하게 평가하고 상당한 성능 격차와 Python 과적합 현상을 밝혀낸다.

원저자: Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수백만 개의 레시피를 읽으며 요리를 배운 아주 똑똑한 로봇 비서가 있다고 상상해 보세요. 하지만 여기 함정이 하나 있습니다. 그 레시피의 99%가 이탈리아 파스타였습니다.

당신이 이 로봇에게 완벽한 스파게티 카르보나라를 만들어 달라고 요청하면, 로봇은 천재적입니다. 거의 매번 완벽하게 해내죠. 하지만 만약 당신이 스시 롤, 타코, 또는 커리를 만들어 달라고 요청한다면, 로봇은 갑자기 어려움을 겪기 됩니다. 로봇은 생선 위에 파스타 소스를 얹거나, 젓가락 대신 포크를 사용하려고 할지도 모릅니다.

이것이 바로 Multi-LCB의 연구진들이 오늘날 가장 발전된 AI 코딩 어시스턴트들로부터 발견한 문제입니다.

문제점: "이탈리아 파스타" 편향

한동안 이 AI 코더들을 테스트하는 표준 척도는 **LiveCodeBench (LCB)**라는 벤치마크였습니다. LCB를 새로운 코딩 퍼즐이 계속 추가되는 거대한 도서관이라고 생각하면 됩니다. 이는 AI가 단순히 정답을 암기해서 '부정행위'를 하는 것이 아님을 알 수 있게 해주는 아주 좋은 도구입니다.

하지만 큰 결함이 있었습니다. LiveCodeBench는 오직 파이썬(Python)으로만 AI를 테스트했다는 점입니다. 파이썬은 코딩 세계의 "이탈리아 파스타"와 같습니다. 인기가 많고 다루기 쉽죠. 하지만 현실 세계에서 소프트웨어 엔지니어들은 파스타만 만드는 것이 아닙니다. 그들은 모든 것을 요리해야 합니다. 고속 시스템을 위해서는 C++이 필요하고, 대규모 기업용 앱을 위해서는 Java가 필요하며, 웹사이트를 위해서는 JavaScript가 필요합니다.

여기서 핵심적인 질문이 생깁라. 이 AI는 실제로 코딩을 잘하는 것인가, 아니면 단지 파이썬을 기가 막히게 잘하는 것뿐인가?

해결책: Multi-LCB (국제적인 포틀럭 파티)

저자들은 이 동일한 코딩 퍼즐 라이브러리를 12가지 다른 언어(Python, C++, Java, Rust, Go 등을 포함)로 번역하는 작업을 수행했습니다. 이것이 바로 Multi-LCB입니다.

그들은 단순히 AI에게 코드를 "번역"하라고 시킨 것이 아닙니다. 대신, 원래의 퍼즐(예: "이 숫자들의 합을 구하라")을 가져와서, AI가 C++, Java, Rust 등의 규칙을 사용하여 문제를 해결해야 하도록 지침을 다시 작성했습니다.

작동 방식 (주방 비유):

  1. 레시피: 코딩 대회(수학 문제 등)에서 퍼즐을 가져옵니다.
  2. 번역: "테스트 케이스"(정답이 맞는지 확인하는 방법)를 보편적인 형식으로 변환합니다. 예를 들어, "밀가루 2컵을 넣으세요"라는 레시피를 컵, 그램 저울, 혹은 숟가락을 사용하든 상관없이 작동하는 형식으로 바꾸는 것과 같습니다. 이를 통해 AI가 단순히 형식을 맞추는 능력이 아니라, 논리 자체를 테스트받도록 보장합니다.
  3. 테스트: AI는 동일한 퍼즐을 12가지 다른 언어로 해결하려고 시도합니다.
  4. 판정: 코드가 실제로 실행되는지, 그리고 충돌 없이 문제를 해결하는지 확인합니다.

발견한 점 (맛 테스트 결과)

연구진은 24개의 서로 다른 AI 모델을 테스트했습니다. 이 "맛 테스트"가 밝혀낸 내용은 다음과 같습니다.

  • "파스타" 과적합: 파이썬에서 챔피언이었던 많은 모델이 다른 언어에서는 평범하거나 형편없는 수준으로 떨어졌습니다. 이는 마치 라자냐는 완벽하게 만들지만 토스트는 태워 먹는 요리사와 같습니다. 이는 파이썬을 잘한다고 해서 AI가 일반적으로 코딩을 잘한다는 것을 자동으로 의미하지 않는다는 것을 증명합니다.
  • "비법 재료" 유출: 일부 모델은 특정 언어의 오래된 퍼즐에서 의심스러울 정도로 높은 성적을 보였습니다. 이는 해당 모델들이 문제를 해결하는 법을 실제로 배운 것이 아니라, 훈련 데이터에서 정답을 "암기"했을 가능성(마치 시험 답안지를 외운 학생처럼)을 시사합니다.
  • 난이도 격차: AI는 특정 언어를 훨씬 더 어렵게 느꼈습니다. AI는 규칙이 엄격하거나 덜 흔한 언어(Scala이나 Rust 등)에서 가장 고전했는데, 이는 사람이 익숙하지 않은 언어를 사용할 때 어려움을 겪는 것과 같습니다.

이것이 왜 중요한가

이 논문이 나오기 전까지, 우리는 파이썬 테스트를 통과한 AI를 "코딩 천재"라고 생각했습니다. 하지만 Multi-LCB는 많은 "천재"들이 사실은 파이썬 전문가일 뿐이라는 것을 보여주었습니다.

이 논문은 진정으로 유용한 소프트웨어 엔지니어링용 AI를 구축하려면, "이탈리아 파스타"(파이썬)만 테스트하는 것을 멈추고 전체 메뉴를 테스트하기 시작해야 한다고 결론짓습니다. Multi-LCB는 어떤 AI가 진정으로 국제적인 성찬을 차려낼 수 있는지 판별할 수 있는 주방과 레시피, 그리고 심사위원을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →