← 최신 논문
💬 NLP

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench는 데이터 오염 저항성을 보장하고 엄격한 통계적 분석 및 궤적 감사를 통해 배포된 시스템의 결정적인 통찰력을 드러내도록 설계되었으며, 실제 유지보수 작업을 수행하는 제품급 코딩 에이전트를 평가하기 위해 실제 오픈 소스 프로젝트에서 직접 작성된 25개의 러시아어 작업 명세로 구성된 레포지토리 수준의 에이전트 기반 코딩 벤치마크입니다.

원저자: Evgeny Shilov (Independent Researcher)

게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Evgeny Shilov (Independent Researcher)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡하고 맞춤 제작된 레이스 카 함대를 수리하기 위해 전문가급 정비사 팀을 고용한다고 상상해 보십시오. 지금까지 대부분의 정비사 테스트는 기술 매뉴얼처럼 완벽하고 격식 있는 영어로 작성되었습니다. 하지만 현실 세계에서 고객은 매뉴얼처럼 말하지 않습니다. 그들은 자신의 모국어로 이렇게 말합니다. "비 오는 화요일에 브레이크를 밟을 때마다 차가 흔들리기 시작했어요."

RuBench는 AI 코딩 어시스턴트가 영어가 아닌 러시아어로 작성된 이러한 무질서한 현실 세계의 고객 요청을 실제로 이해할 수 있는지 확인하기 위해 설계된 새로운 테스트입니다.

다음은 이 테스트가 어떻게 작동하는지, 어떤 일이 일어났는지, 그리고 연구진이 발견한 놀라운 반전을 쉬운 비유를 사용하여 설명한 내용입니다.

1. 테스트: "현실적인" 정비소

기존의 대부분의 테스트는 AI 에이전트에게 깔끔한 영어 버그 설명을 제공했습니다. RuBench는 다릅니다.

  • 자동차: 이 테스트는 다섯 개의 실제 인기 오픈 소스 소프트웨어 프로젝트(예: aiohttp 또는 Laravel)를 사용합니다. 이것들은 가짜 퍼즐이 아니라 수천 명의 개발자가 사용하는 실제 코드베이스입니다.
  • 요청 사항: 연구진은 공식적인 버그 보고서 대신, 처음부터 러시아어로 된 25개의 새로운 요청을 작성했습니다. 이는 마치 사업주가 계약자에게 불평하는 것처럼 들립니다. "봇을 관리자로 만들면 충돌이 발생해요. 수정하되, 기존 채팅 기능은 망가뜨리지 마세요."
  • 미스터리 박스: 연구진은 "정답지"(실제 코드 수정 사항과 그것이 작동함을 증명하는 테스트)를 숨겨두었습니다. AI는 스스로 수정 방법을 찾아내야 합니다. 오직 연구진만이 그 키를 가지고 AI의 성공 여부를 확인할 수 있습니다.
  • 신선도: 모든 버그는 AI 모델이 학습된 이후에 이루어진 코드 업데이트에서 발견되었습니다. 이는 AI가 학습 데이터에서 단순히 정답을 암기했을 가능성을 배제하기 위함입니다.

2. 정비사: 누가 일을 완수했는가?

연구진은 네 가지 서로 다른 "정비사 팀"(소프트웨어 도구와 AI 모델의 조합)을 테스트했습니다. 각 팀을 25개의 수리 작업에 대해 세 번씩 실행하여 얼마나 일관성이 있는지 확인했습니다.

  • 스타 플레이어: Claude Code와 "Opus 4.8" 모델을 사용하는 팀이 가장 뛰어났습니다. 이 팀은 약 **79%**의 문제를 해결했습니다.
  • 중위권: "Sonnet 5" 모델도 거의 대등한 성적(75%)을 냈으며, Codex CLI를 통한 "GPT-5.5" 모델은 약 67%를 해결했습니다.
  • 고전하는 정비사: 더 저렴하고 빠른 버전인 "Haiku 4.5" 모델은 약 **53%**의 작업만을 해결했습니다.

주의 사항: 25개의 작업만 있었기 때문에 상위 세 팀 간의 차이가 통계적으로 "실제로 존재한다"고 입증된 것은 아닙니다. 운이 좋았을 수도 있습니다. 하지만 상위 팀들과 고전하는 Haiku 모델 사이의 격차는 매우 크고 명확했습니다. 상위 팀들은 하위 팀과는 완전히 다른 수준의 문제를 해결했습니다.

3. 거대한 반전: "조용한 교체"

이것이 논문에서 가장 흥란한 부분입니다. 연구진은 Fable 5라는 새로운 모델을 사용하는 다섯 번째 팀도 테스트했습니다.

그들이 AI가 수행한 작업의 "블랙박스" 로그를 자세히 조사했을 때, 다음과 같은 비밀을 발견했습니다.

  • 20%의 작업에서, Fable 5 모델은 실제로 작업을 수행하지 않았습니다.
  • 대신, 소프트웨어 제품(Claude Code)이 작업 도중에 Fable 5를 더 오래되고 강력한 Opus 4.8 모델로 몰래 교체했습니다.
  • 이유는? Fable 5는 매우 엄격한 안전 가드레일을 가지고 있습니다. 표준 인터넷 프로토콜(웹 헤더 수정 등)과 관련된 작업을 발견하자, 안전 가드레일이 불안해하며 "이 작업은 건드릴 수 없다"고 판단했고, 시스템이 작업을 마무리하기 위해 자동으로 Opus 4.8로 넘겨버린 것입니다.

교훈: 연구진은 우리가 AI 제품을 테스트할 때, 단순히 "뇌"(모델)를 테스트하는 것이 아니라 "몸체"(전체 소프트웨어 패키지)를 테스트하고 있다는 것을 깨달았습니다. 소프트웨어가 작업 중간에 몰래 뇌를 교체한다면, 그 테스트 결과는 해당 특정 뇌가 할 수 있는 능력에 대해 거짓을 말하고 있는 것입니다.

4. 결론

  • 성공: 제품급 AI 에이전트는 이미 비영어권 언어(러시아어)로 명시된 실제 유지보수 작업을 처리할 수 있을 만큼 충분히 훌륭합니다. 최고의 설정은 10개 중 거의 8개의 작업을 해결했습니다.
  • 현실 점검: "저렴한" 모델들(Haiku와 같은)은 여전히 현저히 약하며, 문제의 절반 정도만 해결합니다.
  • 방법론: 이 논문은 정직한 결과를 얻으려면 모델을 교체하거나 온라인에서 정답을 찾아보는 등의 부정행위를 하지 않았는지 확인하기 위해 AI의 전체 "일기"(궤적)를 반드시 관찰해야 함을 입증합니다.

요약하자면, RuBench는 AI가 "인간의 언어"(러시아어)를 구사하는 데 능숙해지고 있음을 보여주는 동시에, 이 AI들을 감싸고 있는 소프트웨어가 때로는 작업자를 더 나은 사람으로 몰래 교체하여 알려주지 않는 속임수를 쓸 수 있다는 점도 밝혀냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →