← 최신 논문
💻 computer science

RubberDuckBench: A Benchmark for AI Coding Assistants

본 논문은 AI 코딩 어시스턴트를 평가하기 위해 실제 GitHub 풀 리퀘스트에서 파생된 다국어 벤치마크인 RubberDuckBench 를 소개하며, 최첨단 모델조차 일관성과 정확성에서 어려움을 겪고 자주 환각을 일으키며 비용과 성능 간에는 관찰된 상관관계가 없다는 점을 밝힙니다.

원저자: Ferida Mohammed, Fatma Ayad, Petros Maniatis, Satish Chandra, Elizabeth Dinella

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ferida Mohammed, Fatma Ayad, Petros Maniatis, Satish Chandra, Elizabeth Dinella

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분을 위해 컴퓨터 코드를 작성할 수 있는 매우 똑똑하고 매우 빠른 로봇 팀이 있다고 가정해 봅시다. 여러분은 이들에게 "이 코드 부분이 왜 이상하게 작동할까?" 또는 "이 숫자를 바꾸면 어떤 일이 일어날까?"와 같은 질문을 합니다. 여러분은 이 로봇들이 여러분이 작업 중인 특정 코드를 살펴보고 완벽한 답변을 해줄 것이라고 기대합니다.

이 논문인 RubberDuckBench는 이러한 로봇 조수들을 위한 최종 시험과 같습니다. 저자들 (브라이든 메이어 칼리지, 구글, 메타의 연구원들) 은 이 로봇들이 실제로 특정 코드에 대한 질문에 답변하는 데 능숙한지, 아니면 단순히 추측하고 있는지를 확인하고 싶어 했습니다.

간단한 비유를 사용하여 이 연구의 개요를 살펴보면 다음과 같습니다:

1. 문제: "문맥 밖" 함정

이 연구 이전까지 AI 프로그래머들을 위한 대부분의 테스트는 학생에게 프롬프트를 바탕으로 완전히 새로운 에세이를 처음부터 쓰도록 요구하는 것과 같았습니다. 하지만 현실에서 프로그래머들은 새로운 코드를 요청할 뿐만 아니라, 특정 프로젝트에 이미 존재하는 코드에 대해 질문합니다.

  • 과거의 테스트: 요리사에게 "케이크는 어떻게 만드나요?"라고 묻는 것과 같습니다.
  • 현실 세계: 요리사가 "왜 내 케이크가 오븐의 세 번째 선반에서 탔을까?"라고 묻는 것과 같습니다.
    연구자들은 두 번째 유형의 질문에 대한 적절한 테스트가 아직 구축되지 않았음을 깨달았습니다.

2. 시험 제작: "러버덕" 방법

프로그래머들은 종종 코드 문제를 파악하기 위해 "러버덕"(또는 동료) 과 대화합니다. 연구원들은 GitHub(사람들이 코드를 공유하는 곳) 에서 개발자들 간의 실제 대화를 살펴보았습니다.

  • 출처: 그들은 개발자들이 서로의 코드에 대해 구체적인 질문을 하는 수천 개의 댓글을 발견했습니다.
  • 필터링: 많은 댓글은 "이 오타를 고쳐라"와 같은 단순한 제안에 불과했습니다. 연구원들은 AI 와 인간을 활용하여 노이즈를 제거하고 좋은 질문들을 선별하여 명확한 15 개 문제의 시험지로 만들었습니다.
  • 채점 기준: 코드를 설명하는 정답이 하나만 있는 것은 아니기 때문에, 그들은 상세한 채점 기준표 (rubrics) 를 만들었습니다. 이는 "학생이 'const' 키워드를 언급하면 2 점을 주고, 코드가 어떻게 작동하는지 거짓말을 하면 3 점을 뺏는다"라고 명시하는 교사의 가이드와 같습니다.

3. 시험: 20 대의 로봇이 시험을 치르다

그들은 20 개의 서로 다른 AI 모델 (즉, "로봇들") 을 이 시험에 투입했습니다. 여기에는 GPT-5, Claude Opus, Grok 4 등 유명한 모델들이 포함되었습니다. 그들은 이들에게 제공된 특정 코드를 바탕으로 15 개의 질문에 답하도록 요청했습니다.

4. 결과: 로봇들은 결함이 있다

결과는 "초지능" 로봇들에게 놀랍고 다소 실망스러운 것이었습니다:

  • 명확한 승자 부재: 최상위 로봇인 Grok 4는 약 **69%**의 질문에 맞췄습니다. 그 다음으로 좋은 모델들은 약 **68%**를 맞췄습니다. 통계적으로 그들은 모두 같은 "리그"에 속했습니다. 명확한 챔피언은 없었습니다.
  • "완벽한 점수" 신화: 심지어 최상위 로봇들도 거의 모든 질문을 완벽하게 맞춘 적은 없습니다. 최상위 로봇들은 모든 시도에서 15 개 중 2 개의 질문에만 완벽하게 답할 수 있었습니다. 그들의 점수 대부분은 "부분 점수"(답의 일부만 맞춘 경우) 에서 나왔습니다.
  • 거짓말 문제 (할루시네이션): 이것이 가장 큰 문제였습니다. 평균적으로 로봇들은 답변의 **58%**에서 거짓말을 하거나 사실을 지어냈습니다.
    • 비유: 여행 가이드에게 도시의 특정 거리에 대해 물어본다고 상상해 보세요. 절반의 경우, 그들은 그 거리가 실제로는 제과점인데 공원이 있다고 자신 있게 말해줍니다.
    • 심지어 o3와 같은 최상위 모델조차도 답변의 **67%**에서 거짓말을 했습니다.
  • 파이썬의 어려움: 로봇들은 Java 와 C++ 코드에 대한 질문에는 훨씬 잘 답변했지만, 코드가 파이썬으로 작성되었을 때는 크게 실수했습니다.

5. 가격 대비 성능

연구원들은 더 많은 돈을 지불하거나 "더 큰 두뇌"(더 많은 파라미터) 를 사용하는 것이 로봇들을 더 똑똑하게 만드는지 또한 확인했습니다.

  • 돈이 천재를 사주지 않는다: 가장 비싼 모델들 (예: Claude Opus) 은 실행 비용이 많이 들지만, 저렴한 모델들보다 성능이 크게 나아지지 않았습니다. 실제로 Grok 4가 가장 좋은 성능을 보였지만, 비싼 Claude 모델들보다 12 배 더 저렴했습니다.
  • 크다고 좋은 것은 아니다: 오픈소스 모델들의 경우, 가장 큰 모델 (1200 억 파라미터) 이 실제로 더 작은 모델 (200 억 파라미터) 보다 나쁜 성능을 보였습니다.

결론

이 논문은 AI 코딩 조수들이 발전하고 있지만, 특정 코드에 대한 복잡한 질문에 답변하는 데 있어서는 아직 신뢰할 수 없다고 결론 내립니다. 그들은 종종 추측을 하고, 빈번하게 거짓말을 하며, 가장 비싼 옵션이 반드시 가장 똑똑한 것은 아닙니다.

저자들은 RubberDuckBench를 향후 연구의 목표로 삼아, 단순히 지어내는 것이 아니라 코드를 진정으로 이해하고 정직하며 정확한 AI 조수들을 개발하도록 개발자들을 독려하기를 희망합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →