← 최신 논문
💬 NLP

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

RealClawBench는 실제 OpenClaw 개발자-에이전트 세션에서 유도된 재구성된 실행 환경과 결정론적 스코어를 활용하여 281개의 까다로운 실무 과제를 재현 가능한 평가로 변환함으로써 현재 모델들의 상당한 성능 격차를 드러내는 라이브 벤치마크 프레임워크를 도입합니다.

원저자: Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 로봇 셰프가 얼마나 뛰어난지 테스트하려고 한다고 상상해 보세요.

과거의 방식 (전통적인 벤치마크):
전통적으로 연구자들은 "그릴드 치즈 샌드위치 만들기"나 "초콜릿 케이크 굽기"와 같은 완벽하고 교과서적인 레시피 목록을 작성했습니다. 그리고 로봇에게 이 레시피를 주고 단계를 잘 따르는지 확인했습니다. 문제는 현실은 교과서처럼 흘러가지 않는다는 점입니다. 현실 세계에서는 고객이 "빵이 약간 딱딱해요, 치즈는 냉장고 뒤쪽에 있어요, 그리고 그릴이 아니라 토스터 오븐밖에 없는데, 먹을 만한 걸로 좀 만들어 줄래요?"라고 말할 수도 있습니다. 기존의 테스트들은 로봇이 이러한 복잡하고 실제적인 세부 사항들을 처리할 수 있는지 확인하지 못했습니다.

새로운 방식 (REALCLAWBENCH):
이 논문의 저자들은 '개발자 에이전트'(프로그래머를 돕는 로봇)를 진정으로 테스트하려면, 가짜 테스트를 만드는 것을 멈추고 실제 사람들이 현장에서 로봇을 사용하는 모습을 관찰해야 한다는 점을 깨달았습니다.

그들은 REALCLAWBENCH라고 불리는 시스템을 구축했습니다. 이해를 돕기 위해 쉬운 비유를 들어 설명하겠습니다.

1. 실제 순간 포착하기 (소스)

팀은 단순히 과업을 발명하는 대신, 실제 개발자들이 코딩 도움을 받기 위해 "OpenClaw"라는 도구를 사용한 76,155회의 실제 세션을 관찰했습니다. 그들은 실제 사람들이 얼마나 복잡하고, 때로는 모호한 요청을 하는지 목격했습니다.

  • 비유: 조용한 주방에서 셰프가 메뉴를 작성하는 것이 아니라, 보안 카메라로 바쁜 레스토랑에서 실제 고객들이 음식을 주문하는 모습을 촬영하는 것과 같습니다.

2. "마법의 정화 과정" (파이프라인)

실제 고객의 가공되지 않은 기록을 그대로 가져와서 테스트로 만들 수는 없습니다. 그 기록에는 개인 비밀번호, 회사의 기밀 파일, 혹은 더 이상 존재하지 않는 컴퓨터에 대한 참조 등이 포함되어 있을 수 있기 때문입니다.
논문은 이 실제 순간들을 정화하는 파이프라인(단계별 공정 라인)을 설명합니다.

  • 개인정보 보호 스크린: 영상 속 얼굴을 흐리게 처리하는 것처럼, 모든 비밀 정보와 개인 정보를 삭제합니다.
  • 환경 재구성: 만약 개발자가 자신의 특정 컴퓨터에 있는 파일을 수정해 달라고 요청했다면, 팀은 해당 테스트를 나중에 다시 실행할 수 있도록 가상의 안전한 컴퓨터 환경을 구축합니다.
  • 요청 재작성: 모호하고 대화적인 요청("저번에 말했던 그거 좀 봐줄래요?")을 명확하고 독립적인 지시 사항("로그인 파일의 버그를 수정해 주세요")으로 변으로 바꿉니다.
  • 자동 판사: 사람이 직접 채점하는 대신, 결과물을 확인하는 컴퓨터 프로그램을 작성합니다. 파일이 수정되었는가? 예/아니오. 추측은 허용되지 않습니다.

3. 결과: "라이브" 테스트

최종 결과물은 281개의 실제 세계 과업을 담은 벤치마크입니다.

  • 특별한 이유: 이것은 "라이브"이며 "앵커링(anchored)" 되어 있습니다. 즉, 이 테스트는 시간이 지나면 낡아버리는 정적인 질문 목록이 아닙니다. 지속적인 실제 사용자 데이터 스트림으로부터 구축되었기 때문에, 새로운 실제 사례들로 테스트를 업데이트하여 신선함을 유지할 수 있습니다.
  • "현실 격차(Realism Gap)": 이 논문은 이전의 테스트들이 테스트 내용과 실제로 일어나는 일 사이에 "격차"가 있었다고 주장합니다. REALCLAWBENCH는 이 격차를 메웁니다. 이는 운전자를 완벽하고 텅 빈 경주 트랙에서 테스트하는 것에서, 실제 교통 체증과 구멍 난 도로, 그리고 당황한 보행자들이 있는 실제 도로 상황에서 테스트하는 것으로 전환하는 것과 같습니다.

무엇을 발견했는가?

그들은 이 새롭고 복잡한 실제 세계 테스트에 현재 사용 가능한 가장 똑똑한 14개의 AI 모델을 테스트했습니다.

  • 점수: 가장 뛰어난 AI 모델(Claude Opus 4.7)조차 약 **66%**의 과업만을 해결했습니다.
  • 시사점: 이는 여전히 개선의 여지가 많다는 것을 의미합니다. 현재의 "초지능적" 로봇들도 실제 개발자들이 매일 직면하는 복잡한 현실 세계의 문제들 앞에서는 여전히 고군분투하고 있습니다.

요약

요약하자면, 이 논문은 다음과 같이 말합니다: "로봇을 가짜의 완벽한 시나리오로 테스트하는 것을 멈추십시오. 대신 그들이 실제로 마주하는 복잡한 현실 세계의 문제들로 테스트하되, 공정하게 채점할 수 있을 만큼만 적절히 정화하여 테스트하십시오."

그들은 정확히 이 일을 수행하는 시스템을 구축했으며, 현재의 가장 뛰어난 로봇들도 실제 세계에서 진정으로 신뢰받기 위해서는 아직 약 3분의 2 정도의 길만 왔을 뿐이라는 사실을 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →