← 최신 논문
💻 computer science

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

본 논문은 지속적 상태 충돌이 있는 실행 가능한 워크플로우에서 명령줄 에이전트를 평가하는 생성기 기반 벤치마크 프레임워크인 ClawForge 를 소개하며, 최신 최첨단 모델들이 기존 상태를 검사하고 사전 존재하는 아티팩트를 처리하는 데 크게 어려움을 겪어 엄격한 정확도가 최대 45.3% 에 머무르고 있음을 밝힌다.

원저자: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 ClawForge 논문에 대한 설명을 일상적인 언어와 창의적인 비유로 번역한 것입니다.

큰 그림: "지저분한 책상" 문제

매우 똑똑한 로봇 비서를 고용하여 당신의 삶을 정리하게 한다고 상상해 보세요. 우리가 이 로봇들에게 주는 대부분의 테스트는 마치 "새로 빈 책상"을 주고 "할 일 목록을 작성해 주세요"라고 말하는 것과 같습니다. 로봇은 목록을 작성하고 우리는 그 단어들이 정확한지 확인합니다.

하지만 현실 세계에서는 당신의 책상이 결코 비어 있지 않습니다. 반쯤 끝난 프로젝트, 낡은 스티커 메모, 상충되는 지시사항, 그리고 구식이 된 파일들로 덮여 있습니다. 로봇의 지능을 실제로 시험하는 것은 "목록을 작성할 수 있는가?"가 아니라, **"이 지저분한 책상을 보고 무엇이 고장 났는지 파악하고, 좋은 것을 지우지 않으면서 낡은 것을 고쳐서 일을 끝낼 수 있는가?"**입니다.

이 논문은 바로 이 "지저분한 책상" 시나리오에 전적으로 초점을 맞춘 AI 에이전트 (로봇) 를 테스트하는 새로운 방법인 ClawForge를 소개합니다.


ClawForge 란 무엇인가? ("시나리오 공장")

저자들은 이러한 "지저분한 책상" 테스트를 손으로 만드는 것은 너무 어렵고 느리다는 것을 깨달았습니다. 100 가지의 서로 다른 지저분한 시나리오를 테스트하고 싶다면, 100 가지의 서로 다른 지저분함을 수동으로 만들어야 합니다.

ClawForge 는 자동화된 공장입니다.
사람들이 모든 테스트를 작성하는 대신, 연구자들은 테스트를 생성하는 시스템을 구축했습니다. 이는 "고장 난 출시 일정 수정하기"와 같은 템플릿을 받아 다양한 도시, 날짜, 오류와 같은 세부 사항을 자동으로 채워 넣습니다.

  • 출력: 이는 단순한 질문이 아닌, 완전한 "실행 가능한 작업"을 생성합니다. 시작 상태 (지저분한 책상), 일련의 규칙, 그리고 결과를 평가하는 방법이 포함된 미니 시뮬레이션입니다.
  • 목표: AI 가 **상태 충돌 (State Conflict)**을 처리할 수 있는지 확인하는 것입니다. 이는 이미 존재하는 것들, 그중 일부가 잘못되었거나 구식이거나 중복된 것들을 처리하는 것을 의미합니다.

테스트 작동 방식 ("게임 루프")

테스트를 AI 가 플레이어인 비디오 게임 레벨이라고 생각해 보세요:

  1. 설정: 게임은 보드에 이미 몇 가지 항목이 있는 "저장 파일"을 로드합니다. 예를 들어, "서버 수정"이라는 작업이 이미 있지만 "낮은 우선순위"로 표시되어 있을 수 있습니다 (이는 잘못되었습니다).
  2. 지시: AI 는 명령을 받습니다: "서버 수정이 잘못되었습니다. 수정하되 다른 유효한 작업들은 삭제하지 마세요."
  3. 행동: AI 는 인간이 명령어를 사용하는 것처럼 하나씩 명령어를 입력합니다.
  4. 평가: 이것이 가장 중요한 부분입니다. 시스템은 AI 가 인간이 했을 것과 정확히 같은 단어를 입력했는지 확인하는 것이 아니라, 책상의 최종 상태를 확인합니다.
    • 오래되고 잘못된 작업이 제거되었습니까?
    • 새롭고 올바른 작업이 있습니까?
    • AI 가 실수로 작업의 중복을 생성했습니까?
    • 유효한 것들은 그대로 두었습니까?

최종 책상이 완벽해 보이면 AI 는 통과합니다. 지저분해 보이면 실패합니다.

결과: 로봇들은 여전히 배우고 있습니다

저자들은 OpenAI, Anthropic, Kimi 등 여러 회사의 가장 똑똑한 AI 모델 7 개를 이 새로운 벤치마크로 테스트했습니다. 결과는 놀랍고 겸손하게 만들었습니다:

  • "만점"은 드뭅니다: 최고의 AI 모델조차도 작업의 약 **45%**만 완벽하게 올바르게 수행했습니다. 이는 벤치마크가 어렵고 아직 "해결"되지 않았음을 의미합니다.
  • "잘못된 수정" 문제: 특정 유형의 실패가 매우 흔했습니다. 잘못된 항목을 교체하라고 요청받았을 때, 모델들은 종종 막혔습니다. 잘못된 항목은 삭제했지만 새 항목을 추가하는 것을 잊거나, 새 항목은 추가했지만 낡고 고장 난 항목을 그대로 두는 경우가 많았습니다.
    • 비유: 타이어를 교체하라고 말한다고 상상해 보세요. AI 는 펑크 난 타이어는 떼어내지만 스페어 타이어를 끼우는 것을 잊습니다. 또는 스페어 타이어는 끼우지만 펑크 난 타이어를 바닥에 굴러다니게 둡니다.
  • "손대지 마라" 문제: 또 다른 흔한 실패는 책상이 이미 대부분 완료된 경우였습니다. AI 는 이미 올바른 작업을 보고 그냥 두는 대신, 다시 "수정"하려고 시도하여 중복을 생성했습니다.
    • 비유: 로봇에게 "커피는 이미 다 내려졌습니다"라고 말합니다. 로봇은 "알겠습니다"라고 말한 뒤 즉시 두 번째 포트를 내리면서 혼란을 만듭니다.
  • 효율성이 중요합니다: 일부 모델은 간단한 문제를 해결하는 데 너무 많은 단계를 거친 반면, 다른 모델들은 빠르지만 실수를 저질렀습니다. 가장 뛰어난 성능을 보인 모델들은 행동하기 전에 기존 상태를 먼저 확인한 모델들이었습니다.

두 가지 가장 어려운 도전

이 논문은 거의 모든 모델을 당황하게 만든 "지저분한 책상" 시나리오의 두 가지 특정 유형을 강조합니다:

  1. 잘못된 상태 교체: AI 는 잘못된 것을 식별하고 올바른 것으로 교체해야 하며, 나머지 모든 것은 안전하게 유지해야 합니다. 이것이 가장 어려운 작업이었으며, 최고의 모델조차도 17% 만 올바르게 수행했습니다.
  2. 중단된 워크플로우 재개: AI 는 누군가가 프로젝트를 시작한 방에 들어가서, 누락된 부분을 완성하고 이미 완료된 부분은 다시 하지 않도록 해야 합니다. 여기서 최고의 모델과 최악의 모델 간의 격차는 컸습니다 (17% 에서 90% 까지), 이는 일부 모델이 뛰어오르기 전에 "방의 분위기"를 읽는 데 훨씬 더 능숙함을 보여줍니다.

왜 이것이 중요한가

저자들은 더 이상 AI 를 "깨끗한" 작업으로만 테스트할 수 없다고 주장합니다. 실제 작업은 역사, 실수, 그리고 부분적인 진전을 다루는 것을 포함합니다. ClawForge는 일이 거의 완벽하지 않고 처음부터 시작하는 경우가 드문 실제 사무실에서 일할 준비가 된 AI 를 측정하는 도구입니다.

간단히 말해: ClawForge 는 이미 작동하는 가구를 부수지 않고 지저분한 방을 치우는 법을 배우는 AI 에이전트들을 위한 체육관입니다. 현재로서는 가장 강력한 AI 에이전트들조차 이 체육관에서 자신의 발에 걸려 넘어지고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →