← 최신 논문
💻 computer science

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

본 논문은 역동적이고 상태 기반의 환경에서 다중 턴, 다중 일, 다중 모달 동료 에이전트를 평가하도록 설계된 새로운 벤치마크인 ClawMark 를 소개하며, 최첨단 모델이 부분적인 진전을 보이고 있음에도 불구하고 외부적 변화에 적응하고 완전한 엔드 투 엔드 작업 성공을 달성하는 데는 여전히 심각한 어려움을 겪고 있음을 밝힙니다.

원저자: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xi
게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 사무 보조 직원을 고용하여 사무실을 운영한다고 상상해 보세요. 오늘날 대부분의 AI 보조원 테스트는 단답형 퀴즈와 같습니다. AI 에게 단일 질문을 던지고, 답변을 받으면 테스트는 끝납니다. 그 퀴즈 동안 세상은 시간 정지 상태에 머뭅니다.

하지만 현실에서 보조원은 한 가지 질문에 답하고 떠나는 것이 아닙니다. 그들은 며칠 동안 당신 곁에 머뭅니다. 그들이 일하는 동안 세상은 그들 주변에서 계속 변합니다. 새로운 이메일이 도착하고, 일정이 변경되며, 파일이 업데이트되고, 새로운 증거 (사진이나 음성 메모 등) 가 나타납니다. 만약 보조원이 이러한 변화를 인지하지 못한다면, 그들은 오래된 정보를 바탕으로 결정을 내려 실수를 범할 수 있습니다.

ClawMark는 AI 보조원이 이러한 messy 하고 변화하는 현실을 처리할 수 있는지 확인하기 위해 특별히 설계된 새로운 "테스트 드라이브"입니다.

"살아있는 사무실" 테스트

정지된 퀴즈 대신 ClawMark 는 숨 쉬는 시뮬레이션 사무실과 같습니다.

  • 설정: AI 는 보험 청구 처리나 프로젝트 관리와 같은 작업을 부여받으며, 이는 여러 "근무일"에 걸쳐 진행됩니다.
  • 반전: 각 날 사이마다 환경이 스스로 변화합니다. 새로운 이메일이 도착하거나, 스프레드시트가 업데이트되거나, 아무도 AI 에게 알리지 않은 채 폴더에 숨겨진 파일이 떨어질 수 있습니다.
  • 증거: AI 는 단순히 텍스트를 읽는 것이 아닙니다. 인간이 하듯이 원본 사진을 보고, 오디오 녹음을 듣고, 스캔된 PDF 를 읽으며, 비디오를 분석해야 합니다.

AI 채점 방식

많은 AI 테스트에서는 인간이나 다른 AI 가 답변을 읽고 "그것은 잘 들린다"라고 말합니다. ClawMark 는 더 엄격한 방식을 취합니다: 로봇 심판을 사용합니다.

  • 여기에는 "의견"이 없습니다. 테스트는 AI 작업이 완료된 후 컴퓨터의 실제 상태를 확인하는 1,537 개의 작은 자동 Python 스크립트 (체크러) 를 사용합니다.
  • AI 가 실제로 파일을 저장했습니까? 일정을 업데이트했습니까? 숨겨진 사진을 발견했습니까?
  • AI 가 "내가 했다"라고 말하지만 파일이 없다면, 로봇 심판은 0 점으로 처리합니다. 이는 정답을 말로만 했을 때가 아니라, 정답을 올바른 칸에 적었을 때만 점수를 받는 수학 시험과 같습니다.

결과: 시작은 좋으나 적응은 부족함

연구진은 이 "살아있는 사무실"에서 주요 챗봇의 두뇌 역할을 하는 최상위 AI 모델 7 개를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  1. "완벽한 점수"는 드뭅니다: 최고의 AI 조차도 작업의 20% 에서만 "완벽한" 엔드투엔드 성공을 거두었습니다. 이는 그들이 종종 일부 진전을 이루었지만, 단 한 번의 실수 없이 전체 작업을 완료하는 경우는 드물다는 것을 의미합니다.
  2. "2 일차 하락": 이것이 가장 흥미로운 발견입니다. 첫날에는 AI 들이 꽤 잘 수행했습니다. 하지만 둘째 날, 환경이 변화했을 때 (새로운 이메일, 새로운 파일), 7 개 모델 중 6 개가 현저히 악화되었습니다.
    • 비유: 비디오 게임을 한다고 상상해 보세요. 당신은 레벨 1 을 쉽게 클리어합니다. 하지만 게임이 갑자기 규칙을 바꾸고 레벨 2 에서 새로운 적을 추가하면, AI 는 어떻게 플레이할지 잊어버리고 비틀거립니다. 세상이 변했다는 것을 깨닫고 "깨어나는" 데 어려움을 겪습니다.
  3. 침묵하는 변화가 크립토나이트입니다: AI 는 "침묵하는 변이", 즉 큰 발표 없이 발생한 변화 (예: 배경에서 조용히 업데이트되는 파일) 를 놓쳤을 때 가장 자주 실패했습니다. 또한 자신의 작업을 올바른 곳 (백엔드 쓰기) 에 실제로 저장하는 데에도 어려움을 겪었습니다.

결론

ClawMark 는 AI 보조원이 단일 문제를 해결하는 데는 더 똑똑해지고 있지만, 끈기 있는 동료가 되는 법은 여전히 배우고 있음을 보여줍니다. 그들은 "첫날"에는 좋지만, 사무실 환경이 그들 주변에서 변할 때 종종 균형을 잃습니다.

이 논문은 진정한 신뢰할 수 있는 AI 동료를 만들기 위해서는 단일 질문에 얼마나 잘 답하는지에 초점을 맞추기보다, 세상이 변할 때 변화하는 세계에 적응하고 도구를 업데이트하는 것을 기억하는 능력에 더 집중해야 한다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →