← 최신 논문
🤖 AI

Copy-on-Write Scoring: Application-Specific Agent Evaluations

이 논문은 PostgreSQL 수준의 격리를 활용하여 애플리케이션 환경 내에서 LLM 기반 에이전트를 직접 평가함으로써, 데이터베이스 쓰기 실패를 세밀하고 비용 효율적으로 식별하고 에이전트 도구 표면을 반복적으로 개선할 수 있게 하는 Copy-on-Write (CoW) Scoring 프레임워크를 소개한다.

원저자: Joanna Roy, Sven Hoelzel

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Joanna Roy, Sven Hoelzel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 방금 프로젝트 관리 도구나 캘린더 같은 당신이 즐겨 쓰는 앱들과 대화할 수 있는 초지능형 로봇 비서를 만들었다고 상상해 보세요. 당신은 이 로봇이 당신의 삶을 정리하도록 돕기를 원하지만, 로봇이 실수로 당신의 할 일 목록 전체를 삭제하거나, 상사가 실제로 회의 중인데 상태를 "휴가 중"으로 바꿔버릴까 봐 겁이 납니다. 이것이 바로 AI 에이전트의 세계입니다. AI 에이전트는 단순히 채팅만 하는 것이 아니라, 소프트웨어 시스템 내에서 실제로 무언가를 수행하는 컴퓨터 프로그램입니다. 현재 가장 큰 문제는 이 로봇들을 어떻게 안전하게 테스트하느냐는 것입니다. 보통 과학자들은 가상의 세계(예: 비디오 게임 시뮬레이션)에서 이들을 테스트하지만, 이러한 시뮬레이션은 종로 현실과 동떨어지거나, 실제 앱이 변경될 때마다 업데이트하기에는 비용이 너무 많이 들어 아무도 감당할 수 없는 경우가 많습니다. 우리는 로봇이 실제로 무언가를 망가뜨리지 않으면서도 실제 앱 안에서 작업하는 모습을 관찰하여, 로봇이 정확히 어디에서 혼란을 느끼는지 파악하고 이를 수정할 수 있는 방법이 필요합니다.

여기에 조안나 로이(Joanna Roy)와 스벤 횔첼(Sven Hölzel) 연구진이 제안한 CoW(Copy-on-Write) 스코어링이라는 새로운 아이디어가 있습니다. 이들의 방식은 데이터베이스(앱이 데이터를 저장하는 디지털 파일 캐비닛) 내부에 직접 구축된 "마법의 유리 벽"과 같습니다. 보통 당신이 로봇에게 "이 파일을 변경해"라고 말하면, 로봇은 실제 파일로 가서 그 위에 글을 써버립니다. 하지만 CoW 방식에서는 로봇이 실제 파일 위에 놓인 특별하고 투명한 유리판 위에 글을 쓰도록 지시받습니다. 로봇은 실제 파일에 쓰고 있다고 생각하지만, 실제로는 유리판 위에 쓰고 있을 뿐입니다. 그 아래에 있는 원래 파일은 완벽하게 안전하고 손상되지 않은 상태로 유지됩니다.

여기서 영리한 점은, 시스템이 (완벽한 인간이 수행하는 것과 같은) 어떤 일이 일어나야 하는지에 대한 "그라운드 트루스(ground truth, 정답)" 버전을 유지하면서, 로봇이 유리판 위에 한 작업과 이를 비교한다는 것입니다. 로봇이 별도의 레이어에 글을 쓰기 때문에, 연구자들은 즉시 다음과 같은 사실을 알 수 있습니다: "아, 로봇이 엉뚱한 행을 삭제하려고 했구나" 또는 "잘못된 작업에 댓글을 달았구나." 연구자들은 로봇의 유리판 작업이 완벽한 인간의 버전과 얼마나 유사한지를 바탕으로 로봇의 성능을 점수화할 수 있습니다. 만약 로봇이 실패하면, 연구자들은 백업을 복구하거나 실제 데이터를 손상시킬 걱정 없이 그저 유리판을 깨끗이 닦아내고 다시 시작하면 됩니다.

연구팀은 이 실험을 오픈 소스 프로젝트 관리 플랫폼인 Plane을 대상으로 실시했습니다. 그들은 "모든 미완료 버그를 '진행 중' 목록으로 이동하기"나 "새로운 작업을 특정 팀원에게 할당하기"와 같은 20가지의 서로 다른 실제 업무를 설정했습니다. 그리고 다섯 가지의 서로 다른 AI 모델이 CoW 시스템의 감시 아래 이 업무들을 수행하도록 했습니다. 결과는 놀라웠습니다. 연구진은 많은 로봇이 "멍청해서"가 아니라 어휘 불일치(vocabulary mismatches) 때문에 실패했다는 것을 발견했습니다. 예를 들어, 앱은 그것을 "작업 항목(work items)"이라고 불렀지만, 로봇은 "이슈(issues)"를 찾고 있었습니다. 로봇은 적절한 단어를 찾지 못해 멈춰 서거나, 포기하거나, 혹은 환각 현상(hallucination, 존재하지 않는 명령을 만들어내는 것)을 일으켰습니다.

CoW 스코어링을 통해 팀은 이러한 구체적인 실패 지점을 정확히 짚어낼 수 있었습니다. 그들은 "아, 로봇이 '이슈'가 '작업 항목'이라는 것을 몰라서 여기서 실패하고 있구나"라는 것을 깨달았습니다. 그래서 그들은 로봇이 사용하는 도구에 두 단어를 모두 포함하도록 업데이트했습니다. 다시 테스트를 실행했을 때, 로봇의 성능은 훨씬 좋아졌습니다. 예를 들어, Gemini-2.5-Pro라는 모델은 점수가 54% 향상되었고, GPT-4.1이라는 모델은 47% 급증했습니다. 이 연구는 이 "유리 벽" 방식이 AI 에이전트를 실제 애플리케이션에서 디버깅하는 강력하고 저렴한 방법임을 시사하며, 개발자들이 단순히 무엇이 잘못되었는지 추측하는 대신, 로봇을 혼란스럽게 만드는 구체적인 도구와 프롬프트를 수정할 수 있도록 도와준다는 것을 보여줍니다. 이는 로봇이 실제적인 재앙의 위험 없이 실제 세상에서 연습할 수 있게 해주는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →