← 최신 논문
💬 NLP

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

이 논문은 AI 에이전트가 복잡한 다회차 작업을 정확한 지속적 상태 전이와 함께 안정적으로 실행하는 능력을 측정함으로써 상태 유지 비즈니스 워크플로 상의 AI 에이전트를 평가하기 위해 설계된 샌드박스이자 벤치마크인 Thinkingbox를 소개하며, 이는 507개의 정책 조건 시나리오 전반에 걸쳐 간헐적인 성공과 일관된 신뢰성 사이의 상당한 격차를 드러낸다.

원저자: Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급변하는 인공지능의 세계에서, '에이전트'라고 불리는 새로운 세대의 컴퓨터 프로그램이 등장했습니다. 단순히 질문에 답하거나 텍스트를 작성하던 이전의 챗봇들과 달리, 이 에이전트들은 행동을 취하도록 설계되었습니다. 이들은 마치 인간 직원처럼 웹을 탐색하거나, 소프트웨어 코드를 실행하거나, 디지털 도구를 호출하여 업무를 수행할 수 있습니다. 수년간 연구자들은 에이전트에게 고장 난 코드 한 줄을 수정하거나 웹사이트에서 특정 사실을 찾는 것과 같이, 명확하고 확인하기 쉬운 정답이 있는 문제를 해결하도록 요청하며 이들을 테스트해 왔습니다. 이러한 영역에서의 성공은 에이전트가 올바른 최종 출력물이나 유효한 명령어를 생성했는지 여부로 측정되었습니다. 하지만 실제 비즈니스의 세계는 결코 그렇게 단순하지 않습니다. 기업 사무실에서의 업무는 종종 컴퓨터 시스템이 정확하게 업데이트되어야 하고, 정책이 준수되어야 하며, 데이터베이스의 상태가 특정 방식으로 변경되어야 하는 긴 일련의 사건들을 포함합니다. 만약 에이전트가 프로세스 중간에 실수를 하거나 잘못된 기록을 변경한다면, 그 결과는 실질적이고 막대한 비용을 초래할 수 있습니다. 이 기술의 미래에 대한 핵심적인 질문은 에이전트가 단 한 번 성공할 방법을 찾을 수 있느냐가 아니라, 의도치 않은 손상을 입히지 않고 매번 예외 없이 신뢰할 수 있게 수행할 수 있느냐입니다.

피츠버그 대학교, 노스웨스턴 대학교, 캘리포니아 대학교 어바인, 그리고 마이크로소프트의 연구진은 이 질문에 답하기 위해 새로운 테스트 환경을 구축했습니다. 이들은 에이전트가 시뮬레이션된 사용자 및 복잡한 비즈니스 도구와 상호작용할 수 있는 안전하고 격리된 샌드박스인 'ThinkingBox'라는 디지털 환경을 만들었습니다. 이 샌드박스 안에서 에이전트들은 온라인 주문에 대한 환불 처리, 호텔 예약 변경, 보험 청구 업데이트, 또는 직원의 IT 지원 요청 처리와 같은 현실적인 과업을 부여받습니다. 이 환경은 정보가 불완전하고, 규칙이 엄격하며, 모든 행동이 디지털 기록에 영구적인 흔적을 남기는 사무 업무의 혼란스러운 현실을 모방하도록 설계되었습니다. 연구진은 단순히 에이전트에게 대화를 요구한 것이 아니라, 실제로 시스템의 상태를 변경하도록 요구했습니다. 테스트의 공정성과 재현성을 보장하기 위해, 이 샌드박스는 매 시도 후에 완전히 초기화되어 어떤 두 실험도 동일한 데이터나 숨겨진 이력을 공유하지 않도록 합니다.

연구진은 이후 소매, 여행 및 환대, 자동차 보험, 은행, 컨설팅의 다섯 가지 산업 분야에 걸친 507개의 뚜렷한 과업으로 이 환경을 채웠습니다. 이들은 주요 기술 기업의 독점 시스템과 오픈 소스 모델을 모두 포함하여 사용 가능한 가장 진보된 다양한 인공지능 모델들을 초대하여 이 과업들을 시도하게 했습니다. 각 모델에는 각 문제를 해결할 수 있는 20번의 기회가 주어졌습니다. 평가는 엄격했습니다. 에이전트는 단순히 정중한 답변을 내놓거나 겉보기에 올able한 도구 호출을 했다고 해서 통과되는 것이 아니었습니다. 대신, 시스템은 최종 결과를 요구된 결과와 대조하여 확인했습니다. 환불이 실제로 데이터베이스에 나타났는가? 호텔 객실이 제대로 변경되었는가? 다른 고객의 보험 증권을 실수로 변경하지 않고 보험 청구가 업데이트되었는가? 또한 시스템은 '부수적 효과(collateral effects)'를 점검했는데, 이는 에이전트가 건드리지 말아야 할 것을 실수로 변경했는지, 즉 실제 소프트웨어 환경에서 흔하고 위험한 오류를 범했는지를 확인하는 것을 의미합니다.

결과는 에이전트가 가끔 해낼 수 있는 능력과 신뢰할 수 있는 능력 사이에 상당한 격차가 있음을 드러냈습니다. 가장 성능이 좋은 모델은 첫 번째 시도에서 과업을 올바르게 해결하는 데 약 65%의 성공률을 보였습니다. 이것이 인상적으로 들릴 수도 있지만, 연구진이 신뢰성을 살펴보았을 때 양상은 급격히 변했습니다. 모델이 20번의 시도 모두에서 성공적으로 과업을 해결할 수 있는 빈도를 확인했을 때, 그 수치는 단 25%로 급감했습니다. 이는 똑똑한 에이전트가 충분한 시도가 주어진다면 종종 성공적인 경로를 찾아낼 수는 있지만, 오류 없이 지속적으로 그 성공을 반복할 수는 없음을 의미합니다. 연구진은 많은 실패가 에이전트가 요청을 이해하지 못하거나 사용자와 대화하는 데 실패했기 때문이 아니라, 다른 이유 때문임을 발견했습니다. 가장 흔한 문제는 도구가 에러 메시지를 보냈을 때 에이전트가 이를 복구하지 못하거나, 엉뚱한 데이터에 대해 올바른 동작을 수행했다는 것이었습니다. 예를 들어, 에로전트는 기록을 업데이트하기 위한 도구를 성공적으로 호출했지만 변경 사항을 잘못된 고객에게 적용하거나, 필요한 단계를 완료하기 전에 프로세스를 중단하여 시스템을 망가진 상태로 남겨둘 수 있습니다.

이 연구는 또한 서로 다른 모델들이 서로 다른 유형의 업무에서 어려움을 겪는다는 점을 강조했습니다. 어떤 모델들은 소매 주문을 처리하는 데는 꽤 능숙했지만, 복잡한 보험 정책이나 은행 규정을 다룰 때는 성능이 저조했습니다. 이는 한 분야에서의 높은 성능이 에이전트가 다른 분야에서도 신뢰할 수 있음을 보장하지는 않는다는 것을 시사합니다. 연구진은 에이전트가 사용자에게 완벽해 보이는 최종 메시지를 생성하더라도, 근본적인 데이터베이스는 변경되지 않았거나 손상된 경우가 많다는 것을 관찰했습니다. 이러한 발견은 대화의 품질이나 도구 호출의 유효성에만 집중하는 현재의 많은 시스템 평가 방식에 도전합니다. 논문은 인공지능이 중대한 비즈니스 업무를 맡기 위해 신뢰받으려면, 단순히 한 번 성공적인 경로를 찾는 것을 넘어, 그 경로를 일관되고 반복적인 정밀도로 실행하는 법을 배워야 한다고 결론짓습니다. ThinkingBox 샌드박스와 그 벤치마크는 이제 대중에게 공개되어, 이 디지털 노동자들이 정말로 현실 세계에 나갈 준비가 되었는지를 측정하는 새로운 표준을 제공하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →