SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?
본 논문은 23 개의 전문 SaaS 시스템에 걸친 106 개의 현실적인 작업으로 구성된 포괄적인 벤치마크인 SaaS-Bench 를 소개하며, 이는 현재 컴퓨터를 사용하는 에이전트들이 계획, 상태 추적, 오류 복구 측면의 한계로 인해 복잡하고 장기적인 워크플로우에서 극도로 어려움을 겪으며 종단 간 성공률이 4% 미만에 그치고 있음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
가장 복잡한 업무 일정을 처리할 새로운 비서를 고용한다고 상상해 보세요. 단순히 이메일에 답장하는 것을 원하는 것이 아니라, 은행, 프로젝트 관리 소프트웨어, 의료 기록, 디자인 도구 등에 직접 로그인하여 실제로 업무를 수행하기를 원합니다.
이 논문은 이러한 현실 세계의 업무에 AI 어시스턴트 (컴퓨터 사용 에이전트) 가 얼마나 능숙한지 테스트하기 위한 새로운'최종 시험'인SaaS-Bench를 소개합니다.
다음은 그들이 수행한 작업과 발견한 점을 간단한 비유로 정리한 내용입니다.
1. 문제: "비디오 게임"vs"현실 업무"
지금까지 대부분의 AI 어시스턴트 테스트는 비디오 게임을 하는 것과 같았습니다. 레벨은 짧고 규칙은 단순하며, 막히면 게임이 단순히 리셋되었습니다.
- 옛 방식: "빨간 버튼을 클릭한 다음'안녕하세요'라고 입력하세요." (쉬움, 짧음, 고립됨)
- 현실 세계: "HR 시스템으로 가서 직원을 해고한 다음, 회계 시스템으로 가서 최종 급여를 계산하고, CRM 으로 가서 해당 직원의 고객을 재배정하며, 날짜가 완벽하게 일치하는지 확인하세요." (어려움, 길음, 복잡함)
저자들은'비디오 게임'테스트를 통과하는 것이 AI 가 실제 업무를 처리할 수 있음을 의미하지는 않는다는 점을 깨달았습니다. 따라서 전문가들이 실제로 사용하는23 개의 실제 배포 가능 소프트웨어 시스템(실제 의료 기록 시스템, 회계 도구, 프로젝트 관리 도구 등) 을 기반으로 새로운 테스트를 구축했습니다.
2. 시험: SaaS-Bench
SaaS-Bench를 거대한 다일간의 장애물 코스로 생각하세요.
- 코스: 의료, 금융, 소프트웨어 공학 등 여섯 가지'업무 구역'에 걸쳐106 개의 다양한 작업이 있습니다.
- 규칙: AI 는 인간처럼 웹 브라우저를 사용하여 이러한 시스템을 탐색해야 합니다. 데이터베이스 코드를 들여다보며 속일 수 없으며, 버튼을 클릭하고 화면을 읽어야 합니다.
- 난이도: 이러한 작업은 5 분짜리가 아닙니다. 평균 작업은100 단계 이상(클릭, 입력, 스크롤)이 소요됩니다. 마치 누군가에게 케이크를 굽고, 그 레시피를 작성한 다음, 친구에게 레시피를 우편으로 보내고, 밀가루 영수증을 제출하는 것을 한 번에 하라고 요구하는 것과 같습니다.
3. 결과: AI 가 길을 잃었습니다
연구진은 이 시험에서 AI 세계의'최고 학생'들과 같은 가장 똑똑한 AI 모델을 테스트했습니다. 결과는 냉혹했습니다.
- 점수: 최고의 AI 모델조차도 시작부터 끝까지 작업을 완전히 완료한 비율이4% 미만이었습니다.
- "거의"함정: AI 는 실제로 작업의초기단계에서는 잘했습니다. 전체 과정의 80% 까지 도달할 수 있었습니다. 첫 번째 양식을 작성하고, 올바른 버튼을 클릭하며, 첫 번째 문서를 생성할 수 있었습니다.
- 충돌: 하지만 그 후 사소한 실수 (잘못된 날짜 입력 등) 를 범하고, 그 실수를 인지하지 못한 채 잘못된 길을 계속 따라갔습니다. 끝에 도달할 때는 전체 결과가 틀리게 되었습니다.
비유: "왼쪽으로 회전하고 5 마일 운전하라"고 말해 주는 데는 뛰어난 GPS 를 상상해 보세요. 하지만 실수로 회전을 놓치면 GPS 는"길을 잃었으니 다시 계산하자"고 말하지 않습니다. 대신 50 마일 더 직진하라고 자신 있게 말하며, 연료가 떨어질 때까지 계속 가게 합니다. AI 는 자신감 있지만, 종종 틀립니다.
4. 왜 실패했을까요? (네 가지 큰 장애물)
이 논문은 훌륭한 은유를 사용하여 AI 가 어려움을 겪은 네 가지 주요 원인을 식별했습니다.
- "카드의 집"효과 (취약성): 이러한 긴 작업에서는 각 단계가 이전 단계에 의존합니다. 10 단계를 실수하면 11 단계부터 100 단계까지 모두 무너집니다. AI 는 10 단계에서 매우 잘하기 때문에 자신이 훌륭하다고 생각하지만, 그 작은 실수 하나가 전체 구조를 무너뜨립니다.
- "침묵하는 독" (오류 연쇄): 때때로 AI 는 표면적으로는 정확해 보이는 실수를 범합니다.
- 예시: AI 는"아크투루스 디지털"대신"Elena"라는 고객 이름을 생성합니다. 화면에"Elena(아크투루스)"라고 표시되므로 AI 는"좋아, 해냈어!"라고 생각합니다. 하지만 이름이 기술적으로 잘못되었기 때문에, 그 뒤에 따르는 모든 금융 거래가 잘못된 사람과 연결됩니다. AI 는 자신이 우물을 독살했다는 사실을 전혀 깨닫지 못합니다.
- "자신감 있는 거짓말쟁이" (자기 기만): AI 는 자신이 무엇을 했는지 스스로에게 말하는"기억"을 가지고 있습니다. 때로는 실수를 발견하고 수정하려고 시도하지만, 수정이 제대로 되었는지 확인하는 것을 잊어버립니다. 그런 다음 화면에 여전히 오류가 표시되어 있음에도 불구하고"수정했습니다!"라는 보고서를 작성합니다. 수학 실수를 깨닫고 지우려고 시도하지만, 정답을 그냥 적어 놓고"끝났다"고 말하는 학생과 같습니다.
- "동전 던지기" (불안정성): 같은 AI 에게 같은 작업을 세 번 요청하면, 첫 번째 시도에서는 완벽한 점수를 받고, 두 번째 시도에서는 완전히 실패하며, 세 번째 시도에서는 그럭저럭 할 수 있습니다. 일관성이 없습니다.这意味着 어제 작동했다 하더라도 오늘 그에게 업무를 신뢰할 수 있게 맡길 수 없다는 뜻입니다.
5. 결론
이 논문은 다음과 같이 묻습니다:"AI 에이전트가 실제 세계의 소프트웨어를 사용하여 전문적인 업무를 해결할 수 있는가?"
답은 다음과 같습니다:아직은 아닙니다.
이러한 AI 모델은 대화하고 언어를 이해하는 데는 놀라울 정도로 뛰어나지만, 현재는길고 복잡하며 현실적인 실행에는 매우 서툴습니다. 세부 사항에 빠지고, 작업을 재확인하지 않으며, 실수를 했을 때 복구하지 못합니다.
저자들은 이 테스트 (SaaS-Bench) 를 AI 가 쓸모없다는 것을 보여주기 위해 만든 것이 아니라, 정확히어디서무너지는지 보여 주어 이를 수정할 수 있도록 하기 위해 만들었습니다. AI 가 혼란스러워하거나 잘못된 답에 대해 자신감을 갖지 않고 100 단계 워크플로우를 처리할 수 있을 때까지는 전문적인 업무를 대신할 준비가 된 것이 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.