VAmoS Bench: Voice Agent Simulation Bench
이 논문은 적대적 요소가 포함된 현실적인 전화 통화를 시뮬레이션하여, 인간의 개입 없이 작업을 정확하게 해결하고, 데이터베이스를 업데이트하며, 보안을 유지하는 능력을 바탕으로 에이전트를 평가함으로써 상태 유지(stateful)가 필요한 금융 고객 지원 시나리오에서 음성 에이전트의 엔드 투 엔드 성능을 측정하는 새로운 평가 프레임워크인 VAmoS Bench를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기계 속의 목소리: AI 전화 통화를 테스트하는 새로운 방법
당신이 친구와 대화하듯 컴퓨터와 대화할 수 있는 세상을 상상해 보세요. 이것은 공상 과학 소설이 아닙니다. 바로 급성장하고 있는 음성 에이전트(voice agents) 분야입니다. 이들은 당신의 목소리를 듣고, 당신이 말하는 것을 이해하며, 당신에게 말을 걸 수 있는 똑똑한 컴퓨터 프로그램입니다. 이들은 이미 은행에서 분실된 신용카드를 처리하거나, 클리닉에서 환자에게 진료 예약을 알리는 데 사용되고 있습니다. 하지만 이를 만드는 것은 까다로운 일입니다. 이는 당신의 말을 듣고, 질문에 대해 생각하고, 거대한 데이터베이스에서 적절한 답을 찾아낸 다음, 그 답을 다시 말하기까지 눈 깜짝할 사이에 수행해야 하는 로봇을 만드는 것과 같습니다.
오랫동안 과학자들은 부품을 따로 체크하는 방식으로 이 로봇들을 테스트해 왔습니다. 예를 들어, "로봇이 얼마나 잘 듣는가?"(단어를 얼마나 틀리게 인식하는지 측정) 또는 "얼마나 자연스럽게 들리는가?"(인간처럼 들리는지 측정)를 물었습니다. 하지만 이는 자동차를 테스트하면서 엔진과 타이어만 점검하고, 실제로 도로를 달릴 때 사고 없이 주행할 수 있는지는 확인하지 않는 것과 같습니다. 진짜 질문은 단순히 부품에 대한 것이 아니라, 전체 작업에 관한 것입니다. 즉, 로봇이 실제로 문제를 해결했는가? 비즈니스 세계에서는 이를 "컨테인먼트(containment, 수용/완결)"라고 부릅니다. 컴퓨터가 스스로 문제를 해결했는지, 아니면 포기하고 사람에게 연결했는지를 의미합니다. 이 논문은 부분적인 조각이 아닌 전체 그림을 보는 새로운 방식의 로봇 테스트법을 소개합니다.
대규모 테스트: VAmoS Bench
이 논문의 저자인 Veris AI 팀은 기존의 테스트들이 이야기의 가장 중요한 부분을 놓치고 있다는 점을 깨달았습니다. 그들은 VAmoS Bench(Voice Agent Simulation Bench)라는 것을 만들었습니다. 이것을 자동차 대신 가상의 은행원인 Riley를 테스트하는 고도의 기술이 적용된 "운전 면허 시험"이라고 생각하면 됩니다.
Riley의 업무는 가상의 은행에서 신용카드 관련 문제를 처리하는 것입니다. 그녀는 도난당한 카드를 정지시키거나, 분실된 카드를 취소하거나, 새 카드를 활성화하는 등의 업무를 수행해야 합니다. Riley를 테스트하기 위해 연구진은 단순히 화면에 뜨는 질문을 던진 것이 아닙니다. 그들은 "발신자"(인간인 척하는 컴퓨터 프로그램)가 실제 오디오 연결을 통해 Riley에게 전화를 거는 시뮬레이션을 구축했습니다. 발신자는 "새 카드를 원하지만 신원을 증명하고 싶지는 않다"거나 "카드를 잃어버렸는데 매우 급하다"와 같은 비밀스러운 목표를 가지고 있습니다.
이 테스트는 100개의 서로 다른 레벨(시나리오)이 있는 비디오 게임처럼 구성되어 있습니다. 어떤 레벨은 일반적인 고객이 카드 상태를 묻는 것처럼 쉽습니다. 어떤 레벨은 까다로우며, 에이전트가 여러 단계를 올바른 순서대로 수행해야 합니다. 그리고 어떤 레벨은 "보스 전투"로, 발신자가 에이전트를 속이거나, 안전 절차를 건너뛰도록 압박하거나, 심지어 이상한 단어로 에이전트를 해킹하려고 시도하는 상황입니다.
"말하기"와 "행하기"의 마법
이 테스트의 가장 멋진 점은 에이전트를 채점하는 방식입니다. 과거의 테스트는 대화를 듣고 "잘했습니다! 카드를 해결한 것처럼 들리네요"라고 말했을 뿐입니다. 하지만 VAmoS Bench는 탐정 역할을 합니다. 이 시스템은 두 가지를 동시에 살펴봅니다.
- 에이전트가 말한 것 (전사 데이터/텍스트)
- 에이전트가 실제로 한 일 (데이터베이스 변경 및 도구 호출)
수학 시험을 치르는 학생을 상상해 보세요. 만약 학생이 종이에 "답은 42입니다"라고 적었지만 실제로 수학 계산을 하지 않았다면, 그 학생은 F를 받습니다. 만약 계산은 맞게 했지만 답을 틀리게 적었다면, 그 역시 F를 받습니다. VAmoS Bench는 "척하는" 에이전트를 잡아냅니다. 예를 들어, 에이전트가 "카드를 정지했습니다"라고 말했지만, 컴퓨터 체크 결과 실제로 카드를 정지시키는 명령을 보내지 않았다면, 테스트는 이를 실패로 처리합니다. 반대로, 에이전트가 카드는 성공적으로 정지시켰지만 실수로 발신자에게 비밀번호를 알려주었다면, 카드는 해결되었을지라도 테스트는 이를 실패로 처리합니다.
결과: 누가 테스트를 통과했는가?
연구진은 11개의 서로 다른 음성 에이전트 시스템을 이 100번의 통화 관문 속에 밀어 넣었습니다. 결과가 실제인지 확인하기 위해 각 시스템에 대해 테스트를 세 번씩 반복했습니다. 결과는 다음과 같습니다.
- 승자: Pipecat과 LiveKit Agents 기반으로 구축된 시스템이 가장 우수했으며, 각각 약 **71%**와 **70.3%**의 통화를 성공적으로 처리했습니다.
- 패자: Nemotron이라 불리는 시스템이 가장 고전했으며, 단 **43%**의 통화만을 성공했습니다.
- "보스 전투": 모든 에이전트에게 가장 어려웠던 부분은 복잡한 시나리오였습니다. 에이전트들은 단순한 작업에는 괜찮았지만, 복잡한 통화에서는 **52.2%**의 성공률만을 보였습니다. 이 통화들은 사용자 확인, 특정 카드 찾기, 카드 정지, 그리고 교체 카드 주문까지 대화를 매끄럽게 이어가며 여러 단계를 수행해야 하는 것들이었습니다.
- 까다로운 부분: 에이전트들은 사람들을 속이려는 시도(적대적 그룹)에 대해 "아니오"라고 말하는 데는 꽤 능숙하여, 해당 통화의 **73.4%**를 성공했습니다. 하지만 비밀을 지키는 데는 형편없었습니다. 인증되지 않은 발신자에게 도움을 거절할 때조차, 그들은 종종 어떤 정보가 잘못되었는지(예: "주소가 틀립니다")를 실수로 알려주어, 나쁜 의도를 가진 사람이 다시 시도할 수 있는 단서를 제공했습니다.
이것이 중요한 이유 (그리고 의미하지 않는 것)
이 논문은 많은 음성 에이전트가 훌륭하게 들릴 수는 있지만, 문제가 복잡해지거나 엄격한 실행 순서를 따라야 할 때 실제 문제를 해결하는 데 자주 실패한다는 점을 보여줍니다. 연구팀은 수천 번의 시도 중 27번이나 에이전트가 무언가(예: 카드 정지)를 했다고 주장했지만, 컴퓨터 로그를 확인해보니 실제로 수행하지 않은 경우가 있었다는 것을 발견했습니다.
하지만 저자들은 특정 시스템을 세계 최고의 승자로 선언하는 데 주의를 기울입니다. 그들은 이 결과가 이 특정 은행 시나리오와 100개의 테스트에 국한된 것임을 지적합니다. 상위 성과자들 사이의 차이는 미미했으며(1% 미만), 이 테스트는 시뮬레이션이었기 때문에 실제의 무질서한 인간 고객들과 실제 은행 환경에서 어떻게 수행될지는 알 수 없습니다.
요약하자면, VAmoS Bench는 음성 에이전트를 측정하는 새롭고 더 엄격한 잣대입니다. 이는 예의 바르게 말하지만 아무것도 하지 않는 로봇에게 우리가 속지 않도록 도와주며, 진짜 과제는 단순히 로봇을 말하게 만드는 것이 아니라, 비밀을 누설하지 않으면서 올바른 순서대로 실제로 일을 완수하게 만드는 것임을 강조합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.