← 최신 논문
💬 NLP

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

본 논문은 재주석 없이 텍스트 기반 도구 호출 벤치마크를 오디오 평가로 변환하는 재현 가능하고 데이터셋에 구애받지 않는 프레임워크를 제시하여 텍스트와 음성 간의 모델 의존적 성능 격차를 드러내고 오픈소스 LLM 을 효과적이고 프라이버시를 보호하는 판사로 검증합니다.

원저자: Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

스마트 어시스턴트를 구축한다고 상상해 보세요. 이 어시스턴트는 사용자와 대화할 뿐만 아니라 일정 확인이나 항공권 예약과 같은 작업을 수행할 수도 있어야 합니다. 이를 구축하는 데는 크게 두 가지 방법이 있습니다:

  1. "번역가" 접근법 (캐스케이드): 어시스턴트가 사용자의 음성을 듣고, 인간과 같은 번역가가 사용자의 말을 정확히 받아적게 한 뒤, 초지능 텍스트 리더가 그 메모를 읽어 무엇을 해야 할지 결정합니다.
  2. "초청청자" 접근법 (오모니멀): 어시스턴트가 사용자의 음성을 직접 듣고, 먼저 받아적지 않고 무엇을 해야 할지 파악합니다.

핵심 질문은 다음과 같습니다: "초청청자"가 실제로 더 잘 작동할까요, 아니면 여전히 "번역가" 접근법이 승리할까요?

이 논문은 처음부터 새로운 음성 녹음 세트를 구축할 필요 없이 그 질문에 답하기 위해 교묘하고 재현 가능한 "테스트 트랙"을 소개합니다.

문제: "텍스트 전용"의 함정

이러한 스마트 어시스턴트에 대한 대부분의 테스트는 텍스트를 사용하여 수행됩니다. 사용자가 명령을 입력하면 컴퓨터가 답변합니다. 하지만 현실 세계에서는 사람들이 말을 합니다.

  • 기존 테스트는 완벽하게 매끄럽고 비어 있는 레이싱 트랙 (텍스트) 에서 차를 운전하는 것과 같습니다.
  • 현실 생활은 교통이 붐비고 비가 오는 울퉁불퉁한 도로에서 차를 운전하는 것과 같습니다.

연구자들은 궁금해했습니다: 만약 이러한 완벽한 텍스트 테스트를 음성 테스트로 바꾼다면, 성능이 얼마나 떨어질까요?

해결책: "음성 번역가" 프레임워크

수천 명의 실제 사람들이 말하는 것을 녹음하는 것 (비싸고 번거롭습니다) 대신, 저자들은 기존 텍스트 테스트를 자동으로 음성 테스트로 변환하는 레시피를 개발했습니다.

이것을 다음과 같이 생각해보세요:

  • 그들은 작성된 지시 사항 목록 (텍스트 벤치마크) 을 가져왔습니다.
  • 이를 고급 "텍스트 음성 변환 (TTS)" 기계 (매우 정교한 로봇 음성 같은) 에 입력하여 오디오 파일을 생성했습니다.
  • 현실감을 더하기 위해 배경 소음 (바쁜 커피숍이나 자동차 엔진 소리 같은) 을 추가했습니다.
  • 매우 중요하게: "정답 키 (골드 레이블)"는 정확히 그대로 유지했습니다.

이를 통해 동일한 질문을 두 번 테스트할 수 있습니다. 한 번은 텍스트로, 한 번은 음성으로요. 이는 음성이 시스템에 얼마나 많은 "소음"을 추가하는지 정확히 측정할 수 있게 합니다.

레이스: 누가 이겼을까요?

저자들은 OpenAI, Google, Alibaba 등의 회사에서 개발한 일곱 가지 다른 "초청청자" 모델을 두 가지 유형의 작업에 대해 테스트했습니다:

  1. Confetti: 어시스턴트가 올바른 도구를 선택하고 세부 사항을 정확히 채워 넣어야 하는 작업 (예: "화요일에 런던으로 가는 항공권 예약").
  2. When2Call: 어시스턴트가 도구 사용이 필요한지, 아니면 단순히 대화만 해야 하는지 결정해야 하는 작업.

결과:

  • 만능 해결책은 없음: 단 하나의 "최고" 모델은 없었습니다.
    • "Confetti" 작업에서는 Gemini-3.1-Flash-Live가 챔피언이었습니다.
    • "When2Call" 작업에서는 GPT-Realtime-1.5가 왕좌를 차지했습니다.
  • "음성 세금": 모든 모델은 텍스트에서 음성으로 전환할 때 약간씩 성능이 저하되었습니다.
    • 일부 모델 (Qwen3 등) 은 정확도가 아주 조금만 떨어졌습니다 (비 속에서 달리는 선수가 약간 속도가 느려지는 것과 같습니다).
    • 다른 모델들 (GPT-Realtime-1.5 등) 은 상당한 정확도 손실을 겪었습니다 (진흙탕에서 미끄러지는 선수와 같습니다).
  • "번역가" 대 "초청청자" 대결:
    • 일부 모델의 경우 "번역가" 접근법 (음성 -> 텍스트 -> 행동) 이 실제로 "초청청자"보다 약간 더 좋거나 동등했습니다.
    • 다른 모델들의 경우 "초청청자"가 더 좋았습니다.
    • 결론: 하나의 아키텍처가 항상 더 낫다고 가정할 수 없습니다. 이는 사용하는 모델과 수행하는 작업에 전적으로 달려 있습니다.

그들은 어디서 실패할까요?

연구자들은 실수를 분석하여 재미있는 패턴을 발견했습니다:

  • "잘못 들린 세부 사항" 문제: 대부분의 경우, 모델들은 큰 그림은 올바르게 파악했습니다 (항공권을 예약해야 한다는 것을 알았습니다), 하지만 세부 사항을 잘못 처리했습니다 (잘못된 날짜나 잘못된 도시로 예약했습니다).
  • 이는 주문을 잘못 알아들어서 "저녁 식사"를 원한다고 말했는데 "아침 식사"를 가져다주는 웨이터와 같습니다.

"심판" 문제

현실 세계에서는 기업들이 AI 가 올바른 작업을 수행했는지 확인하기 위한 "정답 키"를 종종 가지고 있지 않습니다. 따라서 이 논문은 다른 AI 모델을 "심판"으로 사용하여 성능을 평가하는 방법을 테스트했습니다.

  • 그들은 충분한 두뇌 능력 (최소 80 억 개의 파라미터) 을 가진 오픈소스 심판들 (무료이고 프라이버시를 존중하는 모델들) 이 값비싼 독점 심판들과 마찬가지로 작업을 평가할 수 있음을 발견했습니다. 이는 프라이버시를 우려하는 기업들에게 매우 좋은 소식입니다.

결론

음성 어시스턴트를 구축한다면, "초청청자"를 사용할지 "번역가"를 사용할지 단순히 추측하지 마세요.

  1. 자신의 데이터로 테스트하세요: 이 프레임워크를 사용하여 텍스트 로그를 음성 테스트로 변환하세요.
  2. "음성 세금"을 확인하세요: 음성을 추가했을 때 특정 모델의 성능이 얼마나 떨어지는지 확인하세요.
  3. 모호함에 주의하세요: 사용자가 모호한 질문을 하면 시스템은 텍스트든 음성든 관계없이 더 많이 실패할 것입니다.

간단히 말해: 이 논문은 기업들이 음성 어시스턴트가 현실 세계에 준비되었는지 확인하기 위한 "스트레스 테스트"를 제공하며, 최선의 선택은 일반적인 경험칙이 아니라 특정 모델과 특정 작업에 달려 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →