Building Interactive Real-Time Agents with Asynchronous I/O and Speculative Tool Calling
본 논문은 복잡한 다중 턴 도구 호출을 지원하는 실시간 저지연 에이전트 상호작용을 가능하게 하고, 클라우드 및 엣지 규모 모델 모두에서 상당한 속도 향상을 달성하면서도 허용 가능한 정확도를 유지하기 위해 비동기 I/O 와 추측적 도구 호출을 결합한 프레임워크를 제안합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하지만 약간 느린 비서에게 복잡한 일련의 지시를 전달하려고 한다고요. 기존의 방식 (표준 방법) 에서는 비서가 무엇을 해야 할지 생각하기 시작조차 하기 전에, 당신이 문장 전체를 말하고 끝날 때까지 기다려야 했습니다. 그런 다음, 비서가 전화번호를 찾아보거나 문자를 보내야 할 필요가 있다면, 말하기를 멈추고 그 작업을 수행한 뒤 결과를 기다렸다가, 그제야 무슨 일이 있었는지 당신에게 알려주었습니다. 이런 주고받기는 많은 침묵과 대기 시간을 만들어내어 대화를 어색하고 부자연스럽게 느끼게 했습니다.
이 논문은 AI 에이전트가 실시간 인간 대화와 훨씬 더 유사하게 작동하는 새로운 방식을 제시합니다. 연구자들은 이 방법을 비동기 I/O와 추측적 도구 호출이라고 부릅니다. 간단한 비유를 통해 그 작동 원리를 살펴보겠습니다:
1. "멀티태스킹 셰프" (비동기 I/O)
표준 AI 에이전트는 한 번에 한 가지 일만 할 수 있는 셰프라고 생각하세요: 당신이 주문을 끝낼 때까지 기다렸다가 야채를 다지고, 다시 스토브가 데워질 때까지 기다렸다가 요리를 시작합니다.
새로운 방식은 AI 를 멀티태스킹 셰프로 바꿉니다.
- 당신이 여전히 말하고 있는 동안: 셰프는 당신이 말한 처음 몇 마디를 바탕으로 야채 다지기를 시작합니다. 문장을 끝낼 때까지 기다리지 않습니다.
- 스토브가 데워지기를 기다리는 동안: 셰프가 도구 (예: 데이터베이스 조회) 가 완료될 때까지 기다려야 한다면, 벽을 멍하니 바라보며 서 있지 않습니다. 그 대기 시간을 활용하여 다음 단계를 계획하거나 심지어 다음 재료를 준비하기 시작합니다.
기술적인 용어로 말하자면, 이는 AI 가 당신의 말하기와 그 사고 과정을 '분리'한다는 것을 의미합니다. AI 는 당신이나 외부 세계로부터 정보를 기다리는 동안에도 그 자리에 멈추지 않고 계속 작업을 수행합니다.
2. "안전망이 있는 도박사" (추측적 도구 호출)
때로는 AI 가 추측을 해야 합니다. 당신이 "조에게 전화해..."라고 말하면, AI 는 누군가에게 전화를 걸어야 한다는 것을 알지만, 어떤 조인지 아직 모릅니다.
- 기존 방식: AI 는 "잠시만요, 어떤 조죠?"라고 말하며 당신이 명확히 할 때까지 모든 것을 멈춥니다.
- 새로운 방식: AI 는 추측적인 행동을 취합니다. "알겠습니다, 혹시나 해서 '조 스미스'를 찾아보겠습니다"라고 말하며 즉시 프로세스를 시작합니다.
안전망:
논문은 "안전한" 추측과 "위험한" 추측 사이의 중요한 차이를 구분합니다:
- 안전한 도구 (읽기 전용): AI 가 단순히 전화번호를 찾아보는 경우라면 즉시 수행할 수 있습니다. 나중에 당신이 "사실은 조 존스를 의미했습니다"라고 말하면, AI 는 번호만 바꾸면 됩니다. 나쁜 일은 일어나지 않습니다.
- 위험한 도구 (쓰기 전용): AI 가 문자 메시지를 보내거나 파일을 삭제하려 한다면, 단순히 추측할 수 없습니다. 그 행동을 "대기" 상자에 보관합니다. 메시지를 준비하지만 실제로 "전송" 버튼을 누르기 전에 최종 "초록불" (말하기를 끝냈다는 확인) 을 기다립니다.
만약 AI 가 잘못 추측하고 당신이 마음을 바꾼다면, 그 행동이 발생하기 전까지 대기 중인 작업을 단순히 취소할 수 있습니다. 이는 셰프가 양파를 다지기 시작하지만, 칼이 도마에 닿기 전에 당신이 "사실 오늘 저는 채식주의자입니다"라고 말하면 즉시 멈추는 것과 같습니다.
3. "시계 기반 훈련"
AI 에게 이를 가르치기 위해 연구자들은 단순히 "더 빨라지라"고 말하지 않았습니다. 대신 시계가 있는 특수한 훈련 체육관을 구축했습니다.
- 이 체육관에서 AI 는 정보 (예: 당신의 목소리나 도구의 답변) 가 특정 지연된 순간에 도착할 것으로 예상하도록 훈련받습니다.
- AI 는 그 지연 시간 동안에도 계속 일하도록 학습합니다.
- 또한, AI 가 초기에 잘못 추측하는 가짜 "실수"를 훈련 데이터에 만들어 넣어, AI 가 당황하지 않고 나중에 그 실수를 수정하는 방법을 배우도록 강요했습니다.
결과
논문은 이 방법을 두 가지 유형의 AI 에서 테스트했습니다:
- 대형 클라우드 모델: 기존 강력한 AI API(예: OpenAI 의 것) 를 사용할 때, 이 방법은 정확도가 아주 약간 떨어지는 것 외에는 속도를 1.3 배에서 1.7 배까지 향상시켰습니다.
- 소형 엣지 모델: 노트북에서 실행 가능한 소형 AI 모델들을 그들의 특수한 "시계" 방식을 사용하여 훈련시켰을 때, 이 모델들은 높은 정확도를 유지하면서 1.6 배에서 2.2 배까지 빨라졌습니다.
요약하자면: 이 논문은 AI 에이전트가 생각하거나 기다리는 동안 "일시 정지"하는 것을 어떻게 멈출 수 있는지 보여줍니다. 기다리는 동안 일하게 하고, 나중에 수정할 수 있는 안전한 추측을 하도록 함으로써, 인간과 실시간으로 상호작용하게 하여 음성 비서가 훨씬 더 자연스럽고 반응이 빠르도록 만듭니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.