← 최신 논문
🤖 AI

Just A Rather Very Intelligent Spoken Agent

이 논문은 실시간 사용자 상호작용, 작업 투명성, 그리고 추적 기반 응답 및 선제적 가이드를 통한 전반적인 성능 향상을 통해 롱 호라이즌(long-horizon) AI 에이전트 워크플로우를 강화하는 상시 작동형 음성 중재자의 효과를 평가하기 위해 설계된 새로운 벤치마크이자 모듈형 프로토타입인 JarvisBench를 소개한다.

원저자: Chen Chen, Zhehuai Chen

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Chen Chen, Zhehuai Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

AI 시대의 사라진 중간 관리자

당신이 복잡한 나무 집(treehouse)을 지어달라고 아주 똑똑하고 빠른 인턴을 고용했다고 상상해 보세요. 당신은 설계도를 건네며 "한번 해봐!"라고 말합니다. 그러고 나서 당신은 자리를 뜹니다. 몇 시간 동안, 당신에게는 가끔 들리는 망치질 소리나 나무 톱질 소리 외에는 아무것도 들리지 않습니다. 당신은 그 인턴이 나무 집을 제대로 짓고 있는지, 아니면 썩은 가지를 건드린 것인지, 혹은 사다리 대신 미끄럼틀을 만들기로 결심한 것인지 알 길이 없습니다. 흐름을 방해하지 않고 슬쩍 가서 훔쳐볼 수도 없으며, 질문을 하기 위해 작업이 끝날 때까지 기다렸을 때는 이미 전체 구조가 위험하게 기울어져 버린 뒤일지도 모릅니다. 이것이 현재 많은 고급 AI 에이전트들이 처한 상황입니다. 이들은 매우 유능한 "노동자"이지만, 긴 시간 동안 침묵 속에서 홀로 작동하며 인간 상사를 막막하게 만듭니다.

이 논문은 인공지능(AI), 특히 AI 에이전트에 초점을 맞추고 있습니다. AI 에이전트를 단순히 한 가지 질문에 답하는 챗봇이 아니라, 계획을 세우고, 도구(웹 브래우저나 코드 에디터 등)를 사용하며, 장기간에 걸쳐 다단계 문제를 해결할 수 있는 디지털 직원이라고 생각하세요. 여기서 핵심 개념은 "장기적 관점(long-horizon)"의 과업입니다. 즉, 시간이 걸리고, 많은 단계가 필요하며, 미묘한 방식으로 잘못될 수 있는 업무를 의미합니다. 이 논문은 우리의 AI 노동자들이 점점 더 똑똑해지고 있지만, 우리가 그들과 소통하는 방식은 과거에 머물러 있다고 주장합니다. 우리는 단순한 명령 전달 방식이 아니라, 흐름을 끊지 않으면서도 실시간으로 연결되어 질문을 던지고 작업자를 가이드할 수 있는 새로운 종류의 인터페이스를 필요로 합니다.

자비스를 만나다: 언제나 깨어 있는 속삭임

이 논문의 저자인 NVIDIA의 Chen과 Chen은 이러한 "루프 밖의 문제(out of the loop problem)"에 대한 해결책을 제시합니다. 그들은 JarvisBench라고 불리는 개념을 도입했는데, 이는 새로운 유형의 AI 조력자를 위한 테스트 환경과 같습니다. 이 조력자를 당신(사용자)과 열심히 일하는 AI 에이전트 사이에 앉아 있는 "중재자" 또는 "중간 관리자"라고 생각하세요.

영화 아이언맨에서 캐릭터 J.A.R.V.I.S.는 저자들이 만들고자 하는 것의 완벽한 예시입니다. 그는 단순히 토니 스타크가 질문하기를 기다리는 것이 아니라, 토니가 무엇을 하는지 듣고 관찰하며, 즉각적으로 질문에 답하고, 심지어 토니가 실수를 하려 할 때 먼저 말을 겁니다. 논문은 현재의 AI 에이전트들에게 이러한 "자비스" 층이 부족하다고 주장합니다. 보통은 명령을 내리면 AI가 침묵 속에서 작업하고, 문제가 생겼을 때만 텍ert 형태의 업데이트를 받게 됩니다. 저자들은 이것이 너무 빈약한 연결이라고 말합니다. 그들은 항상 켜져 있고(always-on), 음성 상호작용이 가능하며, 진행 상황을 설명할 준비가 되어 있고, 작업자가 막혔을 때 인간에게 빠른 도움을 요청할 수 있는 에이전트를 원합니다.

이 아이디어가 효과가 있다는 것을 증명하기 위해, 팀은 프로토타입 시스템과 이를 테스트하기 위한 규칙 세트를 구축했는데, 이를 JarvisBench라고 부릅니다. 그들은 단 하나의 특정 로봇을 만든 것이 아니라, 서로 어떻게 잘 작동하는지 확인할 수 있도록 다양한 "두뇌(AI 모델)"와 다양한 "노동자(worker)"를 끼워 넣을 수 있는 유연한 프레임워크를 만들었습니다.

두 갈래의 테스트: 작업에 도움이 되는가? 인간에게 도움이 되는가?

연구진은 이 "자비스" 아이디어가 실제로 차이를 만드는지 확인하기 위해 두 부분으로 구성된 챌린지를 설정했습니다.

트랙 1: 노동자의 가장 친한 친구 (에이전트 협업)
이 트랙의 목표는 자비스 중재자가 AI 노동자가 실제로 업무를 더 잘 완수하도록 돕는지 확인하는 것입니다. AI 노동자가 복잡한 퍼즐을 풀거나 코드를 작성하고 있다고 상상해 보세요. 자비스가 없다면, 노동자는 실수 루프에 빠지거나 잘못된 길로 들어선 뒤 너무 늦기 전까지는 이를 깨닫지 못할 수 있습니다. 자비스가 있다면, 중재자가 노동자의 모든 움직임을 지켜봅니다. 만약 노동자가 같은 실수를 두 번 반복하거나 혼란스러워 보이면, 자비스는 동작을 일시 중단(또는 일시 중단을 시뮬레이션)하고 인간 전문가에게 짧은 팁을 요청합니다. 그런 다음 그 팁을 다시 노동자에게 전달합니다.

테스트 결과는 유망했습니다. 연구진은 다양한 AI 노동자를 사용하여 34가지의 장기 과업(정보 검색, 파일 정리, 코드 작성 등)을 실행했습니다. 자비스 중재자를 추가했을 때, 노동자들의 과업 완수 능력이 향상되었습니다. 예를 들어, "Claude Opus 4.7"이라는 두뇌를 사용하는 노동자의 성공 점수는 **64.01%**에서 **75.79%**로 향상되었습니다. 중재자가 직접 일을 하는 것이 아니라, 문제 지점을 포착하고 노동자가 궤도로 돌아올 수 있도록 딱 필요한 만큼의 인간 가이드를 가져오는 가교 역할을 한 것입니다. 논문은 이 "중간 계층"이 AI 에이전트를 완전히 새로 구축할 필요 없이 실수로부터 회복하도록 돕는 데 매우 중요하다고 제안합니다.

트랙 2: 인간의 가장 친한 친구 (사용자 상호작용)
두 번째 트랙은 다른 질문을 던집니다. 이 중재자가 인간의 경험을 더 좋게 만드는가? 당신이 상사라고 가정하고, "지금 무엇을 하고 있나요?" 또는 "왜 그 파일을 선택했나요?"라고 묻고 싶다고 상상해 보세요. 기존 방식에서는 로그를 뒤지거나 보고를 기다려야 했습니다. 하지만 자비스와 함께라면, "헤이, 어떻게 되어가고 있어?"라고 물을 수 있고 즉시 음성 답변을 들을 수 있습니다.

연구진은 시뮬레이션된 "비전문가" 사용자가 작업 중에 질문을 던지게 함으로써 이를 테스트했습니다. 그들은 중재자가 본 것을 바탕으로 노동자의 진행 상황을 얼마나 잘 설명하는지, 그리고 과업의 맥락에 관한 질문에 얼마나 잘 답하는지를 측정했습니다. 연구진은 중재자 뒤에 있는 "두뇌"가 매우 중요하다는 것을 발견했습니다. 매우 똑똑한 두뇌(예: GPT-5.4)는 맥락 질문에 답하는 데 탁월하여 5점 만점에 3.91점이라는 높은 점수를 받았습니다. 그러나 더 작고 빠른 두뇌들도 현재 노동자가 무엇을 하고 있는지 설명하는 데는 유능했습니다. 핵심적인 결론은, 좋은 중재자는 당신이 기술 전문가가 아니거나 화면 가득한 코드를 뚫어지게 쳐다볼 필요 없이, 당신에게 정보를 제공하고 몰입하게 만들 수 있다는 것입니다.

이것이 의미하는 바 (그리고 의미하지 않는 것)

논문은 이 결과가 시뮬레이션과 특정 테스트에 기반한 예비 결과임을 신중하게 밝히고 있습니다. 이들이 모든 AI 문제를 해결했거나 완벽한 로봇 집사를 만들었다고 주장하는 것이 아닙니다. 그들은 중재자가 업무를 가로채거나 과업 자체를 해결해서는 안 된다는 점을 명시적으로 배제했습니다. 중재자의 역할은 엄격히 관찰하고, 듣고, 가이드하는 것입니다.

또한 중재자의 "두뇌" 품질이 결정적이라는 사실도 발견했습니다. 만약 두뇌가 충분히 똑똑하지 않다면, 불필요하게 노동자를 방해하거나 잘못된 조언을 줄 수 있습니다. 하지만 두뇌가 강력할 때, 똑똑한 노동자와 똑똑한 중재자의 조합은 더 투명하고, 더 유용하며, 성공 가능성이 높은 팀을 만들어냅니다.

요약하자면, 이 논문은 AI의 미래가 단순히 노동자를 더 똑똑하게 만드는 것뿐만 아니라, 인간과 기계 사이의 더 나은 대화를 구축하는 데 있다고 제안합니다. "자비스" 층을 추가함으로써, 우리는 마침내 AI 에이전트가 단순히 우리를 위해 일하는 것이 아니라, 우리와 함께 일하며, 우리를 과정에 참여시키고 상황이 까다로워질 때 도움을 줄 수 있게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →