← 최신 논문
🤖 AI

TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI

TRACE-Router는 에이전트 워크플로를 수락 시점에 단일 대규모 언어 모델에 할당하고 지연된 태스크 수준의 보상을 바탕으로 정책을 업데이트하는 태스크 수준 라우팅 프레임워크로서, 여러 벤치마크에서 기존의 호출 단위 라우터보다 정확도-지연 시간 트레이드오프 측면에서 더 뛰어난 성능을 보여줍니다.

원저자: Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna

게시일 2026-07-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 고객의 요청이 복잡한 미션이 되는 거대하고 첨단 기술을 갖춘 콜센터를 운영하고 있다고 상상해 보십시오. 당신에게는 팀원들이 있습니다. 어떤 이들은 매우 빠르지만 세부 사항을 놓칠 수 있고, 또 다른 이들은 믿기지 않을 정도로 철저하지만 시간이 오래 걸립니다. 인공지능의 세계에서 이들은 대규모 언어 모델(LLM)입니다. 기업들의 큰 과제는 어떤 작업에 어떤 직원을 배정할지 결정하는 것입니다. 항상 느리고 신중한 전문가만 선택한다면 비용과 시간을 낭비하게 될 것입니다. 반대로 항상 빠른 직원을 선택한다면 어려운 문제에서 틀린 답을 얻을 수도 있습니다.

오랫동안 이 문제를 해결하는 표준적인 방법은 단일 질문을 보고 "좋아, 이건 쉬워 보이니 빠른 직원에게 보내자"라거나 "이건 어려워 보이니 전문가에게 보내자"라고 결정하는 것이었습니다. 하지만 이러한 접근 방식은 '에이전트형(agentic)' AI를 다룰 때 숨겨진 결함이 있습니다. 에이전트는 단순히 질문 하나에 답하는 것이 아니라, 긴 여정을 떠납니다. 하나의 큰 문제를 해결하기 위해 질문을 던지고, 도구를 사용하고, 지도를 확인하고, 다시 질문을 던질 수도 있습니다. 만약 여정 중간에 직원을 바꾼다면, 새로운 직원은 첫 번째 직원이 무엇을 생각하고 있었는지 알지 못하며, 전체 미션이 실패할 수 있습니다. 진짜 문제는 어떻게 여정 전체에 적합한 직원을 선택할 것인가, 그리고 다음번에는 더 잘하기 위해 어떻게 결과로부터 배울 것인가 하는 점입니다.

이것이 바로 TRACE-Router를 개발한 연구자들이 해결하고자 했던 문제입니다. 그들은 매 질문을 별개의 결정으로 취급하는 것은 마치 매 마일마다 새로운 운전자를 선택하며 횡단 여행을 하는 것과 같다는 것을 깨달았습니다. 대신, 그들은 전체 여정 동안 한 명의 운전자를 선택하고 목적지에 도착할 때까지 그와 함께 가는 시스템을 제안합니다.

그들의 새로운 시스템이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다. 스마트한 기차역의 역무원을 상상해 보십시오. 기존 시스템에서 역무원은 승객의 티켓을 보고 어떤 기차에 태울지 결정합니다. 만약 승객이 나중에 기차를 갈아타야 한다면, 역무원은 새로운 결정을 내리며 종종 승객의 원래 목표를 잊어버리곤 합니다. TRACE-Router는 규칙을 바꿉니다. 승객(작업)이 도착하면, 역무원은 목적지를 보고 즉시 특정 기차(특정 AI 모델)에 배정합니다. 일단 승객이 그 기차에 올라타면, 몇 번의 정차를 거치더라도 여정 내내 그 기차에 머물게 됩니다.

마법은 여행이 끝난 후에 일어납니다. 역무원은 승객이 안전하고 정시에 도착했는지 확인하기 위해 기다립니다. 만약 여행이 성공적이었다면, 역무원은 시작할 때 내렸던 결정에 대해 "엄지 척(thumbs up)"을 줍니다. 만약 여행이 실패했거나 너무 오래 걸렸다면, "엄지 다운(thumbs down)"을 줍니다. 결정적으로, 역무원은 개별 정거점을 탓하는 것이 아니라 초기 기차 선택을 탓합니다. 이를 통해 시스템은 단편적인 순간이 아닌 전체 경험으로부터 배울 수 있습니다.

이 논문은 "컨텍스추얼 밴딧(contextual bandit)"이라 불리는 영리한 학습 방법을 소개합니다. 이것을 역무원이 다양한 유형의 승객에게 어떤 기차가 가장 잘 맞는지 배우는 게임이라고 생각해 보십시오. 그들은 AI에게 먼저 물어보지 않고도 티켓을 빠르게 훑어보는 것만으로 승객들을 "쉬움", "중간", "어려움"과 같은 대략적인 카테고리로 분류합니다. 각 카테고리에 대해 시스템은 다양한 기차를 시험해 보고, 어떤 기차가 일을 가장 잘 완수하는지 배우며, 결국 완벽한 조합을 찾아냅니다. 이는 마치 요리사가 음식을 맛보고 매운 음식에는 항상 빨간 가스레인지를 사용해야 하고, 단 음식에는 파란 가스레인지가 더 낫다는 것을 배우는 것과 같습니다.

이 접근 방식의 결과는 매우 인상적입니다. 연구진은 복잡한 수학 문제와 코딩 작업을 포함한 여러 실제 도전 과제들을 테스트했습니다. 그들은 하나의 모델을 전체 작업에 고수함으로써, 다른 방식들이 놓쳤던 속도와 정확도 사이의 "스윗 스팟(sweet spot)"을 일관되게 찾아냈음을 발견했습니다. τ 2-Bench라는 특정 테스트에서, 이 시스템은 동일한 시간이 주어졌을 때 다른 스마트한 라우팅 방식들보다 7~8개의 문제를 더 정확하게 해결할 수 있었습니다. 또 다른 테스트인 Terminal-Bench에서는 가장 강력한 단일 모델보다 7.1 퍼센트 포인트 더 높은 정확도를 달성하면서도, 실제로는 36% 더 빨랐습니다.

논문은 또한 어떤 것이 효과적인지 알아보기 위해 몇 가지 다른 아이디어들을 테스트했습니다. 그들은 시스템이 더 빨리 배우기를 기대하며 가짜 경험을 제공하여 시스템을 "사전 예열(pre-warm)"해 보았습니다. 그러나 결과는 이것이 오히려 시스템을 더 느리고 유연하지 못하게 만든다는 것을 보여주었기에, 그들은 시스템이 순수하게 실제 여행으로부터 배우는 "콜드 스타트(cold start)" 방식을 유지하기로 했습니다. 또한 그들의 학습 알고리즘을 다른 인기 있는 방법들과 비교했으며, 그들의 선택이 다양한 유형의 작업에 대해 가장 안정적이고 신뢰할 수 있다는 것을 발견했습니다.

요약하자면, TRACE-Router는 AI 에이전트를 관리하는 최선의 방법은 매 단계마다 미세하게 관리하는 것이 아니라, 전체 여정 동안 단 한 명의 잘 선택된 파트너를 믿는 것이라고 제안합니다. 최종 결과를 기다려 결정을 판단함으로써, 시스템은 속도와 정확도의 균고를 맞추는 법을 배우며 이전 방식들이 할 수 없었던 방식으로 더 똑똑한 선택을 내리게 됩니다. 이는 AI를 일련의 고립된 질문이 아니라 하나의 응집력 있는 장거리 미션으로 바라보는 관점의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →