TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness
이 논문은 소형 디지털 아바타 에이전트가 재학습 없이 진화하는 이커머스 하네스에 동적으로 적응할 수 있도록 하여, 기본 모델 및 더 큰 범용 LLM과 비교하여 우수한 실시간 성능과 강건성을 달성하게 하는 3단계 프레임워크인 하네스 인지 학습(Harness-Aware Training, HAT)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
온라인 쇼핑의 활기찬 세계에서 새로운 종류의 호스트가 등장했습니다: 바로 디지털 아바타입니다. 이들은 컴퓨터로 생성된 사람들로, 카메라 앞에 서서 수천 명의 시청자에게 동시에 말을 걸고, 제품에 대한 질문에 답하며, 판매를 유도합니다. 이것이 제대로 작동하려면 아바타 뒤에 있는 컴퓨터가 믿을 수 없을 정도로 빨라야 합니다. 만약 생각하고 말하는 데 시간이 너무 오래 걸리면 라이브 스트리밍의 흐름이 끊기고 시청자들은 떠나버립니다. 하지만 속도는 문제의 절반일 뿐입니다. 아바타는 또한 갑작스러운 변화를 처리할 수 있을 만큼 똑똑해야 합니다. 상인이 할인 규칙을 변경하거나, 새로운 제품이 도착하거나, 안전 규정이 바뀌어 호스트의 발언 방식이 달라질 수도 있습니다. 과거에는 이러한 문제를 해결하기 위해 방송을 중단하고, 컴퓨터의 뇌를 다시 쓰고, 처음부터 다시 시작해야 했습니다. 이 느린 과정 때문에 아바타는 종종 구식 규칙에 갇혀 빠르게 움직이는 비즈니스의 요구에 적응하지 못하곤 했습니다.
TaoLive의 연구진은 아바타의 '뇌'와 '규칙서'를 분리하는 시스템을 만들어 이 문제를 해결했습니다. 아바타를 숙련된 배우라고 상상해 보십시오. 규칙서에는 대본, 판매를 처리하는 구체적인 지침, 그리고 재고 확인이나 가격 조회와 같은 도구 목록이 들어 있습니다. 뇌는 그 대본을 읽고 연기하는 배우입니다. 이 새로운 접근 방식에서 팀은 배우의 뇌를 건드리지 않고도 즉각적으로 편집할 수 있는 유연한 규칙서를 구축했습니다. 그들은 이를 '하네스(Harness)'라고 부릅니다. 상인이 가격이나 규칙을 변경하면, 팀은 단순히 하네스를 업데이트하기만 하면 됩니다. 그러면 배우는 즉시 새로운 지침을 읽게 됩니다. 그러나 이는 까다로운 과제를 낳았습니다. 만약 배우가 오직 한 가지 특정 버전의 대본으로만 훈련되었다면, 대본이 바뀔 때 혼란을 겪을 것이기 때문입니다. 배우는 새로운 것을 읽는 법을 배우는 대신 옛 단어들을 암기해 버릴 것입니다. 이를 해결하기 위해 연구진은 '하네스 인식 훈련(Harness-Aware Training)'이라는 새로운 훈련 방법을 개발했습니다. 배우에게 단 하나의 대본을 암기하도록 가르치는 대신, 수백 가지의 서로 다른 버전의 대본을 동시에 학습시켰습니다. 훈련 과정 중에 지침을 섞고, 도구의 이름을 바꾸고, 규칙의 순서를 변경했습니다. 이는 배우가 단순히 특정 단어를 외우는 것이 아니라, 지침의 '의미'를 이해하는 법을 배우도록 강제했습니다.
이 접근 방식의 결과는 놀랍습니다. 연구진은 실제 세계의 라이브 스트리밍 이커머스 시나리오에서 이 새로운 아바타를 테스트했습니다. 그 결과, 이 새로운 방식으로 훈련된 아바타는 제품 질문에 답하고 복잡한 상호작용을 처리하는 데 평균 94.8%의 정확도를 보였습니다. 이 점수는 당시 사용 가능한 가장 강력한 범용 AI 모델들이 동일한 작업에서 기록한 약 93.0%보다 높은 수치였습니다. 결정적으로, 이 새로운 아바타는 이러한 특정 판매 기술을 배울 때 일반적인 지시 사항을 따르는 능력을 잃지 않았습니다. 기존의 훈련 방식은 종종 일반 지능의 저하를 일으켰지만, 이 새로운 방식은 아바타를 날카롭고 적응력 있게 유지했습니다. 연구진이 아바타를 한 번도 본 적 없는 버전의 규칙서로 테스트했을 때도 94.6%의 정확도를 유지했는데, 이는 아바타가 단순히 암기한 것이 아니라 진정으로 적응하는 법을 배웠음을 증명합니다.
속도 또한 큰 장애물이었습니다. 아바타는 라이브 관중에게 말을 걸어야 하므로 실시간으로 응답해야 합니다. 연구진은 단일 고성능 그래픽 카드에 시스템을 배치했습니다. 변화하는 규칙을 읽고, 사실을 확인하고, 음성을 생성하는 복잡한 작업에도 불구하고 아바타는 빠르게 응답했습니다. 절반의 경우, 완전한 답변을 내놓는 데 단 3.4초밖에 걸리지 않았습니다. 더 느린 경우라도 95%의 응답이 8.1초 이내에 준비되었습니다. 이는 기다리는 시간이 길어지면 쇼의 흐름이 깨지는 엄격한 라이브 방송의 요구 조건을 충족합니다. 또한 시스템은 오류에 대해 견고함을 입증했습니다. 연구진이 의도적으로 규칙서나 도구에 실수를 도입했을 때, 이전 시스템들은 흔히 완전히 실패했지만, 이 아 없다은 회복하여 대화를 올바르게 이어갔습니다.
팀은 또한 라이브 쇼핑 환경에서 이 새로운 시스템을 업계에서 사용하는 표준 방식과 비교하는 실제 테스트를 진행했습니다. 7일 동안 새로운 시스템은 기존 시스템보다 사용자당 매출액을 5.54% 더 많이 창출하는 데 도움을 주었습니다. 또한 완료된 주문 건수에서도 작지만 측정 가능한 증가를 이끌어냈습니다. 이러한 개선은 하드웨어의 변경이나 규칙이 바뀔 때마다 모델을 다시 훈련해야 하는 번거로움 없이 이루어졌습니다. 시스템은 단순히 발행되는 새로운 지침에 맞춰 스스로 적응했습니다.
이 연구는 빠르고 유연한 AI 에이전트를 구축하는 것이 가능하다는 것을 보여줍니다. 변화하는 규칙을 학습 과정으로부터 분리하고, 모델이 그러한 변화를 예상하도록 훈련함으로써, 연구진은 비즈니스와 함께 진화할 수 있는 디지털 호스트를 만들었습니다. 아바타는 더 이상 최신 상태를 유지하기 위해 끊임없이 소프트웨어 업데이트가 필요한 정적인 프로그램이 아닙니다. 대신, 여름 세일이든, 신제품 출시든, 혹은 갑작스러운 정책 변화든, 새로운 대본을 읽고 올바르게 수행할 수 있는 역동적인 파트너입니다. 이 연구 결과는 AI가 진정으로 유용해지려면, 단순히 답을 아는 것이 아니라 끊임없이 변하는 세상 속에서 답을 찾는 법을 이해하도록 훈련되어야 함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.