ShopEase: A Generative AI-Based Multi-Agent Framework for Intelligent Enterprise Customer Support Using Hybrid Retrieval-Augmented Generation
이 논문은 로컬 LLaMA 3.2와 하이브리드 검색을 활용하는 기업용 고객 지원을 위한 멀티 에이전트 생성형 AI 프레임워크인 ShopEase를 소개하며, 2,632개의 쿼리에 대한 평가를 통해 밀집 FAISS 검색이 크로스 인코더 재순위화와 관련된 지연 시간 페널티를 피하면서도 정확도 측면에서 희소 및 재순위화된 하이브리드 방식보다 우수함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 비즈니스 세계에서 고객을 만족시키는 방법은 종종 그들의 질문에 빠르고 정확하게 답변하는 것을 의미합니다. 온라인으로 물건을 구매한 사람이 환불, 배송 지연, 또는 파손된 제품에 대해 알고 싶어 할 때, 그들은 즉각적인 답변을 기대합니다. 수십 년 동안 기업들은 인간처럼 대화하도록 설계된 컴퓨터 프로그램인 챗봇을 통해 이를 자동화하려고 노력해 왔습니다. 이러한 프로그램들은 단순하고 반복적인 질문에는 잘 작동하지만, 상황이 복잡해지면 종종 갈피를 못 잡습니다. 만약 고객이 특정 정책에 대해 물으면서 동시에 과거의 주문 내역이나 독특한 문제를 언급한다면, 기본적인 프로그램은 대화 내용을 기억하지 못하거나 적절한 규칙집을 찾지 못해 길을 잃을 수 있습니다. 이를 해결하기 위해, 연구자들은 이제 단일 로봇보다는 전문가 팀처럼 행동하는 시스템을 구축하고 있습니다. 이 새로운 시스템들은 '검색 증강 생성(retrieval-augmented generation)'이라는 방법을 사용하는데, 이는 컴퓨터가 말을 하기 전에 데이터베이스에서 사실을 찾아내어, 단순히 추측하는 것이 아니라 실제 회사의 규칙에 기반한 답변을 하도록 보장하는 세련된 방식입니다. 또한 그들은 여러 개의 '에이전트', 즉 고객이 누구인지 기억하는 에이전트, 적절한 정책을 찾아내는 에이전트, 그리고 인간의 개입이 필요한지 결정하는 에이전트와 같이 서로 다른 업무를 처리하는 작은 프로그램들을 사용합니다.
인도 공과대학교 카라그푸르(IIT Kharagpur)의 연구팀은 기업 고객 지원을 위해 이러한 팀 접근 방식이 얼마나 잘 작동하는지 테스트하기 위해 ShopEase라는 새로운 시스템을 구축했습니다. 그들의 목표는 질문이 던져지는 순간부터 최종 답변에 이르기까지 고객 문의의 전체 여정을 처리할 수 있는 프레임워크를 만드는 것이었으며, 동시에 언제 인간 작업자에게 바통을 넘겨야 할지를 아는 것이었습니다. 이 시스템은 함께 작동하는 여섯 개의 뚜렷한 부분으로 설계되었습니다. 먼저, 가드(guard)가 들어오는 질문이 안전하고 명확한지 확인합니다. 그다음, 에이전트가 고객이 실제로 원하는 것이 무엇인지 식별합니다. 다른 에이전트들은 데이터베이스에서 고객의 개인 이력을 가져오고 이전 대화의 세부 사항을 회상합니다. 중앙 검색 팀은 상황에 적용되는 특정 규칙을 찾기 위해 수천 개의 정책 문서를 검색합니다. 만약 시스템이 문제가 너무 복잡하거나 위험하다고 느끼면, 에스컬레이션(escalation) 에이전트가 해당 사례를 인간에게 넘깁니다. 마지막으로, 감독관(supervisor)이 이 모든 단계를 조정하고 최종 응답이 고객에게 전달되기 전에 검토를 거치도록 보장합니다.
이 설계가 실제로 작동하는지 확인하기 위해, 연구진은 이 특정 실험을 위해 따로 떼어 놓은 2,632개의 실제 고객 질문 세트를 사용하여 테스트를 진행했습니다. 이 질문들은 환불, 반품, 배송 문제, 취소, 파손 제품, 그리고 명확한 카테고리에 속하지 않는 질문 그룹 등 여섯 가지 흔한 범주를 다루었습니다. 연구팀은 어떤 방식의 정책 문서 검색이 가장 효과적인지 알고 싶었습니다. 그들은 여섯 가지 다른 검색 전략을 시도했습니다. 어떤 방식은 정확한 단어 일치에만 의존했고, 다른 방식은 특정 어휘가 다르더라도 단어 이면에 담긴 의미를 이해하는 방식을 사용했습니다. 또한 그들은 이러한 방법들의 조합을 테스트했으며, 상위 결과에 대해 두 번째의 더 세심한 점검을 수행하는 단계를 추가하여 최종 답변이 개선되는지 확인했습니다.
결과는 질문의 의미를 이해하는 것이 정확한 단어를 일치시키는 것보다 훨씬 더 중요하다는 것을 보여주었습니다. 의미 기반의 문서를 찾는 데 전적으로 의존한 시스템이 가장 높은 성공률을 기록하며, 적절한 정책 카테고리를 85.37%의 확률로 정확하게 식별했습니다. 이는 단어 일치만을 찾았던 시스템이 55.74%의 경우에서만 정답을 맞힌 것보다 유의미하게 높은 수치였습니다. 흥란하게도, 그 추가적인 세심한 점검 단계를 더하는 것은 도움이 되지 않았습니다. 사실, 그것은 시스템을 더 정확하게 만들지 못하면서 오히려 더 느리게 만들었습니다. 연구진은 이 추가적인 처리 계층을 더했을 때 답변을 얻는 데 걸리는 시간이 눈에 띄게 증가했지만, 정답의 수는 늘어나지 않는다는 것을 발견했습니다. 이는 이러한 종류의 과업에서는 빠르고 의미 기반인 검색이 느린 다단계 프로세스보다 더 효과적임을 시사합니다.
연구진이 시스템이 성공한 지점과 실패한 지점을 자세히 살펴보았을 때, 명확한 패턴이 나타났습니다. 시스템은 배송, 취소, 반품에 관한 질문을 처리하는 데 매우 뛰어났으며, 종종 90% 이상의 확률로 정답을 맞혔습니다. 그러나 알려진 카테고리에 깔끔하게 들어맞지 않는 질문에는 크게 어려움을 겪었습니다. 고객이 특정 정책과 일치하지 않는 모호한 질문을 했을 때, 시스템은 모른다고 인정하기보다 종종 추측하여 알려진 카테고리에 할당하곤 했습니다. 이것이 오류의 주요 원원이었습니다. 시스템은 또한 환불과 반품을 구별하는 데 어려움을 겪었는데, 이 두 개념이 유사한 언어를 사용하는 경우가 많아 혼동을 일으켰기 때문입니다. 이러한 문제에도 불구하고, 이 연구는 다중 에이전트 시스템이 고객 이력, 대화 기억, 그리고 정책 검색을 하나의 조율된 워크플로우로 성공적으로 결합할 수 있음을 입증했습니다.
연구진은 또한 각 구성 요소가 얼마나 중요한지 알아보기 위해 시스템의 특정 부분을 제거했을 때 어떤 일이 발생하는지 테스트했습니다. 그들은 고객의 개인 정보를 기억하는 부분을 제거했을 때 답변의 개인화 정도가 가장 크게 떨어진다는 것을 발견했습니다. 이는 고객이 누구인지 아는 것이 규칙을 아는 것만큼이나 중요하다는 것을 확인시켜 주었습니다. 대화 이력을 처리하는 부분을 제거하는 것도 답변의 품질을 떨어뜨렸지만, 고객 데이터를 잃었을 때만큼은 아니었습니다. 사례를 인간에게 전달하는 역할을 하는 부분은 자동화된 답변의 품질에 미치는 영향이 적었는데, 이는 그 역할의 주된 임무가 기계가 문제를 해결할 수 없을 때 개입하는 것이지 기계 자체의 성능을 높이는 것이 아니기 때문입니다.
결론적으로, Shop-Ease 시스템은 적절한 도구가 사용된다면 팀 기반 접근 방식이 기업 지원에 효과적임을 보여주었습니다. 연구는 단어의 의미를 이해하는 밀집 검색(dense retrieval)이 이러한 업무에 있어 단순 키워드 매칭보다 우수하다는 것을 보여주었습니다. 또한 복잡한 재점검 단계를 추가하는 것이 가치를 더하지 못한 채 속도만 늦출 수 있다는 점도 밝혀냈습니다. 시스템이 완벽하지는 않지만, 특히 모호하거나 범위를 벗어난 질문을 다룰 때 그러한데, 이는 고객 서비스의 미래를 위한 견고한 토대를 제공합니다. 연구진은 향-후 개선 방향이 질문이 시스템의 지식 범위를 벗어났을 때 이를 감지하는 더 나은 방법과 더 다양한 시나리오를 다루기 위한 정책 라이브러리 확장 등에 집중되어야 한다고 제안합니다. 현재로서는, 이 연구는 빠르고 정확하며 상황이 요구될 때 인간에게 넘길 준비가 된 지능형 지원 시스템을 구축하기 위한 명확한 로드맵을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.