← 최신 논문
🤖 AI

Iterating Toward Better Search: A Two-Agent Simulation Framework for Evaluating Agentic Search Architectures in E-Commerce

이 논문은 이커머스 검색 아키텍처를 평가하기 위한 모듈형 2-에이전트 시뮬레이션 프레임워크를 소개하며, 2,011건의 대화를 통해 롤링 윈도우 메모리가 의도 추출 방식보다 우수하고, 체계적인 실패 분석이 오류율을 유의미하게 감소시키며, 서로 다른 LLM 백본이나 평가 모델이 뚜렷하게 다른 성능 및 평가 결과를 도출한다는 점을 입증한다.

원저자: Jetlir Duraj, Jayanth Yetukuri, Shuang Zhou, Dhruv Varma, Rui Kong, Ishita Khan, Qunzhi Zhou

게시일 2026-06-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jetlir Duraj, Jayanth Yetukuri, Shuang Zhou, Dhruv Varma, Rui Kong, Ishita Khan, Qunzhi Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대하고 첨단 기술을 갖춘 백화점의 매니저라고 상상해 보십시오. 당신은 고객과 대화하고, 그들이 무엇을 원하는지 이해하며, 완벽한 제품을 찾도록 도와줄 수 있는 새롭고 매우 스마트한 디지털 쇼핑 어시스턴트를 만들고 싶습니다. 하지만 이 어시스턴트를 고용하여 실제 고객 앞에 내놓기 전에, 먼저 테스트를 해야 합니다.

문제는, 실제 사람을 대상으로 테스트하는 것은 느리고, 비용이 많이 들며, 위험하다는 것입니다. 만약 어시스턴트가 형편없다면 실제 고객들은 좌절하게 될 것입니다. 만약 컴퓨터가 고객과 어시스턴트 역할을 모두 수행하도록 하여 테스트를 시도한다면, 그 테스트는 가짜입니다. 왜냐하면 "고객"은 "어시스턴트"가 무엇을 말할지 이미 알고 있기 때문에, 대화가 로봇처럼 느껴지고 부자연스러워지기 때문입니다.

이 논문은 하나의 해결책을 제시합니다: 2개 에이전트 시뮬레이션 랩(A Two-Agent Simulation Lab).

이 랩을 쇼핑 어시스턴트를 위한 현실적인 "비행 시뮬레이터"라고 생각하십시오. 이것은 서로의 생각을 알지 못하는 두 개의 별도 AI 캐릭터를 사용합니다:

  1. 구매자 에이전트(The Buyer Agent): 특정 성격(예: "성급한 테크 마니아" 또는 "인내심 있는 알뜰 쇼퍼")을 가진 디지털 고객입니다. 이 에이전트는 특정 미션(예: "특정 시계 스트랩 찾기")과 인내 수준을 가지고 있습니다. 이 에이전트는 어시스턴트가 실제로 보여주는 것에 대해서만 반응합니다.
  2. 응답자 에이전트(The Responder Agent): 당신이 테스트 중인 쇼핑 어시스턴트입니다. 이 에이전트는 실제 검색 엔진(예: eBay의 실제 데이터베이스)과 직접 연결되어 제품을 찾고 질문에 답합니다.

"구매자"와 "응답자"가 분리되어 있기 때문에, "구매자"를 동일하게 유지하면서 "응답자"(새로운 디자인 시도)를 교체할 수 있습니다. 이를 통해 고객이 바뀌면서 발생하는 노이즈 없이, 새로운 디자인이 실제로 더 나은지 확인할 수 있습니다.

연구진은 네 가지 주요 아이디어를 테스트하기 위해 14가지 유형의 "구매자"와 함께 2,011번의 대화를 실행했습니다. 연구 결과는 다음과 같이 쉽게 설명할 수 있습니다.

1. 적을수록 좋다 (기억의 교훈)

그들은 어시스턴트가 대화를 기억하는 두 가지 방식을 비교했습니다:

  • "요약기" (Sys-A): 매 문장마다 어시스턴트가 멈춰서 똑똑한 AI에게 "고객이 정말로 말하려는 의도가 무엇인가?"라고 묻고 요약본을 작성합니다.
  • "스크롤 백" (Sys-B): 어시스턴트가 그냥 고객이 말한 마지막 몇 문장의 목록을 계속 유지합니다. 마치 대화 기록을 위로 스크롤 하는 것과 같습니다.

결과: "스크롤 백" 방식이 승리했습니다. 이 방식은 35% 더 빨랐으며 실제로 더 잘 수행했습니다.
비유: 식당 웨이터가 주문을 받을 때마다 손님이 무엇을 원할지 보고서를 작성하는 대신, 그냥 주문 내용을 듣고 기억하는 것과 같습니다. 보고서를 쓰는 웨이터보다, 마지막에 말한 몇 가지를 그냥 듣고 기억하는 웨로가 더 빨랐고 실수도 적었습니다. "요약기"는 가끔 의미를 잘못 파악하거나 중요한 세부 사항을 버리곤 했습니다.

2. "수정하기" 스피드 런 (The "Fix-It" Speed Run)

테스트를 마친 후, 팀은 어시스턴트가 실패했던 대화들을 살펴보았습니다. 그들은 어시스턴트가 매우 까다롭고 성급하며 정확한 일치를 원하는 고객들을 상대할 때 어려움을 겪는다는 특정 패턴을 발견했습니다.

  • 해결책: 그들은 이러한 특정 실패 사례를 처리하기 위해 어시스턴트 코드에 세 가지 작고 정밀한 변경을 가했습니다.
  • 결과:이틀 만에, "실패에 가까운 상황(near-failures)"을 62% 감소시켰습니다.
    비유: 자동차 엔진이 추울 때만 덜컥거린다는 것을 알아차린 정비사와 같습니다. 엔진 전체를 다시 만드는 대신, 그들은 특정 볼트 하나를 조였을 뿐입니다. 그 후 자동차는 완벽하게 작동했습니다.

3. 뇌가 중요하다 (모델의 교훈)

그들은 "스크롤 백" 디자인은 그대로 둔 채, 어시스턴트를 구동하는 "뇌"(기저의 AI 모델)를 교체했습니다.

  • 뇌 A: Gemini라는 최고 수준의 모델입니다.
  • 뇌 B: Llama라는 약간 다른 최고 수준의 모델입니다.
    결과: 디자인은 동일했음에도 불구하고, Gemini 뇌를 가진 어시스턴트가 훨씬 더 도움이 되고 고객을 잘 이해했습니다. Llama 뇌는 13% 더 빨랐지만, 더 일반적이고 로봇 같은 답변(마치 브로슈어 같은 답변)을 내놓았고, 전문 지식을 갖춘 점원처럼 구체적이고 유용한 조언을 주는 데는 부족했습니다.
    교훈: 완벽한 자동차 차체를 가질 수는 있지만, 약한 엔진을 넣는다면 자동차는 제대로 성능을 낼 수 없습니다.

4. "심판" 문제 (가장 놀라운 발견)

쇼핑 어시스턴트의 성적을 매기기 위해, 연구진은 두 명의 다른 초고성능 AI를 "심판"(하나의 Google 모델, 하나의 Anthropic 모델)으로 사용했습니다. 두 심판에게 동일한 대화 내용을 주고 채점을 하게 했습니다.
결과: 심판들은 30%의 대화에서 의견이 불일치했으며, 때로는 큰 차이를 보이기도 했습니다.

  • 심판 A (Gemini): 어시스턴트가 예의 바르고, 설명을 잘하며, 대화 흐름이 매끄러운 것을 좋아했습니다.
  • 심판 B (Claude): 고객이 실제로 물건을 구매하거나 장바구니에 담았을 때만 높은 점수를 주었습니다.
    비유: 두 명의 영화 평론가가 같은 영화를 보는 것과 같습니다. 한 명은 연기가 아름답고 이야기가 감동적이라며 별 5개를 줍니다. 다른 한 명은 영화가 관객을 웃기지 못했다는 이유로 별 1개를 줍니다. 두 사람 모두 자신만의 규칙에 따라 판단한 것이므로 둘 다 "맞는" 것이지만, 서로 다른 것을 심사하고 있습니다.
    결론: 당신의 시스템을 채점하기 위해 어떤 AI를 선택하느냐는 시스템 자체만큼이나 중요합니다. 만약 잘못된 심판을 선택한다면, 당신의 어시스턴트가 실제로는 판매에 실패하고 있음에도 불구하고 훌륭하다고 착각할 수 있습니다.

요약

이 논문은 쇼핑 봇을 위한 현실적인 "비행 시뮬레이터"를 구축했습니다. 그들은 다음을 배웠습니다:

  1. 단순한 기억(대화 내용을 그대로 기억하는 것)이 복잡한 요약보다 더 효과적입니다.
  2. 어디서 실패하는지 면밀히 관찰한다면 매우 빠르게 성능을 개선할 수 있습니다.
  3. "뇌"(AI 모델)는 디자인만큼이나 중요합니다.
  4. 누구에게 채점을 맡기느냐에 따라 결과가 달라집니다. 도움이 되는 대화를 원한다면 한 심판을, 판매를 원한다면 다른 심판을 선택하십시오.

이 연구의 목표는 특정 제품을 파는 것이 아니라, 기업들에게 실제 인간과 대화하기 전에 자신들의 쇼핑 어시스턴트를 테스트할 수 있는 신뢰할 수 있고 저렴하며 빠른 방법을 제공하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →