← 최신 논문
💻 computer science

EARS: Explanatory Abstention for Reliable Sub-Agent Modeling in Large-scale Multi-Agent Systems

이 논문은 하위 에이전트가 스스로의 한계를 감지하고 환각된 출력을 내놓는 대신 설명 가능한 절제와 근거를 바탕으로 대응하도록 훈련함으로써 대규모 멀티 에이전트 시스템의 신뢰성을 향상시키고, 이를 통해 실제 운영 환경에서의 전체 작업 성공률을 높이는 프레임워크인 EARS를 소개한다.

원저자: Shuang Xie, Yunan Lu, Han Li, Lingyun Wang

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shuang Xie, Yunan Lu, Han Li, Lingyun Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 온라인 쇼핑몰을 위한 거대하고 첨단 기술이 집약된 고객 서비스 센터를 상상해 보십시오. 이 센터에는 헤드 매니저(코디네이터)와 전문가 요원(서브 에이전트) 팀이 있습니다.

헤드 매니저의 업무는 고객의 요청을 듣고 어떤 전문가가 이를 처리하기에 가장 적합한지 빠르게 결정하는 것입니다. 예를 들어, 고객이 매출 수치에 대해 물으면 매니저는 그들을 "데이터 분석가" 전문가에게 보냅니다. 만약 배송에 대해 묻는다면 "물류" 전문가에게 보냅니다.

문제점: "과도하게 자신만만한" 전문가

이 논문은 이 시스템에서 발생하는 흔한 결함을 식별합니다. 전문가 요원들은 비용 절감을 위해 더 작고 빠른 컴퓨터 두뇌(모델)로 구축되는 경우가 많습니다. 때때로 고객은 다음과 같은 질문을 던집니다:

  • 모호한 질문: "내 상점이 어떻게 됐지?" (어떤 상점? 어느 시기에?)
  • 불완전한 질문: "매출 보여줘." (무엇의 매출? 어제? 작년?)
  • 범위를 벗어난 질문: 해당 전문가가 답변할 수 있는 도구를 아예 가지고 있지 않은 경우.

기존 시스템에서 이러한 질문을 접했을 때, 전문가들은 "이것을 할 수 없다"라고 말하는 법을 몰랐습니다. 대신 그들은 어떻게든 추측해서 답변하려고 시도했습니다. 그들은 답변을 지어내거나(환각 현상), 혼란스럽고 도움이 되지 않는 응답을 내놓았습니다. 이는 전체 시스템을 신뢰할 수 없게 만들었습니다.

해결책: EARS ("설명적 유보")

연구진은 EARS(신뢰할 수 있는 서브 에이전트 모델링을 위한 설명적 유보)라는 새로운 프레임워크를 만들었습니다.

EARS를 전문가들에게 "이것을 할 수 없다"라고 말하는 새롭고, 정중하며, 매우 구체적인 방법을 가르치는 것이라고 생각하십시오. 단순히 답변을 하지 않는 대신, 이들은 다음을 수행하도록 훈련받았습니다:

  1. 멈춤 (유보): 답변을 하지 않습니다.
  2. 설명: 왜 멈췄는지 정확한 이유를 설명합니다.

그들은 단순히 "안 됩니다"라고 말하지 않습니다. 대신 "질문이 너무 모호하기 때문에 답변할 수 없습니다"라거나, "날짜를 알려주지 않으셨기 때문에 답변할 수 없습니다", 또는 "이것은 제 업무가 아니라 물류 팀의 업무이기 때문에 답변할 수 없습니다"라고 말합니다.

이는 "실패"를 헤드 매니저에게 전달되는 유용한 신호로 전환하며, 매니저는 이를 통해 요청을 수정하거나 적절한 사람에게 다시 보낼 수 있습니다.

전문가들을 교육하는 방법

컴퓨터에게 단순히 "정직하라"고 말한다고 해서 제대로 작동하는 것은 아닙니다. 연구진은 영리한 3단계 훈련 과정을 사용했습니다:

  1. 인간 교사: 먼저, 실제 사람들이 수천 개의 고객 채팅을 검토하고 전문가가 실패한 정확한 이유를 라벨링했습니다. 그들은 다양한 실패 유형에 대한 규칙집(분류 체계)을 만들었습니다.
  2. "판사" 패널: 인간이 읽기에는 채팅 양이 너무 많았기 때문에, 연구진은 강력한 AI "판사" 패널을 훈련시켜 교사 역할을 하게 했습니다. 그들은 이 판사들이 실패의 구체적인 이유를 포착할 수 있을 때까지 테스트했습니다. 추가적인 확신을 위해 "합의" 방식을 사용했습니다: 네 명의 서로 다른 AI 판사가 모두 동일한 이유에 동의하면, 이를 정답으로 표시했습니다.
  3. 훈련 루프: 연구진은 이 "판사 승인" 사례들을 사용하여 전문가들을 재학습시켰습니다. 이제 전문가는 혼란스러운 질문을 받으면 그 패턴을 즉시 인식하고, 가짜 답변을 내놓는 대신 명확한 설명을 즉시 보냅니다.

결과

팀은 수백만 명의 고객에게 서비스를 제공하는 실제 대규모 이커머스 환경에서 이를 테스트했습니다.

  • EARS 도입 전: 시스템은 요청의 **68.5%**만을 성공적으로 처리했습니다. 나머지는 틀렸거나, 혼란스럽거나, 도움이 되지 않았습니다.
  • EARS 도입 후: 성공률이 **78.9%**로 급증했습니다.

쉽게 말해, 전문가들에게 막혔을 때 인정하고 그 이유를 설명하는 법을 가르침으로써, 팀 전체가 훨씬 더 신뢰할 수 있게 되었습니다. 헤드 매니저는 문제를 더 빠르게 수정할 수 있었고, 고객들은 더 나은 답변을 얻을 수 있었습니다. 이 논문은 AI 에이전트 팀에서, 언제 말을 하지 않을지(그리고 그 이유를 말하는 것)를 아는 것이 무엇을 말할지 아는 것만큼 중요하다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →