← 최신 논문
💬 NLP

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

이 논문은 Nubank에서 개발한, 구조화된 컨텍스트 엔지니어링, 인간 참여형(human-in-the-loop) 반복 프로세스, 그리고 엄격한 LLM 판사 평가를 통합하여 5개 도메인에 걸쳐 1억 명 이상의 사용자를 대상으로 프로덕션 수준의 고객 지원 AI 에이전트를 성공적으로 배포하고, 만족도 및 셀프 서비스율의 유의미한 개선을 달 수 있었으며, 오프라인 지표와 온라인 영향력 사이의 강력한 상관관계를 입증한 통합된 평가 중심 프레임워크를 제시한다.

원저자: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 1억 명의 고객을 보유한 거대 은행을 운영하고 있다고 상상해 보십시오. 매일 수백만 명의 사람들이 "제 신용카드는 어디 있나요?" 또는 "왜 제가 이만큼의 돈을 내야 하나요?"와 같은 질문을 하기 위해 전화하거나 채팅을 합니다.

과거에는 이런 질문에 답하기 위해 엄청난 수의 상담사 군단이 필요했습니다. 하지만 이제 당신은 이 대화들을 처리할 수 있는 초스마트 AI 로봇을 만들고 싶습니다. 문제는, 만약 로봇이 틀린 답을 준다면 고객은 화가 나고, 신뢰를 잃고, 떠나버린다는 것입니다. 당신은 로봇이 성능이 좋다고 단순히 "추측"할 수 없습니다. 실제 사람들과 대화를 나누기 전에 100% 확신이 필요합니다.

이 논문은 (거대 은행인) 누뱅크(Nubank)가 어떻게 안전하고 성공적으로 AI 로봇을 구축했는지에 대한 청사진입니다. 그들이 어떻게 했는지 쉽게 설명해 드리겠습니다.

1. 문제점: 충돌 테스트 장치 없는 로봇 만들기

보통 사람들이 AI를 만들 때는 지침을 작성하고, 조금 테스트해 본 뒤, 잘 되기를 바랄 뿐입니다. 저자들은 이것이 자동차를 만든 뒤 에어백이 작동하는지 확인하려고 절벽 아래로 차를 몰고 내려가는 것과 같다고 말합니다. 고객 지원 분야에서 '충돌(사고)'은 너무나도 비용이 많이 드는 일입니다.

그들은 로봇이 단 한 명의 실제 인간과 대화하기 전에, "시뮬레이터" 안에서 로봇을 수천 번 테스트할 방법이 필요했습니다.

2. 해결책: "평가 주도형" 공장

단순히 지침을 쓰는 대신, 그들은 네 개의 주요 스테이션이 있는 조립 라인을 구축했습니다. 레이싱 카를 튜닝하는 과정이라고 생각하면 됩니다.

  • 스테이션 1: 모듈형 키트 (컨텍스트 엔지니어링)
    로봇을 위한 하나의 거대하고 엉망인 설명서를 쓰는 대신, 그들은 이를 레고 블록처럼 나누었습니다.

    • 규칙: 로봇이 말하는 방식 (예: 정중하게, 간결하게).
    • 플레이북: 특정 문제에 대한 단계별 가이드 (예: "카드를 분실했다면 A 단계를 수행한 다음 B 단계를 수행하라").
    • 도구: 로봇이 실제로 할 수 있는 일들의 목록 (예: 데이터베이스 확인 또는 카드 재발급).
    • 메모리: 대화 중에 배운 내용을 기록하는 메모장.
    • 왜 중요한가: 만약 로봇의 인사가 잘못되었다면, 전체 자동차를 다시 만드는 것이 아니라 "인사 레고 블록"만 교체하면 됩니다.
  • 스테이션 2: 로봇 판사 (LLM-as-a-Judge)
    로봇이 일을 잘하고 있는지 어떻게 알 수 있을까요? 로봇에게 스스로를 채점하라고 할 수는 없습니다. 그래서 그들은 또 다른 AI(판사)를 사용하여 첫 번째 로봇의 답변을 채점하도록 했습니다.

    • 함정: 때때로 판사 AI는 편향되거나 게으를 수 있습니다. 이를 해결하기 위해 그들은 GEPA라는 특별한 기술을 사용했습니다. 판사 AI가 시험지를 채점하는 것을 지켜보는 코치를 상상해 보세요. 코치는 판사가 너무 엄격하게 채점했다는 것을 깨닫고, 더 공정하도록 채점 기준표를 다시 작성합니다. 그들은 채점이 매우 일관되게 될 때까지 이 과정을 자동으로 수행했습니다.
  • 스테이션 3: 인간 안전망 (평가자 간 신뢰도)
    AI 판사를 믿기 전에, 실제 인간들이 동일한 답변을 채점하게 했습니다. 그들은 인간들이 서로 얼마나 동의하는지 확인했습니다. 만약 인간들이 90%의 확률로 일치한다면, 그 테스트가 공정하다는 것을 알 수 있습니다. 그런 다음, AI 판사가 인간과 똑같이 일치하는지 확인했습니다.

  • 스테ция 4: 실전 테스트 (A/B 테스트)
    로봇이 시뮬레이터 테스트를 통과하면, 아주 적은 그룹의 실제 고객(예: 사용자 중 1%)에게 대화를 허용했습니다. 이 로봇을 기존 시스템과 비교했습니다. 만약 새로운 로봇이 고객을 더 행복하게 만든다면, 더 많은 사람에게 대화를 허용했습니다.

3. 결과: 로봇의 승리

그들은 다섯 가지 다른 유형의 문제에 대해 이 시스템을 테스트했습니다:

  1. 카드 배송: "제 카드는 어디 있나요?"
  2. 부채 관리: "대출금을 어떻게 갚나요?"
  3. 신용 한도: "한도를 높일 수 있나요?"
  4. 카드 관리: "PIN 번호를 변경해 주세요."
  5. 제품 설명: "이 기능은 무엇인가요?"

마법의 숫자들:

  • 행복도: "카드 배송" 로봇의 경우, 고객 행복도(tNPS라고 불리는 점수)가 37포인트 상승했습니다. 이는 엄청난 개선입니다.
  • 셀프 서비스: 더 많은 사람이 사람의 도움 없이 문제를 해결했습니다. "셀프 서비스 비율"이 29포인트 상승했습니다.
  • 인간 vs 로봇: 다섯 가지 사례 중 네 가지에서 로봇은 최고 수준의 인간 전문가와 거의 대등한 수준(몇 퍼센트 차이 이내)을 보여주었습니다. 유일하게 어려움을 겪은 곳은 매우 복잡한 "부채 관리" 영역이었는데, 이는 수학적 계산과 공감 능력이 가장 까다로운 문제이기 때문이며 타당한 결과입니다.

4. 핵심 교훈: "측정할 수 있다면, 고칠 수 있다"

이 논문의 가장 중요한 교훈은 이것입니다: 테스트의 품질이 당신이 얼마나 빨리 개선할 수 있는지를 결정합니다.

그들은 매우 엄격한 테스트 시스템(시뮬레이터)을 구축했기 때문에, 로봇의 지침을 수정했을 때 그것이 좋아졌는지 나빠졌는지를 즉시 알 수 있었습니다. 고객이 행복해질 때까지 몇 주를 기다릴 필요가 없었습니다. 그들은 시뮬레이터에서 로봇을 수십 번 반복 개선(iterate)할 수 있었고, 마침내 출시했을 때 로봇은 이미 챔피언이 되어 있었습니다.

요약하자면: 그들은 단순히 똑똑한 AI를 만든 것이 아니라, AI를 위한 스마트한 테스트 실험실을 만든 것입니다. 실험실이 매우 훌륭했기 때문에, 세상으로 내보낸 로봇은 믿을 수 있고, 고객을 행복하게 만들며, 1억 명의 사용자를 맞이할 준비가 되어 있었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →