Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting
본 논문은 소규모 상업용 보험의 직통 언더라이팅을 위한 에이전트형 AI 프레임워크를 제안하고 평가하며, 타겟 기반 검색, 제3자 데이터 검증, 명시적 규칙 평가를 결합한 멀티 에이전트 시스템이 투명성과 감사 가능성을 요구하는 복잡한 시나리오에서 특히 단일 LLM 및 나이브 RAG 베이스라인보다 우수한 성능을 보임을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 초고속으로 돌아가는 피자 가게를 운영하고 있다고 상상해 보세요. 매일 수백 명의 사람들이 주문을 맡깁니다. 어떤 주문은 단순합니다: "치즈만 넣고, 양파는 빼주세요." 하지만 어떤 주문은 까다롭습니다: "페퍼로니를 원하는데, 그 페퍼로니가 특정 농장에서 온 것이어야 해요. 그리고 그 농장이 50마일 이내에 있는지 알고 싶은데, 고객이 주문서에 농장 이름을 적는 것을 깜빡했어요."
옛날에는 당신의 가게에서 엄격한 체크리스트를 사용했습니다. 만약 주문서에 "페퍼로니"라고 적혀 있지 않으면 피자를 만들 수 없었습니다. 적혀 있다면 만들었죠. 하지만 현실은 복잡합니다. 사람들은 양식에 맞춰 쓰는 대신 "길 아래에 있는 농장에서 온 매콤한 고기가 좋아요"와 같은 메모를 남기기도 합니다.
이 논문은 보험 회사(특히 소기업용 보험인 BOP)를 위한 새로운 종류의 주방 매니저에 관한 것입니다. 저자인 로버트 리처드슨(Robert Richardson)과 그의 팀은 에이전틱 AI(Agentic AI)—똑똑한 다단계 로봇 비서라는 멋진 용어—가 기존의 방식보다 이러한 복잡한 주문을 더 잘 처리할 수 있는지 확인하고자 했습니다.
세 가지 주방 매니저
이를 테스트하기 위해, 그들은 시뮬레이션된 주방(실제 고객 주문이 아닌 컴퓨터로 생성된 데이터로 만든 가상의 세계)을 구축했습니다. 여기에는 635개의 서로 다른 "신청서"(피자 주문)가 있었습니다. 그들은 이를 처리하는 세 가지 방식을 테스트했습니다:
- 단일 LLM 셰프 ("원패스" 요리사): 이 로봇은 매우 똑똑하지만, 주문과 규칙 책을 읽은 즉시 "예!" 또는 "아니오!"라고 외칩니다. 빠르긴 하지만, 자신이 퍼즐의 조각을 놓치고 있지는 않은지 생각하며 멈추지 않습니다. 그저 눈앞에 보이는 것을 바탕으로 추측할 뿐입니다.
- RAG 셰프 ("사서" 요요리사): 이 로봇은 더 똑똑합니다. 대답을 외치기 전에, 도서관(규칙 데이터베이스)으로 달려가 주문과 일치하는 특정 규칙을 찾아냅니다. 사실을 찾는 데는 뛰어나지만, 여전히 책을 읽고 대답할 뿐입니다. 다음에 무엇을 할지 실제로 계획하지는 않습니다.
- 에이전틱 셰프 ("팀 캡틴"): 이것은 단 한 명의 로봇이 아니라, 서로 대화하는 세 명의 전문 작업자로 구성된 팀입니다.
- 작업자 1은 주문을 살펴보고 "이것은 쉬워 보인다", "이것은 이상하다", 또는 "정보가 부족하다"라고 말합니다.
- 작업자 2는 정보가 부족할 때 투입됩니다. "이봐, 고객이 면적을 적지 않았지만, 외부 데이터베이스를 확인해서 찾을 수 있는지 알아보자"라고 말합니다.
- 작업자 3은 "생각하는 사람"입니다. 만약 주문에 수학적 계산이 필요하다면(예: "고객의 건물이 12,000평방피트인데, 그중 절반만 식료품용입니다. 식료품 부분이 5,000평방피트 미만인가요?"), 이 작업자가 계산을 수행하고 규칙을 확인합니다.
- 만약 그래도 해결할 수 없다면, 팀 캡틴은 "멈춰! 사람이 확인해야 해"라고 말합니다.
큰 발견
이 논문은 **에이전틱 셰프(팀)**가 특히 상황이 복잡해질 때 정답을 맞히는 데 가장 뛰어나다고 제안합니다.
그들의 시뮬레이션 결과 수치는 다음과 같습니다:
- 주문이 단순했을 때는 세 명의 셰프 모두 괜찮은 성과를 냈습니다.
- 하지만 주문이 까다로울 때(수학이 필요하거나 누락된 정보를 찾아야 하는 경우), 에이전틱 셰프가 확실한 승자였습니다.
- 정보가 누락되었지만 다른 곳에서 찾을 수 있는 주문의 경우, 에이전틱 셰프는 **88.2%**의 확률로 정답을 맞혔습니다. 단일 패스 로봇은 **80.3%**의 확률로만 맞혔습니다.
- 정보가 누락되었고 또한 찾을 수도 없는("풀 수 없는" 퍼즐) 주문의 경우, 에이전틱 셰프는 **84.3%**의 확률로 멈추고 인간에게 요청할 줄 알았습니다. 단일 패스 로봇은 멈춰야 할 때를 아는 능력이 **56.7%**에 불과했습니다.
가장 중요한 발견은 에이전틱 시스템이 "모른다"라고 말하는 법을 훨씬 더 잘 안다는 것입니다. 다른 로봇들은 추측하려 들었고 종종 틀렸습니다. 에이전틱 팀은 "정보가 충분하지 않으니 인간을 부르자"라고 깨달았는데, 이는 보험과 같이 이해관계가 걸린 높은 수준의 업무에서 정확히 원하는 바입니다.
이 시스템이 아닌 것
저자들은 이 시스템이 무엇이 아닌지를 매우 명확히 밝히고 있습니다.
- 이것은 마법 같은 독심술이 아닙니다. 논문은 AI가 인간처럼 단순히 "생각"할 수 있다는 생각에 명시적으로 반대합니다. 이 로봇들은 감정이나 진짜 뇌를 가진 것이 아닙니다. 그들은 단지 통계적 패턴과 규칙을 따를 뿐입니다.
- 이것은 인간의 대체제가 아닙니다. 논문은 목표가 언더라이터(인간 결정권자)를 모두 해고하는 것이 아니라고 주장합니다. 대신, 로봇이 쉬운 일과 "확인이 필요한" 일을 처리하게 하여, 인간이 정말 어렵고 까다로운 사례에 집중할 수 있도록 하는 것이 목표입니다.
- 이것은 아직 현실 세계에서 입증된 사실이 아닙니다. 결과는 합성 데이터셋(컴퓨터로 만든 가상의 세계)에서 나온 것입니다. 저자들은 실제 보험 데이터는 지저-하고 노이즈가 많으며, 자신들의 가짜 데이터가 포착하지 못할 수 있는 뜻밖의 상황이 가득하다는 점을 인정합니다. 따라서 결과가 유망하긴 하지만, 이는 시뮬레이션된 것이지 아직 실제 보험 회사에서 증명된 것은 아닙니다.
트레이드오프: 속도 vs. 지능
함정이 있습니다. 똑똑해지는 데는 시간이 걸립니다.
- 단일 LLM 셰프가 가장 빨랐으며, 주문당 약 1.64초가 걸렸습니다.
- 에이전틱 셰프는 가장 느렸으며, 주문당 약 4.72초가 걸렸습니다.
논문은 실수를 방지하기 위해 까다로운 주문에는 이 추가적인 시간이 가치가 있다고 제안합니다. 하지만 아주 쉬운 주문에는 팀 전체가 필요하지 않을 수도 있습니다.
결론
이 논문은 만약 당신이 보험 결정을 자동화하고 싶다면, 단순히 추측하는 하나의 빠른 로봇을 사용하는 것이 아니라, 멈추고, 노트를 확인하고, 수학을 하고, 누락된 사실을 찾아내며, 막혔을 때 인정할 줄 아는 로봇 팀을 구축해야 한다고 제안합니다.
그들의 시뮬레이션된 주방에서, 이 "에이전틱" 접근 방식은 다른 방식들보다 실수를 덜 저질렀고 결정에 대한 더 나은 근거를 제시했습니다. 그러나 저자들은 이것이 가짜 데이터를 사용한 **개념 증명(Proof of Concept)**임을 상기시킵로 합니다. 우리가 이 로봇들에게 실제 돈과 실제 비즈니스를 맡기기 전에는, 혼란스러운 현실 세계에서 테스트를 거쳐야 하며 인간이 항상 최종 결정을 내리도록 해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.