← 최신 논문
💬 NLP

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

이 논문은 대규모 언어 모델의 지식, 장문 맥락 추론, 도구 기반 실무 능력을 평가하기 위해 16개 보험 계리 협회의 12,000개 이상의 문항으로 구성된 포괄적인 벤치마크인 INS-ActBench를 소개하며, 최첨단 모델들이 표준화된 지식에는 뛰어나지만 복잡한 전문 업무 워크플로에서는 여전히 크게 뒤처져 있음을 밝히고 있습니다.

원저자: Changyu Chen, Chenwei Lin, Xian Xu

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Changyu Chen, Chenwei Lin, Xian Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 금융 마법사가 되는 법을 가르치고 있다고 상상해 보십시오. 당신은 이미 로봇에게 돈과 관련된 용어 사전 읽는 법과 기초적인 수학을 하는 법을 가르쳤습니다. 하지만 진정한 마법사가 된다는 것은 단순히 주문을 아는 것만이 아닙니다. 그것은 언제 그 주문을 사용해야 하는지, 상황이 엉망일 때 어떻게 주문들을 섞어서 써야 하는지, 그리고 성에 불을 지르지 않고 주문을 외울 수 있는 정교한 손놀림을 갖추는 것에 관한 것입니다. 이것이 바로 **거대 언어 모델(LLM)**의 세계입니다. LLend는 인간처럼 읽고, 쓰고, 추론할 수 있는 매우 똑똑한 컴퓨터 프로그램입니다. 오랫동안 우리는 이 로봇들을 고립된 과업으로 테스트해 왔습니다. "이 단어의 정의를 말할 수 있는가?" 또는 "이 수학 문제를 풀 수 있는가?"와 같은 것들 말이죠. 하지만 현실 세계에서 전문가들은 고립되어 일하지 않습니다. 그들은 백 페이지 분량의 계약서를 읽고, 중요한 단 하나의 조항을 찾아내며, 위험도를 계산한 다음, 자신의 답이 맞다는 것을 증명하기 위해 스프레드시트나 코드를 사용해야 합니다. 이 논문은 거대한 질문을 던집니다. 이 AI 마법사들이 정말로 직무 전체를 수행할 수 있는 것일까요, 아니면 그저 플래시카드를 암기하는 데 능숙한 것뿐일까요?

여기에 푸단 대학교 연구진이 AI가 **보험계리 과학(Actuarial Science)**이라는 특정하고 중대한 업무를 수행할 수 있는지 테스트하기 위해 만든 거대한 "최종 시험"인 INS-ActBench가 있습니다. 보험계리사를 보험회사를 위해 일하는 전문적인 '리스크 탐정'이라고 생각해 보십시오. 그들은 수학, 통계학, 경제학을 사용하여 (자동차 사고나 화재처럼) 나쁜 일이 일어날 가능성이 얼마나 높은지, 그리고 회사가 그 비용을 지불하기 위해 얼마만큼의 돈을 저축해 두어야 하는지를 파악합니다. 이 직업은 규칙을 이해하고, 현실 세계의 재난에 관한 복잡한 이야기를 읽고, 틀려서는 안 되는 정밀한 계산을 수행하는 능력을 요구합니다. 연구진은 전 세계 보험계리사들이 치른 실제 시험에서 추출한 12,050개의 문항으로 테스트 뱅크를 구축했습니다. 그들은 단순히 단순한 상식을 묻는 것이 아니라, AI가 세 가지 다른 난이도 수준을 처리할 수 있는지 확인하도록 설계했습니다:

  1. 플래시카드 (INS-Act-Know): AI가 정의와 공식을 기억할 수 있는가?
  2. 추리 소설 (INS-Act-Case): AI가 한 회사의 재무 상태에 관한 길고 복잡한 이야기를 읽고, 숨겨진 단서들을 찾아내어 미래에 대해 현명한 추측을 할 수 있는가?
  3. 워크숍 (INS-Act-Practice): AI가 실제로 올바른 컴퓨터 코드나 스프레드시트 수식을 작성하여 검증 가능한 숫자를 산출해 내는 실무를 수행할 수 있는가?

연구진이 9개의 서로 다른 AI 모델을 이 혹독한 테스트에 투입했을 때, 결과는 "와우"와 "이런"이 섞인 모습이었습니다. AI 모델들은 첫 번째 단계에서 놀라울 정도로 뛰어났습니다. 그들은 플래시카드를 완벽하게 해냈으며, 표준화된 지식 질문에서 종종 인간 전문가보다 높은 점수를 기록했습니다. 만약 AI에게 단순히 규칙을 읊거나 간단한 수학 문제를 풀라고 한다면, 그것은 천재가 될 수 있다는 것이 드러났습니다.

하지만 테스트가 복잡해지는 순간, 로봇들은 비틀거리기 시작했습니다. AI가 길고 복잡한 보험 사례(‘추리 소설’ 단계)를 읽어야 할 때, 점수는 급격히 떨어졌습니다. 그들은 이야기의 서로 다른 부분들 사이의 점들을 연결하는 데 어려움을 겪었습니다. 더욱 심각한 것은, 그들이 "워크숍"에 들어가서 최종 숫자를 만들어내기 위해 코드나 스프레드시트 수식을 실제로 작성해야 할 때, 신뢰할 수 있는 결과를 내놓지 못했다는 점입니다. 연구는 AI가 수학에 대해 '말할' 수는 있지만, 일관되고 검증 가능한 방식으로 수학을 '수행'하는 데는 자주 실패한다는 것을 발견했습니다.

연구진은 또한 AI의 성능이 규칙의 출처에 따라 달라진다는 것을 발견했습니다. 보험법은 미국, 영국, 일본 등 국가마다 다릅니다. AI 모델들은 훈련 데이터에서 자주 본 "표준" 규칙에는 뛰어났지만, 서로 다른 지역 규정을 가진 국가의 문제가 나오면 혼란을 겪었습니다. 또한 AI의 가장 큰 실패는 보통 도구(예: 계산기) 사용법을 잊어버렸기 때문이 아니라, 도구를 올바르게 사용했음에도 불구하고 문제에 잘못된 논리나 공식을 적용했기 때문이라는 점도 밝혀냈습니다.

요약하자면, 이 논문은 AI가 보험계리 지식에 있어서는 환상적인 백과사전이 되었지만, 아직 신뢰할 수 있는 전문 비서는 아니라는 점을 시사합니다. AI는 필기 시험은 통과할 수 있지만, 보험회사를 안전하게 지키는 최종 결정을 내리는 사무실 자리에 앉을 준비는 되어 있지 않습니다. 연구진은 AI가 이 분야에서 진정으로 도움을 주기 위해서는, 긴 이야기 속에서 맥락을 연결하고 작은 실수 없이 복잡한 단계별 워크플로우를 실행하는 능력을 훨씬 더 발전시켜야 한다고 결론지었습니다. 현재로서는 여전히 인간 전문가가 펜을 쥐고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →