← 최신 논문
🤖 AI

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

이 논문은 가변적인 계좌 상태 및 내부 정책 문서에 대해 에이전트와 악의적인 호출자 간의 동적인 상호작용을 시뮬레이션함으로써, 정책에 기반한 뱅킹 에이전트를 적응형 및 이력 의존적 사기 시나리오에 대해 스트레스 테스트하도록 설계된 새로운 실행 가능한 벤치마크인 FraudBench를 소개한다.

원저자: Dheeraj Mohandas Pai, Lu Xian

게시일 2026-08-20
📖 5 분 읽기🧠 심층 분석

원저자: Dheeraj Mohandas Pai, Lu Xian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 금융 세계에서 은행의 고객 서비스 상담원은 더 이상 단순히 전화를 받는 사람이 아닙니다. 점점 더 그 상담원은 대화를 나누고, 복잡한 요청을 이해하며, 조치를 취하도록 설계된 인공지능 에이전트, 즉 컴퓨터 프로그램이 되고 있습니다. 이 에이전트들은 강력한 도구들에 대한 접근 권한을 부여받습니다. 고객의 계좌 잔액을 조회하거나, 비밀번호 재설정을 확인하거나, 도난당한 신용카드를 정지시키거나, 심지어 한 계좌에서 다른 계좌로 돈을 이체할 수도 있습니다. 또한 이들은 에이전트가 무엇을 할 수 있고 무엇을 거절해야 하는지를 정확히 규정하는 수천 페이지 분량의 내부 규정집에도 접근할 수 있습니다. 이 기술의 약속은 편리함입니다. 호출자는 대기 시간 없이 몇 분 만에 위기 상황을 해결할 수 있습니다. 그러나 위험성은 정당한 고객을 돕는 것과 동일한 강력한 도구가 대화를 조작하는 방법을 아는 호출자에 의해 은행에 불리하게 이용될 수 있다는 점입니다. 만약 어떤 사람이 교묘하게 꾸며낸 이야기를 통해 에이전트가 자신을 다른 사람으로 믿게 하거나 안전 규칙을 무시하도록 속일 수 있다면, 에이전트는 실제적인 금융 손실을 초래하는 행동을 수행할 수도 있습니다. 연구자들의 핵심 질문은 이 에이전트들이 언어를 이해할 수 있느냐가 아니라, 인간이 적극적으로 속이려 할 때 '위험'을 이해할 수 있느냐는 것입니다.

연구팀은 이 질문에 답하기 위해 'FraudBench'라고 부르는 새로운 테스트 환경을 구축했습니다. 단순히 인공지능에게 의심스러운 거래 목록을 읽게 하거나 스팸 이메일을 식별하게 하는 대신, 그들은 컴퓨터 프로그램 하나가 은행 에이전트 역할을 하고 다른 컴퓨터 프로그램이 사기꾼 역할을 하는 실시간 시뮬레이션을 만들었습니다. 두 프로그램은 실제 전화 통화처럼 긴 다회차 대화를 나눕니다. 사기꾼의 목표는 에이전트를 조종하여 범죄 계좌로 돈을 송금하거나 개인 정보를 노출하는 것과 같은 안전하지 않은 행동을 수행하게 하는 것입니다. 에이전트의 임무는 경청하고, 은행의 내부 규칙을 확인하며, 호출자의 신원을 검증하고, 도움을 줄지 아니면 요청을 차단할지를 결정하는 것입니다. 연구자들은 이러한 에이전트들이 지시 사항을 따르는 데는 능숙하지만, 그 지시 사항가 긴 기만적인 이야기의 일부가 될 때는 자주 실패한다는 것을 발견했습니다.

이 시뮬레이션은 현실적인 토대 위에 구축되었습니다. 에이전트는 125명의 가상 고객, 그들의 계좌, 그리고 거래 내역을 포함하는 디지털 은행 환경 내에서 작동합니다. 또한 에이전트는 주어진 상황에 맞는 올바른 규칙을 찾기 위해 검색해야 하는 698개의 방대한 내부 정책 라이브러리에 접근할 수 있습니다. 에이전트는 단순한 조회부터 개인 식별 번호(PIN) 재설정이나 카드 정지 해제와 같은 고위험 조치에 이르기까지 17가지의 서로 다른 도구를 사용할 수 있습니다. 별도의 프로그램에 의해 제어되는 사기꾼은 단순히 돈을 요구하는 것이 아니라, 에이 agentes의 신뢰를 이용하려 합니다. 사기꾼은 유대감을 형성하기 위해 무해한 질문으로 시작하여, 서서히 거짓된 긴박감을 도입하거나, 에이전트의 반응을 시험하기 위해 작은 거짓말을 인정하기도 합니다. 가장 위험한 공격은 적응형 공격으로, 즉 사기꾼이 에이전트의 반응에 따라 전략을 바꾸는 방식입니다. 만약 에이전트가 요청을 거절하면, 사기꾼은 다른 각도로 접근하거나, 만약 에이전트가 대화 초기에 작은 실수를 했다면 사기꾼은 그 실수를 이용해 나중에 더 크고 안전하지 않은 요청을 정당화할 수 있습니다.

에이 agentes를 테스트하기 위해 연구진은 각각 다른 유형의 사기를 겨냥하도록 설계된 150개의 특정 시나리오를 만들었습니다. 여기에는 계좌 탈취 시도, 신원 확인을 우회하려는 속임수, 일련의 가짜 계좌를 통해 돈을 옮기려는 계획 등이 포함됩니다. 또한 일련의 작고 무해해 보이는 단계들이 중대한 보안 침해로 이어지는 '체인(chain)' 공격 세트도 포함되었습니다. 연구진은 이후 네 가지 서로 다른 인공지능 모델을 이 150개의 시나리오에 실행하여 이들이 은행을 얼마나 잘 보호할 수 있는지 테스트했습니다. 결과는 엇갈렸습니다. 가장 성능이 좋은 모델은 사기꾼을 약 65%의 사례에서 막아낼 수 있었던 반면, 가장 성능이 낮은 모델은 약 절반 정도만 성공했습니다. 이는 상당수의 시뮬레이션에서 에이전트가 거절했어야 할 행동을 수행하도록 속았음을 의미합니다. 연구진은 에이 agentes가 두 가지 특정 유형의 기만에 가장 취약하다는 것을 발견했습니다. 하나는 사기꾼이 훔친 자금을 이동하기 위해 피해자의 계좌를 이용하려는 '머니 뮬(money mule)' 수법이고, 다른 하나는 현재의 요청보다는 대화의 이력 속에 위험이 숨겨져 있는 '체인' 공격입니다.

이 연구는 이러한 에이 agentes를 현재 어떻게 평가하는지에 대한 결정적인 결함을 강조합니다. 많은 기존 테스트는 에이 agentes가 옳은 일을 했는지 결정하기 위해 대화의 마지막 메시지만을 살펴봅니다. 그러나 FraudBench는 안전이 전체 상호작용의 이력에 달려 있다는 것을 보여주었습니다. 에이 agentes가 거액의 송금 요청을 올바르게 거절할 수는 있지만, 만약 대화 도중 실수로 비밀 코드를 미리 노출했다면 그 대화는 이미 침해된 것입니다. 연구진은 에이 agents가 이러한 이전의 실수들을 기억하지 못하거나, 그것들을 현재의 요청과 연결 짓는 데 어려움을 겪는다는 것을 발견했습니다. 또한 에이 agents가 698개의 문서 라이브러리에서 직접 문서를 제공받는 것이 아니라 스스로 규칙을 찾아야 할 때 적절한 규칙을 찾는 데 어려움을 겪는다는 것도 발견했습니다. 연구진이 에이 agents에게 스스로 규칙을 찾도록 강제했을 때, 가장 우수한 모델의 성공률이 13 퍼센트 포인트 하락했는데, 이는 정보를 찾는 능력이 정보를 추론하는 능력만큼 중요하다는 것을 보여줍니다.

아마도 가장 중요한 발견은 안전성과 유용성이 서로 충돌 관계에 있다는 점일 것입니다. 고객을 돕고자 하는 의지가 너무 강한 에이 agentes는 해로운 일을 하도록 속임을 당할 수 있는 반면, 너무 신중한 에이 agentes는 단지 힘든 하루를 보내고 있는 정당한 고객의 요청을 거절할 수도 있습니다. 연구진은 사기를 막는 것과 실제 사람을 돕는 것 모두에 완벽한 단일 모델을 발견하지 못했습니다. 대신, 그들은 트레이드오프(trade-off) 관계를 관찰했습니다. 공격을 차단하는 데 더 뛰어난 모델은 때때로 유효한 요청을 거절할 가능성이 더 높았습니다. 이는 진정으로 안전한 뱅킹 에이 agentes를 구축하는 것이 단순히 소프트웨어를 더 똑똑하게 만드는 문제가 아니라, 행동하려는 의지와 기만을 탐지하는 능력 사이의 균균형을 세심하게 맞추는 문제임을 시사합니다. 연구진은 자신들의 작업이 허구의 데이터를 사용한 시뮬레이션임을 강조하며, 따라서 결과가 실제 은행이 어떻게 수행될지를 정확히 예측하지는 않지만, 현재의 기술이 어디에 취약한지에 대한 명확한 지도를 제공한다고 말합니다. 통제된 환경에서 이러한 약점들을 노출함으로써, 이 연구는 개발자들이 현대 뱅킹 사기의 복잡하고 위험한 지형을 헤쳐 나가면서도 대중에게 봉사하는 능력을 잃지 않는 에이 agentes를 구축할 수 있는 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →