← 최신 논문
💬 NLP

CTRAG: An In-Context Retrieval-based Framework for Automated Compliance Checking using LLMs

이 논문은 적응형 청킹(adaptive chunking), 동적 검색(dynamic retrieval), 인컨텍스트 학습(in-context learning)을 활용하여 통제 질문과 기업 문서를 교차 참조함으로써 규제 준수 검증의 정확도를 자동화하고 대폭 향상시키는 새로운 검색 증강 생성(RAG) 프레임워크인 CTRAG를 소개하며, 이는 Big Four 회계법인에서의 성공적인 실제 구축을 통해 검증되었습니다.

원저자: Muhammad Roman, Karen Rafferty, Barry Devereux

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Muhammad Roman, Karen Rafferty, Barry Devereux

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

=== 요약 ===
당신이 미스터리를 풀려는 탐정이라고 상상해 보세요. 하지만 범죄 현장 대신, 당신의 "범죄"는 규칙을 어기는 기업입니다. 비즈니스의 세계에는 돈을 어떻게 다루는지, 비밀을 어떻게 보호하는지, 또는 데이터를 어떻게 안전하게 보관하는지에 대한 거대한, 보이지 않는 규칙책처럼 수천 개의 규칙이 존재합니다. 기업이 이 규칙들을 잘 따르고 있는지 확인하는 것을 "컴플라이언스(준수)"라고 부릅니다. 전통적으로 이 업무는 인간 감사인들이 수행하며, 그들은 아주 작은 단서들을 찾아내기 위해 산더미처럼 쌓인 지저한 서류들을 일일이 읽어야 합니다. 이는 느리고 지루하며, 인간은 피곤함을 느끼기 때문에 때때로 단서를 놓치거나 혼란에 빠지기도 합니다.

이제 인공지능, 구체적으로는 대규모 언어 모델(LLM)이라고 불리는 똑똑한 컴퓨터 뇌의 세계로 들어와 봅시다. LLM을 세상의 거의 모든 것을 읽었고 사람처럼 말할 수 있는 초고속 독자라고 생각하세요. 하지만 함정이 있습니다. 이 똑똑한 뇌들은 가끔 사실을 지어내거나(이를 "환각"이라고 합니다), 눈앞에 있는 정보 대신 자신이 암기한 것에 의존하기 때문에 특정 사실을 잊어버리기도 합니다. 이를 해결하기 위해 과학자들은 "검색 증강 생성(RAG)"이라는 기술을 사용합니다. 탐정에게 보고서를 쓰기 에 검색할 수 있는 특정 파일 뭉치와 손전등을 주는 것을 상상해 보세요. AI는 먼저 문서에서 사실을 찾아낸 다음, 그 정보를 바탕으로 답변을 작성합니다. 이 논문은 기업이 규칙을 잘 따르고 있는지 확인하기 위해 그 손전등 검색과 최종 보고서를 최대한 완벽하게 만드는 방법을 탐구합니다.


탐정의 새로운 도구 상자: CTRAG

이 논문의 연구진은 주요 전문 서비스 기업과 협력하여 CTRAG라는 새로운 시스템을 구축했습니다. CTRAG를 기업이 규칙을 준수하고 있는지 확인하는 지루하고 시간이 많이 걸리는 업무를 자동화하도록 설계된 하이테크 컴플라이언스 탐정이라고 생각해 보세요. CTRAG는 사람이 몇 시간 동안 PDF를 넘겨보는 대신, 질문 형태로 작성된 규칙을 가져와 회사의 문서들을 뒤져 답을 찾아냅니다.

이 논문의 주요 목표는 이 AI 탐정에게 어떻게 검색하는 법을 가르칠 것인가에 대한 최적의 방법을 찾아내는 것이었습니다. 그들은 AI가 관련 없는 소음에 방해받지 않고 올바른 단서를 찾도록 돕는 다양한 전략을 테스트했습니다.

"청킹(Chunking)" 퍼즐: 파이를 어떻게 자를 것인가

가장 큰 과제 중 하나는 회사 문서를 어떻게 나눌 것인가였습니다. 500페이지짜리 소설에서 특정 문장을 찾아야 한다고 상상해 보세요. 만약 책을 200자 단위의 아주 작은 조각(마치 페이지를 우표 크기로 자르는 것과 같은)으로 자른다면, 이야기의 맥락을 잃어버릴 수 있습니다. 만약 3000자 단위의 거대한 조각(책을 절반으로 자르는 것과 같은)으로 자른다면, 너무 많은 추가 텍스트가 포함되어 그 중간에서 특정 단서가 길을 잃을 수도 있습니다.

연구팀은 다양한 "청크 크기"(텍스트 조각의 크기)를 테스트했습니다:

  • 아주 작은 조각 (200자): 너무 작고 파편적이었습니다. AI는 전체적인 그림을 볼 수 없어서 혼란을 겪었습니다.
  • 거대한 조각 (3000자): 너무 무질서했습니다. AI는 마치 불타는 건초더미 속에서 바늘을 찾는 것처럼 너무 많은 정보에 압도되었습니다.
  • 최적의 지점: 그들은 **작은 청크(약 800자)**가 가장 효과적이라는 것을 발견했습니다. 이는 마치 책을 관리 가능한 단락 단위로 자르는 것과 같았습니다. 이 크기는 AI를 소음으로 몰아넣지 않으면서도 맥락을 명확하게 유지하기에 딱 적당했습니다.

그들은 또한 텍스트를 단순히 특정 글자 수로 자르는 것이 아니라 논리적인 이야기의 흐름에 따라 자르려는 "메타 청킹(Meta-chunking)"이라는 정교한 방법도 시도했습니다. 이 방법은 이론적으로는 똑똑해 보였지만, 이 특정 작업에는 너무 느리고 계산 비용이 많이 드는 것으로 나타나 결국 더 단순한 고정 크기 절단 방식을 선택했습니다.

"손전등" 설정: 얼마나 많은 파일을 확인할 것인가?

AI가 질문을 던질 때, 답변을 하기 위해 얼마나 많은 문서 조각을 가져올지 결정해야 합니다. 이를 K-값(또는 top-K)이라고 합니다.

  • 만약 AI가 단 1개의 조각만 본다면, 답이 두 번째 파일에 숨겨져 있을 경우 놓칠 수 있습니다.
  • 만 만약 5개의 조각을 본다면, 관련 없는 추가 세부 사항들 때문에 혼란스러워질 수 있습니다.
  • 연구진은 4개의 조각을 보는 것(K=4)이 완벽한 균형임을 발견했습니다. 이는 AI가 방해받지 않으면서 결정을 내릴 수 있는 충분한 근거를 제공했습니다.

AI에게 인간처럼 생각하는 법 가르치기

가장 큰 돌파구는 **인컨텍스트 러닝(In-Context Learning, ICL)**이라는 기법에서 왔습니다. 당신이 신입 인턴에게 사건을 해결하는 법을 가르친다고 상상해 보세요. 단순히 "규칙을 찾아라"라고 말하는 것이 아니라, 예시를 보여주는 것입니다: "여기 한 회사가 클라우드 제공업체를 사용한 사례가 있고, 회사가 직접 작업을 수행하지 않았음에도 왜 이것이 '통과(Pass)'에 해당하는지에 대한 이유가 있어."

AI는 "간접 컴플라이언스(indirect compliance)" 상황, 즉 기업이 직접 하는 것이 아니라 벤더(예: 클라우드 제공업체)가 규칙을 준-수함으로써 규칙을 따르는 상황에서 어려움을 겪었습니다. 도움 없이는, 회사가 직접 일을 하지 않았다는 이유로 AI가 "실패(Fail)"라고 판정할 수 있었습니다. 하지만 엄선된 몇 가지 예시(과거 사례의 참조 시트와 같은)를 제공함으로써, AI는 인간의 판단력을 모방하는 법을 배웠습니다. AI는 "아, 벤더가 준수한다면 우리에게도 적용되는구나!"라는 것을 깨달았습니다.

결과: 더 빠르고, 더 똑똑하며, 더 정확하게

연구진이 실제 환경에서 Big Four 전문 서비스 기업과 함께 CTRAG를 테스트했을 때, 결과는 인상적이었습니다:

  • 정확도: 시스템은 **F1-스코어 78%**와 **재현율(Recall) 85%**를 달 기록했습니다. 탐정의 용어로 말하자면, 이는 실제 규칙 위반 사례의 85%를 찾아냈으며 많은 사례를 놓치지 않았음을 의미합니다.
  • 효율성: 시스템은 인간 검토자의 수동 작업을 약 60% 줄였습니다.
  • "증거 없음" 해결책: 하나의 까다로운 문제는 AI가 문서에서 정보를 찾지 못했을 때였습니다. 추측하는 대신, 시스템은 "증거 없음"을 "비준수(Non-Compliant)"로 처리하도록 프로그래밍되었습니다. 논리는 간단합니다. 문서에서 규칙을 준수했다는 것을 증명할 수 없다면, 아마도 준수하지 않았을 것이라는 것입니다. 이러한 "증거 없음" 사례를 실패로 재분류함으로써, 시스템은 AI를 다시 학습시키지 않고도 놓칠 뻔했던 많은 잠재적 위반 사례를 잡아낼 수 있었고, 덕분에 85%라는 높은 재현율을 달성할 수 있었습니다.

제외된 사항들

논문은 무엇이 효과가 없었는지도 명확히 밝혔습니다:

  • **작은 청크 (200자)**는 맥락을 너무 많이 깨뜨렸기에 나쁜 아이디어였습니다.
  • **거대한 청크 (3000자)**와 메타 청킹은 이 특정 작업에 실용적이지 않을 만큼 너무 소음이 많거나 느렸습니다.
  • 직접 프롬프팅(예시 없이 AI에게 그냥 질문하는 것)은 제3자 벤더가 관련된 까다로운 사례에서는 충분하지 않았습니다.

결론

저자들은 CTRAG가 컴플라이언스 체크를 간소화하는 강력한 도구라고 제안하지만, 이를 "해결된 문제"라고 부르는 데는 신중합니다. 그들은 자신들의 테스트가 단일 조직의 240개 규칙과 45개의 문서에 기반했다는 점을 언급했습니다. 결과는 유망하며 이 접근 방식이 다른 기업이나 작업(예: 계약서 검토)으로 확장될 수 있음을 시사하지만, 모든 곳에서 작동하는지 확인하기 위해서는 다양한 산업군에 걸친 더 많은 테스트가 필요합니다.

요약하자면, CTRAG는 AI에게 적절한 크기의 "정보 조각"과 적절한 수의 "손전등" 빛, 그리고 몇 가지 "참조 시트" 예시를 제공함으로써, 인간이 더 빠르고 실수 없이 규칙을 확인할 수 있도록 돕는 시스템을 구축할 수 있음을 보여줍니다. 이것은 마법은 아니지만, 기업 세계를 정직하게 유지하기 위해 기술을 사용하는 매우 똑똑한 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →