← 최신 논문
💬 NLP

Beyond Semantic Similarity: A Two-Phase Non-Parametric Retrieval Workflow for Corporate Credit Underwriting

본 논문은 기업 신용 심사에서의 '유사성-활용성 격차'를 해결하기 위해 의미적 유사성보다 분석적 유용성을 우선시하는 2 단계 비모수 검색 시스템을 제시하여 800 명 이상의 분석가들의 문서 검토 시간을 몇 시간에서 몇 분으로 성공적으로 단축시켰습니다.

원저자: Linus Ng Junjia, Ezekiel Tee Kongquan, Kelvin Heng, Kenneth Zhu Ke, Zhao Jing Yuan

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Linus Ng Junjia, Ezekiel Tee Kongquan, Kelvin Heng, Kenneth Zhu Ke, Zhao Jing Yuan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 한 회사의 건강 상태를 파악하려는 금융 탐정이라고 상상해 보세요. 수천 개의 문서로 이루어진 거대한 도서관이 있습니다. 연간 보고서, 산업 분석, 법적 공시 등이 포함되어 있으며, 일부는 수백 페이지에 달합니다. 당신의 임무는 해당 회사에 자금을 대출할지 여부를 결정하기 위해 숨겨진 부채나 위험한 시장 동향과 같은 구체적인 단서를 찾는 것입니다.

이 논문은 해당 도서관을 검색하는 새로운, 더 지능적인 방법을 설명합니다. 일상적인 언어로 정리해 보면 다음과 같습니다.

문제: "키워드 함정"

전통적으로 컴퓨터 검색 시스템은 단어 매칭에만 관심을 두는 사서처럼 작동합니다. "X 회사의 부채는 얼마입니까?"라고 질문하면, 컴퓨터는 "부채"와 "X 회사"라는 단어가 언급된 모든 페이지를 찾습니다.

하지만 금융 분야에서는 이것이 함정이 됩니다. 어떤 페이지는 "우리는 부채가 없습니다"라고 말하거나, "부채는 우리 업계에서 흔한 용어입니다"라고 하거나, "부채"라는 단어를 50 번 반복하는 지루한 법적 면책 조항일 수 있습니다. 이러한 페이지는 당신의 단어와 완벽하게 일치하지만, 결정을 내리는 데는 쓸모가 없습니다. 저자들은 이를"유사성–유용성 간극"이라고 부릅니다. 컴퓨터는 답변처럼 보이는 것들을 찾지만, 실제로는 유용한 답변이 아닌 것들을 찾아냅니다.

해결책: 2 단계 탐정 팀

저자들은 키워드 매칭기보다는 인간 탐정 팀처럼 작동하는 시스템을 구축했습니다. 작업을 두 가지 명확한 단계로 나눕니다.

1 단계: 넓은 그물 (높은 회수율)

먼저 시스템은 매우 넓은 그물을 던집니다. 두 가지 방법을 동시에 사용합니다.

  1. 키워드 검색: "EBITDA"나 "유동성"과 같은 정확한 금융 용어를 찾습니다.
  2. 개념 검색: 구체적인 단어가 다르더라도 단어 뒤에 숨은 아이디어를 찾습니다.

이 단계는 중요한 것을 놓치지 않도록 잠재적인 페이지들을 대량으로 (한 번에 50 개씩) 확보합니다. 이는 바다의 모든 것을 잡기 위해 거대한 그물을 던지는 어부와 같습니다.

2 단계: 전문가 필터 (높은 유용성)

마법이 일어나는 곳입니다. 시스템은 어류 더미에서 멈추지 않고 AI 전문가 판사를 불러옵니다.

  • 필터: 판사가 보기 전에 경량의 AI 가 확인합니다. "이 페이지가 실제로 특정 질문에 대해 이야기하고 있는가? 아니면 단순한 법적 잡음인가?" 만약 잡음이라면 즉시 폐기됩니다.
  • 판사: 남은 페이지들은 더 똑똑한 AI 에게 전달되어 다른 질문을 던집니다. "이것이 대출 결정을 내리는 데 얼마나 유용한가?"
    • "이 페이지가 내 질문과 비슷하게 들리는가?"라고 묻는 대신
    • "이 페이지가 대출에 '예' 또는 '아니오'라고 말하기 위해 사용할 수 있는 사실을 제공해 주는가?"라고 묻습니다.

이를 통해 최종 결과 목록에는 단순히 같은 단어를 가진 "흙"이 아닌 정보의 "황금 알갱이"만 포함되도록 보장합니다.

지저분한 세부 사항 처리

금융 문서는 지저분합니다. 긴 단락, 각주, 병합된 셀과 기이한 헤더가 있는 복잡한 표가 포함되어 있습니다.

  • 맥락 인식 도구: 시스템이 간단한 표를 발견하면 숫자를 깔끔하게 추출합니다. 하지만 다단계 재무제표와 같이 복잡하고 혼란스러운 표를 발견하면 숫자를 추측하려 하지 않습니다. 대신 전체 표를 가져와서 "영수증"으로 태그합니다 (정확히 어느 페이지와 문서에서 왔는지 알려줍니다). 이렇게 하면 컴퓨터가 실수로 데이터를 손상시키지 않고 나중에 인간이 숫자를 확인할 수 있습니다.

"온프레미스" 규칙

이 시스템은 기밀 은행 데이터를 다루기 때문에 공개 클라우드 서버나 외부 AI 도구를 사용하지 않습니다. 은행 자체의 안전한 건물 내부 (온프레미스) 에서 완전히 실행됩니다. 데이터가 건물을 절대 떠나지 않는 사적이고 안전한 도서관을 가진 것과 같습니다. 이는 완전한 프라이버시와 엄격한 은행 법규 준수를 보장합니다.

결과

이 팀은 800 명 이상의 실제 금융 분석가를 대상으로 이 시스템을 테스트했습니다.

  • 이전: 분석가들은 올바른 사실을 찾기 위해 문서를 파헤치는 데 몇 시간을 보냈습니다.
  • 이후: 시스템은 해당 시간을 약 3 분으로 단축했습니다.

요약

간단히 말해, 이 논문은 "단어 매칭 기계"가 되려고 시도하는 것을 멈추고 "의사결정 보조 도구"로 행동하기 시작하는 시스템을 제시합니다. 넓은 그물을 던지고, 지루한 법적 잡음을 필터링한 후, 실제 비즈니스 의사결정에 얼마나 도움이 되는지에 따라 남은 정보를 순위 매기며, 모든 데이터를 안전하고 안전하게 유지합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →