Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts
본 논문은 복잡한 다국어 개인 이름 매칭에서 최첨단 정확도를 달성하고 현재 드림 11 플랫폼의 KYC 규정 준수를 위해 대규모로 배포 중인 대규모 언어 모델을 위한 구조 기반 엔티티 해결 (SGER) 이라는 두 단계 커리큘럼 미세 조정 프레임워크를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
두 사람의 이름을 매칭하려고 한다고 상상해 보세요. 하지만 이름들이 혼란스럽고 지저분하게 쓰여 있습니다. 한 사람은 "Rajesh Kumar"로, 다른 사람은 "Kumar Rajesh"로, 세 번째 사람은 공백이 없는 "RajeshKumar"로, 네 번째 사람은 친근한 호칭이 추가된 "Rajeshbhai"로 나열될 수 있습니다. 지역, 언어, 심지어 기록한 직원의 입력 방식에 따라 이름이 달라지는 인도처럼 다양한 국가에서는 이것이 컴퓨터에게 악몽과 같습니다.
이 논문은 SGER(Structure-Guided Entity Resolution, 구조 유도 엔티티 해결)라는 새로운 시스템을 소개하며, 이 문제를 교묘한 두 단계 훈련 방법으로 해결합니다. 작동 원리를 간단히 설명하면 다음과 같습니다:
문제: "지저분한 이름" 퍼즐
"고객 확인 (KYC)" 절차—회사가 게임을 하거나 계좌를 개설하기 전에 사용자의 신원을 확인하는 과정—에서 컴퓨터는 종종 실패합니다.
- 구식 방법: 전통적인 컴퓨터는 두 이름 사이의 다른 글자 수를 세는 것과 같은 간단한 규칙을 사용합니다. 이는 퍼즐 조각의 모양을 무시하고 색상만 보고 퍼즐을 풀려는 것과 같습니다. 누군가 "Subham" 대신 "Shubham"이라고 쓰면 컴퓨터는 혼란에 빠집니다.
- 신식 방법 (LLM): 대규모 언어 모델 (AI) 은 똑똑하지만, "이 두 이름이 같은 사람인가요?"라고 단순히 물어보면 때로는 틀리게 추측합니다. 왜냐하면 그들은 이름의 문법을 먼저 배우지 않았기 때문입니다. 그들은 구조와 답을 동시에 배우려 하는데, 이는 학생에게 논문을 쓰면서 동시에 수학 문제를 풀라고 요구하는 것과 같습니다.
해결책: AI 를 위한 두 단계 "학교"
저자들은 Llama 3라는 시스템을 기반으로 AI 모델에게 가르칠 커리큘럼 (수업 계획) 을 두 가지 명확한 단계로 만들었습니다. 새로운 직원을 훈련시키는 것과 같다고 생각하세요:
1 단계: "이름 건축가" 수업
AI 가 이름을 매칭하기 전에, 먼저 이름을 분해하도록 가르칩니다.
- 과제: "Kirtan Singh Rathore"와 같은 지저분한 이름을 AI 에게 줍니다.
- 수업 내용: AI 는 이름: Kirtan, 중간 이름: Singh, 성: Rathore라고 명시하는 깔끔하고 구조화된 목록 (JSON 파일과 같은) 을 출력해야 합니다.
- 비유: 자동차를 만들기 전에 뒤죽박죽인 레고 블록 더미를 "바퀴", "창문", "벽"으로 분류하는 법을 아이에게 가르치는 상황을 상상해 보세요. AI 는 순서에 상관없이 "Singh"가 종종 중간 이름이나 성이며 "Rathore"가 성임을 배우게 됩니다.
2 단계: "탐정" 수업
이제 AI 가 이름이 어떻게 구성되는지 이해했으므로, 탐정 역할로 승진합니다.
- 과제: 두 개의 이름 (예: "Rajeshk"와 "Rajesh Kumar") 을 주고 "이들이 같은 사람인가요?"라고 묻습니다.
- 장점: AI 는 1 단계에서 이름을 분해하는 방법을 이미 알고 있으므로, 결정을 내리는 동안 구조를 추측할 필요가 없습니다. 오직 매칭에만 집중할 수 있습니다.
- 결과: "Rajeshk"가 단순히 "Rajesh Kumar"의 오타이거나 약어임을 알아내는 데 놀라울 정도로 정확해집니다.
결과: 초정밀 시스템
이 팀은 세계에서 가장 복잡하고 다양한 이름 규칙을 가진 곳으로 알려진 인도에서 50,000 개의 실제 사례로 이 시스템을 테스트했습니다.
- 구식 방법: 약 57% 에서 85% 의 정확도를 보였습니다.
- 표준 AI(두 단계 훈련 없이) 약 91% 의 정확도를 보였습니다.
- SGER(새로운 시스템) 99.02% 의 정확도를 달성했습니다.
이는 이름이 오타가 나거나 순서가 바뀌거나 공백이 빠져 있더라도, 두 이름이 같은 사람에게 속하는지 거의 완벽하게 판단할 수 있음을 의미합니다.
실제 영향: Dream11
이것은 단순한 이론이 아니라 이미 작동하고 있습니다. 이 시스템은 2 억 5 천만 명 이상의 사용자를 보유한 세계 최대의 판타지 스포츠 플랫폼인 Dream11에 배포되었습니다.
- 이전: 컴퓨터가 확신이 서지 않을 때는 인간에게 수동으로 확인을 요청해야 했습니다. 이는 느리고 비용이 많이 들었습니다.
- 이후: AI 가 거의 모든 것을 자동으로 처리합니다.
- 혜택: 이 회사에서는 더 이상 인간에게 이러한 사례를 확인하게 할 필요가 없으므로 연간 50 만 달러 이상을 절약할 수 있으며, 합법적인 사용자는 기다림 없이 즉시 인증을 받을 수 있습니다.
요약
이 논문은 AI 를 인도처럼 이름 매칭과 같은 구체적이고 지저분한 작업에 적합하게 만들려면, 단순히 데이터를 던져주는 것이 아니라 먼저 게임의 규칙(이름이 어떻게 구조화되는지) 을 가르치고, 그 다음에 게임을 하는 방법(이름을 매칭하는 것) 을 가르쳐야 한다고 주장합니다. 이 "커리큘럼" 접근 방식은 좋은 AI 를 거의 완벽한 수준으로 끌어올려 글로벌 기업에게 큰 골칫거리를 해결해 주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.