← 最新论文
💬 NLP

Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts

本文介绍了结构引导的实体解析(SGER),这是一种面向大语言模型的两阶段课程微调框架,在匹配复杂的多语言人名方面达到了最先进的准确率,并已在 Dream11 平台上大规模部署用于客户身份验证(KYC)合规。

原作者: Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试匹配两个人的名字,但这些名字以混乱、杂乱的方式书写。一个人可能被列为"Rajesh Kumar",另一个人列为"Kumar Rajesh",第三个人列为"RajeshKumar"(没有空格),第四个人列为"Rajeshbhai"(加上了一个友好的称呼)。在一个像印度这样多元化的国家,名字会根据地区、语言,甚至录入员如何输入而发生变化,这对计算机来说是一场噩梦。

本文介绍了一种名为SGER(结构引导实体解析)的新系统,它通过一种巧妙的两步训练方法解决了这个问题。以下是其工作原理的简明解释:

问题:“杂乱名字”的谜题

在“了解你的客户”(KYC)核查的世界里——即公司在允许你玩游戏或开设账户之前验证你的身份——计算机经常失败。

  • 旧方法:传统计算机使用简单的规则,例如计算两个名字之间有多少个字母不同。这就像只通过观察拼图块的颜色来尝试解决拼图,而忽略了形状。如果某人将"Shubham"写成"Subham",计算机就会感到困惑。
  • 新方法(大语言模型):大语言模型(AI)很聪明,但如果你只是问它们“这两个名字是同一个人吗?”,它们有时会猜错,因为它们尚未先学习名字的“语法”。它们试图同时学习结构和答案,这就像要求学生同时撰写论文和解决数学问题。

解决方案:AI 的“两阶段学校”

作者基于Llama 3系统,为他们的 AI 模型设计了一套课程(教学计划),分为两个明确的阶段。这就像培训一名新员工:

第一阶段:“名字架构师”课程
在 AI 尝试匹配名字之前,先教导它拆解名字

  • 任务:你给 AI 一个杂乱的名字,例如"Kirtan Singh Rathore"。
  • 教学:AI 必须输出一个整洁的结构化列表(如 JSON 文件),说明:名字:Kirtan,中间名:Singh,姓氏:Rathore。
  • 类比:想象教一个孩子将一堆杂乱的乐高积木分类为“轮子”、“窗户”和“墙壁”,然后再尝试搭建一辆汽车。AI 学会了"Singh"通常是中间名或家族名,而"Rathore"是家族名,无论它们出现的顺序如何。

第二阶段:“侦探”课程
现在 AI 已经理解了名字的构成,它被提升为侦探角色。

  • 任务:你给它两个名字(例如"Rajeshk"和"Rajesh Kumar"),并问:“这两个人是同一个人吗?”
  • 优势:由于 AI 已经在第一阶段学会了如何解构名字,它在做出判断时无需猜测结构。它可以专注于匹配本身。
  • 结果:它在识别"Rajeshk"只是"Rajesh Kumar"的拼写错误或缩写方面变得极其准确。

结果:一个超精准的系统

该团队在来自印度的50,000 个真实世界案例上测试了这个系统,印度以其世界上最复杂和多样的命名惯例而闻名。

  • 旧方法:准确率约为 57% 至 85%。
  • 标准 AI(未经过两步训练):准确率约为 91%。
  • SGER(新系统):达到了99.02% 的准确率

这意味着该系统几乎可以完美地判断两个名字是否属于同一个人,即使名字存在拼写错误、顺序颠倒或缺失空格。

现实世界的影响:Dream11

这不仅仅是一个理论;它已经在运行。该系统已部署在Dream11,这是全球最大的幻想体育平台,服务超过2.5 亿用户

  • 之前:当计算机不确定时,必须将案例转交给人工进行手动检查。这既缓慢又昂贵。
  • 之后:AI 几乎自动处理所有事情。
  • 益处:该公司每年节省超过50 万美元,因为他们不再需要支付人工检查这些案例的费用,且合法用户无需等待即可立即获得验证。

总结

该论文认为,要使 AI 擅长处理特定且杂乱的工作(例如在印度匹配名字),你不应该只是向其投喂数据。相反,你应该先教导它游戏规则(名字的结构),然后教导它如何玩游戏(匹配名字)。这种“课程”方法将一个好的 AI 变成了一个近乎完美的 AI,为全球公司解决了一个巨大的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →