A System for Name and Address Parsing with Large Language Models
本文提出了一种由提示驱动、以验证为中心的框架,该框架通过整合输入归一化、约束解码以及严格的基于规则的验证,在无需微调的大型语言模型基础上,可靠地将非结构化的姓名和地址文本转换为一致的 17 项字段模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你面前有一大堆乱七八糟的手写信件。有些是用英文写的,有些是西班牙文,有些墨迹模糊,还有些缺少逗号,或者有像把“123 Main St Apt 4B”写成“123MainStApt4B”这样的拼写错误。你的目标是将这堆混乱的资料变成一张整洁、有序的电子表格,让每一项信息(姓名、街道、城市、邮编)都有自己专属的列。
这篇论文描述了一种实现这一目标的新方法,它使用了一个非常聪明的计算机大脑(称为大语言模型,简称 LLM),但加入了一个特别的设计:作者并没有从头开始教这个计算机大脑学习一种新语言(这就像雇佣一名新员工并进行数月的培训),而是围绕它构建了一个严格的“清单与监督者”系统。
以下是他们的系统运作方式,分为几个简单的步骤:
1. “准备厨师”(输入规范化)
在聪明的计算机查看数据之前,一位“准备厨师”会先进行清理工作。
- 问题: 原始数据非常混乱。有人写“Ave.”,有人写“Avenue.”;有人写“N.E.”,有人写“NE.”。
- 解决方法: 系统会自动将一切标准化。它会将所有的缩写转换为全称,修正大小写,并删除奇怪的符号。这就像厨师在烹饪前将所有的蔬菜切成完全相同的大小,以便食谱每次都能完美执行。
2. “严格食谱”(提示词组装)
作者并没有让计算机大脑去猜测该做什么,而是给了它一张非常具体、不可更改的食谱卡。
- 问题: 如果你只是问一个聪明的计算机:“这是一个地址,请告诉我它的组成部分”,它可能会捏造事实或每次都以不同的格式输出答案。
- 解决方法: 食谱卡上写着:“你是一名专业的解析专家。你必须按完全相同的顺序输出恰好 17 个字段。如果你不知道某些信息,请留空。不要捏造数据。”这就像给机器人一份严格的组装手册:“把螺丝放在这里,把螺栓放在那里。不准即兴发挥。”
3. “流水线作业”(约束推理)
计算机以固定的小组(每组 16 个)进行处理,就像一条每次移动 16 辆汽车的组装流水线一样。
- 目标: 这确保了计算机不会变得“有创意”或感到疲劳。它保持设置锁定,因此如果你运行两次相同的任务,你会得到完全相同的结果。这就像一台永远不会改变速度或设置的工厂机器。
4. “质量控制检查员”(验证)
这是最关键的部分。一旦计算机完成工作,一个严格的“质量控制检查员”就会检查每一行。
- 规则:
- 邮政编码是否与州匹配?(例如,加利福尼亚州的邮编不能出现在纽约)。
- 计算机是否捏造了一个不存在的街道名称?
- 是否恰好有 17 个字段?
- 结果: 如果计算机犯了错,检查员会立即发现。如果计算机不确定,系统会将该条目标记出来,供人类稍后查看。这确保了最终的电子表格几乎是完美的。
他们发现了什么?
作者在 1,500 条不同的地址记录上测试了这个系统,其中包括来自美国、波多黎各和其他国家的混乱记录。
- 得分: 该系统的正确率达到了 99.8%。
- 对比: 它比旧有的基于规则的系统(类似于僵化的说明书)表现略好,并且不需要为了工作而进行“重新训练”或学习新知识。
- 信心: 系统还能告诉你它对答案的把握程度。当它说确定度在 90% 以上时,几乎每次都是正确的。
核心要点
论文认为,你不需要训练昂贵的定制 AI 模型来修复混乱的数据。相反,你可以使用功能强大的现成 AI 模型,但在其周围包裹一层严格的、基于规则的安全网。
这就像雇佣一位才华横溢、极具创意的作家(AI)来填写税务表格。如果你只是让他们写,他们可能会编造数字。但如果你给他们一份带有严格空格、检查清单和规则,以及一位在提交前检查每个空格的监督者的表格,你就能每次都得到一份完美的税务表格,而无需从头教这位作家如何报税。
这种方法使得将混乱的现实世界文本转化为干净、可靠的数据变得快速且廉价,且无需为每个国家或语言重新训练 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。