LingVarBench: Benchmarking LLMs on Entity Recognitions and Linguistic Verbalization Patterns in Phone-Call Transcripts
该论文介绍了 LingVarBench,这是一个利用多样化语言模式和 LLM 采样值来自动优化提取提示词的基准测试及合成数据生成流水线,在电话通话转录文本的结构化实体识别任务中,实现了与人工调优模型相当的性能,同时克服了数据隐私和标注成本方面的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人去听取医生与患者之间的电话通话,并从中提取出像姓名、出生日期或邮政编码之类的关键细节。这听起来很简单,但人类的语言是混乱的。人们会结巴、重复,或者说“嗯”、“呃”,或者把一个日期说成“一九七五年的三月三日”,而不是“03/03/1975”。
问题在于,为了教这个机器人应对这些混乱的模式,你需要成千上万条真实的电话录音。但你不能直接获取这些录音,因为它们包含了受严格隐私法(如 HIPAA)保护的私人医疗秘密(如姓名和健康状况)。这就像是你想教一个人在暴风雪中开车,但你不被允许让他们在真实的雪地上驾驶,而且你也找不到足够的练习赛道。
由此诞生了“LingVarBench”。
论文的作者们为这些 AI 机器人构建了一个虚拟驾驶模拟器。他们没有等待真实的、私密的电话录音一点点流出,而是创建了一个能够生成数千条虚假但真实的电话通话文本的机器。
以下是他们的“模拟器”如何运作的,分为三个简单的步骤:
1. “数值生成器”(编剧)
首先,系统会挑选它需要提取的一项信息,比如邮政编码(例如:94101)。然后生成一系列有效的数字列表。
2. “文本生成器”(演员)
这是最具创意性的部分。系统会拿到这个邮政编码,并要求大语言模型(AI 演员)以人类可能出现的每一种奇怪方式将其大声说出来。
- “逐个数字”型演员: “九……四……一……零……一。”
- “结巴”型演员: “九……呃……九……四……一。”
- “分组”型演员: “九十四……一零一。”
- “自我纠正”型演员: “九四一……不对,是九四一零一。”
系统创造了数千种这样的变体,涵盖了从自信的说话者到犹豫不决的说话者等各种情况。
3. “一致性检查器”(编辑)
有时,AI 演员会因为试图听起来自然而产生混乱,导致说错了数字。系统内置了一个编辑,它会倾听这段虚假的录音并进行检查:“演员实际说的是 94101 吗,还是他搞砸了?” 如果演员搞砸了,这条录音就会被扔进垃圾桶。只有那些完美、一致的虚假录音才会被保留下来。
结果:无需隐私风险的训练
作者使用这个庞大的“干净、虚假但真实”的录音库来训练他们的 AI。他们不需要接触任何真实的患者隐私数据来进行初始训练。
他们通过将该 AI 应用于真实电话通话来测试它,而该 AI 仅通过这些虚假数据进行了训练。
令人惊讶的结果:
- “零样本”机器人: 一个仅被给予基本指令而未经训练的 AI 在处理时表现挣扎,准确率约为 75–88%。
- “人工微调”机器人: 一个使用真实(私密)数据经过人类精心微调的 AI,准确率约为 89–94%。
- “LingVarBench”机器人: 仅用这些虚假、合成数据进行训练的 AI,其表现与人工微调后的 AI 不相上下,在处理姓名和邮政编码等信息时达到了 94–95% 的准确率。
为什么这很重要(根据论文所述)
论文声称,你不需要等待真实数据的到来,也不需要承担违反隐私风险的代价,就可以构建一个鲁棒的系统。通过使用这个“模拟器”来生成多样化的表达方式,你可以立即创建一个能够应对人类语言混乱现实的 AI。
该论文并未声称:
- 它并不声称该系统目前正在诊断疾病。
- 它并不声称这能取代人类医生。
- 它并不声称该 AI 可以理解复杂的、多轮的对话(例如人们改变话题或拒绝回答的情况——该系统目前仅处理针对特定问题的直接回答)。
简而言之,这篇论文展示了一个“训练馆”,在这里,AI 可以练习倾听混乱的语音,而无需在第一次接触真实患者的私密对话之前就进行练习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。