DialogPII: A multilingual dataset of synthetic dialog transcripts to detect personal information
本文介绍了 DialogPII,这是一个包含合成对话转录文本及其对应的语音衍生资源的多种语言数据集,涵盖了 11 种语言、19 种实体类型以及 8 种交互场景,旨在支持用于保护对话数据隐私的自动去标识化系统的开发与评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的对话图书馆——人们在其中谈论健康、拨打报警电话或与客服聊天。这些对话是研究人员试图教会计算机理解人类语言的“金矿”。但问题在于:这些对话中充满了“秘密成分”,比如真实姓名、电话号码、家庭住址或医疗状况。如果你在分享这个图书馆时没有隐藏这些秘密,你就会无意中泄露人们的私人生活。
这篇论文介绍了 DialogPII,这是一个全新的、大规模的“训练健身房”,旨在教计算机如何在数据被共享之前,识别并隐藏这些秘密成分。
以下是他们构建这个系统的过程,用简单的语言进行了解释:
1. “虚构”但真实的图书馆
你不能直接抓取真实的人的私人电话并进行分享;那是违法且不道德的。因此,研究人员使用了一个“数字厨师”(大语言模型)来烹饪出合成对话。
这就像是一个电视剧编剧室。他们不是在拍摄真人,而是为 8 种不同类型的场景编写了剧本:
- 紧急求助电话(如 911)。
- 医生诊室就诊。
- 心理治疗环节。
- 警察报案。
- 客服聊天。
- 以及更多。
他们创建了 1,029 段对话(大约 147 段对应其支持的 11 种语言中的每一种)。为了确保这些“演员”听起来不像机器人,人类编辑介入并修正了生硬的措辞、更改了重复的名字,并确保每个国家的文化细节(如街道名称或当地习俗)都感觉真实。
2. “红笔”游戏(标注)
一旦剧本写好,团队就开始玩一场“寻找秘密”的游戏。他们检查每一行文字,并高亮显示任何可能识别出个人身份的内容。
- 名字? 高亮。
- 电话号码? 高亮。
- “我的表哥鲍勃”(一种关系)?高亮。
- “我在当地医院工作”(一份职业)?高亮。
他们发现了 19 种不同类型的秘密 需要寻找。他们在 11 种语言(包括英语、德语、阿拉伯语、印地语和土耳其语)中进行了这项工作,确保“红笔”规则在任何地方都适用。
3. “机器人声音”挑战
这是最聪明的部分。大多数隐私工具只看文本。但人类是说话的!
- 团队将他们的书面剧本交给计算机,让它大声朗读出来(文本转语音)。
- 然后,他们使用另一个计算机程序来聆听这段音频并将其写回成文字(语音转文本)。
这创造了一个“混乱”版本的对话。就像真实的语音转文本软件一样,这个版本存在拼写错误、漏词和奇怪的停顿。研究人员随后将他们从“干净文本”中提取的“红笔”高亮内容,尝试映射到这些“混乱的音频转录文本”上。他们手动修正了错误,从而创造出一个完美的“标准答案”,用于训练计算机在嘈ار噪的语音数据中寻找秘密。
4. “试驾”测试
为了证明这个新健身房确实有效,他们构建了一个基础的计算机大脑(模型),并在这些虚构对话上进行了训练。
- 结果: 计算机在处理干净文本时表现得非常出色(准确率约为 90%)。
- 更难的测试: 当他们在那些混乱的、由语音生成的转录文本上进行测试时,准确率略有下降(降至约 82%),这是符合预期的,因为音频转录增加了任务难度。
- 现实世界检查: 他们甚至在来自另一个数据库的一组真实(但已脱敏)的电话通话上进行了测试。计算机仍然表现得相当不错,这证明它学习到了通用规则,而不仅仅是死记硬背了虚构剧本。
为什么这很重要
把 DialogPIP 看作是一个安全、合法且多样化的“飞行模拟器”。
- 以前: 研究人员必须使用真实的、敏感的数据(风险极高)或者规模很小、内容枯燥的数据集(缺乏实用价值)。
- 现在: 他们拥有了一个庞大的、多语言、多场景的数据集,而且可以 100% 安全地共享。
这使得开发者能够构建更好的“隐私盾牌”AI 系统。一旦这些盾牌在 DialogPII 上完成了训练,它们就可以被用于保护真实的人类数据,例如在医院、呼叫中心和心理咨询应用中,确保当我们为了科学研究而分享数据时,不会无意中泄露我们的秘密。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。