IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages
本文介绍了 IndicTalk,这是一个大规模、自动生成的语料库,包含超过 130 万条基于人格且以事件为依据的、跨越 9 种印度语及其 18 种变体的代码混合对话,旨在推进针对代表性不足地区的多种语言对话式人工智能的发展。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大、繁忙的全球城镇广场。长期以来,说英语的人拥有最响亮的扩音器和最舒适的长凳,而其他语言的使用者往往不得不顶着噪音大声喊叫,或者只能坐在场边。在人工智能的世界里,这个“城镇广场”是计算机学习如何聊天的场所。最近,这些被称为“大语言模型”(LLM)的计算机已经变得非常擅长进行对话,但它们主要是通过倾听英语使用者来学习的。
然而,在世界许多地方,人们并不只说一种语言;他们会将多种语言混合使用。这被称为“语码混合”(code-mixing)。想象一下,一位朋友在讲故事时,会在一句话的中途突然从母语切换到英语,甚至用英文字母来书写他们的母语单词(比如输入“hello”而不是“नमस्ते”)。这就是数以亿计的人在网上实际交流的方式。问题在于,大多数 AI 聊天机器人就像是严格的老师,一次只能理解一种语言。当你在语言中进行混用时,它们会感到困惑,这使得它们很难与数十亿以这种混合方式说话的人进行自然交流。为了解决这个问题,我们需要一个巨大的练习对话库,能够捕捉到这种混乱而美丽的语言融合。
于是,IndicTalk 应运而生,这是一个旨在为印度语言构建此类库的大型新项目。这项工作的研究人员意识到,虽然英语有很多数据集,但对于印度九种不同语言之间复杂的、混合语言的对话,几乎没有任何资源。现有的资源要么规模太小,要么只关注一种语言对(如印地语和英语),或者仅仅是句子的列表,而不是完整的、流动的对话。
为了解决这个问题,团队创建了一个全自动的“对话工厂”。他们没有雇佣成千上万的人来手工编写对话,而是构建了一个从真实新闻故事开始的流水线。想象一下,从报纸中提取一条标题,总结其主要事实,然后将这个摘要喂给一个超级聪明的 AI。接着,这个 AI 会被赋予一个特定的“人格”——比如一个好奇的朋友、一位严厉的老师或一位忧虑的家人——并被要求围绕该新闻故事进行一场对话。系统一遍又一遍地执行此过程,生成了数百万条聊天记录。
其成果便是 IndicTalk,一个包含超过 1,328,604 场多轮对话的巨型数据集。这些不仅仅是随机的聊天;它们植根于真实的事件,涵盖了 9 种印度语言(包括孟加拉语、印地语、泰米尔语和泰卢固语)中的 18 种不同的语言变体。它的特别之处在于,它捕捉了两种书写方式:传统的原生脚本(如天城文或泰米尔文)以及罗马化版本(即使用英文字母来输入这些语言),这也是许多人在手机上发短信的方式。
研究人员并没有只是简单地堆砌数据;他们进行了严格的质量检查。他们使用了自动过滤器,以确保对话确实正确地混合了语言,并且没有意外地滑向纯英语或纯单一母语。他们还聘请了人类专家和其他强大的 AI 模型作为评委来对聊天内容进行评分。结果令人振奋:这些对话被发现是流畅、连贯且自然地进行了语码混合,就像真实的真人聊天一样。
简而言之,这篇论文表明,通过使用智能的自动化流水线,我们可以创建一个高质量、大规模的资源,帮助 AI 理解人们真实的、混合语言的表达方式。虽然作者指出这些是合成的(计算机生成的)对话,可能会错过现实人类语言中那些微小的、混乱的不完美之处,但他们成功地证明了构建一个大规模、多样化的数据集是可能的,这个数据集弥合了僵化的 AI 与流动的多语言现实生活之间的鸿沟。该数据集现在已开放供他人使用,有望帮助构建那些最终能真正融入全球城镇广场的聊天机器人和语音助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。