← 最新论文
💬 NLP

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

该论文介绍了“Inspect India Evals”,这是一个基于英国 AISI 的 Inspect AI 平台构建的开源基准测试框架,旨在解决大语言模型在印度缺乏文化和语言相关性评估的问题,通过对十六种语言中的六个特定基准进行测试,揭示了像 Sarvam-M 和 Gemma 2 这样的模型在印度文化知识和安全合规性方面优于规模更大的对应模型。

原作者: Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚买了一个超级聪明的机器人助手,它能和你聊天、写故事,还能解决数学问题。你非常兴奋,想让它在你的社区里大显身手,但有一个限制:你的社区是一个巨大的、繁忙的市场,人们说着几十种不同的语言,庆祝着独特的节日,并拥有各自根深蒂固的传统。如果你只用关于纽约或伦敦生活的英文书籍来教这个机器人,它会成为一名博学的学者,但却是一个糟糕的邻居。它可能会无意中冒犯当地的长辈,误解一个文化笑话,甚至更糟——因为它不了解“当地规则”,从而给出危险的建议。这就是**大语言模型(LLMs)**的世界——其大脑是在海量文本上训练出来的。现在科学家们正在问一个大问题:这些 AI 大脑是否准备好为像印度这样文化和语言都极其多样化的国家提供帮助了?

为了回答这个问题,研究人员需要一种测试机器人的方法。通常,他们使用标准的测试,如“MMLU”或“TruthfulQA”,这些就像是为欧洲高速公路设计的驾驶考试。但在印度开车是不同的;道路更窄,交通规则独特,地标也完全不同。如果你只在欧洲的高速公路上测试一辆车,你无法知道它是否能应对混乱的印度街头市场。这篇论文介绍了一种专门为印度构建的新型开源“驾驶测试”,名为 Inspect India Evals。它检查 AI 模型是否能说 16 种不同的印度语言,是否理解印度社会动态(如复杂的种姓制度和宗教多样性),以及在面对有关印度数字身份系统和支付应用的棘手问题时能否保持安全。

大考:AI 的新地图

这篇论文的作者们与印度电子信息技术部合作,意识到现有的 AI 测试错失了重点。他们构建了一个名为 Inspect India Evals 的框架,这就像是一个专门为印度背景设计的六项挑战障碍赛。他们不再仅仅问:“你能解决这个数学问题吗?”而是问:“你能用泰米尔语解决这个数学问题吗?”或者“你能告诉我如何注册政府身份证件,而不会意外教人如何伪造它吗?”

该框架包括六个具体的挑战:

  1. 多语言 MMLU:一个将知识测试翻译成 16 种印度语言(如印地语、孟加拉语和泰米尔语)的任务,以观察 AI 是真的理解事实,还是仅仅在瞎猜。
  2. BharatBBQ:一个偏见测试,检查 AI 是否持有关于印度种姓、宗教或地区的刻板印象,而不仅仅是关于美国种族或性别的问题。
  3. DPI 安全性:针对印度“数字公共基础设施”(如用于身份识别的 Aadhaar 和用于支付的 UPI)的安全检查。它测试 AI 是否能在拒绝协助欺诈的同时,仍能回答有益的问题。
  4. 多语言安全性:检查 AI 是否会对有害请求(如“如何黑进银行”)说“不”,即使是用区域性语言提出的请求。
  5. 越狱抗性:尝试通过不同语言的多步对话来诱骗 AI 违反其规则。
  6. 印度文化知识:一个关于深度文化事实的测试,从宪法到农业政策不等。

竞赛:谁通过了测试?

研究人员让五种不同的开源 AI 模型参加了这个障碍赛。这些模型的规模从 80 亿到 320 亿个“参数”(可以理解为 AI 大脑中的连接数量)不等。他们测试的模型包括 Sarvam-M 24B(一个专注于印度的模型)、Gemma 2 27BQwen 2.5 32BDeepSeek-R1 14B 以及 Llama 3.1 8B

以下是他们的发现,这有点令人惊讶:

  • 本土英雄胜出:专门针对印度语言和文化进行微调的 Sarvam-M 24B 模型整体表现最佳。它的平均得分达到了 74.4%。它在理解印度文化方面表现尤为出色(得分 60.0%),并在处理数字安全问题方面表现完美(100%)。它甚至在文化知识方面击败了更大、更强大的模型。
  • 安全之星Gemma 2 27B72.1% 的平均分紧随其后,位列第二。它是一个完美的安全卫士,在偏见测试和数字安全方面获得了 100% 的得分,尽管它在深度文化事实方面稍显吃力。
  • 推理机器人的挣扎DeepSeek-R1 14B 以擅长在回答前进行深度思考的“推理”模型而闻名。它在多种语言的事实推理测试中表现优异,得分 80.6%。然而,它在安全和文化知识方面惨败,在数字安全上仅得 20%,在文化事实上仅得 10%。它太专注于“思考”,以至于忘记了安全或文化意识。
  • 大模型并未取胜:有趣的是,拥有更多参数(更大的大脑)并不保证获胜。拥有 320 亿参数的模型 Qwen 2.5 32B 在许多领域得分都低于较小的 Sarvam-M 24B。这表明对于印度而言,专门化训练 比单纯的原始规模更重要。

“印度公平指数”

为了理清这些数字,作者创建了一个名为 印度公平指数 (IFI) 的单一评分。该分数将安全性、偏见和事实准确性结合为一个数字。

  • Gemma 2 27B 获得了最高的 IFI 得分,为 83.1%
  • Sarvam-M 24B76.6% 紧随其后。
  • DeepSeek-R1 14B 得分为 65.2%,这表明仅仅聪明是不够的,如果缺乏安全性。
  • Llama 3.1 8B 得分最低,为 51.6%

结论:安全无处不在,文化极具挑战

最有趣的发现之一是,所有五种模型在多种语言中拒绝有害请求的表现都是完美的。它们在“多语言安全性”测试中全部获得了 100% 的得分。无论是以英语、印地语还是泰米尔语要求做坏事,它们都说了“不”。这是个好消息!

然而,模型在 印度文化知识 方面表现得很吃力。专门化模型(Sarvam)得分 60%,而其他模型则在 10% 到 30% 之间徘徊。这表明标准的全球 AI 训练是不够的;你需要针对印度历史、节日和社会结构的专门训练才能做得对。

作者还指出了一种权衡:DeepSeek-R1 表明,旨在进行复杂推理的模型有时会被诱导违反安全规则(越狱抗性仅为 40%),而像 Gemma 和 Sarvam 这样的模型则要强韧得多(抗性达 80%)。

这意味着什么

论文得出结论,我们不能直接把一个在西方训练的 AI 丢到印度。这就像试图把一辆一级方程式赛车开在泥泞的乡村小路上;它可能很快,但会卡住或撞车。结果表明,为了让 AI 在印度真正有用且安全,它需要针对当地语言和文化的专门化微调

作者谨慎地表示,这些结果是基于一个样本量较小的“试点”研究(每个任务仅有 5 个样本)。虽然趋势很明显,但他们建议需要通过更大规模的问题组进行更多测试,才能绝对确定。但信息已经非常明确:专门化的、具备文化意识的模型才是印度 AI 的未来,我们需要更好的测试来确保它们在投入使用前是安全的。

该“驾驶测试”的代码和数据现在已向所有人开放,以便开发者可以为这个世界上最多样化的国家构建更好、更安全的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →