The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation
本文提出了 RiDiC 数据集及生成管道,通过构建涵盖不同流行度梯度的多领域多语言实体,用于评估大语言模型在长文本生成中的事实准确性,并揭示了前沿模型在此类任务中仍易产生幻觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 RIDIC 的新项目,它的核心目的是给大型语言模型(LLM,比如 ChatGPT 或文心一言)做一场“事实核查大考”,而且这场考试专门针对那些大家不太熟悉、比较冷门的知识。
为了让你更容易理解,我们可以把这篇论文的内容想象成**“给 AI 厨师举办的一场全能烹饪大赛”**。
1. 为什么要办这场比赛?(背景与痛点)
现在的 AI 厨师很厉害,你问它“怎么做番茄炒蛋”,它能给你一本正经地写出一篇完美的食谱。但是,如果你问它一些冷门的问题,比如“某条不知名小河的源头在哪里”或者"1977 年某个偏远地区发生的地震细节”,AI 可能会一本正经地胡说八道(也就是“幻觉”)。
以前的考试(数据集)大多只考“热门菜”(比如名人传记、常见历史事件),就像只让厨师做“宫保鸡丁”和“鱼香肉丝”。大家发现,AI 做这些热门菜很稳。但现实生活中的用户,往往需要的是各种各样的“野味”或“地方特色菜”。如果 AI 在冷门知识上乱编,在医疗、法律或新闻领域就会出大乱子。
这篇论文的作者们想: “我们需要一套新的考题,专门测试 AI 在冷门、冷门、再冷门的知识上会不会翻车。”
2. 他们是怎么准备考题的?(RIDIC 数据集的生成)
作者们设计了一套**“智能出题流水线”**,就像是一个自动化的“食材采购与分类系统”:
- 选食材(实体选择): 他们从维基百科和 Wikidata(一个巨大的知识数据库)里,挑选了三大类“食材”:
- 河流(比如长江、亚马逊河,或者某条不知名的小溪)。
- 自然灾害(比如著名的飓风,或者某次不起眼的山崩)。
- 汽车型号(比如法拉利、丰田,或者某个停产的冷门车型)。
- 分等级(热度控制): 这是最关键的一步。他们不随机挑,而是按照**“人气”**把食材分成三档:
- 头(Head): 超级明星,像“长江”或“特斯拉 Model 3",全网都知道。
- 身(Torso): 中等名气,像“某条省内的河流”或“某款老式轿车”。
- 尾(Tail): 真正的“冷门”,像“某条只有当地人知道的小溪”或“某次几十年前的小地震”。
- 比喻: 就像餐厅菜单,头是招牌菜,身是家常菜,尾是那种“只有主厨知道存在”的稀有食材。
- 配佐料(多语言与证据): 他们不仅准备了英文版的考题,还准备了中文版。并且,他们把维基百科上关于这些事物的所有资料(就像把食材的“身份证”和“说明书”)都收集起来,作为**“标准答案”**,用来检查 AI 厨师做得对不对。
最终,他们凑齐了 3000 个 这样的考题(每种 1000 个),这就是 RIDIC 数据集。
3. 比赛过程与结果(实验发现)
作者们让三个著名的 AI 厨师(Llama, Qwen, GPT-5)分别用英文和中文来回答这 3000 个关于河流、灾害和汽车的问题,然后由“裁判”(自动化的事实核查工具)来打分。
结果非常有趣,就像发现了几个“烹饪黑箱”:
- 越冷门,越爱编:
- 当题目是“头”(热门)时,AI 厨师们表现得很稳,像老手一样。
- 一旦题目变成“尾”(冷门),AI 就开始“瞎编”了。特别是那些小模型(像 Llama 和 Qwen),在冷门知识上的准确率直接腰斩。
- 比喻: 就像让一个厨师做“宫保鸡丁”他闭着眼都能做对,但让他做“某种特定年份、特定产地的野生菌料理”,他可能连菌子长什么样都记不清,直接拿蘑菇顶替。
- 中文比英文更难:
- 所有 AI 在中文回答上的事实准确率,普遍比英文低。
- 原因: 就像中文菜谱里的“冷门食材”资料本来就少,AI 学的时候“教材”不够厚,考试时自然容易出错。而且,用来做“标准答案”的中文维基百科资料,有时候也不够详细,导致裁判很难判断 AI 到底是对是错。
- 领域也有影响:
- 在“自然灾害”和“汽车”领域,AI 表现较好;但在“河流”领域,AI 最容易出错。这可能是因为河流的数据太分散,或者名字太容易混淆(比如叫“黄河”的河可能有好几条)。
- 大模型更靠谱:
- GPT-5(目前最强的模型)在冷门知识上的表现明显优于小模型,说明**“脑子大”(参数多)确实能记住更多冷门知识**。
4. 这个研究有什么用?(结论)
这篇论文不仅仅是一份“考试成绩单”,它更像是一个**“工具箱”**:
- 提供了新标尺: 以前我们不知道 AI 在冷门知识上到底多不靠谱,现在有了 RIDIC,我们可以精准地测量出 AI 的“长尾幻觉”(Long-tail Hallucination)有多严重。
- 揭示了短板: 它告诉我们,AI 在中文环境下的事实性能力还有很大提升空间,特别是在处理冷门知识时。
- 开源了方法: 作者把生成这套考题的代码和数据都公开了。这意味着,以后任何研究者都可以用这套方法,去测试新的 AI 模型,或者针对新的领域(比如“古代植物”或“冷门电影”)生成新的考题。
一句话总结:
这就好比作者们给 AI 界造了一个**“冷门知识大考场”,发现现在的 AI 虽然是个“博学多才”的学霸,但一遇到生僻字和冷门题**,尤其是用中文回答时,就容易**“胡编乱造”**。RIDIC 数据集就是为了让 AI 们知道:别光会背热门课文,冷门知识也得好好学,不然就要露馅了!
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。