compar:IA: The French Government's LLM arena to collect French-language human prompts and preference data
本文介绍了 compar:IA,这是一个开源的法国政府平台,通过盲测成对比较的方式收集大规模法语人类偏好数据,旨在解决训练和评估大语言模型时非英语数据集匮乏的问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能(AI)的世界就像一座巨大的图书馆,而书本几乎全是用英语编写的。如果你试图阅读一本法语、西班牙语或其他语言的书,故事可能会显得生硬,角色可能会表现得怪异,或者建议可能不符合文化背景。这是因为 AI “学生”们大部分时间都在研读英文书籍,很少与其他语言进行练习。
为了解决这个问题,法国政府建立了一个特别的游乐场,叫做 compar:IA。你可以把它想象成一场大型的、公开的 AI 模型盲测品鉴会,只不过他们品尝的不是冰淇淋,而是对问题的回答。
以下是它的运作方式,分为几个简单的部分:
1. 盲测品鉴(它是如何运作的)
想象你走进一个房间,看到两位神秘厨师(AI 模型)正在根据你的问题烹饪答案。你还不知道他们是谁。
- 第一步: 你提出一个问题(比如,“我该如何烤牛角面包?”或“给我讲个笑话”)。
- 第二步: 两位厨师各写出一个回答。你并排阅读它们。
- 第三步: 你选择你更喜欢的那一个。
- 第四步: 只有在你投票之后,厨师才会揭晓他们的身份。
这种“盲测”方法至关重要。它能防止你仅仅因为识别出某个品牌或名字就去选择某位厨师。它确保了投票纯粹是基于回答的质量。
2. 为什么要建立这个?(问题所在)
大多数 AI 训练数据就像是一顿只包含英文食物的饮食。正因如此,AI 在处理法国文化、俚语和安全规则方面表现挣扎。要教会一个 AI 精通法语,你需要成千上万的法国人说:“我喜欢这个回答,但我讨厌那一个。”
在 compar:IA 出现之前,这些数据要么隐藏在大科技公司内部,要么对于法语使用者来说根本不存在。compar:IA 是一个 公共厨房,任何人都可以参与其中来协助烹饪这些数据,然后将“食谱”(数据)免费分享给所有人。
3. 收获(他们收集了什么)
自 2024 年底开放以来,这个数字游乐场一直非常繁忙。截至 2026 年初,他们已经收集了:
- 超过 60 万个 由真实人类提出的问题。
- 超过 25 万次 决定哪个 AI 回答更好的投票。
- 89% 的数据是法语,这在由英文数据主导的世界中意义重大。
他们不仅收集了投票,还要求用户对答案的具体部分做出反应,从而创建了一张关于法国用户真正关心什么的丰富地图。
4. 谁在使用它,以及为什么?
- 对于普通人: 这是一个免费的方式,可以与许多不同的 AI 模型(有些著名的,有些是开源的)进行聊天,以观察它们的思维方式。它还向用户展示了 AI 回答问题时消耗了多少能量(电力),从而鼓励他们思考环境问题。
- 对于科学家和公司: 他们可以下载“食谱书”(数据),来训练自己的 AI 模型,使其更好地使用法语。
- 对于学校: 教师利用它向学生展示 AI 是如何工作的,将其变成一个课堂工具,让学生讨论哪个 AI 的回答更公平或更准确。
5. 游戏规则(隐私与安全)
创建者非常注重隐私。
- 无需注册: 你不需要提供姓名或电子邮件即可参与。这降低了参与门槛,但也意味着他们稍后必须格外小心。
- 过滤器: 在任何数据被分享给公众之前,一台智能计算机都会扫描每一段对话。如果它发现了真实的人名、地址或私人信息,它会将整段对话丢进垃圾桶。与其意外泄露某人的秘密,不如损失一些数据点。
- 开源: 数据是在法国政府的许可下发布的,这意味着只要遵守规则,任何人都可以将其用于研究或构建新工具。
6. 计分板
该平台还维护着一个 排行榜(排名列表)。它就像一个体育记分牌,显示了法国人最青睐哪些 AI 模型。然而,作者警告说,这并不是一个完美的“智能”测试。它仅仅展示了人们在非正式场合中“喜欢”什么。它更像是一场人气竞赛,而非最终考试。
7. 未来
法国团队将此视为一个原型。他们已经在致力于将这种“品鉴会”扩展到其他语言(首先是丹麦语),以便其他国家也能建立属于自己的公共数据花园。
简而言之: compar:IA 是一项公共服务,通过众包法国语言偏好,来教导 AI 如何像人类法国人一样说话、思考和行事,同时保持过程的开放、私密且对所有人免费使用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。