CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
本文介绍了 CAPITU,这是一个基于巴西文学经典作品构建的、包含 59 种可自动验证指令的葡萄牙语基准测试,旨在评估大语言模型在单轮及多轮对话中遵循语言约束和文化语境指令的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章介绍了一个名为 CAPITU 的新工具,它的任务很简单:给会说葡萄牙语(巴西方言)的 AI 大模型做一次“听指挥”的考试。
想象一下,你正在教一个非常聪明的外国留学生(AI)写巴西风格的作文。以前,我们要么用英语考他,要么只是简单地把英语题目翻译成葡萄牙语。但这有个大问题:就像让一个只会说英语的人去理解巴西的俚语或特殊的诗歌押韵一样,翻译过来的题目往往抓不住葡萄牙语的灵魂。
CAPITU 就是为了解决这个问题而生的。以下是它的核心亮点,用几个生动的比喻来解释:
1. 独特的“文学考场” 📚
以前的考试题目可能很生硬,比如“写一段关于天气的文字”。
CAPITU 则把考试场景设定在巴西的八本经典文学名著中(比如《堂·卡斯特罗》或《贫民窟》)。
- 比喻:这就像不是让 AI 在空荡荡的教室里做题,而是把它扔进了一个充满巴西文化气息的“文学茶话会”。它必须在这个特定的文化背景下,用符合巴西人说话习惯的方式回答问题。这不仅考语言能力,还考它是否懂巴西的“文化梗”。
2. 严格的“规则游戏” 🎮
这个考试最厉害的地方在于,它不靠老师(人类)的主观感觉打分,而是靠自动化的“死板规则”。
- 比喻:想象你在玩一个极其严格的“文字积木游戏”。
- 规则 A:你必须用恰好 100 个单词。
- 规则 B:你必须用到 3 个以"-inho"(葡萄牙语中一种表示“小”或“可爱”的后缀,类似中文的“小”字)结尾的词。
- 规则 C:你不能使用“我”这个人称代词。
- 规则 D:每句话的开头字母必须拼出一个单词(比如拼出“爱”)。
- 如果 AI 哪怕多写了一个字,或者少用了一个后缀,系统就会直接判定“失败”。这种自动打分的方式,就像用尺子量长度一样精准,完全不需要老师去猜“我觉得写得不错”。
3. 葡萄牙语的“专属陷阱” 🇧🇷
英语和葡萄牙语长得很像,但有很多细微差别。CAPITU 专门设计了针对葡萄牙语“陷阱”的题目。
- 比喻:英语里可能没有像葡萄牙语那样丰富的“小词”(比如把“房子”变成“小房子”)。CAPITU 会故意问:“请写一段话,里面必须包含 5 个以'-zinho'结尾的词。”
- 如果 AI 只是把英语题目翻译过来,它可能根本不知道这个后缀的存在,或者不知道怎么用。CAPITU 就是要看 AI 能不能像巴西本地人一样,自然地运用这些语言特色。
4. 多轮对话的“记忆力挑战” 🧠
考试不仅有单题,还有连续对话。
- 比喻:
- 第一轮:AI 写个故事开头。
- 第二轮:你让它继续写,但加个新规矩(比如“现在每句话都要以‘但是’开头”)。
- 第三轮:再让它继续,再加个规矩(比如“现在不能再用‘但是’了,要用‘然而’")。
- 很多 AI 在第二轮或第三轮时,会忘记第一轮或第二轮的旧规矩。CAPITU 专门测试 AI 能不能在对话变长、规则变多时,依然记得所有之前的“老规矩”。
5. 考试结果:谁赢了? 🏆
作者测试了 18 个最厉害的 AI 模型,结果很有趣:
- 超级学霸:OpenAI 的 GPT-5 系列(特别是带“推理模式”的)表现最好,几乎能完美遵守所有规则(98.5% 的准确率)。
- 性价比之王:巴西本土的 AI 模型(如 Sabiazinho-4)虽然个头小,但表现非常惊人,甚至超过了某些昂贵的国际大牌模型,而且便宜得多(就像用国产手机打出了国际大牌的效果)。
- 普遍弱点:所有 AI 在“数数”(比如精确控制字数)和“记住多轮对话的旧规矩”上都比较吃力。这就好比让一个天才画家去数画布上有多少根头发,他画得再好,数数也容易出错。
总结
CAPITU 就像是为巴西葡萄牙语 AI 量身定制的“高考”。它不再问那些泛泛的问题,而是通过文学故事作为背景,用死板的数学规则作为尺子,专门测试 AI 能不能在复杂的巴西文化语境下,精准地“听指挥”。
这不仅帮助开发者知道哪些 AI 更懂巴西,也提醒我们:未来的 AI 不仅要聪明,还要能像当地人一样,在特定的文化土壤里,精准地遵守每一个细微的指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。