TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs
本文介绍了 TreeProbe,这是首个旨在通过测试大语言模型对藏医学结构化理论框架的遵循程度,来评估其文化偏见的基准测试,研究揭示了当前模型往往表现出向主流生物医学或中医药范式进行的系统性认识论漂移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走进一座巨大的、高科技的图书馆,书里的书都是由超级聪明的机器人写的。这些被称为“大语言模型”(LLM)的机器人几乎读遍了互联网上的所有内容。它们擅长回答问题、写故事,甚至能假装成医生。但问题在于:它们读过的绝大多数书籍都是用英文编写的,且基于西方科学。因此,当你向它们询问一种来自不同文化的医疗体系时——比如藏医学,它有着自己独特的身体与疾病认知方式——机器人就会感到困惑。它们并没有使用藏医学的规则,而是不小心切换到了西方医学规则,甚至是中医规则,就像一个只会做披萨的大厨突然尝试做寿司,却用了披萨面团一样。这篇论文的研究内容,就是为了构建一个特殊的测试,来观察这些机器人究竟是如何以及为何犯下这种错误,以及它们在多大程度上“偏离”了真相。
这项研究的研究人员由来自中国和西藏的高校的张进(Jin Zhang)及其团队领导,他们创造了一个名为 TreeProbe 的新工具。把藏医学想象成一棵拥有深厚根基的巨大古树。该论文利用藏医学经典文献中的“医学之树”框架,构建了一个包含 4,719 个问题、涵盖 467 种不同疾病 的测试。他们不仅仅是问机器人一些简单的常识;他们还要求机器人解释疾病发生的原因、如何利用藏医学的“三因”(一个类似于平衡能量的概念)进行诊断,以及如何通过特定的饮食或草药进行治疗。
研究团队发现,即使是当今最聪明的机器人仍在挣扎。在测试中,表现最好的模型在多选题上的正确率也仅为 60% 左右。但真正的重点不仅在于它们答错了题目,更在于它们如何出错的。机器人的回答并非随机猜测;它们一致地向其他医学体系偏移。一些模型(如 Anthropic 的 Claude)倾向于转向西方的生物医学思维,而另一些模型(如一些中国模型)则向传统中医(TCM)偏移。这就像机器人有一个“默认设置”,覆盖了它们本应使用的特定藏医学知识。
研究人员还发现,机器人很擅长“装腔作势”。它们可以写出语法完美的流利藏文句子,但其中的医学建议往往是错误的,或者与其他体系混淆了。这就像一个机器人说着完美的法语,但在你询问法式菜肴时,却给了你一份德式菜谱。研究表明,这是因为机器人的训练数据中,西方和中国的医学理念比藏医学要常见得多。当机器人卡壳时,它会退回到它最熟悉的知识领域,从而无意中抹去了藏医学独特的逻辑。
简而言之,TreeProbe 充当了机器人的“诊断工具”。它向我们展示了,要让人工智能真正公平且对每个人都有用,我们不能仅仅喂给它更多的数据;我们必须教会它尊重并理解不同的认知世界的方式。这篇论文并不声称已经解决了这个问题,但它提供了第一份清晰的地图,标示出了机器人在哪里迷失了方向,从而帮助开发者在未来构建出更好、更具文化意识的人工智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。