Generative AI systems conflate two distinct pregnancy-dating algorithms
这项研究表明,生成式人工智能系统经常混淆两种不同的孕期计算算法,从而导致显著的计算错误和误标,这凸显了医疗人工智能透明披露其计算路径的紧迫需求。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图烘焙一个需要整整 280 天才能发酵完成的蛋糕。你有两种不同的配方来计算蛋糕何时准备好。长期以来,大家都认为这两个配方是完全相同的双胞胎。
配方 A(“日历捷径”): 这是老派的方法,被称为内格勒法则(Naegele's Rule)。它就像一个心算小技巧:“在日历上回退三个月,然后加上七天。”它快速、简单,可以在脑中直接完成,并且已经被使用了 200 多年。
配方 B(“精确计数”): 这是 280 天计数法。它就像数清沙漏里的每一粒沙子一样。你只需在起始日期基础上增加 280 天,无论你经过的月份有多少天。
问题所在:双胞胎并非同胞
本文的作者发现,这两个配方其实是表亲而非双胞胎。因为我们的日历很奇特(有些月份有 30 天,有些有 31 天,而且二月有时会有 29 天),“日历捷径”并不总是与“精确计数”落在同一天。
他们针对从 1812 年到 2025 年的每一天进行了测试。他们发现,在 56% 的案例中,这两个配方给出的到期日是不一样的。快捷方式通常比精确计数晚 1、2 甚至 3 天;它从未给出更早的日期,只是向后漂移了。
最大的麻烦发生在怀孕过程跨越闰日(2 月 29 日)时。在这种情况下,两个配方永远不会达成一致。精确计数包含了那个额外的天数,但日历捷径却直接跳过了它。
AI 的错误:“糊涂厨师”
研究人员随后要求五种流行的 AI 系统(如 ChatGPT、Claude 和 Gemini)扮演这些“烘焙师”并计算这些到期日。他们想看看 AI 是否知道这两个配方的区别。
结果如下:
- 优秀的烘焙师: 其中两个 AI 系统意识到这两个配方是不同的。它们给出了正确的答案并解释道:“如果你使用快捷方式,你会得到 X 日,但如果你精确计数 280 天,你会得到 Y 日。”
- 糊涂的烘焙师: 另外三个 AI 系统搞错了。它们表现得像是正在使用“日历捷径”(比如说着“我减去了三个月并加上了七天”之类的话),但随后却在暗中使用了“精确计数”的数学逻辑来给出不同的答案。或者,它们声称这两种方法是同一回事,而事实显然并非如此。
这就像一位厨师告诉你:“我正在遵循快捷配方,”但实际上却在偷偷用秤来称量食材以获得不同的结果。它们将自己描述的方法与实际使用的计算方法混淆了。
这为什么重要?
作者指出,对于单次怀孕而言,1 到 3 天的差异并不构成医疗灾难。婴儿自然会在很长一段时间内出生。
然而,这项研究将怀孕日期计算作为一个测试案例,旨在展示 AI 存在的一个更大问题。AI 并不是在进行“思考”或逻辑推理;它只是根据在教科书中看到的模式进行预测。由于旧教科书混淆了这两个配方,AI 也学会了这种混淆。
论文得出结论:如果一个 AI 工具要为你提供医疗计算,它必须对其如何得出答案保持诚实。它不应只给出一个数字,而应该说明:“我使用了精确的 280 天计数法,”或者“我使用了日历捷径”,这样你才能确切知道你得到的是什么。如果一个 AI 连怀孕中这两个简单的数学规则都无法区分,那么在未来进行类似的、更危险的计算时,也可能会犯类似的错误。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。