When Literature Data Mislead Artificial Intelligence in Materials Discovery
本文表明,人工智能驱动的材料发现过程受到文献衍生数据集中系统性误差和歧义(例如文本与图表不匹配以及单位不一致)的显著影响,这些问题引入了结构化标签噪声,并使得改进可追溯报告和策展实践变得必要。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:科学家不再需要花费数年时间在实验室里一次又一次地测试材料。相反,他们要求计算机扫描数百万篇研究论文,寻找最佳数值,并预测哪些新物质最适合用于电池或太阳能电池。这就是人工智能在材料科学领域的承诺。其核心理念是,如果一台计算机能够阅读人类发表过的每一项实验,它就能学习物质行为的隐藏规律,并设计出完美的材料以满足我们未来的能源需求。但这一愿景依赖于一个脆弱的假设:即那些旧论文中记录的数字确实如其所言。如果一位科学家写道某种材料的导电强度为某一数值,计算机就会假设这个数字是真实、清晰且可直接使用的。
来自东北大学和东京大学的研究团队发现,这个假设是极其危险且错误的。他们仔细研究了科学家如何报告固态电解质的数据,这类特殊的材料允许离子在下一代电池内部移动。他们的调查表明,从科学文献中提取的数值不仅是略有偏差,而且在根本上具有误导性。问题并不在于原始科学家犯了错,而在于他们报告研究结果的方式往往具有歧义。一个数字在正文中可能是正确的,但在图表中却是错误的;或者单位可能发生了混淆,导致数值发生了百倍的变化。当人工智能系统抓取这些数字来构建模型时,它们在不知不觉中是在从一个扭曲的现实中学习,将模糊的描述视为硬性的事实。
研究人员首先将科学论文视为原始数据源,而非完成的故事。他们关注的是离子电导率,这是衡量电流通过固体材料难易程度的指标。这一数值对于判断一种材料是否足以胜任电池至关重要。在一个理想的世界里,研究人员测量该数值,将其记录下来,随后的人阅读并完全按照原样使用。但在现实中,从实验笔记到计算机数据库的路径充满了隐形的陷阱。该团队追踪了从原始文章到用于训练人工智能的精选数据库中的数千个报告值。他们发现,这一过程往往涉及对原作者意图的猜测,而这些猜测经常是错误的。
团队发现的一个常见问题是文本与图表之间的不匹配。科学家可能会在正文段落中写道某种材料在室温下的电导率为特定值,但当研究人员查看同一篇论文中的实际图表时,该温度下的数据点却讲述了一个不同的故事。正文中的数字可能比图表中的数值稍高或稍低。对于人类读者来说,这可能看起来像是一个微小的笔误或舍入误差。但对于将每个数字都视为精确事实的计算机而言,这造成了冲突。计算机不知道该信任哪一个数字。当这种情况在数百篇论文中反复发生时,数据库就会充斥着表面看起来正确、实则不可靠的冲突信息。
另一个主要的混乱来源是图表的标注方式。科学论文经常使用复杂的图表来展示电导率随温度变化的趋势。这些图表通常带有特定的坐标轴标签,但有时这些标签非常模糊甚至完全缺失。研究人员可能会绘制一个数值,却并未明确说明该数值代表的是原始电导率,还是该数值的某种数学变换。由于缺乏这种清晰度,两个阅读同一张图表的人可能会提取出两个完全不同的数值。团队展示了根据对坐标轴的不同解读,同一个数据点既可以被读作极高的电导率,也可以被读作极低的电导率。这些差异并非随机错误,而是遵循某种模式的结构性错误,使得计算机很难将其识别为错误。
最危险的错误涉及计量单位。在科学领域,电导率可以用不同的单位来报告,例如每厘米或每米。一个单位的差异就会导致数值产生百倍的变化。研究人员发现,有些论文明确说明了一个数值的单位,但图表或随后的数据库条目却将其视为另一种单位。由于这些数字看起来仍然符合物理常理——处于这些材料可能的物理范围内——错误便未被察觉。读取数据的计算机会接受错误的数值作为真理。在团队检查的一个具体案例中,一个数值被误解的方式导致了百倍的误差。一旦这个错误进入数据库,它就会被其他研究人员和机器学习模型复制和重复使用,像病毒一样在科学记录中传播。
该团队分析了大量关于凝胶型和无机固态电解质的论文。他们发现,文本与图表不匹配的情况在凝胶电解质中很常见,出现在他们检查的约百分之十的论文中。对于无机材料,问题则更加多样化,其中单位不一致是最频繁的问题。在十六个无机案例的样本中,研究人员识别出了二十五个独立的报告歧义实例。这意味着单篇论文可能包含多种类型的错误。数据表明,这些不仅仅是孤立的疏忽,而是科学成果交流中的一个结构性问题。即使是该领域的专家,在没有做出假设的情况下也难以正确解读数据,这表明该问题在当前的出版体系中根深蒂固。
研究人员认为,这不仅仅是图书管理员或数据库管理人员的问题,更是人工智能在科学领域发展的危机。机器学习模型的优劣取决于其喂养的数据。如果训练数据充满了隐藏的歧义和单位错误,模型就会学习到错误的模式。它可能会预测某种材料性能卓越,而实际上它毫无用处;或者它可能会错过一个突破性的候选材料。团队发现,这些错误表现为一种“结构化标签噪声”。不同于会被平均掉的随机错误,这些错误是持续且系统性的,这意味着它们可以使计算机的学习向特定方向产生偏差。其结果是一个看起来充满信心、实则存在根本缺陷的模型。
为了解决这个问题,作者提出了一个新的科学报告标准。他们建议研究人员必须对目前缺失的细节进行更明确的说明。每一个图表都应清晰注明正在绘制的内容以及所使用的单位。测量数值时的温度应该是精确的,而不仅仅是描述为“室温”。作者应当澄清一个数值是直接测量的,还是从曲线中计算得出的。这些看似微小、枯燥的细节,研究人员坚持认为它们是可靠科学的基础。如果没有这些细节,数据就无法被计算机或其它科学家安全地重复利用。
研究得出结论,科学数据的可靠性是一个基础设施问题,其重要性不亚于算法或计算机本身。随着科学向着由机器辅助发现新材料的未来迈进,人类的实验记录必须在真正的意义上实现“机器可读”。这意味着不仅要有数字,还要有明确、可追溯且一致的数字。研究人员强调,提高数据质量并非一项次要的编辑任务,而是下一代科学发现的前提条件。如果输入是有缺陷的,那么无论人工智能变得多么聪明,输出也将是有缺陷的。前进的道路需要一种文化的转变,即在价值观念中,报告的清晰度应与发现本身同样重要,从而确保科学的数字未来建立在坚实的基础之上。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。