Evaluating Vision-Language Models for Structured Information Extraction from Heterogeneous Multi-Page Laboratory Reports
本研究评估了视觉语言模型在从异构多页实验室报告中提取结构化数据方面的表现,发现虽然全文档处理具有更高的速度优势,但使用 Qwen2.5-VL 的逐页工作流在不同文档长度下实现了最高的准确性和稳定性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
医院每天都会产生海量的纸质和数字记录,从医生撰写的叙述性笔记到实验室测试的密集表格数据。为了让计算机能够帮助医生做出更好的决策,或帮助研究人员发现疾病模式,这些信息必须从图像和文本转化为机器可读的、干净且有组织的数据。这一过程被称为信息提取,长期以来一直是一个瓶颈,因为医疗文档非常杂乱。它们的形状、大小和格式各不相同;有些是清晰的数字文件,而有些则是旧纸张的模糊扫描件。此外,信息往往分散在多个页面中,测试名称、数值和单位以复杂的表格形式排列,且不同医院之间的布局也各不相同。
近年来,一种被称为“视觉语言模型”的新型人工智能应运而生,用以应对这一挑战。与只能阅读文本或只能识别图像的旧系统不同,这些模型可以同时观察文档的图像并理解其中的文字。它们能够通过一个数字在页面上的位置来判断该数字属于哪项特定测试,而不仅仅是因为它紧跟在某个单词后面。然而,尽管这些模型功能强大,科学家们仍未完全理解向它们输入这些复杂的、多页文档的最佳方式。计算机应该一次性查看整个十页报告,还是应该逐页进行检查?这个问题的答案决定了计算机是会遗漏重要细节,还是会浪费时间,而当这些数据被用于指导患者护理时,这种区别至关重要。
一组研究人员致力于通过一项使用真实世界实验室报告的对照实验来寻找答案。他们收集了来自两家主要供应商(Lal Pathals 和 Thyrocare)的脱敏测试结果,并制作了这些报告的数字版本和扫描版本。为了确保测试的公平性,他们准备了三种不同长度的文档:短篇单页报告、中篇五至六页报告,以及长篇达十页的报告。随后,他们使用两种领先的人工智能模型(Qwen2.5-VL 和 Llama 3.2 Vision)测试了处理这些文档的三种不同方法。第一种方法要求模型将整个报告视为单张图像;第二种方法要求模型逐页查看并汇总结果;第三种方法则使用不同的模型来逐页查看。
结果表明,呈现文档的策略与模型本身一样重要。当研究人员要求 Qwen2.5-VL 模型逐页处理报告时,它实现了最高的准确度,正确识别并记录了近 99% 的预期测试结果。这种方法在处理长文档时表现得尤为稳健;即使是包含十页数据的长文档,逐页处理法仍能保持 98% 以上的准确度。相比之下,当同一个模型被要求一次性查看整个十页报告时,其准确度显著下降至约 91%。当文档过长无法一次性看完时,该模型往往会遗漏出现在后几页的测试项目。
这种更高准确度的代价是时间。逐页处理法处理一份报告的时间大约是查看整个文档法的时间的两倍。虽然“完整文档法”速度更快,且在找到测试项时极其精确,但它确实无法看到隐藏在较长报告中的许多测试项。第三种工作流——即使用 Llama 3.2 Vision 模型逐页查看——表现最差。它耗时最长,平均每份报告处理时间超过 108 秒,并且经常生成错误的记录或遗漏数据,整体准确率低于 88%。这表明,仅仅将文档拆分成碎片是不够的;模型的特定智能程度与呈现方式同样重要。
研究还考察了文档质量对结果的影响。无论是干净的数字文件还是纸质文档的扫描图像,对表现最佳的工作流几乎没有影响。使用 Qwen2.5-VL 模型的逐页处理法在所评估的扫描条件下(包括短篇和中篇报告)保持了完美的准确度。这一发现表明,扫描件的物理质量不如向计算机喂入信息的策略关键。研究人员指出,医院报告的具体布局也会起到作用,其中一家供应商的报告比另一家的稍微容易处理一些,但总体趋势在两个来源中均成立。
最终,这项研究证明了不存在一种提取医疗报告数据的“最佳”单一方法。选择完全取决于用户的需求。如果一个医院系统需要快速处理数千份报告,并且可以容忍丢失一些稍后可以补录的细节,那么更快的“整篇文档法”可能比较合适。然而,如果目标是建立一个完整且可靠的每一项测试结果的记录,尤其是针对长篇且复杂的文档,那么较慢的“逐页处理法”则是更优的选择。研究结论指出,向人工智能系统呈现文档的方式是一个关键的设计决策,它直接影响着其生成的医疗数据的可靠性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。