← 最新论文
🤖 machine learning

Scaling Electronic Health Record Foundation Models for Population Health Management

本文介绍了一种可扩展的电子健康档案基础模型,该模型通过利用来自美国和台湾超过 500 万名患者的数十亿次跨站点医疗事件进行预训练,并通过利用统一的代码对齐框架和计算最优缩放,在预测 11 种慢性疾病方面展现出比现有模型更优越的性能和泛化能力。

原作者: Liwen Sun, Hao-Ren Yao, Ophir Frieder, Xiang Qian, Chenyan Xiong

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Liwen Sun, Hao-Ren Yao, Ophir Frieder, Xiang Qian, Chenyan Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当今的醫療系統運作起來往往像是一群孤立的島嶼。一位患者可能在一個城市看專科醫生,在另一個城市做檢查,並在第三個城市開處方箋,而每個地點都保留著各自獨立的記錄。這種碎片化使得很難看到一個人健康的完整全貌。當醫生無法輕易地將這些點連結起來時,他們可能會錯過嚴重長期疾病(如心臟病或癌症)的早期預警信號。當這些疾病被檢測出來時,通常已經進入晚期,需要昂貴且密集的治療。人群健康管理(population health management)的目標就是通過觀察大量的患者數據來解決這個問題,從而在人們感到生病之前發現那些處於風險中的人,從而實現早期的、挽救生命的干預。

為了實現這一目標,研究人員轉向了電子健康紀錄(EHR),即患者每一次就診、檢查和用藥的數位日誌。然而,這些紀錄並非使用單一、通用的語言書寫。一家醫院可能會為某種常見程序使用特定的代碼,而另一家位於不同國家的醫院則會對完全相同的事情使用完全不同的代碼。這種不匹配使得訓練電腦系統從不同地區的數據中學習變得幾乎不可能。一項新研究介紹了一個名為 EHR-FM 的解決方案,這是一個大型計算模型,旨在閱讀並理解無論來自何處的醫療記錄。通過學習來自美國和台灣超過 500 萬名患者、涉及數十億次醫療事件的數據,該系統學會了識別預示慢性疾病發作的細微模式,即使這些數據來自兩個截然不同的醫療世界。

研究人員面臨的核心挑戰不僅僅是數據的巨大容量,還有不同編碼系統所造成的混亂。想像一下,你正在學習一門新語言,其中「心臟病發作」這個詞在每一本書中的拼寫方式都不一樣。在醫療記錄中,一種藥物或程序根據當地的計費系統的不同,可能有數百種不同的名稱。為了修復這個問題,團隊構建了一個翻譯器,在電腦看到這些數據之前,將所有不同的代碼轉換成單一、統一的語言。他們結合了官方醫學詞典和先進的人工智能技術,將數千個本地代碼映射到標準的國際代碼上。這使得他們能夠將來自台灣和美國的記錄合併成一個龐大且連貫的數據集,其中包含近 100 億次醫療事件。

利用這些統一的數據,研究人員訓練了一個大型基礎模型(foundation model),這是一種從大量信息中學習通用規則的人工智能。他們測試了模型的性能如何隨著其規模和所見數據量的增加而變化。他們發現模型遵循一個可預測的模式:隨著他們增加計算能力和數據量,模型的表現變得顯著提升。他們構建了從非常小到超過 20 億個參數(衡量其複雜度和學習能力的指標)不等的不同版本的模型。經過跨國數據訓練的最大版本,在預測重大疾病的發作方面展現出了卓越的技能。

在現實場景的測試中,該模型展示了識別患者在未來一年內是否會發展出癌症、心力衰竭或中風等疾病的非凡能力。在美國,該模型在保持極低誤報率的同時,針對未來心臟病病例實現了 0.4 的 AUC 值。在台灣的數據中,它在保持同樣高準確度的情況下,針對未來病例實現了 0.7 的 AUC 值。這種高靈敏度對於人群健康至關重要;這意味著系統可以標記高風險個體以進行進一步篩查,而不會因過多的錯誤警告而使醫生應接不暇。該模型的表現優於依賴簡單規則的傳統計算程序,也超越了其他僅在單一地點數據上進行訓練的先進人工智能模型。

或許最令人震驚的發現是,該模型在處理其從未見過的數據時表現得如何。當在斯坦福大學一個完全不同的患者記錄集上進行測試時(該集使用了不同的編碼系統並涵蓋了不同的群體),模型的表現仍然優於之前的尖端系統。這表明,通過學習多樣化的混合數據,該模型開發出了一種超越局部差異的人類疾病深層理解。研究人員還發現,僅僅重複複製相同的數據來擴大數據集,並不像添加來自不同地區的新穎、多樣化數據那樣能有效幫助模型學習。這表明信息的「多樣性」與「數量」同樣重要。

這項研究證實,通過統一全球範圍內的醫療記錄,構建強大且具擴展性的慢性病預測工具是可行的。研究人員展示了通過對齊不同的編碼系統,我們可以創建一個從全球數百萬患者的集體歷史中學習的模型,從而識別那些可能被忽視的風險。雖然該模型目前還不能取代醫生的判斷,但它提供了一種優先處理護理的新強大方式。通過及早標記高風險個體,醫療系統可以從「對疾病做出反應」轉向「預防疾病」,從而潛在性地挽救生命並減輕醫療資源的負擔。研究人員已將其代碼公開,希望這種方法能有助於建立一個無論人們生活在何處,都能獲得主動式、數據驅動型護理的未來。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →