OpenMHC: Accelerating the Science of Wearable Foundation Models
本論文は、ウェアラブル・ヘルスAIの研究を民主化し加速させるため、約12,000人の参加者から得られた6,000万時間を超えるウェアラブル・ヘルスデータを含む包括的なオープンアクセスのデータセットであるOpenMHC、ならびに基盤モデルのオープンソース実装と統一されたベンチマークを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたのスマートウォッチが、眠ることのない、小さく、疲れを知らない探偵であると想像してみてください。一分ごとに、それはあなたのスマートフォンへ秘密をささやきます。どれだけの歩数を歩いたか、心拍数がどれほど速くなったか、どれほど深く眠ったか、そして階段を何段登ったかさえも。長年、科学者たちはコンピュータにこれらの「ささやき」を聞き取らせ、私たちの健康をより良く理解させる方法を教えてきました。彼らはこれらの超スマートなコンピュータを「基盤モデル(foundation models)」と呼んでいます。これらは、世界中のあらゆる料理を味わってきたマスターシェフのようなものだと考えてください。一度味を知れば、新しいレシピを考案したり、悪い食材を瞬時に見つけ出したりすることができます。しかし、ここに問題があります。マスターシェフになるには、大量の食材が詰まった巨大なキッチンが必要です。ヘルスケアデータの世界では、最大のキッチンは大手テック企業によって閉ざされた扉の向後にあり、研究者たちには、ごく小さな、空っぽの食器棚しか残されていませんでした。データが十分になければ、これらのAIシェフは、私たちの体がどのように動き、感じているのかという物語の全貌を学ぶことはできないのです。
ここで、スタンフォード大学やインペリアル・カレッジ・ロンドンなどの研究チームが、巨大な鍵を持って登場しました。彼らは、10年以上にわたって実施されているデジタルヘルス実験「My Heart Counts」への扉を開放しました。彼らが公開しているのは、OpenMHCと呼ばれる宝の山です。これは単なる軽い軽食ではありません。約12,000人のウェアラブルデータからなる、6,700万時間以上のデータの饗宴です。これには、iPhoneやApple Watchから収集された歩数、心拍数、睡眠パターン、ワークアウトのログなど、あらゆるものが含まれています。この巨大なデータセットとともに、彼らは「レシピ(コード)」と、それをテストするために構築した「訓練されたシェフ(AIモデル)」も共有しています。彼らの目的は、誰もが、どこでも、健康問題の予測や、欠損データの補完、あるいは私たちの体が明日どのように振る舞うかを予測する新しい方法を「料理」できるようにすることです。
材料に関する重要な注意点: 料理を始める前に、このキッチンにはいくつかの特有の癖があることを知っておく必要があります。データを提供した人々は主に米国居住者であり、グループは30代後半の白人男性に偏っています。これは、AIが学ぶ「味」が、世界中の他の人々にとって必ずしも正しく感じられない可能性があることを意味します。また、これはデジタル研究であったため、すべての健康情報(糖尿病の有無や幸福感など)はユーザーによる自己申告に基づいています。これはラベルに「ノイズ」や不確実性を導入することになり、AIが完璧なパターンを学習することを難しくする可能性があります。最後に、このAIは、収集されたデータに基づいた時点での健康特性を検出するように設計されており、来年の心臓発作のような将来の医療イベントを予測するためのものではありません。
大いなる発表:彼らが見つけたもの
研究者たちは単にデータを投げ出したのではありません。彼らは、どのAIモデルが実際にデータ sense(意味)を理解できるかを見るために、巨大な遊び場を作りました。彼らは主に3つの課題を設定しました。
- 予測: AIは、ウォッチのデータを見るだけで、あなたの健康特性(糖尿病の有無や幸福度など)を推測できるか?
- 補完(空白を埋める): シャワーを浴びたり充電したりするために人はウォッチを外すため、データには穴があります。AIは、その欠落した数分間に何が起きていたかを推測できるか?
- 予測(フォアキャスティング): AIは、次の24時間のあなたの活動がどのようになるかを予測できるか?
以下が彼らの発見です:
1. 「専門のシェフ」が勝つが、「単純な料理人」も依然として手強い
さまざまなAIモデルをテストしたところ、LSM-2(ウェアラブルデータに特化して訓練された基盤モデルの一種)と呼ばれるモデルが、総合的に最高のシェフであることがわかりました。それは、健康状態の予測や欠損データの補完において最も一貫していました。しかし、研究者たちは驚くべき発見をしました。非常に単純で古いスタイルのモデルであるXGBoost(非常に整理されたルールベースの計算機のよう)が、非常に僅差で2位に入ったのです。実際、いくつかのタスクでは、単純なモデルは洗練されたAIと同じくらい優れた性能を発揮しました。これは、巨大なAIは強力ではあるものの、「より複雑であること」が常に「より優れていること」を意味するわけではないことを示唆しています。時には、よく調整された単純なツールが素晴らしい成果を上げるのです。
2. 大規模言語モデル(チャットボットのようなもの)は苦戦した
チームは、エッセイを書いたりチャットしたりする大規模言語モデル(LLM)を使用して、これらの健康のパズルを解こうと試みました。彼らはデータをテキストやグラフの画像としてモデルに投入しました。結果はどうだったでしょうか? これらの巨大なチャットボットは、一般的に、特化したヘルスケアモデルや、単純な計算機よりも性能が劣っていました。心拍数や歩数の特定の「言語」を読み取るには、汎用的なツールよりも、特化したツールの方がはるかに適しているようです。
3. 長期的な記憶が役立つ
欠損データを補完(補完)する場合、単一の日のデータだけを見るモデルよりも、数日間にわたるユーザーの履歴を見ることができるモデルの方がはるかに優れた結果を出しました。これは、誰かが今何をしているかを推測するようなものです。もしその人を1分間しか見ていなければ、間違えるかもしれません。しかし、その人が通常午後6時にランニングに行くことを知っていれば、より賢い推測ができるのです。論文は、ユーザーの長期的な履歴を使用することが、モデルをよりスマートにするための鍵であることを示唆しています。
4. 公平性が重要である
研究者たちは、モデルがすべての人を平等に扱っているかどうかも確認しました。彼らは、高度なAIモデルは正確ではあるものの、単純なモデルと比較して、特定のグループ(異なる年齢層や性別など)に対してより大きなミスを犯すことがあることを発見しました。これは、健康ツールを構築する際、多数派だけでなく、すべての人に対して公平に機能するようにしなければならないという重要な教訓です。
なぜこれがゲームチェンジャーとなるのか
この論文が出る前は、ウェアラブルのヘルスケアデータを理解するAIを構築しようとしても、行き詰まっていました。データを入手できず、大手企業がどのようにモデルを訓練しているのかを見ることもできませんでした。それは、コックピットを一度も見ることなく、飛行機の操縦を学ぼうとするようなものでした。
OpenMHCは、全員にコックピットと、フライトマニュアル、そしてトレーニングシミュレーターを与えることで、その状況を変えました。13年間にわたる11,894人の参加者のデータを、モデルを実行するためのコードとともに公開することで、著者たちはこの分野を民主化しました。彼らは、まだすべての健康の謎を解明したと主張しているわけではありません。実際、自己申告データの性質上、いくつかの疾患については、AIが単純な基準値を上回るのに苦労していることも認めています。しかし、彼らは科学コミュニラが実験を開始し、料理を作り、そして願わくば、私たちを健康に保つための新しい方法を発見するための基礎を提供しました。キッチンは今、開かれました。そして、材料は誰でも使える状態で用意されています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。