Towards Conversational Medical AI with Eyes, Ears and a Voice
本論文は、リアルタイムの音声・視覚データを活用して医療意思決定を支援し、主要な遠隔医療指標において医師と同等の性能を示すマルチモーダル会話型 AI システム「AI 共臨床医」を紹介するとともに、安全な高リスク診断 AI には協働的な三項モデルが不可欠であることを強調する。
原著者:Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, AniruddhMeet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno
原著者: Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno
医療実践は、熟練した対話だけでなく、医師と患者間の豊かな聴覚的・視覚的手がかりの微妙な交換と解釈にも依存している。大規模言語モデル(LLM)はテキストベースの診断相談において著しく進歩したが、対面または遠隔医療コミュニケーションの本質的なリアルタイムの視聴覚的微妙さを統合するには至っていない。現在のテキストのみのアプローチは、アクセスのしやすさ(例えば、視力が低下している患者、言語の壁、または識字率の低い患者)に課題を呈し、「誘導された身体診察」の複雑さや非言語的兆候(歩行、感情、皮膚科的兆候など)の観察を捉え損なっている。さらに、既存の対話型 AI の評価は、しばしば客観的構造化臨床試験(OSCE)に由来するグローバルな評価基準に依存しており、痛みの場所の誤解や苦痛の微妙な視覚的兆候の見落としなど、視聴覚領域における安全上重要なエラーを検出するために必要な症例固有の粒度が欠けている可能性がある。
方法論
システムアーキテクチャ:AI 共臨床医
著者は、Gemini ファミリーのモデルと Project Astra を基盤とした、史上初の対話型 AI システム「AI 共臨床医」を紹介する。低遅延の共感的相互作用と深層かつ構造化された臨床推論という相反する要件に対処するため、このシステムは二重エージェントアーキテクチャを採用している:
協調モデル: 著者は、高リスクのリアルタイム診断 AI は、自律的な診断医としてではなく、医師と患者をサポートする共臨床医として機能する協調的/三角的モデルにおいて最も安全に進展すると結論付けている。トリアージや鑑別診断などの特定の領域ではシステムが人間のパフォーマンスに近づいているが、身体診察や疾患固有の推論には依然として格差があり、人間の監督が必要である。