Measuring AI Readiness in Health Professions Education: Development and Validation of the AI Competence and Preparedness Evaluation Resource (AICPER)
本研究は、看護、薬学、および公衆衛生プログラムにおいて高い信頼性と構造的妥当性を示した、医療専門職の訓練生によるAIに対する機能的、倫理的、および教育的領域における認識を評価するために設計された多次元的な尺度であるAICPERの開発と厳密な心理計量的妥当性の検証を提示するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、将来の医師、看護師、そして公衆衛生の専門家となる学校全体に対し、新しい超スマートなロボット助手(AIアシスタント)の使い方を教えようとしていると想像してください。完璧なトレーニングマニュアルを作成する前に、学生たちがそのロボットについてどう考えているのかを正確に知る必要があります。彼らはそれを愛しているのでしょうか? それとも、ロボットがミスをすることを恐れているのでしょうか? 宿題にそれを使うことは「ズル」だと考えているのでしょうか?
長い間、こうした質問をするためのツールは、まるで温度を測るのに定規を使うようなもので、仕事には適していませんでした。それらはあまりにも単純すぎたり、特定の一種類の学生だけに焦点を当てていたり、あるいは「生成AI」(エッセイを書いたり画像を生成したりする種類のAI)が爆発的に普及する前に作成されたものだったりしました。
そこで登場したのが、AICPERです。これは、米国のヘルスケア系の学生のために特別に設計された、新しいハイテクな「AI態度温度計」だと考えてください。ラトガーズ大学の研究チームは、看護、薬学、そして公衆衛生の学生が人工知能(AI)に対してどのような感情を抱いているのかを正確に把握するために、このツールを構築しました。
大きな発見:重要なのは「どこで」ではなく「どのように」か
研究者たちが最初にAICPERを構築した際、彼らはAIが使用される3つの具体的な場所、すなわち臨床現場(病院)、研究(ラボ)、教育(教室)を測定していると考えていました。彼らは、回答がこれら3つの整然としたグループに分類されることを予想していました。
しかし、ここにひねりがありました。学生たちの脳は、そのようには分類しなかったのです。研究者が数値を分析したところ、「グループ」は場所ではなく、感情に基づいた3つの全く異なるカテゴリーへと再編成されました。
- 機能的利点(「クールなツール」要素): このグループは、学生がAIによって自分の仕事がいかに楽になり、速くなり、賢くなるかという度合いを測定します。これは、「このロボットは重い箱を運ぶのを助けてくれるか?」と尋ねるようなものです。
- 倫理と信頼(「懸念」要素): このグループは、恐怖心を捉えます。ロボットはミスをするのか? 偏り(バイアス)があるのか? 患者の秘密を預けても大丈夫なのか? これは、「このロボットは私の仕事を奪ったり、嘘をついたりするのではないか?」というグループです。
- 教育的エンゲージメント(「学びたい」要素): これは、AIに関連する学習への学生の関与度を測定します。これは、「これに関する授業を受けたい」というグループです。
この論文は、単に「病院でのAIについてどう思いますか?」と尋ねるよりも、この新しい3部構成の方が学生を理解する上ではるかに優れた方法であることを明らかにしました。ある学生は、AIは時間を節約するための素晴らしいツールだと考える一方で(高い機能的利点)、その倫理的リスクについては依然として恐怖を感じている(低い倫理と信頼)ということもあり得るのです。従来のツールではそのニュアンスを見逃してしまいますが、AICPERはそれを捉えることができます。
検証方法(「ストレス・テスト」)
この新しい温度計が実際に機能するかどうかを確認するために、研究者は単に推測したわけではありません。彼らは193人の学生と7人の専門家判定員による厳格なストレス・テストを実施しました。
- 専門家: 高度な学位を持つ7人のスマートな人々が、すべての質問をチェックし、その質問が適切であるかどうかを確認しました。彼らは質問が関連性があることに同意し、このツールに0.86という非常に優れた「内容妥当性」スコアを与えました。
- 学生: 看護、薬学、および公衆衛生プログラムの学生193名が調査に参加しました。
- 数学的検証: 研究者は、質問が適切にまとまっているかを確認するために、「探索的因子分析」や「確認的因子分析」といった高度な統計手法を用いました。結果はどうだったでしょうか? ツールは実に見事に耐え抜きました。内部一貫性スコアは0.86であり、これは質問が同じ潜在的な感情を信頼性高く測定していることを意味します。
数字が示すこと
この研究は単に「機能する」と言っただけではありません。具体的な数字で裏付けを行いました。
- 最終的なツールは18項目で構成されています(適合しなかった2つの質問は除外されました)。
- 3つの因子(機能的利点、倫理、エンゲージメント)は、それぞれ独立していますが、0.42から0.61の相関関係を持って関連しています。
- このツールは、看護、薬学、公衆衛生の学生に対して同様に機能します。研究者はグループ間の比較を行い、ツールの測定方法に差が極めて小さい(-0.001)ことを確認しました。つまり、看護師も薬剤師も同じ「言語」で質問に答えているということです。
それではないもの(「ノー」のリスト)
この論文が主張していないことも知っておくことが重要です。
- 魔法の杖ではありません: 論文では、一部のプロセスにおいてこれは「予備的な」ステップであると明記しています。彼らは、構造の発見と確認の両方に同じ学生グループを使用しました。結果の安定性を証明するために高度な数学(2,000回の繰り返しによるブートストラップ・リサンプリング)を用いましたが、別の学生グループでテストすることが次の必要なステップであると認めています。
- まだ完璧ではありません: 研究者たちは、一部の「逆転項目」(「いいえ」と答えることで「はい」を意味するような質問)が、データのノイズを生じさせていることに気づきました。これらの特定の回答における変動の約**24.8%**は、学生の意見ではなく、質問の言い回しに起因していました。彼らは、将来のバージョンでは、より明確にするためにこれらを言い換えるべきだと提案しています。
- まだ全員向けではありません: この研究には看護、薬学、公衆衛生の学生のみが含まれています。医学部生(将来の医師)については含まれていないため、このツールが彼らにとっても有効であるかどうかは、まだ断言できません。
結論
AICPERは、ヘルスケア系の学生がAIに対してどのように感じているかを測定することに成功した、厳格にテストされた18項目のツールです。それは、学生の態度は単に「どこで」AIを使うかではなく、「有用性」「信頼」「関与」という3つの核となる感情に基づいていることを証明しました。
研究者たちは、学校のリーダーが、学生が具体的にどこで躓いているのかを知るために、このツールを活用できると示唆しています。もしクラスが「利点」については理解しているが「倫理」については恐怖を感じているのであれば、その恐怖を解消するための特定のレッスンを構築できます。もし倫理観は高いがテクノロジーを学びたくないと考えているのであれば、異なる教授法を試すことができます。
この論文は、(さらなるテストが必要であるため)「最終的な解決策」とまでは呼んでいませんが、ヘルスケア教育におけるAIへの準備態勢という複雑な世界をナビゲートするための、最初の確かな検証済みマップを提供しています。それは、霧がかった推測を、明確で三次元的な図へと変えるものなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。