ARISMA: Guidelines for AI- and LLM-Assisted Systematic Reviews, Scoping Reviews, and Mapping Studies
本論文は、システマティックレビュー、スコーピングレビュー、およびマッピング研究において、手法の厳密性と説明責任を確保するために、AIおよび大規模言語モデルを監査可能かつ人間が監督するアシスタントとして統合するための原則、ライフサイクル分類、および報告基準を確立する包括的なガイドライン・フレームワークであるARISMAを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
科学研究の世界には、「システマティック・レビュー」と呼ばれる特定の種類の仕事があります。例えば、ある新しい薬が古い薬よりも効果があるかどうか、あるいは気候変動に関する現在の知識の状況はどうなっているのかといった、複雑な問いに答えようとする専門家チームを想像してみてください。これを行うためには、単に興味深い論文を数本読むだけでは不十分です。そのトピックに関してこれまでに発表されたすべての関連研究を見つけ出し、それらすべてを読み、その知見を一つの信頼できる結論へと統合しなければなりません。このプロセスは現代の医学や政策の基礎となっていますが、非常に困難な作業です。科学論文の数が毎年増加するにつれ、それらすべてを見つけ出し、読むという作業は、より遅く、より高価で、最新の状態を維持することがより困難になっています。
近年、人工知能(AI)として知られる強力なコンピュータプログラムが登場しました。これらのツールはテキストを読み、言語を理解し、人間には到底及ばないスピードで情報を要約することができます。研究者たちは、論文を見つけ、どの論文を残すべきかを判断し、重要な数値を抽出するのを助けるために、これらのツールを使い始めました。しかし、この新しいスピードは問題をもたらしました。これらのツールを安全に使用するための明確なルールが誰も持っていなかったのです。もしコンピュータプログラムが極めて重要な研究を見落としたり、数字の読み取りに間違いを犯したりすれば、レビュー全体が誤ったものになり、それに依拠する医師や政策立案者が誤った判断を下すことになりかねません。問題は、これらのツールが機能するかどうかだけでなく、いかにして科学へのコントロールを失うことなくそれらを使用するかということになったのです。
南デンマーク大学の研究チームは、この問題を解決するために「ARISMA」と呼ばれる新しいガイドラインを提案しました。彼らの取り組みは、人工知能を人間の科学者の代わりとして扱うものではありません。むしろ、それは常に監視され、テストされ、記録されるべき「非常に有能な助手」であると位置づけています。核心となる考え方はシンプルですが厳格です。科学的レビューにおけるあらゆる重要な決定は、理解可能であり、検証可能であり、最終的には人間の責任でなければならないということです。研究者たちは、機械は重労働をこなすことはできるものの、何が証拠としてカウントされるかを密かに決定させることは許されないと主張しています。
この論文は、これらのツールを使用してレビューが行われる際の完全なライフサイクルを概説しています。それは計画段階から始まります。ここでは、コンピュータが関与する前に、人間のチームが何を求めているのかを明確に定義しなければなりません。ガイドラインは、人工知能が検索用語のブレインストーミングやトピックの類義語の提案において非常に役立つ可能性があることを示唆していますが、最終的な検索戦略は人間の専門家によってチェックされなければなりません。研究者たちは、もしテスト走行中にコンピュータが既知の重要な研究を見落とした場合、その検索戦略は失敗とみなされ、実際のデータに使用する前に修正されなければならないと強調しています。これにより、検索が単に速いだけでなく、完全であることを保証します。
検索が完了すると、チームは数千のタイトルと抄録をスクリーニングし、どの論文を全文読むべきかを判断するという膨大な課題に直面します。こここそが人工知能が最も有望な成果を示している場面ですが、同時にガイドラインが最も慎重になる場面でもあります。論文によれば、コンピュータは論文の順位付けを行ったり、除外すべき論文を提案したりすることはできますが、単独で最終決定を下すことはできません。研究者たちは「信頼レベル」というシステムを提案しています。信頼度が低いシナリオでは、コンピュータは人間が読むための順序を提案するだけです。中程度の信頼度のシナリオでは、除外を推奨することもありますが、人間がその推奨事項のすべてをチェックしなければなりません。医療行為を導くようなハイステークス(利害関係の大きい)なレビューにおいては、コンピュータは単なる「第二の目」として機能し、最終的な判断は人間のチームが行います。決定的なのは、コンピュータがこれらの作業を行う前に、人間がすでに採点した少数の論文セットを用いてテストされなければならないということです。もしコンピュータがこのテストセットで多くの間違いを犯した場合、その進行は許可されません。
ガイドラインはまた、論文から患者数や治療結果などの具体的な数値を抽出するという、非常に難しい作業についても触れています。ここで、研究者たちはさらに保守的になります。彼らは、コンピュータは一般的な記述を見つけることは得意ですが、表の中や複雑な文章の中に隠された正確な数値については苦戦することが多いと指摘しています。論文は、コンピュータは記述的な詳細を含むドラフト(草案)を作成することはできるものの、最終的な結果を算出するために使用されるすべての数値は、人間によって一行ずつチェックされなければならないと提案しています。もし人間がその数値の根拠を検証しなければ、その数値はレビューで使用することはできません。このルールは、コンピュータがもっともらしいが元のテキストには存在しない事実を捏造する「ハルシネーション(幻覚)」を防ぐためのものです。
プロセス全体を通じて、ガイドラインは「証跡(ペーパー・トレイル)」を要求します。コンピュータツールが使用されるたびに、研究者はどのツールを使用したか、ソフトウェアのバージョンは何であったか、どのような指示を与えたか、そして出力結果はどうであったかを記録しなければなりません。もしコンピュータが間違いを犯したり、あるいは人間チームがコンピュータの動作方法を変更したりした場合、その変更には日付を付け、説明が加えられなければなりません。これにより、レビューの履歴が作成され、最終報告を読む誰もが、どこでコンピュータが助け、どこで人間が主導権を握ったのかを正確に把握できるようになります。また、論文は法的および倫理的な側面にも触れており、チームはプライベートなデータや未発表のデータを公開されているコンピュータサービスに送信することについて注意しなければならないと警告しています。そうしたデータは、チームの意図しない方法で保存されたり利用されたりする可能性があるからです。
研究者たちは、科学者や情報スペシャリストを含む21人の分野の専門家と対話することで、これらのガイドラインを開発しました。彼らは、アイデアをテストし、フィードバックに基づいてそれらを洗練させ、ルールを実践的かつ明確にすることに注力しました。その結果、人工知能のスピードを活用しながら、科学的レビューに求められる正確性と信頼性を損なわないための枠組みが完成しました。論文は、目標はレビューを完全に自動化することではなく、より「監査可能(オーディタブル)」にすることであると結論付けています。人工知能を自律的な意思決定者としてではなく、検査され境界を定められた「道具」として扱うことで、ガイドラインは、真実に対して常に人間が責任を負う形で、レビューの最終的な結論が検証された証拠に基づいたものとなることを保証しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。