Introducing HALC: A general pipeline for the systematic and reliable construction of prompts for automated coding with LLMs in the computational social sciences
本論文は、大規模言語モデルを用いた自動コンテンツ分析のためにプロンプトを系統的かつ確実に構築するように設計された汎用的なパイプラインであるHALCを紹介し、広範な実証的評価を通じて、多様なデータセット、言語、およびコーディングタスクにおけるその有効性を実証するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
社会科学において、研究者たちは人間によるコミュニケーションを理解するために、長らく緩やかで慎重なプロセスに依拠してきました。彼らは、新聞記事、政治演説、あるいはソーシャルメディアのコメントといった何千もの文書を読み、テキストが何を述べているかに基づいてそれらをカテゴリー分けします。これは内容分析と呼ばれます。数十年にわたり、最も信頼されてきた手法は、この分類を行うために人間の読者を雇うことでした。人間は柔軟であり、ニュアンスを理解することができますが、同時に、遅く、コストがかかり、労働時間の限界もあります。近年、大規模言語モデルとして知られる強力なコンピュータプログラムが登場しました。これらのプログラムは、人間の言語を読み書きする驚異的なスキルを備えており、この分類プロセスを自動化するという約束を提示しています。しかし、単にコンピュータにテキストを読んで分類させるだけでは、一貫性のない結果を招くことがよくあります。コンピュータは、同じテキストに対して二度尋ねられた際に異なる答えを出したり、研究者が意図している特定のルールを誤解したりすることがあります。中心となる課題は、研究者の注意深い人間によるルールを、精度を損なうことなく、コンピュータが確実に従える指示へとどのように翻訳するかという点でした。
ホーエンハイム大学の研究チームは、この問題を解決するための新しい手法を開発しました。彼らはこれをHALCと呼んでいます。彼らの目標は、科学者が推測に頼るのではなく、これらの強力なコンピュータモデルを使用して、体系的かつ透明性のある形でデータをコーディングできるステップ・バイ・ステップのパイプラインを作成することでした。研究者たちは、これらのコンピュータモデルは素晴らしいものである一方で、完璧ではないことを認めることから始めました。それらは予測不可能であり、そのパフォーマンスは、どのようにタスクを実行するよう指示されるかによって変化します。信頼できるシステムを構築するために、チームはまず大規模な予備研究を実施しました。彼らは気候運動に関する一連のコメントを取り上げ、コンピュータモデルにそれらを繰り返し読ませました。彼らは、最も一貫性と正確性の高い結果をもたらすのはどの「プロンプト(指示文)」の言い回しであるかを確認するために、何百通りもの異なる言い回しをテストしました。その結果、同じテキストを5回読み、最も一般的な回答を採用することで、結果が大幅に安定することを発見しました。また、コンピュータに教え込むための初期の人間によるデータの質が極めて重要であることも発見しました。もし「グラウンドトゥルース(正解となる根拠)」となる人間のデータが不安定であれば、コンピュータの結果も不安定になるのです。最も重要なことは、最善の指示は短かったり曖昧であったりするものではないという点でした。最も成功したプロンプトは詳細であり、コンピュータに自身の推論をステップ・バイ・ステップで説明させ、最終的な決定を正当化させるものでした。これは、まさに人間のコーダーが答えを書き留める前に問題について思考するプロセスと同じです。
これらの知見に基づき、研究者たちはHALCパイプラインを定式化しました。このプロセスは、特定の研究プロジェクトのための定義とルールが含まれた、標準的な人間作成のコードブックから始まります。コンピュータのために車輪を再発明するのではなく、研究者はこれらの人間のルールを直接、構造化されたプロンプトへと翻訳します。次に、このプロンプトを少量のデータに対してテストし、コンピュータの出力を元の人間のコーディングと比較します。もしコンピュータが人間の信頼基準に一致しない場合、研究者は単に新しい指示を推測して作るのではなく、より具体的な例を追加したり、定義を明確にしたりするなど、厳格なルールに基づいたプロセスに従ってプロンプトを洗練させ、再度テストを行います。このサイクルは、コンピュータが科学的に許容されるレベルの人間コーダーとの一致に達するまで繰り返されます。その段階に至って初めて、彼らはコンピュータを使用して全データセットを処理します。このアプローチは、コンピュータを単独で機能する魔法の箱としてではなく、人間の判断に対して注意深く較正(キャリブレーション)されるべきツールとして扱っています。
このシステムが現実世界で機能することを証明するために、チームはHALCパイプラインを全く異なる2種類のデータに適用しました。一つ目は、英語、ドイツ語、スペイン語で書かれた、5カ国からの膨大な政治政党の宣言集です。課題は、どの文章が移民について論じているか、そしてそれが国境管理に焦点を当てているのか、あるいは既に居住している人々の統合に焦点を当てているのかを特定することでした。二つ目のデータセットは、主要なドイツ企業30社の年次報告書で、文章のトーン(ポジティブ、ネガティブ、またはニュートラル)を判断することが目的でした。どちらの場合も、研究者は英語の指示をコンピュータに使用し、個別のプロンプトを必要とせずに異なる言語を理解するモデルの能力に依拠しました。結果は心強いものでした。政治テキストについては、コンピュータは元の人間コーダーに近い信頼性スコアを達成し、異なる言語や政治的文脈をうまくナビゲートしました。ビジネスレポートについては、複雑な推論のために設計された特定のタイプのモデルを使用した際に、コンピュータはさらに優れたパフォーマンスを示し、パイプラインが異なる種類のタスクに適応できることを示しました。
本研究は、大規模言語モデルは強力ではあるものの、単にタスクを与えれば完璧に遂行すると期待できるわけではないと結論付けています。それらには、出力の信頼性を確保するための構造化された体系的なアプローチが必要です。HALCパイプラインは、人間の専門知識とマシンのスピードとの間の溝を埋める方法を提供します。コンピュータの指示を確立された人間のルールに基づかせ、本格的な展開前に厳格にテストすることで、研究者は知見の妥当性を損なうことなく作業を自動化できます。著者らは、この手法によって自動コーディングのプロセスが透明かつ再現可能になり、他の科学者が指示がどのように構築され検証されたかを正確に確認できるようになると示唆しています。コンピュータモデルは進化し続けていますが、核心となる原則は変わりません。信頼できる自動化とは、人間の設計とマシンの実行との間の注意深いパートナーシップから生まれるものであり、最終的なデータが、あたかも人間のチームによって分類されたかのように堅実であることを保証するものなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。