← 最新の論文
💻 computer science

Extracting and Coding Digital Sustainability Data using Text Mining and AI: A Design Science Approach

本研究は、テキストマイニング、特化型辞書、および生成AIプロンプトを組み合わせた半自動的なアーティファクトを開発・検証するためにデザインサイエンス・アプローチを採用しており、それによって、専門家による手動コーディングとの高い一致度を維持しつつ、テキストソースからのデジタルサステナビリティデータの抽出およびコーディングの効率性とスケーラビリティを大幅に向上させている。

原著者: Thomas Abraham, Viet Dao, Nesreen El-Rayes

公開日 2026-08-08
📖 1 分で読めます☕ さくっと読める

原著者: Thomas Abraham, Viet Dao, Nesreen El-Rayes

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大な謎を解こうとしている探偵だと想像してください。その謎とは、「企業がいかにしてテクノロジーを用いて、地球と人々を助けているか」というものです。手がかりは、埃をかぶった屋根裏部屋に隠されているのではありません。企業が毎年作成する、何千ページにも及ぶ分厚くて退屈な報告書の中に埋もれているのです。これらの報告書は、テキストの巨大な図書館のようなものであり、「グリーン・データセンター」、「スマートセンサー」、「デジタル・エクイティ(デジタルの公平性)」といった言葉で満たされています。問題は、すべての報告書の全ページを人の手で読み進めることは、ストローで海水を飲もうとするようなもので、永遠に時間がかかり、最も重要な一滴を見逃してしまう可能性があるということです。これが「デジタル・サステナビリティ(デジタルの持続可能性)」の世界です。ここでは、コンピューターやソフトウェアがいかにして世界をより良くできるかを研究者が研究しています。しかし、全体像を把握するためには、これらの手がかりを見つけ出し、分類する必要があります。そこで、「テキストマイニング(コンピューターに読ませ、パターンを見つけさせる技術)」と、「生成AI(文章を書き、思考することができる超スマートなチャットボット)」の魔法が登場します。書類の山に溺れる代わりに、研究者たちは、自分たちが謎の解決に集中できるよう、ロボットのアシスタントに重労働を任せたいと考えているのです。

この論文は、まさにその「ロボットのアシスタント」を構築することについてのものです。研究者のトーマス・エイブラハム、ヴィエット・ダオ、ネスリーン・エル=レイエスは、「デザイン・サイエンス」と呼ばれる手法を採用しました。これは、簡単に言えば、「問題を解決するためのツールを作り、テストし、それを改良していく」という方法です。彼らの目標は、サステナビリティ報告書をスキャンして、関連するデジタル・サステナビリティのストーリーを抽出し、それらのストーリーを整理された論理的なカテゴリーへと分類できる、半自動的なシステムを作ることでした。彼らは単に推測したのではなく、その仕事を行うための3つの具体的な「アーティファクト(道具)」を構築しました。すなわち、探すべき言葉の特別な辞書、AIに考え方を教えるための指示書(プロンプト)、そしてそれらを組み合わせて使用するプロセス全体です。

まず、彼らは「発見」の部分に取り組みました。洞窟の中で特定の種類の宝物を探しているところを想像してみてください。ただ「宝物!」と叫ぶだけでは、たくさんの石や泥を拾うことになります。特定の地図が必要です。研究者たちは「デジタル・サステナビリティ辞書」を構築しました。これは、高度に調整された金属探知機のようなものです。彼らは過去の研究から数千もの言葉を読み込ませ、何が「デジタル・サステナビリティ」らしい響きなのかを学習させました。彼らは、バイオジェンやコカ・コーラといった企業の報告書を用いて、この辞書をテストしました。結果は目覚ましいものでした。コンピューターは、人間の専門家が手作業で見つけたデジタル・サステナビリティのストーリーの94%を見つけ出しましたが、それにかかる時間はごくわずかでした。さらに、人間が見落としていた54個のストーリーさえも見つけ出したのです!しかし、完璧ではありませんでした。コンピューターは時として、「ウェブサイト」のように、重要そうに聞こえるものの、実際にはサステナビリティの取り組みではない言葉に気を取られてしまうことがありました。このことは、コンピューターは優れたスキャナーではあるものの、依然として人間によるダブルチェックが必要であることを研究者に教えました。

次に、彼らは「分類」の部分に取り組みました。コンピューターがストーリーを見つけた後は、それらを正しい箱に入れる必要がありました。研究者は、確立された理論に基づいた2つの異なる「ファイリング・システム」を使用しました。一つのシステムは、テクノロジーが「何をするか」(例えば、プロセスの「自動化」やビジネスモデルの「変革」など)によってストーリーを分類するものであり、もう一つのシステムは、「誰が恩恵を受けるか」(例えば、「内部」対「外部」、あるいは「今日」対「明日」など)によって分類するものです。AIにこれらのファイリング・システムを使わせる方法を教えるために、彼らは単に単純なコマンドを与えたのではありません。「フューショット・プロンプティング(few-shot prompting)」というテクニックを用いました。これは、完成したパズルの例をいくつかAIに見せて、「このピースがここにどのようにフィットするか分かりますか?では、残りはあなたがやってください」と言うようなものです。彼らは3社のデータを用いてAIを訓練し、AIに間違いを犯させ、それを修正し、指示を洗練させることで、AIにコツを掴ませました。

この訓練されたAIを新しい企業(ジョンソン・エンド・ジョンソンやボルボなど)に対してテストしたところ、結果は強力なものでした。「何をするか」のカテゴリーにおいて、AIは人間の専門家の分類と78%の確率で一致しました。「誰が恩恵を受けるか」のカテゴリーでは、85.3%の一致を見せました。研究者たちは、二人の人間(あるいは人間とロボット)がどれだけ一致するかを測定する「コーヘンのカッパ係数(Cohen's Kappa)」というスコアを算出しました。スコアは0.7を超えており、これは高いレベルの一致度と見なされます。これは、AIが単に推測しているのではなく、実際に研究者の論理を学習していることを示唆しています。

しかし、この論文は、これがすべてを解決する「魔法の杖」であるとは断言していません。研究者たちは、このプロセスを完全に自動化することはできないという考えを明確に否定しています。AIは、ビジネスの文脈を理解するのに助けを必要とすることがあると分かりました。例えば、ある企業が数年間にわたって安全システムについて述べている場合、AIはそれを複数の異なるプロジェクトとしてカウントしてしまうことがありますが、人間はそれが一つの長いプロジェクトであることを理解できます。また、辞書も完璧ではなく、新しい言葉が登場するにつれて更新が必要な「生きているもの」です。著者たちの結論は、最善のアプローチは「パートナーシップ」であるということです。コンピューターは、重労働を行う超高速のリサーチ・アシスタントとして機能しますが、AIを訓練し、間違いを修正し、最終的な判断を下すためには、常に人間の専門家がプロセスに関与(ヒューマン・イン・ザ・ループ)していなければなりません。

結局のところ、この論文は、私たちは「人間の知恵」と「機械のスピード」のどちらか一方を選ぶ必要はないということを示唆しています。テキストマイニングと生成AIを、注意深く段階的な訓練プロセスと組み合わせることで、研究者は以前よりもはるかに速く、膨大なデジタル・サステナビリティのデータセットを構築できるのです。これは解決済みの問題ではありませんが、世界を救うという仕事を、少しだけ孤独ではなく、より効率的なものにする強力な新しいツールなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →