Economic Evaluations of Language Models
本論文は、米国のあらゆる職業における言語モデルの時間節約の可能性を評価する、費用対効果の高いオープンソースの評価スイートおよびシミュレーションフレームワークであるEconEvalsを紹介するものであり、現在のモデルは全職種のほぼ半分に多大な影響を与え得る一方で、その実際の導入は技術的な能力ではなく、プライバシーへの懸念やプロプライエタリなシステムの障壁によって現在は制限されていることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能の世界を、本が日々賢くなっていく、巨大で賑やかな図書館だと想像してみてください。長い間、司書たち(科学者たち)は、新しい超スマートな本に対して、数学のパズルを解かせたりコードを書かせたりして、テストを行ってきました。それは、新しい車がレーストラックで勝てるかどうかを確認するようなものです。しかし、ここでの問題は、現実の世界はレーストラックではないということです。現実の世界は、配管修理から病院の管理まで、人々が何千もの異なる仕事に従事している、乱雑で複雑な都市なのです。ここで誰もが問いかけている大きな疑問は、「もしこれらのAIという本がこれほど賢いのであれば、実際の仕事において、どれほど私たちの役に立つのだろうか? それとも、ただ棚に置かれたままになるのだろうか?」ということです。
これに答えるためには、いくつかのことを理解する必要があります。第一に、「ベンチマーク」があります。これはAIのための標準化されたテストのようなものです。もしAIが高いスコアを獲得すれば、それは特定のテストにおいて優れていることを意味します。第二に、「エクスポージャー(露出)」があります。これは「ある労働者の一日のうち、どの程度をこのAIが肩代わりできるか?」と問う、少し凝った言葉です。そして最後に、AIが「テストでできること」と、それが「現実の世界で実際にすること」との間にあるギャップです。私たちがこれを重視するのは、答えを知らなければ、未来の計画を立てられないからです。私たちは、AIが明日すべてを変えると考えるかもしれませんし、あるいは、AIが何も変えないと考えるかもしれません。そのどちらの推測も、間違っている可能性があるからです。
そこで、スタンフォード大学とサンパウロ大学の研究チームが、推測をやめて測定を開始することにしました。彼らは、ECONEVALSと呼ばれる新しいオープンソースのツールキットを構築しました。このツールキットを、アメリカの労働市場全体を描いた巨大なデジタル地図だと考えてください。ソフトウェアエンジニアのような一部の人気のある職業だけを見るのではなく、彼らは1,000以上の異なる職業をマッピングし、それらを1万9,000近い微細なタスクへと分解しました。それは、「電話に答える」ことから「橋を設計する」ことまで、労働者が行うあらゆる物事をズームアップして観察できる顕微鏡を持っているようなものです。
チームは難しい問題に直面しました。それは、実社会の人間が仕事をしている時に実際にAIに何を求めているのかを知る必要があるということですが、そのようなデータの多くは非公開であることです。そこで、彼らは二つのことを行いました。まず、数百万件の公開された会話を掘り下げ、現実の仕事に関連する質問を見つけ出しました。次に、特定の仕事に関する実データが見つからない場合には、「合成(シンセティック)」データを作成しました。想像してみてください。ロボットの俳優が、看護師、教師、あるいは建設作業員の役になりきって、自身の日常的なタスクについてAIに助けを求める様子を。彼らは、この実データとロールプレイによるデータの混合を用いて、10種類のAIモデルをテストしました。
結果はどうだったでしょうか? その結果は、まるで「ポテンシャル(潜在能力)対リアリティ(現実)」の物語のようです。研究者たちは、現在のAIモデルが仕事のサポートにおいて非常に優れていることを発見しました。実際、彼らのシミュレーションによれば、**全米の全職業の47%**において、AIは労働者の日常的なタスクの少なくとも半分において、大幅な時間を節約できる可能性があることが示唆されています。これは、労働力における極めて大きな割合です!
しかし、ここにひねりがあります。AIがその仕事を「できる」からといって、人々がその仕事のためにAIを「使っている」とは限らないのです。チームは、AIが理論的に多くの時間を節約できるはずのタスクのうち、**79%**において、人々がClaudeのようなツールを実際にはあまり活用していないことを発見しました。それは、ガレージに時速200マイルで走れるフェラーリがあるのに、スピードへの恐怖やギアの入れ方を知らないために、郵便受けまでしか運転していないようなものです。
では、何が私たちのAI利用を妨げているのでしょうか? 研究者たちは、なぜAIが特定のタスクにおいて時間を節約できないのかを正確に分解する特別なシミュレーションを行いました。彼らは、最大のボトルネックはAIが「バカすぎる」ことではなく、現実の世界が「複雑すぎる」ことであると発見しました。AIがまだ十分に役立てられない主な理由は以下の通りです:
- 物理的な動作: AIはハンマーを握ったり、漏れた配管を修理したりすることはできません。
- プライバシー: AIに個人の医療記録や法的書類を読ませることはできません。
- 独自のシステム: 多くの企業は、AIが接続できない古い秘密のソフトウェアを使用しています。
- ライブな相互作用: AIは、状況が瞬時に変化するリアルタイムの対面コミュニケーションに苦戦します。
また、論文では彼らの新しい詳細な手法を、従来のAI測定法と比較しました。古い手法は、スーパーパワーのリストを見て「このAIは何でもできる!」と言っているようなものでした。新しい手法は、実際にAIが仕事に取り組む様子を観察し、どこで躓くのかを見ることに似ています。彼らは、古い手法が非常に楽観的であり、AIが**68%の仕事に貢献できると予測していたのに対し、彼らのより現実的なシミュレーションでは、その数値は47%**に近いことを発見しました。
要約すると、この論文は、AIは私たちの仕事の多くを助ける準備ができている強力なツールであるが、プライバシー規則や物理的な手が必要であるといった現実世界の障害のために、私たちはまだそれを使いこなせていないということを伝えています。研究者たちは、AIがより賢くなるにつれて更新可能な、地図と物差しを構築しました。これにより、単なる推測ではなく、テクノロジーが次にどこに着地するかを正確に理解できるようになります。彼らは、AIが経済を解決したと言っているのではなく、どこにロードブロック(障害)があり、どこにオープンなレーン(開通した道)があるのかという、より明確な全体像を提示したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。