A Primer on Computational Semantics for Artificial Intelligence Systems
本論文は、形式的、グラウンデッド、および分布論的な意味論の理論を検討することによって計算意味論の入門を提供し、読者がトランスフォーマーベースの言語モデルが人間と比較してどのように言語を学習し表現しているのかを理解する助けとなるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語は人間が持つ最も人間らしいもの、すなわち、思考、感情、計画を互いに共有するために用いる道具です。しかし、日々それを使用しているにもかかわらず、私たちの多くは、それが実際にどのように機能しているのか、あるいは「赤」のような言葉を口にしたときにそれが真に何を意味しているのかを、容易に説明することはできません。私たちはその色を見ればそれを理解しますが、周囲の世界を指し示さずには、それを簡単に定義することはできないのです。この、言語を使用することと、その仕組みを理解することの間の溝こそが、機械がいかにして言葉を学ぶかを研究する科学者たちが直面している中心的な謎です。数十年にわたり、研究者たちは論理や規則、あるいは膨大な量のテキストをコンピュータに教え込むことで、機械に意味を理解させようと試みてきました。しかし、新たな視点は、これらの機械には根本的な何かが欠けていることを示唆しています。それは、生きているという身体的な経験です。コンピュータが人間のように聞こえても、なぜ人間のように考えないのかを理解するためには、人間がどのように言語を学ぶのかを、現在の人工知能システムがどのように構築されているかと比較して見る必要があります。
ボイジング州立大学のケイシー・ケニントンによるこの論文は、科学者が意味を定義し計算しようとしてきた様々な方法を案内するガイドとして機能しています。著者は、現代の人工知能、特にChatGPTのようなツールの背後にある強力なモデルは、驚くべき正確さで人間の会話を模倣できるものの、人間と同じ方法で言語を理解しているわけではないと主張しています。この論文では、研究者が機械に意味を教えるために試みてきた3つの主要な方法、すなわち、厳格な論理を用いること、言葉を身体的経験に結びつけること、そして言葉がテキストの中でどのように隣り合って現れるかを分析することについて探求しています。ケニントンは、第3の方法(テキストのパターンから学習すること)が、流暢な発話を生み出す上で現在最も成功しているものの、決定的な欠落を残していることを見出しました。テキストのみで訓練された機械は、赤いリンゴを見たことも、椅子の重さを感じたことも、水を飲んだ時の安らぎを経験したこともありません。これらの身体的、感情的なつながりがないため、彼らが処理する言葉は、人間が持つ深い、生きた意味を欠いた、根拠のない記号にとどまっているのです。
この問題を理解するためには、まず人間がどのように学ぶのかを見なければなりません。子供が「犬」という言葉を学ぶとき、辞書の定義から始めるわけではありません。彼らは相互作用を通じて学びます。親が毛むくじゃらの動物を指差し、子供がそれを見るとき、言葉はその視覚、音、そして動物の感触と結びつけられます。このプロセスは、共有された注意と物理的な存在に依存しています。子供は、言葉が現実世界の物事に言及していること、そしてこれらの物事が、椅子に座る、あるいはボールを蹴るといった特定の用途を持っていることを学びます。言葉と、それが記述する物理的現実とのこの結びつきは、「グラウンディング(接地)」と呼ばれます。人間にとって、意味とは単なる定義のリストではなく、私たちの身体、感覚、そして感情に結びついたものです。私たちは「喉の渇き」が何を意味するかを知っています。なぜなら、それを感じたことがあるからです。そして「椅子」が何を意味するかを知っています。なぜなら、それに座ったことがあるからです。
長い間、コンピュータ科学者は、工学で用いられる数学に似た形式論理を用いて、機械に言語を理解させようとしてきました。彼らは言葉を方程式の変数のように扱い、「大きい」「灰色」「ゾウ」といった要素を組み合わせることで、特定の動物に関する論理的な命題を作成できました。このアプローチは、精密で曖昧さがないため、コンピュータにとってはうまく機能します。しかし、混沌とした現実世界においては失敗します。これらの規則に従うコンピュータは、「灰色のゾウ」が灰色であるゾウであることを知ることができますが、灰色がどのように見えるのか、あるいはゾウがどのような感触なのかを知ることはありません。それは意味の構造を持っていますが、実体を持っていません。論文は、機械が物理的な世界においてそれらの言葉が実際に何を指しているのかを知る術を持たないため、このアプローチは壁に突き当たるのだと指摘しています。
「グラウンデッド・セマンティクス(接地された意味論)」として知られる別のアプローチは、言葉を感覚データに結びつけることでこれを修正しようと試みています。この観点では、コンピュータは赤い物体を見た画像を通じて「赤」の意味を学ぶべきであり、あるいは足がボールを蹴るビデオを見ることで「蹴る」の意味を学ぶべきであるとされます。機械が世界を見たり触れたりすることができれば、人間の経験に一致する意味の辞書を構築できるという考えです。これは有望な一歩ではありますが、論文は実装が困難であると述べています。現在のシステムの多くは依然としてテキストに大きく依存しており、たとえ画像を使用する場合でも、嗅覚、触覚、あるいは筋肉の記憶といった、人間の経験の全範囲を見落としていることが多いのです。機械は椅子の写真を認識できるかもしれませんが、長い散歩の後の座ることの安らぎを知ることはありません。
現代の人工知能における最も支配的な手法は、「ディストリビューショナル・セマンティクス(分布意味論)」と呼ばれます。このアプローチは、単純な考えに基づいています。つまり、ある言葉がどのような仲間と一緒にいるかを見ることで、その言葉を理解できるというものです。もし「リンゴ」という言葉がしばしば「赤」「果物」「パイ」といった言葉の近くに現れるなら、コンピュータは「リンゴ」がそれらの概念に関連していることを学習します。数十億の文章を分析することで、これらのシステムは、似た意味を持つ言葉が互いに近くに位置するマップを構築します。この手法は、物語を書き、質問に答え、言語を驚くほど流暢に翻訳できる大規模言語モデルの創出につながりました。これらのモデルは、インターネット上の膨大なテキストを用いて訓練され、前の言葉に基づいて文の次の言葉を予測することを学習しています。
しかし、論文は、この成功には隠れた代償が伴うと論じています。これらのモデルは世界を直接経験することなく、テキストのみから学習しているためです。彼らは夕焼けを見たことも、イチゴの味を知っていることも、小指をぶつけた痛みを経験したこともありません。彼らは、本や記事の中で「リンゴ」と「赤」が一緒に現れるのを見てきたので、両者が関連していることは知っていますが、赤がどのように見えるのか、あるいはリンゴがどのような味がするのかを知りません。著者は、言語モデルに「リンゴを見たことがありますか?」と尋ねる例を用いています。モデルは、見たことがないため、正直に「いいえ」と答えるでしょう。彼らはただ記号を処理してきただけなのです。これは、機械が世界について完璧に語ることができる一方で、世界を理解していないという状況を生み出します。それは、水に一度も触れたことがないのに、水泳に関するあらゆる本を読んだ人のようなものです。
また、論文は人間が言語において果たす感情と意図の役割についても強調しています。私たちが話すとき、単にデータを交換しているのではなく、感情、欲望、そして目標を表現しています。子供が言葉を学ぶのは、他者とコミュニケーションを取りたい、助けが欲しい、あるいは喜びを共有したいというニーズがあるからです。この衝動は、私たちの身体と感情に結びついています。現在の言語モデルには感情や意図がありません。彼らは空腹を感じたり、疲れたり、好奇心を持ったりすることはありません。彼らは、何かをしたいから話すのではなく、次の言葉を予測するようにプログラムされているから話すのです。著者は、これらの内的な衝動や感情的なつながりがなければ、機械は人間が当然のこととして受け入れている、より深く微細な言語の意味を把握することに常に苦労するだろうと示唆しています。
論文の結論は、人工知能は言語の処理において目覚ましい進歩を遂げたものの、意味を理解するという問題はまだ解決していないということです。現在のモデルは、人間の会話を模倣できる強力なツールですが、言葉に真の重みを与える身体的な経験を欠いています。前進するためには、異なるアプローチの強みを組み合わせる必要があると著者は提案しています。テキストを分析できるだけでなく、物理的な世界と相互作用し、感情を感じ、意図を持つことができるシステムが必要です。機械が人間と同じ方法で世界を経験できるようになるまで、彼らの言語理解は不完全なままです。彼らは言葉を使うことには非常に長けていますが、その言葉が真に何を意味するのかを、決して知ることはないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。