← 最新の論文
💬 NLP

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

本論文は、テキストのみの言語モデルにおける流暢な散文の能力と、有用で表現力豊かかつ人口統計学的に斬新な視覚的計画を生成する実際の能力とを区別することにより、それらの視覚的な創造的着想能力を分離して測定する、新しいベンチマークおよび評価フレームワークであるEkphrasisを紹介するものである。

原著者: Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、俳優の姿がまだ見えない状態で映画のキャスティングを行おうとしているディレクターだと想像してください。手元にあるのは、シーンを言葉で説明する脚本家だけです。ここで大きな疑問が生じます。この脚本家は、本当に新しく刺激的なシーンを「想像」できているのでしょうか? それとも、単に、誰もが千回は見てきたような使い古されたクリシェ(決まり文句)を、華やかな言葉で飾り立てているだけなのでしょうか? これこそが、人工知能(AI)、特に「大規模言語モデル(LLM)」の世界における新しい研究の核心にあるパズルです。これらのLLMは、物語を書き、質問に答え、私たちとチャットをする超スマートなコンピュータプログラムです。科学者たちは、これらのテキストのみを扱う機械が、画像に変換される前にアイデアを真に「視覚化」できるのか、それとも単に流麗な言葉を使って「ふりをしている」だけなのかを、長年疑問に思ってきました。これを解明するために、研究者たちは、AIの記述が純粋な視覚的発明の閃きなのか、それともタキシードを着せただけの、再利用された無難なアイデアなのかをテストする方法を必要としていました。

そこで登場するのが、香港科技大学の研究者たちによって設計された、まさにこのことをテストするための新しい「試験」であるEKPHRASISです。EKPHRASISを、AIのための「創造性のジム」と考えてください。このテストでは、AIに絵を描かせる(このテストでは直接描くことはできません)代わりに、研究者は14種類の異なるAIモデルに対し、400個の具体的な創造的課題を与えました。これらの課題は、「時間のプレッシャー」のような抽象的な概念を視覚的なシーンへと変えたり、無関係な2つのアイデアを掛け合わせたり、あるいは物体を新しい方法で書き換えたりすることを求めるものでした。目的は、単にAIが美しい文章を書けるかどうかを見ることではなく、**視覚的創造的着想(VCI)**プラン、つまり、タスクに対して有用であり、頭の中に明確な絵を描けるほど表現力豊かで、そして最も重要なこととして、斬新である(つまり、他のAIがいつも出すような退屈で使い古されたアイデアを繰り返していない)記述を生み出せるかどうかを確認することでした。

研究者たちは、流暢で美しい文章を書くことが、一種の「罠」になり得ることを発見しました。AIは、驚くほど創造的で鮮やかなパラグラフを書くことができますが、その内容は、時間を表すために砂時計を使ったり、悲しさを表すために暗雲を使ったりといった、全く同じ古い視覚的クリシェを描写しているに過ぎないことがあるのです。この「斬新性の錯覚」を見抜くために、チームは特別なスコアリングシステムを構築しました。彼らは単に「これは創造的か?」と問うたのではありません。「これは有用か? 容易にイメージできるか? そして、他の13のAIが言ったであろう内容と異なっているか?」と問うたのです。彼らは「Typed Idea Graphs(型付きアイデアグラフ)」という巧妙な手法を用いて、すべてのモデルが陥りがちな共通の退屈なパターンをマッピングし、新しい回答がそれらの罠を回避しているかどうかをチェックしました。

結果は非常に興味深く、かつ微細な差異を含んでいました。研究によれば、「優れた」視覚的着想を得ることは、単一のスーパーパワーではないことが分かりました。指示に従い有用なプランを作ることに長けている一方で、非常にクリシェ(既成概念的)なAIもあれば、極めて独創的ではあるものの、時としてタスクの本質を見失ってしまうAIもいました。Gemini 3.1 ProやGPT-5.4のようなトップ層のモデルは、これら3つの特性のバランスを取ることに成功していましたが、そのやり方はそれぞれ異なっていました。決定的なのは、研究者が最高のテキスト記述を実際に取り出し、別のツールを使用してそれらから画像を生成したことです。人間が元のテキストを見ることなくこれらの画像を見たとき、やはり「高いVCI」を持つテキストプランから生成された画像を好む傾向がありました。このことは、AIが単に美しい散文を書いているのではなく、真に視覚的な計画を立てていることを示唆しています。

しかし、この論文は、これがAIに人間のような「心の目」やプライベートな想像力があることを意味するのではない、という点に注意を促しています。それは単に、これらのテキストのみのモデルが、テキストから画像への旅路において生き残ることができる、詳細で画像生成に適した設計図を作成できることを意味しています。この研究は、現在のモデルは視覚的な計画を立てる能力が向上している一方で、彼らが好むように学習データが教えてくれる「安全な」アイデアから脱却することには依然として苦労していることを示唆しています。教訓は明確です。AIが創造的な物語を書いたからといって、それが創造的な視覚的アイデアを持っているとは限りません。真の視覚的創造性を測定するためには、流麗な言葉の奥を見通し、その設計図が実際に新しく、有用で、構築可能なものであるかどうかを確認しなければならないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →