← 最新の論文
💬 NLP

Instruction-Guided Poetry Generation in Arabic and Its Dialects

本論文は、スタイルや韻律などの特定のユーザー要件に応じて大規模言語モデルが詩を制御可能に生成、修正、分析することを可能にする、現代標準アラビア語とその方言を対象とした大規模な指示ベースのデータセットを導入する。

原著者: Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Fajri Koto

公開日 2026-05-01
📖 1 分で読めます☕ さくっと読める

原著者: Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Fajri Koto

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

アラビア語の詩を、数百万冊の美しい本が収められた壮大で古代の図書館だと想像してください。何世紀にもわたり、人々はこの図書館で、リズム、韻律、様式に関する厳格な規則に従って詩を書いてきました。まるで特定の設計図に基づいて家を建てるようなものです。しかし、これまでコンピューター(特に大規模言語モデル、LLM)は、主に本を「読む」こと、ページ数を数えること、あるいは誰が書いたかを推測することしかできない司書のような存在でした。彼らは、特定の規則に従ったり、異なる地域のアラビア語方言で書かれたりすることを求められた場合、自ら新しい詩を書くことにはあまり長けていませんでした。

本論文は、コンピューターに詩人そのものになることを教える新しいプロジェクト「InstructPoet」を紹介しています。その手法を簡単に説明します。

1. レシピ本(データセット)

コンピューターに料理を教えるには、良いレシピ本が必要です。研究者たちは、インターネットから古代から現代に至るまでのアラビア語の詩を大量に収集しました。

  • 整理整頓: 彼らは、この無秩序に散らばった詩の山を、整理された箱に LEGO を分類するのと同じように、整然とした統一された形式にまとめました。
  • ラベル付け: 彼らはすべての詩に「メタデータ(ラベル)」を追加し、「恋愛」「戦争」「アッバース朝時代」「湾岸方言」などの詳細をタグ付けしました。
  • 多様な表現: 彼らは標準アラビア語(MSA)だけでなく、**5 つの異なる「風味」**で指示を作成しました。標準アラビア語に加え、4 つの主要な方言(湾岸、レヴァント、ナイル渓谷、北アフリカ)です。これは、コンピューターに形式的な英語だけでなく、テキサス風、スコットランド風、オーストラリア風の英語も教えるようなもので、誰とでも自然に会話できるようにするものです。

2. 4 つのトレーニングゲーム(タスク)

コンピューターに単に「詩を書け」と命じる代わりに、彼らはコンピューターをより賢くするために、4 つの特定のトレーニングゲームを設定しました。

  • 生成(白紙のページ): 「特定のリズムを使って、海についての恋愛詩を書け」。コンピューターはゼロから何かを創造しなければなりません。
  • 継続( cliffhanger): 「詩の最初の 3 行がこれです。残りを続けてください」。コンピューターは流れを崩さずに、物語とリズムを維持しなければなりません。
  • 修正(編集者): 「ここに、いくつかのタイプミスと崩れたリズムを持つ詩があります。修正してください」。コンピューターは校正者として、詩を完璧な状態に復元します。
  • 分析(クイズ): 「この詩を読んで、教えてください:どの時代のものでしょうか?韻律の形式は何ですか?」。コンピューターはテストを受ける批評家として振る舞います。

3. 教室(モデルのトレーニング)

研究者たちは、4 つの異なる「生徒」コンピューター(既存の AI モデル)を、この新しいデータセットを使って指導しました。

  • 生徒たち: 彼らは、多言語に強い 2 つのモデル(LLaMA と Qwen)と、アラビア語に特化した 2 つのモデル(ALLaM と Fanar)を使用しました。
  • 指導スタイル: 彼らは 2 つの方法を試しました。一つはジョイントトレーニング(すべてのゲームを一度に生徒に投げつける)で、もう一つはカリキュラム学習(分析のような簡単なものから始め、ゼロからの作成のような難しいものは後回しにする)です。

4. 成績表(結果)

トレーニング後、彼らは生徒を 2 つの方法でテストしました。

  • ロボット採点者: 彼らは別の AI を使用して、文法、流れ、そしてコンピューターが規則(正しい韻律の使用など)を実際に守ったかどうかといった点で詩を採点しました。
  • 人間の審査員: 彼らは詩を愛するアラビア語ネイティブスピーカーを雇い、詩を読んで 1 から 5 のスケールで評価させました。

発見事項:

  • 劇的な改善: トレーニング前、コンピューターは規則に従った詩を書くのが非常に苦手でした。トレーニング後、彼らは著しく向上しました。
  • 最優秀生徒: すでにアラビア語用に設計されていた ALLaM モデルが、トレーニング後にトップの詩人となりました。流暢さと一貫性において最高得点を記録しました。
  • 最も難しいタスク: ゼロから詩を書くこと(生成)がコンピューターにとって最も簡単でした。壊れた詩を修正すること(修正)が最も難しく、それはコンピューターが技術的な誤りを修正しながら詩の「魂」を理解する必要があったためです。
  • 方言の機能: コンピューターは、形式的なバージョンだけでなく、異なるアラビア語方言の理解と作成において著しく向上しました。

結論

この論文は、コンピューターが人間の詩人を代替したり、完璧で魂を揺さぶる傑作を書いたりすると主張するものではありません。代わりに、人々が詩を書くのを助けるデジタルアシスタントを構築できることを示しています。特定のスタイル、特定の韻律、あなたの地元の方言で詩が欲しい場合、この新しいシステムは草案作成、誤りの修正、あるいは書いたものの分析を手伝うことができます。これにより、コンピューターは受動的な読者から、能動的で規則に従う創造的なパートナーへと変貌します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →