← 最新の論文
💻 computer science

OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

本論文は、従来の認識タスクを超えて甲骨文の潜在的な意味解析を大幅に進化させるために、新しいStable Focal Preference Optimization(SFPO)アルゴリズムと新しいデータセットを活用した、30億パラメータを持つポストトレーニング・フレームワークであるOracleAnalyserを導入する。

原著者: Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

公開日 2026-06-25
📖 1 分で読めます☕ さくっと読める

原著者: Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、亀の甲羅や動物の骨で作られた、巨大で古めかしいパズルボックスを想像してみてください。これらは**甲骨文(こうこつもん)**と呼ばれる、数千年前から刻まれている中国最古の文字体系です。長い間、専門家たちはこれらの奇妙な図形が何を意味しているのかを解明しようと試みてきました。これまでに約4,500以上の文字のうち、1,600文字程度の解読には成功していますが、残りは依然として謎のままです。

これまで、このパズルを解こうとするほとんどのコンピュータプログラムは、コピー機のようなものでした。骨に刻まれた絵を見せると、プログラムは「これは『A』か、それとも『B』か?」と推測しようとします。それらは既に見ているパターンを一致させることは得意ですが、その絵を本当に「理解」しているわけではありません。ただ答えを暗記しているだけなのです。

この論文は、OracleAnalyserという新しいAIを紹介しています。OracleAnalyserは単なるコピー機ではなく、手がかりを実際に観察し、「なぜその文字がその意味を持つと考えているのか」を説明できる探偵翻訳家のような存在です。

この探偵をどのように作り上げたのか、簡単な比喩を用いて説明します。

1. 問題点:「当てずっぽう」 vs 「思考」

従来のAIモデルは、答えの解説は理解せず、解答集だけを丸暗記した学生のようなものでした。もし見たことがない文字を見せられたら、彼らはただ推測するだけでした。

  • 従来の方法: 人が頭に何かを載せて運んでいる絵が刻まれた骨の画像を見せます。AIは「これは『空』という文字だ」と推測します。しかし、それは「なぜ」なのかを説明することができません。
  • 新しい方法 (OracleAnalyser): AIは同じ画像を見てこう言います。「人が直立しているのが見えます。頭の上に丸い形があり、まるで重いものを載せているようです。これは『空』を表す古代のシンボルに見えます」。このAIは、答えを出す前に画像をパーツごとに分解するのです。

2. 学習:探偵への教育

研究者たちは、単にAIに多くの画像を食べさせたわけではありません。彼らはAIに、3つのステップで考え方を教えました。

  • ステップ1:講義(教師あり微調整 / Supervised Fine-Tuning)
    彼らは賢いAI(Qwen2.5-VL)を取り出し、専門家が文字の名前を挙げる「前」に、その絵をどのように説明しているかを示す数千の例を見せました。これは、先生が生徒に「この線を見てごらん。これは屋根のように見えるね。だからこれは『家』を意味するんだ」と教えているようなものです。AIはこの推論の仕方を模倣することを学びました。

  • ステップ2:模擬試験(データの生成 / Generating Data)
    AIにテストを受けるよう命じました。正解することもあり、間違えることもありました。研究者たちはこれらの試行を収集しました。

    • 良い回答: 「これは根のある木のように見える。」(正解)
    • 悪い回答: 「これは棒のように見える。」(不正解)
      彼らはこれらのペアを使用して、何が良い説明で、何が悪い説明なのかをAIに教えました。
  • ステップ3:特別なコーチング(SFPO)
    これがこの論文における最大の革新です。標準的な学習方法では、「悪い」回答が実は「ある程度は合っている」場合(例:木が棒のように見えると言うのは、完全に間違いではないが、具体性に欠ける場合など)、AIが混乱してしまうことがあります。
    研究者たちは、Stable Focal Preference Optimization (SFPO) と呼ばれる新しいコーチング手法を開発しました。

    • 比喩: 間違いに対してただ「間違いだ!」と叫ぶだけのコーチを想像してください。代わりに、このコーチは「最も重要な」間違いに焦点を当て、あまりに紛らわしい、あるいは些細すぎる間違いは無視します。また、生徒が最初の「講義」ステップで学んだことを忘れてしまわないように注意を払います。これにより、AIの安定性と集中力を維持しています。

3. 結果:小さな脳に宿る大きな知能

通常、難しい問題を解くには、巨大なコンピュータの脳(巨大なAIモデル)が必要です。しかし、OracleAnalyserは驚くほど小さく、パラメータ数はわずか**30億(3 billion)**しかありません(競合する巨大な700億パラメータの脳と比較すると、非常に効率的で小さな脳と言えます)。

小さいにもかかわらず、このモデルはすべての巨大なモデルよりも優れた性能を発揮しました。

  • 既知の文字に対して: 意味の説明と文字の特定において、はるかに優れていました。
  • 未知の文字に対して: 見たことがない骨の彫刻を見せられたときでも、形状を観察し(「煙のように見える」や「屋根のように見える」など)、賢い推測を行うことができました。

まとめ

この論文は、AIにパターンを単に「認識」させる(コピー機のように)のではなく、まず画像を「分析」させる(探偵のように)ことを教え、さらに混乱を避けるための特別な安定した学習方法を用いることで、小さくとも強力なツールを作り上げた、と主張しています。このツールは、単に文字の名前を推測するのではなく、古代の図形の背後にある「物語」を説明することで、研究者が中国の古代史を理解する手助けをするのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →