← 最新の論文
💻 computer science

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

本論文は、地中海および欧州の料理とその食材の認識において、従来のCNNベースラインおよび大幅に大規模な商用フロンティアモデルをも凌駕する精度を達成した、統一された欧州の食事データセットで微調整された30億パラメータの視覚言語モデルであるOliveGemmaを紹介するものである。

原著者: Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

スマートフォンのカメラでランチの写真を見ただけで、ソースに含まれる特定のハーブに至るまで、何を食べているのかを正確に把握できる世界を想像してみてください。これは単なる面白いパーティーの余興ではありません。私たちの健康管理のあり方を根本から変える可能性を秘めた革命なのです。何十年もの間、科学者たちはコンピュータに食べ物を認識させる方法を教えてきましたが、それは非常に厄介な作業でした。例えば、見た目がそっくりな双子を仕分けようとするようなものです。チーズたっぷりのピザと、チーズが少なめのピザは、見た目がほとんど同じに見えますし、「ギリシャ風サラダ」も、ある国での見え方と別の国での見え方は全く異なる場合があります。厳格なルールに従うだけの従来のコンピュータプログラムは、こうした微細な違いにしばしば混乱してしまいます。しかし、「ビジョン・ランゲージ・モデル(VLM)」と呼ばれる新しいタイプのテクノロジーが、この状況を一変させようとしています。単に画像を記憶するのではなく、これらのモデルは、食べ物に関する何百万冊もの本を読み、何百万枚もの写真を見た、非常に賢い学生のような存在です。彼らは、ある料理が単に「丸い形をしているからピザである」と判断するのではなく、生地、チーズ、トマトソースがどのように組み合わさっているかという「概念」を理解することで、それがピザであることを理解できるのです。この論文では、巨大なスーパーコンピュータを使わずに、これら賢い学生の一人に地中海およびヨーロッパ料理の世界的なエキスパートになれるかどうかを検証しています。

ここで、イアニナ大学の研究者たちによって生み出された、新しい特化型フード認識エキスパート、「OliveGemma」が登場します。OliveGemmaは、PaliGemma-2-3Bと呼ばれる大規模なオープンソースの基盤の上に構築された、小さくて非常に効率的な「脳」だと考えてください。元の脳には約30億の「ニューロン(パラメータ)」がありますが、研究者たちはそのすべてを再学習させたいわけではありませんでした。それは、ラザニアのレシピを更新するためだけに、百科事典全体を書き直そうとするようなものだからです。代わりに、彼らは「LoRA(Low-Rank Adaptation)」と呼ばれる巧妙なトリックを用いました。大きな脳を巨大な図書館だとすると、LoRAは研究者が棚に取り付ける小さな付箋のメモ帳のようなものです。彼らは元の本の内容を変えることなく、このメモ帳に新しい情報を書き込むことで、「ギリシャ風サラダ」や「ティラミス」といった特定の料理を認識する方法を教えているのです。

チームはこの「付箋の脳」を、地中海およびヨーロッパの料理の写真17,340枚という膨大なコレクションを用いて訓練しました。これらの写真は整理・分類され、216の特定のカテゴリーに分けられています。彼らは単に「これは何ですか?」と尋ねたのではありません。彼らは「推論」することを教えたのです。「この料理にはどのような材料が含まれている可能性が高いか?」「これがピザであり、フラットブレッドではないと判断できる視覚的な手がかりは何か?」といった質問を投げかけました。その結果、完成したモデルは驚くほど小さく軽量で、サイズは約90メガバイトです。これは標準的なプロセッサと16GBのRAMを搭載した一般的なコンピュータで動作できるほど小さいため、写真を巨大なクラウドサーバーに送る必要がありません。これは、患者のデータが安全に保持されなければならない病院などにおいて、プライバシーの観点から極めて重要なことです。

研究者がOliveGemmaの実力をテストしたところ、結果は驚くほど強力なものでした。従来の画像認識プログラム(CNNと呼ばれます)との直接対決において、OliveGemmaは正しい料理を特定する精度92.96%を達成し、勝利しました。これは、最強の従来の競合相手を7.31%上回る数値です。しかし、本当の衝撃は、GoogleのGemini、OpenAIのGPT、AnthropicのClaudeといったAI界の「巨人」たちと比較した時に起こりました。これらの巨人ははるかに巨大で、インターネット上のあらゆる事象を知っていますが、同じ216種類の特定のリストから選択するよう求められると、苦戦したのです。OliveGemmaは彼らを圧倒し、最大の差では約18%、中には**64%**もの差をつけて彼らを打ち負かしました。

この現象が起こる理由は、巨大なモデルはあまりにも一般的すぎるからです。彼らは、あらゆることを少しずつ知っているが、一つの分野については専門家ではない「一般医」のようなものです。対照的に、OliveGemmaは「スペシャリスト」です。地中海料理の似通った料理同士の微妙な違いを理解するように、特別に微調整(ファインチューニング)されています。さらに、OliveGemmaは単に料理の名前を推測するだけでなく、含まれる可能性が高い材料のリストアップも高い精度で行うことができました。材料のリストを正確に提示できた割合は約**90.79%**に達しました。例えば、「ティラミス」にはマスカルポーネとコーヒーに浸したスポンジが入っていることを伝え、たとえ写真では見えなくても、卵黄やマールサラワインといった隠れた材料を推測することさえできたのです。

著者たちは、これが前進ではあるものの、あらゆる食の問題を解決する魔法の杖ではないことにも注意を払っています。現在のモデルは、訓練に使用した216種類のヨーロッパおよび地中海料理に限定されており、中央アジアの特定の種類の麺を識別することはできません。しかし、この研究は、専門分野においてトップクラスの結果を得るために、必ずしも数十億ドル規模のクラウドベースのスーパーコンピュータは必要ないということを強く示唆しています。小さなオープンソースモデルを使用し、数百万のパラメータを用いて正しい方法で教えることで、より正確で、プライバシーが守られ、再現可能で、標準的なコンピュータを持つ誰にでも利用可能なツールを作成できるのです。OliveGemmaは、時には、小さくよく訓練されたスペシャリストが、巨大なジェネラリストに常に勝利することを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →