← 最新の論文
💻 computer science

IndustryForge-27B: A Domain-Enhanced Multimodal Foundation Model for Industrial CAD

IndustryForge-27Bは、5万2千件の産業用CADサンプルを用いた統一的なマルチタスク学習を通じてQwen3.5-VL-27B上に構築されたドメイン強化型マルチモーダル基盤モデルであり、汎用的な能力を維持しつつ、CAD特化型のベンチマークにおいてベースモデルおよびクローズドソースのGPT-5.4の両方を大幅に上回る性能を発揮し、フルスタックの産業用エージェントのための統一された基質として機能します。

原著者: Nianchen Deng, Jiaxin Ai, Tao Hu, Shu Zou, Yurui Dong, Siqi Li, Xinyu Cai, Xuemeng Yang, Licheng Wen, Hongbin Zhou, Hairong Zhang, Pinlong Cai, Botian Shi

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Nianchen Deng, Jiaxin Ai, Tao Hu, Shu Zou, Yurui Dong, Siqi Li, Xinyu Cai, Xuemeng Yang, Licheng Wen, Hongbin Zhou, Hairong Zhang, Pinlong Cai, Botian Shi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピューターが、これまでに書かれたほぼすべての本を読破した、驚くほど有能で博識な司書であるような世界を想像してみてください。彼らは詩を書き、数学の問題を解き、簡単なビデオゲームのためのコードを生成することさえできます。しかし、一つだけ落とし穴があります。彼らは一度も工場に足を踏み入れたことがなく、レンチを手にしたこともなく、複雑な設計図を見たこともありません。彼らは一般的な知識には長けていますが、特定の機械部品を設計したり、巨大な産業用ロボットの操作方法を教えたりと求められると、幻覚を見せ始めます。歯車のことは言葉では完璧に説明できても、サイズを間違えたり、存在しない画面上のボタンを「クリック」しようとしたりします。なぜなら、彼らはエンジニアがソフトウェアと対話するために使う非常に特殊な言語を理解していないからです。

これが、コンピュータ支援設計(CAD)の課題です。CADとは、粘土を使う代わりにコードを用いて、小さなネジから飛行機全体に至るまであらゆるものを構築する、デジタルな芸術であり科学でもあります。コンピューターがここで真に有用であるためには、3つのトリッキーなことを同時にこなさなければなりません。まず、2Dの図面を「見て」、その中に隠された3D形状を理解すること。次に、その形状を構築するための精密なコードを書くこと。そして、特定の産業用ソフトウェア(SolidWorksやInventorなど)に対し、COMと呼ばれる非常に古く非常に特殊な言語を使って対話する方法を知っていることです。これまで、最も優れた汎用AIモデルは、理論は知っていても職業試験には落ちてしまう学生のようなものでした。彼らは理論は知っていても、実務はできなかったのです。

そこで登場するのが、上海の研究者と複数の大学の研究チームによって開発された、新しい種類のAIモデル「IndustryForge-27B」です。このモデルを、車を作る完成されたロボットとしてではなく、大規模で専門的なトレーニングキャンプに参加させられた「超エリート見習い」と考えてください。研究者たちは、強力な汎用AI(Qwen3.5-VL-27B)を取り出し、約52,000件の産業用事例からなる厳選されたライブラリを学習させました。このライブラリには、設計図の読み取りから、単一部品のコード作成、複雑な機械の組み立て、そして産業用ソフトウェアの制御に至るまで、あらゆるものが含まれていました。その結果、エンジニアリングの世界の「秘密の握手(合言葉)」を習得したモデルが誕生したのです。

論文によると、この専門的なトレーニングは驚異的な効果を発揮しています。4つの特定のエンジニアリング課題でテストを行った際、新しいモデルは単に向上しただけでなく、飛躍的な進化を遂げました。単一部品のコード作成におけるベーススコアは約7.8%でしたが、77.8%へと跳ね上がり、ほぼすべてのテストにおいてトップクラスのクローズドソースの競合モデル(gpt-5.4)を圧倒しました。おそらく最も印象的なのは、複数の部品を組み合わせる「アセンブリ(組み立て)」を扱う能力です。他のモデルがほぼ完全に失敗(スコアはほぼ0%)した一方で、このモデルは見事にこなしました。また、研究者たちは、この集中的なトレーニングによって、数学や読解力といった通常のタスクを行う能力を「忘れて」しまわないかについても確認を行いました。結果、モデルは忘れるどころか、むしろ一般的なタスクにおいてわずかに性能が向上しており、エンジニアリングの達人になるための学習が、スマートなアシスタントとしての能力を損なわなかったことを証明しました。

しかし、論文は期待値を設定することにも慎重です。IndustryForge-27Bは、一晩で新しいiPhoneを設計してくれる魔法のボタンではありません。これは、他のツールがその上に構築していくための「基盤(ファウンデーション)」、つまり共通の出発点なのです。このモデルは、「AIが図面を読み取り、コードを書くことができるのか?」という困難な問題を解決します。それにより、他のシステムが次のステップに集中できるようにしているのです。これは大きな前進ではありますが、著者たちも、特に複雑なアセンブリや、設計プロセスを物理シミュレーションに接続する部分については、まだやるべきことが残されていると認めています。しかし、初めて私たちは、実際に工場の現場の言葉を話すことができるデジタルな見習いを手に入れたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →