← 最新の論文
💬 NLP

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSetは、ハードウェア設計における大規模言語モデルの能力を向上させ、オープンソースのアプローチがVerilogコード生成において優れた性能を達成できることを実証するために設計された、AIが生成した自然言語の説明と対になる131,000以上の多様なVerilogモジュールで構成される完全なオープンソースのデータセットである。

原著者: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

公開日 2026-06-10
📖 1 分で読めます☕ さくっと読める

原著者: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、複雑なデジタル回路を構築しようとしている、優秀だが未経験の弟子に教えようとしているところだと想像してください。電子工学の世界では、これらの回路は「Verilog」と呼ばれる特別な言語を使って記述されます。長い間、このタスクにおける最高の「教師」(大規模言語モデル、LLM)たちは、優れた教科書が不足しているために苦戦してきました。既存の書籍の多くは、プライベートなライブラリ(独自の産業データ)の中に閉じ込められていたり、内容が短すぎたり、エラーだらけだったりしたのです。

この論文は、OPENRTLSETを紹介しています。これは、本質的に、これらのAIの弟子を訓練するために特別に設計された、世界最大かつ完全に無料のVerilog教科書のライブラリです。

以下に、彼らがどのようにしてこのライブラリを構築し、何を発見したのかを、簡単な比喩を用いて解説します。

1. 原材料の収集(データセット)

研究者たちは単にコードをコピー&ペーストしたわけではありません。彼らは、3つの異なる庭園から材料を集めるように、3つの異なるソースから膨大なコレクションを構築しました。

  • Verilogの庭園: GitHub(コードの「オープンソース」インターネット)から、10万件以上の既存のVerilog設計を見つけ出しました。
  • VHDLの庭園: VHDLと呼ばれる別の言語で書かれた約5,000の設計を見つけ、それらをVerilogに翻訳しました。これは、フランス語のレシピを、誰もが読めるように英語に翻訳するようなものです。
  • C++の庭園: C/C++(高水準プログラミング言語)で書かれた約24,000の設計を見つけ、特別なツールを使用してそれらをVerilogに変換しました。これは、高水準の建築図面から、詳細なレンガ一個ずつの指示書を自動生成するようなものです。

黄金律: このライブラリに含まれるすべてのコードは「オープンソース」です。つまり、学生、研究者、あるいは企業が、法的制限や隠れた費用を心配することなく、無料で利用できることを意味します。

2. 教師のノートを書く(ラベリング)

生のコードはレンガの山のようなものです。その記述がなければ、その建物が本来何を目的としているのかを理解するのは困難です。これを解決するため、チームは非常にスマートなAI(DeepSeek-R1)を使用して、すべてのモジュールに対して自然言語による説明文を作成しました。

  • 「コンテキスト」のトリック: AIがコードをより良く理解できるようにするために、Verilogの回路とともに、その回路の「C++バージョン」も生成する場合がありました。これは、学生に設計図だけでなく、建物の3Dモデルも提供して、構造をよりよく理解させるようなものです。
  • 結果: 彼らは「コード + 説明」のペアを作成し、レンガの山を「これは何をするものであり、どのように構築するか」という一連のレッスンへと変貌させました。

3. トレーニングキャンプ(ファインチューニング)

研究者たちは、この新しいライブラリを使用して、いくつかの異なるAIモデル(QwenやGraniteなど)を訓練しました。そして、これらのモデルがゼロから新しい正しいVerilogコードを生成できるかどうかをテストしました。

彼らが発見したこと:

  • データが多いほど良い: 131,000個のモジュールからなるフルライブラリでAIを訓練したとき、AIは11,000個のモジュールの小さな断片だけで訓練した場合よりも大幅に向上しました。これは、本の1章だけを読むのと、百科事典全体を読むのととの違いのようなものです。
  • 品質が重要: OPENRTLSETで訓練されたAIは、古い小規模なデータセットで訓練されたAIよりも優れたパフォーマンスを示しました。実際、この新しいAIモデルは、以前の試みよりも約14%高い頻度で正しい回路を生成することができました。
  • 小さなモデルが勝つこともある: 彼らは、高品質なデータで訓練されれば、たとえ80億パラメータ(8B)という比較的小さなAIモデルであっても、この特定のハードウェアデータで訓練されていない有名な大規模モデルを凌駕できることを発見しました。

4. 結論

この論文は、OPENRTLSETが、AIにハードウェア設計を教える上での最大の障壁である「高品質な無料データの不足」を取り除いたと主張しています。大規模でクリーンかつ法的に安全なデータセットを提供することで、彼らは、この特定の分野においてオープンソースのアプローチが、独自の(プロプライエタリな)アプローチに勝り得ることを証明しました。

要約すると、彼らはAIがハードウェア設計を学ぶための究極の「トレーニングマニュアル」を構築しました。適切なオープンソースのツールを与えれば、AIは熟練したビルダーになれることを証明したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →