← 최신 논문
💬 NLP

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet은 하드웨어 설계 분야에서 대규모 언어 모델의 역량을 발전시키고 오픈 소스 방식이 Verilog 코드 생성에서 우수한 성능을 달성할 수 있음을 입증하기 위해 설계되었으며, AI가 생성한 자연어 설명과 쌍을 이루는 131,000개 이상의 다양한 Verilog 모듈로 구성된 완전한 오픈 소스 데이터셋입니다.

원저자: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 경험은 부족한 도제에게 복잡한 디지털 회로를 설계하는 법을 가르치려 한다고 상상해 보십시오. 전자 공학의 세계에서, 이러한 회로들은 Verilog라고 불리는 특별한 언어로 기술됩니다. 오랫동안 이 작업을 수행하기 위한 최고의 "선생님"(대규모 언어 모델 또는 LLM)들은 공부할 좋은 교과서가 부족하여 어려움을 겪었습니다. 기존의 대부분의 책들은 사적인 도서관(독점 산업 데이터)에 잠겨 있었거나, 너무 짧고 오류가 많았습니다.

이 논문은 OPENRTLSET를 소개합니다. 이것은 본질적으로 이 AI 도제들을 훈련시키기 위해 설계된, 세계 최대 규모의 완전 무료 Verilog 교과서 라이브러리입니다.

다음은 이들이 이 라이브러리를 어떻게 구축했는지, 그리고 무엇을 발견했는지를 쉬운 비유를 사용하여 설명한 내용입니다.

1. 원재료 모으기 (데이터셋)

연구진은 단순히 코드를 복사해서 붙여넣은 것이 아니라, 세 가지 서로 다른 출처에서 재료를 모으듯 거대한 컬렉션을 구축했습니다:

  • Verilog 정원: GitHub(코드의 "오픈 소스" 인터넷)에서 100,000개 이상의 기존 Verilog 설계를 찾아냈습니다.
  • VHDL 정원: VHDL이라는 다른 언어로 작성된 약 5,000개의 설계를 찾아내어 이를 Verilog로 번역했습니다. 이는 마치 프랑스어 레시피를 영어로 번역하여 누구나 읽을 수 있게 만드는 것과 같습니다.
  • C++ 정원: C/C++(고수준 프로그래밍 언어)로 작성된 약 24,000개의 설계를 찾아내어 특수한 도구를 사용해 Verio로 변환했습니다. 이것은 고수준의 건축 청사진을 가져와서 상세한 벽돌 한 장 한 장의 지침으로 자동 생성하는 과정과 같습니다.

황금률: 이 라이브러리에 포함된 모든 코드는 "오픈 소스"입니다. 즉, 학생, 연구자, 기업 등 누구나 법적 제한이나 숨겨진 비용에 대한 걱정 없이 무료로 사용할 수 있습니다.

2. 선생님의 노트 작성하기 (레이블링)

가공되지 않은 코드는 벽돌 더미와 같습니다. 그 설명이 없다면 그 건물이 무엇을 하려는 것인지 이해하기 어렵습니다. 이를 해결하기 위해, 팀은 매우 똑똑한 AI(DeepSeek-R1)를 사용하여 모든 모듈에 대한 자연어 설명을 작성했습니다.

  • "컨텍스트" 기법: AI가 코드를 더 잘 이해하도록 돕기 위해, 때때로 그들은 Verilog와 함께 해당 회로의 "C++ 버전"도 함께 생성했습니다. 이는 학생에게 청사진뿐만 아니라 건물의 3D 모델을 함께 제공하여 구조를 더 잘 이해하도록 돕는 것과 같습니다.
  • 결과: 그들은 "코드 + 설명"의 쌍을 만들어냈으며, 이를 통해 벽돌 더미를 "이것은 무엇을 하며, 이것을 어떻게 만드는가"라는 일련의 레슨으로 탈바꿈시켰습니다.

3. 훈련 캠프 (파인튜닝)

연구진은 이 새로운 라이브 library를 가져와 여러 가지 AI 모델(Qwen 및 Granite 등)을 훈련시키는 데 사용했습니다. 그들은 이 모델들이 처음부터 새로운, 올바른 Verilog 코드를 얼마나 잘 생성하는지 테스트했습니다.

그들이 발견한 점:

  • 데이터가 많을수록 좋다: 연구진이 131,000개의 모듈로 구성된 전체 라이브러리로 AI를 훈련시켰을 때, 11,000개 모듈의 작은 조각으로만 훈련시켰을 때보다 훨씬 더 뛰어난 성능을 보였습니다. 이는 책의 한 단원을 읽는 것과 백과사전 전체를 읽는 것의 차이와 같습니다.
  • 품질이 중요하다: OPENRTLSET로 훈련된 AI는 오래되고 작은 데이터셋으로 훈련된 AI보다 훨씬 더 나은 성능을 보였습니다. 실제로, 이 새로운 AI 모델들은 이전의 시도들보다 올바른 회로를 약 14% 더 자주 생성할 수 있었습니다.
  • 작은 모델이 이길 수도 있다: 그들은 특정 하드웨어 데이터로 훈련받은 80억 개의 파라미터를 가진 작은 AI 모델이, 이 특정 데이터로 훈련되지 않은 훨씬 더 크고 유명한 모델들을 능가할 수 있다는 것을 발견했습니다.

4. 결론

이 논문은 OPENRTLSET가 AI에게 하드웨어를 설계하는 법을 가르치는 데 있어 가장 큰 장벽인 "고품질의 자유로운 데이터 부족" 문제를 제거했다고 주장합니다. 방대하고 깨끗하며 법적으로 안전한 데이터셋을 제공함으로써, 그들은 오픈 소스 방식이 이 특정 분야에서 독점적인 방식보다 실제로 더 우수할 수 있음을 보여주었습니다.

요약하자면, 그들은 AI가 하드웨어 설계를 배울 수 있는 궁극적인 "훈련 매뉴얼"을 구축했으며, 적절한 오픈 소스 도구가 주어졌을 때 AI가 어떻게 숙련된 설계자가 될 수 있는지를 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →