← 최신 논문
🤖 AI

RuC: HDL-Agnostic Rule Completion Benchmark Generation

이 논문은 하드웨어 설계 작업에서 대규모 언어 모델의 성능을 체계적으로 평가하기 위해 구문 영역을 마스킹하여 확장 가능하고 세분화된 RTL 코드 완성 벤치마크를 생성하는 문법 기반의 언어 중립적 프레임워크인 RuC를 소개합니다.

원저자: Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez, Emanuele Parisi, Razine Moundir Ghorab, Miquel Moreto, Gokcen Kestor, Dario Garcia-Gasulla

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez, Emanuele Parisi, Razine Moundir Ghorab, Miquel Moreto, Gokcen Kestor, Dario Garcia-Gasulla

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간의 문자적 성향을 가진 로봇에게 스마트폰이나 슈퍼컴퓨터 내부의 칩과 같은 하드웨어용 컴퓨터 코드를 작성하는 법을 가르치려 한다고 상상해 보세요. 이 로봇은 "대규모 언어 모델"(LLM) 로서 이야기 쓰기나 질문 답변에는 뛰어나지만, 실제로 기능적인 회로를 구축할 수 있는지 확인해야 합니다.

이 논문은 이러한 로봇들을 테스트하는 새로운 방법인 RuC(Rule-based Completion, 규칙 기반 완성) 를 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명해 드리겠습니다.

문제: "전부 아니면 전무"식 테스트

RuC 이전에는 이러한 로봇들을 테스트하는 방식이 두 가지 극단적인 옵션을 가진 "빠진 조각 맞추기" 게임과 같았습니다.

  1. "온전한 집" 테스트: 집의 방 전체를 숨기고 로봇에게 복도만 보고 처음부터 다시 그 방을 재건하도록 요청합니다. 이는 너무 어렵습니다. 로봇이 추측해야 할 부분이 너무 많기 때문입니다.
  2. "벽돌" 테스트: 벽에 있는 벽돌 하나만 숨기고 로봇에게 그 색을 추측하도록 요청합니다. 이는 너무 쉽고 무작위적입니다. 그 벽돌이 구조에 중요하지 않을 수도 있기 때문입니다.

두 방법 모두 로봇이 하드웨어 구축의 특정 규칙을 얼마나 잘 이해했는지 정확히 알려주지 못했습니다.

해결책: "문법 퍼즐"

저자들은 RuC 를 개발했는데, 이는 스마트 퍼즐 제작자와 같습니다. RuC 는 무작위 단어나 온전한 방을 추측하는 대신, 하드웨어 언어 (SystemVerilog) 의 "문법"(공식 규칙집) 을 활용하여 퍼즐을 만듭니다.

하드웨어 코드를 언어의 문장처럼 생각해보세요. RuC 는 다음 중 하나를 숨길 수 있습니다.

  • 문장의 주어만 (예: 와이어의 이름).
  • 동사 (예: 와이어가 취하는 동작).
  • 전체 절 (예: 전체 논리 규칙).

이를 통해 연구자들은 어떤 난이도의 퍼즐이든 만들 수 있습니다. 연구자들은 테스트하려는 내용에 따라 로봇에게 아주 작고 간단한 조각을 채우게 하거나, 복잡하고 다단계인 논리 블록을 채우게 할 수 있습니다.

테스트 작동 방식

  1. 설정: RuC 는 실제 존재하는 하드웨어 설계 (예: "Tiny Tapeout" 셔틀과 "CVE2" 프로세서 코어) 를 가져와 문법적 구성 요소로 분해합니다.
  2. 마스킹: RuC 는 특정 규칙 (예: "연속 할당" 또는 "case 문") 을 선택해 숨기고, 이를 빈칸 () 으로 대체합니다.
  3. 프롬프트: 로봇에게 빈칸 앞뒤의 코드를 보여주고 빠진 조각을 채우도록 요청합니다.
    • 비유: "고양이가 ___ 위에 앉았다"라는 문장을 읽는다고 상상해 보세요. 로봇은 "매트"라고 추측해야 합니다. RuC 도 이와 비슷하게 복잡한 하드웨어 논리로 이 작업을 수행합니다.
  4. 확인: 로봇이 답을 작성하면 RuC 는 단순히 단어만 보지 않습니다. 두 가지 엄격한 검사를 수행합니다.
    • 구문 검사: 문장이 문법적으로 의미가 통하는가? (코드가 유효한가?)
    • 기능 검사: 문장의 의미가 원래 것과 같은가? (회로가 실제로 같은 방식으로 작동하는가?) 그들은 "거울" 테스트를 사용합니다. 로봇이 작성한 코드와 원래 코드를 나란히 실행하여 서로 다른 결과를 내는지 확인합니다. 만약 완벽하게 일치하면 로봇은 통과합니다.

발견된 결과

연구자들은 이러한 퍼즐에 대해 세계 최고의 오픈소스 AI 모델 여러 개를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다.

  • "중간 채우기" 트릭: 로봇들은 "중간 채우기"(FIM) 퍼즐처럼 테스트가 구성되었을 때 가장 잘 수행했습니다. 이는 로봇에게 문장의 시작과 끝을 주고 중간을 채우도록 요청하는 방식이며, 전체 새로운 단락을 쓰도록 요청하는 것과는 다릅니다. 알고 보니 로봇들은 이런 방식으로 훈련되었기 때문에 이에 더 능숙한 것으로 나타났습니다.
  • 크기가 중요하지만 항상 그런 것은 아님: 일반적으로 더 큰 로봇 (더 큰 모델) 이 더 높은 점수를 받았습니다. 그러나 특정 퍼즐이 작은 로봇의 강점과 일치한다면 더 작은 로봇이 더 큰 로봇을 이기기도 했습니다.
  • 난이도 차이: 일부 규칙은 로봇들에게 쉬웠습니다 (예: 단순 입력 정의). 반면 다른 규칙들은 매우 어려웠습니다 (예: 복잡한 "if-then" 논리 블록). 이는 "로봇은 코딩을 잘한다"고 단순히 말할 수 없음을 증명합니다. "로봇은 X 는 잘하지만 Y 는 못한다"고 구체적으로 말해야 합니다.

왜 이것이 중요한가

이 논문은 AI 가 엔지니어들이 칩을 설계하는 데 도움을 줄 수 있는지 진정으로 이해하려면 유연하고 정밀한 테스트가 필요하다고 결론 내립니다. AI 에게 단순히 "칩을 작성하라"거나 "한 줄을 추측하라"고 요청해서는 안 됩니다. 운전 면허 시험이 병렬 주차, 고속도로 합류, 적색 신호 정지를 각각 따로 확인하는 것처럼, 언어의 특정 규칙을 따로 테스트해야 합니다. 단순히 차를 운전할 수 있는지 보는 것만으로는 충분하지 않습니다.

RuC 는 이러한 유연하고 규칙별 테스트 환경을 제공함으로써, 결국 AI 를 하드웨어 구축에 활용하게 될 때 정확히 무엇을 할 수 있고 무엇을 할 수 없는지 알 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →