← 최신 논문
🤖 AI

RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

이 논문은 하드웨어 설계 자동화를 위한 LLM의 개발을 엄격하게 평가하고 유도하기 위해 기존 벤치마크의 확장성 한계를 극복하는 3가지 새로운 자기지도 추론 태스크와 10,000개 이상의 형식 검증된 Verilog 설계를 특징으로 하는 대규모 벤치마크인 RTL-BenchLS를 소개한다.

원저자: Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 자연어 지시만으로 복잡한 전자 회로(RTL 설계라고 불리는)를 만드는 법을 배우는 똑똑하지만 경험이 부족한 견습생을 가르치려 한다고 상상해 보십시오. 견습생이 실제로 배우고 있는지 확인하기 위해, 당신은 테스트를 해봐야 합니다.

오랫동안, 이 AI "견습생들"(대규모 언어 모델 또는 LLM)을 평가하기 위해 사용된 테스트들은 마치 유치원 색칠 공부 책과 같았습니다. 그것들은 작고 단순했으며, AI가 패턴을 암기하는 것만으로도 쉽게 만점을 받을 수 있었습니다. 이 논문은 우리가 AI가 실제로 그 일을 할 수 있는지 확인하기 위해 실제 건설 현장이 필요하다고 주장합니다.

다음은 이 새로운, 훨씬 더 어려운 테스트인 RTL-BenchLS에 대한 이야기입니다.

1. 문제점: "유치원" 테스트들

기존의 테스트들은 너무 쉬웠습니다. 그 특징은 다음과 같습니다:

  • 설계 개수가 너무 적음: 수천 개의 설계 대신 고작 50개의 작은 퍼즐만 있는 것과 같습니다.
  • 너무 단순함: AI에게 전체 성을 짓는 대신 단 하나의 레고 블록을 만들어보라고 요구하는 것과 같습니다.
  • 한 가지 기술: 그것들은 주로 문장을 코드로 번역하도록 요구했습니다. AI가 이 작업에 능숙해지자, AI가 모든 것에 대해 100점을 받으며 "포화 상태"(Saturating)에 도달했기 때문에 테스트는 더 이상 유용하지 않게 되었습니다.

나아가, 더 어려운 테스트를 만드는 것은 불가능하다고 여겨졌습니다. 왜일까요? 어려운 테스트를 만들려면 보통 인간 전문가가 모든 퍼즐에 대한 "정답지"(테스트벤치)를 작성해야 하기 때문입니다. 10,000개의 복잡한 회로를 위해 그 일을 해줄 인간 전문가는 충분하지 않습니다.

2. 해결책: 스스로 검증하는 "마법 거울"

연구진은 10,000개 이상의 검증된 회로 설계가 담긴 거대한 라이브러리인 RTL-BenchLS를 구축했습니다. 이것들은 작은 벽돌이 아닙니다. 코드 줄 수가 거의 500줄에 달하는 복잡한 구조물들입니다.

"정답지" 문제를 해결하기 위해, 그들은 인간 전문가를 수천 명 고용하는 대신, 일종의 마법 거울 역할을 하는 세 가지 새로운 유형의 퍼즐을 발명했습니다. AI는 단순히 정답을 추측하는 것이 아니라, 논리를 진정으로 이해했다면 반드시 작동할 수밖에 없는 일들을 수행함으로써 자신이 회로를 이해하고 있음을 증명해야 합니다.

세 가지 새로운 퍼즐:

퍼즐 1: "요약 및 재구축" 챌린지 (왕복 추론 - Round-Trip Reasoning)

  • 설정: AI에게 복잡한 회로도를 제공합니다.
  • 과제: AI는 먼저 회로가 어떻게 작동하는지에 대한 요약(레시피와 같은 것)을 작성한 다음, 오직 그 요약만을 사용하여 동일한 회로를 처음부터 다시 구축해야 합니다.
  • 함정: 만약 요약에서 아주 작은 디테일 하나라도 놓친다면, 재구축된 회로는 원래의 회로와 달라질 것입니다. 시스템은 새로운 회로가 원래의 회로와 동일한지 확인합니다.
  • 비유: 이는 요리사에게 복잡한 요리의 맛을 보고, 그 레시피를 적은 뒤, 그 메모를 바탕으로 다시 요리를 만들어보라고 하는 것과 같습니다. 맛이 다르다면, 그 요리사는 실패한 것입니다.

퍼즐 2: "빈 조각" 챌린지 (마스킹된 콘텐츠 추론 - Masked-Content Reasoning)

  • 설정: AI에게 회로를 보여주되, 특정 코드 블록을 "빈 공간" 스티커로 가려버립니다.
  • 과제: AI는 주변 코드와 빈 공간에 대한 설명을 보고, 스티커 아래에 정확히 무엇이 있었는지 파악하여 이를 올바르게 채워 넣어야 합니다.
  • 비유: 퍼즐 조각 하나가 숨겨진 직소 퍼즐을 상상해 보십시오. 구멍 주변의 그림을 보고 빈 조각이 어떻게 생겼는지 정확히 추측하여 이미지를 완성해야 합니다.

퍼즐 3: "버그 탐정" 챌린지 (저장소 이슈 추론 - Repository-Issue Reasoning)

  • 설정: AI에게 코드 전체(프로젝트)와 "이 부분이 고장 났어요!"라는 사용자의 불만 사항을 줍니다.
  • 과제: AI는 방대한 코드 폴더 내에서 고장 난 부분을 찾아내고, 인간 전문가가 수행할 "골든(Golden)" 수정 방식과 똑같이 작동하도록 고쳐야 합니다.
  • 비유: 정비사에게 "끼익 소리가 나요"라는 메모와 함께 고장 난 자동차를 건네줍니다. 정비사는 다른 곳을 망가뜨리지 않으면서 엔진 속의 정확한 느슨한 나사를 찾아내어 고쳐야 합니다.

3. 결과: AI는 여전히 "초보자"이다

연구진은 8개의 가장 똑똑한 AI 모델을 이 새로운 어려운 벤치마크로 테스트했습니다. 결과는 놀라웠습니다:

  • 기존의 쉬운 테스트에서: 최고의 AI들은 거의 **88%**의 정답률을 보였습니다.
  • 새로운 어려운 테스트에서:
    • 왕복 추론 (요약 및 재구축): 최고의 AI도 단 **~23%**만 맞혔습니다.
    • 빈 조각 찾기: 최고의 AI는 **~28%**를 맞혔습니다.
    • 버그 탐정: 최고의 AI는 단 **~12%**만 맞혔습니다.

이것이 의미하는 바: 현재 가장 똑똑한 AI들조차 복잡한 하드웨어 로직을 진정으로 이해하는 데는 매우 서툽니다. 그들은 단순한 작업에서 패턴을 흉내 내는 데는 능숙하지만, 복잡한 문제를 통해 추론하라고 요구하면 크게 어려움을 겪습니다.

4. 이것이 왜 중요한가

이 논문은 AI가 결코 칩을 만들 수 없다고 말하는 것이 아닙니다. 우리가 사용하는 테스트가 너무 쉬웠기 때문에 AI의 능력을 과대평가해 왔다는 점을 지적하는 것입니다.

RTL-BenchLS는 테스트 장소를 유치원 교실에서 전문 엔지니어링 회사로 옮기는 것과 같습니다. 이는 AI가 어디에서 실패하고 있는지(예: 복잡한 로직에 혼란을 느끼거나 버그 리포트의 작은 디테일을 놓치는 등)를 정확히 보여주며, 엔지니어들에게 진보를 측정할 수 있는 실제적인 도구를 제공합니다. 또한, 개선의 여지가 아주 많다는 것을 입증하며, 완전히 자동화된 하드웨어 설계를 향한 여정이 이제 막 시작되었음을 알려줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →