← 최신 논문
💻 computer science

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

CHORUS는 행동적으로 다양한 체크포인트와 밀집 보상 강화 학습을 활용하여 상호 보완적인 전문가 모델들을 생성하고, 이를 하나의 4B 모델로 통합함으로써 고커버리지 하드웨어 검증 테스트벤치 자극 생성 분야에서 더 큰 규모의 최첨단 모델들을 크게 능가하는 사후 학습 프레임워크이다.

원저자: Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao

게시일 2026-08-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 거대하고 믿기지 않을 정도로 복잡한 레고 성과 같은 세상이 있다고 상상해 보세요. 엔지니어들이 실제로 이 성을 짓기 전에는, 모든 벽돌이 완벽하게 맞는지, 그리고 바람이 불 때 전체 구조물이 무너지지 않을지 확인해야 합니다. 이를 위해 그들은 특별한 "테스트 스크립트"를 작성합니다. 이는 마치 로봇이 성 주변을 뛰어다니며 벽을 흔들어보고, 문을 열어보며 모든 것이 제대로 작동하는지 확인하는 것과 같습니다. 이 과정을 하드웨어 검증(hardware verification)이라고 부르며, 이는 우리의 휴대폰, 자동차, 컴퓨터에 숨겨진 버그가 없도록 만드는 매우 중요한 부분입니다.

오랫동안 사람들은 최적의 테스트를 찾아내기 위해 더 크고 더 큰 "두뇌"(컴퓨터 모델)를 만드는 것만이 발전하는 유일한 방법이라고 생각했습니다. 하지만 최근, 거대 언어 모델(LLM)이라 불리는 새로운 종류의 똑똑한 컴퓨터 두뇌가 이 과정을 돕기 시작했습니다. 이 모델들은 코드를 작성하는 데 능숙하지만, 종종 자신의 실수를 통해 배우기 위한 약간의 자극이 필요합니다. 단순히 교과서를 읽는 대신, 그들은 자신의 코드를 직접 "실행"해 보고, 그것이 깨지는지 확인한 뒤 다시 시도합니다. 이것은 마치 매뉴얼을 그냥 읽는 것이 아니라, 게임 레벨을 직접 플레이하며 죽기도 하고, 다시 도전하며 클리어 방법을 익히는 것과 같습니다. 연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 이 모델들을 단순히 무한히 크고 비싸게 만드는 대신, 하드웨어를 테스트하는 진정한 전문가로 만들 수 있을까?

여기, 게임의 판도를 바꾸는 새로운 방법인 CHORUS가 등장합니다. 하나의 거대하고 초지능적인 모델이 모든 것을 다 하게 만드는 대신, 연구자들은 전문가가 되는 길에는 흥미로운 우회로들이 있다는 사실을 깨달았습니다. 그들은 모델을 단계별로 훈련하면 여러 가지 서로 다른 "버전"의 모델이 만들어진다는 것을 발견했습니다. 이 버전들은 최종적으로 비슷한 전체 점수를 기록하더라도, 실제로는 각기 다른 분야의 전문가입니다. 예를 들어, 어떤 모델은 주방을 테스트하는 데 뛰어나고, 다른 모델은 차고를 테스트하는 데 귀재인 식입니다.

이 논문은 이러한 서로 다른 "전문가" 버전들을 결합함으로써, 단독으로 존재할 때보다 훨씬 더 강력한 단일 슈퍼 모델을 만들 수 있다는 것을 보여줍니다. 실제로, 이 새로운 40억 파라미터(4-billion-parameter) 규모의 상대적으로 작고 컴팩트한 모델은 주요 하드웨어 테스트 챌린지에서 **88.0%**의 점수를 기록했습니다. 이는 훨씬 더 거대한 유명 모델인 DeepSeek-R1(6710억 파라미터)보다 13.5 퍼센트 포인트나 높은 수치입니다.

그들이 어떻게 해냈는지, 간단한 비유를 통해 설명하겠습니다.

"단계별" 훈련:
여러 명의 운동선수를 훈련시킨다고 상상해 보세요. 보통은 가장 뛰어난 선수를 뽑아 완벽해질 때까지 계속 훈련시킵니다. 하지만 CHORUS 팀은 다른 방식을 택했습니다. 그들은 세 명의 서로 다른 운동선수를 동일하게 엄격한 단계들을 거쳐 훈련시켰습니다. 훈련이 끝난 후, 세 명 모두 체력은 거의 비슷했지만, 각자의 강점은 달랐습니다. 한 명은 단거리 선수였고, 한 명은 마라톤 선수였으며, 다른 한 명은 높이뛰기 선수였습니다.

"상호 보완적" 발견:
연구자들은 이 선수들이 단순히 똑같은 일을 하는 것이 아니라는 점에 주목했습니다. 특정 장애물에 직면했을 때, 단거리 선수는 실패할 수 있지만 높이뛰기 선수는 가뿐히 넘을 수 있었습니다. 그들은 "상호 보완적"이었습니다. 만약 평균 점수만 본다면 그들이 모두 같다고 생각하겠지만, 그들이 어떤 장애물을 넘을 수 있는지 살펴보면 완전히 다릅니다.

"결합"의 마법:
팀은 다음과 같이 질문했습니다. "이 세 명의 운동선수를 하나의 슈퍼 운동선수로 합칠 수 있을까?"

  1. 단순한 혼합 (훈련 없는 병합): 그들은 단순히 그들의 근육을 하나로 평균 내어 합치는 시도를 했습니다. 효과는 조금 있었고, 단일 모델보다 나은 성능을 보였지만 완벽하지는 않았습니다.
  2. 스마트한 코치 (적응형 증류): 이것이 진정한 돌파구였습니다. 그들은 새로운 학생 선수를 만들고 코치 역할을 수행했습니다. 새로운 장애물이 나타날 때마다, 코치는 세 명의 전문가를 보고 물었습니다. "이 특정 상황에 가장 적합한 사람은 누구인가?" 만약 단거리 선수가 가장 적합하다면 학생은 단거리 선수로부터 배웁니다. 만약 높이뛰기 선수가 가장 적합하다면 그에게서 배웁니다. 결정적으로, 만약 전문가 중 누구도 학생보다 더 잘할 수 없다면, 코치는 학생이 나쁜 습관을 배우지 않도록 그 과제를 건너뛰었습니다.

결과:
이 "스마트한 코치" 방법을 사용함으로써, 새로운 단일 모델은 모든 장애물의 마스터가 되었습니다. 이 모델은 단순히 기술을 평균 낸 것이 아니라, 매 상황마다 최선의 기술을 선택했습니다. 결과적으로, 이 작고 효율적인 모델은 업계의 거대한 거인들을 압도했습니다.

이 논문은 단순히 모델을 크게 만드는 것만으로는 이 문제를 해결할 수 없다는 점을 명시적으로 부정합니다. 그들은 거대한 6,710억 파라미터 모델조차 자신들의 작은 40억 파라미터 모델만큼의 성능에 도달할 수 없음을 보여주었습니다. 또한, 단순히 하나의 모델을 더 오래 훈련시키는 것도 도움이 되지 않는다는 것을 발견했습니다. 핵심은 고유하고 상호 보완적인 강점을 보존하기 위해 서로 다른 "단계"의 훈련을 유지하는 것이었습니다.

요약하자면, CHORUS는 하드웨어 테스트의 세계에서 다양한 전문가 팀을 보유하고 그들의 고유한 재능을 결합하는 법을 아는 것이, 하나의 거대하고 전지전능한 두뇌를 갖는 것보다 훨씬 더 강력하다는 것을 증명합니다. 이는 때때로 최고의 천재가 되는 방법은 자신의 서로 다른 내면의 목소리에 귀를 기울이는 법을 아는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →