← 최신 논문
⚛️ quantum physics

RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis

RubriQ는 하드웨어 제약 조건을 엄격히 준착하면서도 높은 충실도를 유지하는 동시에 상당한 수준의 T-게이트 압축을 달성하는 결함 허용 양자 회로를 자동으로 합성하기 위해, GPU 가속 시뮬레이션과 루브릭 가이드형 그룹 상대 정책 최적화(GRPO)를 활용하는 확장 가능한 HPC 기반 프레임워크이다.

원저자: Ziqing Guo, Ziwen Pan

게시일 2026-07-09
📖 3 분 읽기🧠 심층 분석

원저자: Ziqing Guo, Ziwen Pan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 구체적이고, 비싸며, 깨지기 쉬운 레고 브릭들을 사용하여 복잡한 기계를 만들려고 한다고 상상해 보십시오. 당신에게는 마스터 설계도(실행하려는 알고리즘)가 있지만, 당신이 가진 지침서는 "날아다니는 자동차를 만드시오"와 같은 모호하고 높은 수준의 언어로 작성되어 있습니다.

문제는 공장 바닥(양자 컴퓨터)에 엄격한 규칙이 있다는 것입니다:

  1. 브릭은 희귀합니다: 특정 유형의 브릭(T-게이트)은 만드는 비용이 매우 많이 듭니다. 당신은 이 브릭을 최대한 적게 사용하고 싶어 합니다.
  2. 배치가 특이합니다: 어떤 기계(IBM 등)는 브릭들이 바로 옆에 붙어 있는 것들만 연결할 수 있게 허용합니다. 반면 다른 기계(IonQ 등)는 어떤 브릭이든 서로 연결할 수 있게 해줍니다.
  3. 목표: 당신은 이 모호한 "날아다니는 자동차" 아이디어를 가장 적은 수의 비싼 브릭을 사용하면서도 공장의 배치 규칙을 준수하는 정밀하고 단계적인 지침서로 바꾸어야 합니다.

RubriQ는 이 퍼즐을 자동으로 해결하기 위해 설계된 새로운 시스템입니다. 작동 방식은 다음과 같습니다.

1. "스마트한 작가" (LLM)

고정된 규칙 목록을 따르는 경직된 컴퓨터 프로그램 대신, RubriQ는 **대규모 언어 모델(LLM)**을 사용합니다. 이것은 수백만 개의 설명서를 읽은 매우 똑똑하고 창의적인 작가라고 생각하면 됩니다.

  • 당신은 작가에게 프롬프트를 줍니다: "4-큐비트 푸리에 변환을 위한 양자 회로를 작성하라."
  • 작가는 코드를 생성하려고 시도합니다. 때로는 완벽한 코드를 쓰기도 하지만, 때로는 엉터리를 쓰거나 단계를 누락하기도 합니다.

2. "엄격한 선생님" (루브릭)

과거에 이 작업을 수행하기 위해 AI를 훈련시킬 때는, 컴퓨터가 마지막에 가서야 "잘했어" 또는 "못했어"라고 말하곤 했습니다. 이것은 학생이 기말고사를 치를 때까지 왜 틀렸는지 설명해주지 않고 단순히 합격/불합격만 알려주는 선생님과 같습니다. 이는 학습을 느리고 답답하게 만듭니다.

RubriQ는 **루브릭(Rubric)**을 도입했습니다. 이는 루브릭이 마치 선생님이 사용하는 상세한 채점 기준표와 같습니다. 단순히 "통과/실패"를 말하는 대신, 시스템은 생성된 코드를 다섯 가지 특정 차원에서 점검합니다:

  • 클리포드 점수 (Clifford Score): 저렴하고 흔한 브릭들을 사용했는가?
  • T-카운트 점수 (T-Count Score): 비싸고 희귀한 브릭의 사용을 최소화했는가?
  • 하드웨어 점수 (Hardware Score): 이 코드가 타겟팅하는 특정 기계(IBM 또는 IonQ)에 실제로 적합한가?
  • 충실도 점수 (Fidelity Score): 기계가 실제로 당신이 요청한 대로 작동하는가?
  • 효율성 점수 (Efficiency Score): 지침서가 짧고 깔끔한가?

시스템은 AI에게 각 영역에 대한 점수를 제공합니다. 이는 "조밀한(dense)" 신호, 즉 풍부한 피드백을 제공하여, AI가 단순히 추측하는 것이 아니라 자신의 코드 중 어느 부분을 수정해야 하는지 정확히 알 수 있게 합니다.

3. "그룹 경연" (GRPO)

AI를 가르치기 위해 RubriQ는 **그룹 상대 정책 최적화(GRPO)**라는 방법을 사용합니다.

  • AI에게 문제를 연속으로 8번 풀어보라고 요청한다고 상imagine 해보십시오.
  • 당신은 어떤 것이 최고인지 판단하기 위해 별도의 "심판" AI를 필요로 하지 않습니다. 대신, 그 8개의 답변을 서로 비교하기만 하면 됩니다.
  • 루브릭 점수가 가장 높은 것이 "엄지 척"을 받고, 점수가 낮은 것들은 "엄지 아래로" 내려갑니다.
  • AI는 자신의 그룹 내에서 승자와 패자를 관찰함으로써 학습하며, 다음번에 더 많은 "승자"를 만들어낼 수 있도록 자신의 글쓰기 스타일을 조정합니다.

4. "슈퍼 팩토리" (HPC)

이 AI를 훈련시키는 것은 엄청난 작업입니다. 양자 회로를 시뮬레이션하는 것은 가능한 모든 미래의 날씨를 동시에 계산하는 것과 같아서, 막대한 컴퓨팅 파워를 요구합니다.

  • 연구진은 수백 개의 강력한 그래픽 카드(GPU)를 갖춘 슈퍼컴퓨터인 NERSC Perlmutter에서 이를 실행했습니다.
  • 그들은 AI가 코드를 생성하고, 파서(parser)가 읽기 가능한지 확인하며, 시뮬레이터가 "가상 공장 바닥"에서 실행하여 점수를 확인하는 파이프라인을 구축했습니다.
  • "루브릭" 방식을 사용했기 때문에, AI는 모호한 "통과/실패" 신호에 의존했던 이전 방식보다 2~3배 더 빠르게 학습했습니다.

결과

연구진이 RubriQ를 테스트했을 때의 결과는 다음과 같습니다:

  • 자원을 절약했습니다: 표준 도구들과 비교했을 때 비싼 "T-게이트"의 수를 평균 3.3배 줄였습니다.
  • 정확했습니다: 생성된 회로들은 IBM과 IonQ의 실제 양자 컴퓨터에서 테스트했을 때 실제로 작동했습니다.
  • 효율적이었습니다: 훨씬 적은 훈련 단계만으로 목표에 도달하여, 엄청난 양의 전기와 컴퓨터 시간을 절약했습니다.

요약하자면: RubriQ는 창의적인 AI 작가에게 상세한 체크리스트(루브릭)를 제공하여 양자 회로를 만드는 법을 가르치고, 자신의 시도들을 서로 비교하며 학습하게 하며, 결과가 실제 세계의 양자 기계에 적합하도록 거대한 슈퍼컴퓨터를 사용하여 실행하는 시스템입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →