RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis
RubriQ는 알고리즘적 정확성, 표면 코드 비용 최소화, 그리고 근미래적 하드웨어 제약 조건을 동시에 충족하는 양자 회로의 합성을 자동화하기 위해 루브릭 가이드 그룹 상대 정책 최적화(GRPO)를 활용하는 확장 가능한 HPC 기반 프레임워크입니다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 오늘날 우리가 가진 그 어떤 컴퓨터로도 불가능한 문제를 해결할 수 있는 기계를 만들려고 한다고 상상해 보십시오. 이 기계는 **양자 컴퓨터(quantum computer)**로, 아주 작은 입자들의 기묘한 규칙을 사용하여 빛의 속도로 수학 계산을 수행하는 장치입니다. 하지만 여기 함정이 있습니다. 이 기계들은 믿을 수 없을 정도로 취약합니다. 이를 작동시키기 위해서는 우리의 크고 복잡한 아이디어들을 기계가 이해할 수 있는 매우 구체적이고 낮은 수준의 언어인 "게이트(gate, 스위치와 같은 것)"로 번역해야 합니다.
문제는 이 번역 작업이 악몽 같다는 점입니다. 단순히 표준 컴퓨터에게 이 일을 시키면, 수학적 규모가 너무 커져서 시스템이 충돌합니다. 현재의 기술로 이 기계를 만들려고 하면, 너무 노이즈가 많고 오류가 발생하기 쉽습니다. 그래서 과학자들은 중간 지점에 갇혀 있습니다. 즉, 미래의 슈퍼 머신에는 완벽하면서도, 현재의 불안정한 프로토타입에서도 실제로 실행할 수 있을 만큼 단순한 회로를 설계해야 합니다. 이는 마치 5성급 호텔의 만찬 레시피를 쓰되, 유치원생 아이가 주방을 다 태워 먹지 않고도 요리할 수 있도록 만드는 것과 같습니다.
여기에 RubriQ라는 새로운 도구가 등장했습니다. 이 도구는 이러한 양자 레시피를 위한 매우 똑똑하고 지치지 않는 편집자 역할을 합니다. 단순히 추측하고 확인하는 대신, RubriQ는 수천 가지의 변형을 동시에 시도하며 학습하는 거대한 AI를 사용하며, 이 과정은 AI가 어떻게 개선되어야 하는지 정확히 알려주는 엄격한 "루브릭(rubric, 채점 기준표)"에 의해 안내됩니다. RubriQ는 단순히 '적당히 좋은 것'을 찾는 것이 아니라, 수학적으로 결점이 없으면서도 현재의 실제 하드웨어에서 실행 가능할 만큼 실용적인 것 사이의 완벽한 균형을 찾아냅니다.
RubriQ 이야기: AI에게 양자 건축가가 되는 법을 가르치기
양자 회로를 설계하는 것을 학생에게 이야기를 써보라고 요청하는 것에 비유해 봅시다. 과거에 컴퓨터에게 양자 프로그램을 작성하도록 요청하는 것은, 학생에게 "멋진 것을 써봐"라는 모호한 프롬프트를 주고 그들이 헛소리를 하지 않기를 바라는 것과 같았습니다. 만약 결과가 잘못되었다면, 당신은 단지 "아니야, 다시 해봐"라고 말할 뿐, 무엇이 왜 틀렸는지에 대해서는 알지 못했습니다. 이것이 기존 방식의 문제였습니다. 그들은 "희소한 보상(sparse reward)"을 제공했는데, 이는 AI가 100% 완벽한 답을 냈을 때만 점수를 주고 그 외의 모든 경우에는 0점을 주는 방식이었습니다. 이 방식은 학습을 믿을 수 없을 정도로 느리고 좌절스럽게 만들었습니다. 마치 어둠 속에서 자전거 타기를 배우는 것과 같았습니다.
RubriQ는 상세한 채점 루브릭을 가진 엄격하지만 도움이 되는 선생님 역할을 하며 게임의 판도를 바꿉니다. 단순히 "합격" 또는 "불합격"이라고 말하는 대신, 다섯 가지 특정 카테고리로 점수를 세분화합니다:
- 작동하는가? (이야기가 말이 되는가).
- 효율적인가? (단어를 너무 많이 사용했는가? 양자 용어로는, 비용이 많이 들고 자원을 많이 소모하는 부분인 "T-게이트"를 최소화하는 것에 관한 것입니다).
- Clifford 중심인가? (너무 화려하고 만들기 어려운 동작이 많은지, 아니면 주로 단순한 동작인지).
- 오늘날의 기계에서 실행 가능한가? (정사각형 구멍을 원형 구멍에 끼우려는 것처럼, 특정 하드웨어의 형태에 잘 맞는가?).
- 빠른가? (몇 단계나 걸리는가?).
이 논문은 **그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)**라고 불리는 방법을 소개합니다. AI가 새로운 요리를 발명하려는 요리사라고 상상해 보십시오. 요리 하나를 만들고 리뷰를 기다리는 대신, RubriQ는 요리사에게 동시에 여덟 가지 다른 버전의 요리를 만들라고 요청합니다. 그런 다음, 이 버전들을 서로 비교합니다. 만약 한 버전이 다른 버전들보다 약간 더 낫다면, AI는 더 많이 그렇게 만들도록 학습합니다. 만약 어떤 버전이 엉망이라면, AI는 그 경로를 피하는 법을 배웁니다. 이러한 "그룹" 비교는 단 하나의 완벽한 답을 기다리는 것보다 훨씬 빠르고 안정적입니다.
그들은 어떻게 기계를 만들었나
이것이 작동하게 만들기 위해 연구진은 거대한 엔진을 구축해야 했습니다. 노트북에서 이 작업을 실행할 수는 없었으며, 로런스 버클리 국립 연구소의 NERSC Perlmutter 슈퍼컴퓨터 클러스터의 힘이 필요했습니다. 그들은 AI에 사용되는 고성능 그래픽 카드인 8개의 NVIDIA A100 GPU를 사용하여 시뮬레이션을 실행했습니다.
여기서 영리한 부분은 이렇습니다. AI는 단순히 추측하지 않습니다. AI는 **프로그래밍 방식의 루브릭(programmatic rubric)**을 사용합니다. 즉, "선생님"은 혼란을 겪을 수 있는 블랙박스 형태의 신경망이 아니라, 수학, 비용, 하드웨어 제한을 즉각적으로 체크하는 하드코딩된 규칙들의 집합입니다. 만약 AI가 멋져 보이지만 수학적으로 실패하는 회로를 생성하면, 루브릭은 즉시 0점을 부여합니다. 만약 작동은 하지만 너무 비싼 "T-게이트"를 많이 사용하는 회로를 생성한다면, 루브릭은 더 낮은 점수를 주어 더 효율적이 되도록 유도합니다.
또한 그들은 주요 병목 현상을 해결했습니다: 바로 시뮬레이션 속도입니다. 양자 회로가 작동하는지 확인하는 작업은 보통 전체를 시뮬레이션해야 하는데, 이는 큐비트(양자 비트)를 추가할수록 기하급수적으로 어려워집니다. RubriQ는 이 과정을 GPU에서 직접 실행할 수 있게 해주는 도구인 CUDA-Q를 통합하여, 표준 CPU에서 실행할 때보다 수천 배 더 빠르게 프로세스를 진행할 수 있었습니다.
그들이 발견한 것
결과는 유망하지만, 저자들은 이를 마법의 해결책이라기보다는 중요한 진전으로 신중하게 표현하고 있습니다.
- 기존 방식보다 더 잘 작동합니다: 1,500개의 서로 다른 양자 작업에 대해 테스트했을 때, RubriQ는 정확도 면에서 96%의 통과율을 달알성했습니다. 이는 거의 매번 시도할 때마다 실제로 수학을 올바르게 수행하는 회로를 생성했다는 의미입니다.
- 훨씬 더 효율적입니다: 양자 컴퓨터에서 가장 중요한 지표는 "T-카운트(T-count, 값비싼 게이트의 수)"입니다. RubriQ는 단순히 "정확하기만 한" 회로와 비교했을 때, 이러한 게이트의 수를 평균 3.31배 압축했습니다. 이는 T-게이트가 적을수록 컴퓨터가 필요한 자원과 실행 시간이 줄어든다는 점에서 매우 큰 성과입니다.
- 더 빠르게 학습합니다: 상세한 루브릭을 사용하기 때문에, 완벽한 점수를 기다리는 대신 RubriQ는 희소한 보상에 의존하는 다른 강화 학습 방법들보다 2~3배 더 빠르게 수렴(학습 완료)했습니다.
- 실제 하드웨어에 준비되어 있습니다: 연구팀은 시뮬레이션에서 멈추지 않았습니다. 그들은 RubriQ가 생성한 최고의 회로들을 가져와 IBM과 IonQ의 실제 양자 컴퓨터에서 실행했습니다. 그 결과, 생성된 회로들이 하드웨어 제약 조건을 1% 미만으로 위반하며 해당 기기들과 호환된다는 것을 발견했습니다.
이것이 의미하는 바
이 논문은 양자 회로 합성을 엄격하고 다차원적인 루브릭에 의해 유도되는 코드 생성 작업으로 취급함으로써, 고품질의 양자 프로그램을 자동화할 수 있다고 제안합니다. 또한 AI의 작업을 판단하기 위해 복잡하게 학습된 "비평가(critic)" 네트워크가 필요하다는 생각에 반론을 제기하며, 대신 명확한 규칙 기반의 점수 체계가 더 효과적이고 실행 비용도 저렴하다고 주장합니다.
이 논문이 양자 컴퓨팅의 모든 문제를 해결했다고 주장하는 것은 아니지만, 실질적인 발전 방향을 보여줍니다. 대규모 언어 모델(LLM)의 창의적인 힘과 프로그래밍 방식 루브릭의 엄격한 규율을 결합함으로써, RubriQ는 수학적으로 건전할 뿐만 아니라 오늘날의 노이즈가 많고 불완든 기계에서도 실행 가능하며, 나아가 미래의 결함 허용(fault-tolerant) 거대 시스템을 준비할 수 있는 회로를 설계하는 방법을 제시합니다. 이는 혼란스러운 현재의 하드웨어 현실과 순수한 미래 양자 컴퓨팅 세계 사이를 잇는 가교 역할을 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.