← 최신 논문
⚛️ quantum physics

Approximate Quantum State Preparation Through Proximal Policy Optimization

본 논문은 다양한 다중 큐비트 시나리오에서 높은 충실도(101410^{-14})로 타겟 상태를 근사하는 최적의 양자 회로를 효율적으로 탐색하면서 게이트 수를 최소화하기 위해 근사 정책 최적화(Proximal Policy Optimization)에 기반한 심층 강화 학습 프레임워크를 제안한다.

원저자: Marco Mordacci, Michele Amoretti

게시일 2026-07-24
📖 4 분 읽기🧠 심층 분석

원저자: Marco Mordacci, Michele Amoretti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

퀀텀 레고 챌린지 (The Quantum Lego Challenge)

상상해 보세요. 당신은 아주 복잡하고 정교한 레고 조각들로 특정한 조형물을 만들려고 합니다. 그런데 단순히 블록을 끼워 맞추는 것이 아니라, 조각을 하나 추가할 때마다 전체 구조가 일반적인 물리 법칙을 거스르는 방식으로 움직이고, 회전하고, 색깔이 변한다고 상상해 보세요. 이것이 바로 **양자 컴퓨팅(Quantum Computing)**의 세계입니다. 단순한 온/오프 스위치(비트)를 사용하는 주머니 속의 컴퓨터와 달리, 양자 컴퓨터는 동시에 여러 상태로 존재할 수 있는 "큐비트(qubit)"를 사용합니다. 이러한 기계가 유용하게 작동하도록 만들기 위해, 과학자들은 먼저 **양자 상태 준비(Quantum State Preparation, QSP)**라는 까다로운 춤을 수행해야 합니다. 이것은 "설정" 단계라고 생각하면 됩니다. 모든 것이 0인 빈 도화지 상태에서 시작하여, 원하는 특정한 패턴을 형성할 때까지 큐비트를 비틀고 돌려야 합니다.

문제는 큐비트를 더 많이 추가할수록 가능한 배열의 수가 폭발적으로 늘어난다는 점입니다. 이는 마치 가능한 레시피의 수가 당신이 셀 수 있는 속도보다 더 빠르게 증가하는 우주에서 완벽한 레고 레시피를 찾는 것과 같습니다. 만약 레시피를 잘못 만든다면, 양자 컴퓨터는 작동하지 않을 것입니다. 수년 동안 인간은 이 레시피를 직접 작성하려고 노력해 왔지만, 그것은 형태가 계속 변하는 미로를 푸는 것과 같습니다. 여기서 **강화 학습(Reinforcement Learning)**이 등장합니다. 이것은 인공지능의 한 종류로, 강아지가 간식을 받기 위해 앉는 법을 배우는 것처럼 시행착오를 통해 학습합니다. AI는 행동을 시도하고, 결과가 목표에 가까우면 "보상"을 받고, 목표에서 멀어지면 "벌칙"을 받으며, 사람의 도움 없이도 최적의 경로를 천천히 찾아냅니다.

논문의 이야기: 로봇에게 양자 회로를 만드는 법 가르치기

이 논문에서 파르마 대학교의 마르코 모르다치(Marco Mordacci)와 미켈레 아모레티(Michele Amoretti)는 이 레고 퍼즐을 해결하기 위한 새로운 방법을 제안합니다. 그들은 **근사 정책 최적화(Proximal Policy Optimization, PPO)**라는 특정 유형의 강화 학습을 사용하여 디지털 "에이전트"(똑똑한 로봇 두뇌)를 구축했습니다. 그들의 목표는 단순하지만 어려웠습니다. 이 에이전트가 수학적으로 허용되는 최대한의 완벽함에 근접하면서도, 가능한 한 적은 수의 "게이트"(양자 버전의 레고 블록)를 사용하여 특정 목표 상태를 만드는 양자 회로를 구축하도록 가르치는 것이었습니다.

에이전트는 단계별로 작동합니다. 현재 양자 시스템의 상태를 살펴보고 새로운 게이트를 하나 추가할지 결정합니다. 에이전트가 선택할 수 있는 게이트는 기본적인 도구 상위와 같습니다. 세 가지 유형의 단일 큐비트 회전(단일 블록을 다양한 방향으로 돌리는 것: RxR_x, RyR_y, RzR_z)과 두 큐비트를 연결하는 "얽힘(entangling)" 게이트인 CNOT(두 블록을 하나처럼 움직이도록 결합하는 것)이 있습니다. 에이전트가 게이트를 추가할 때마다, 컴퓨터는 결과를 목표에 최대한 가깝게 만들기 위해 회전 각도를 미세하게 조정하는 짧은 미니 훈련 세션을 실행합니다. 결과가 더 가까워지면 에이전트는 보상을 받고, 결과가 멀어지거나 너무 많은 게이트를 사용하면 벌칙을 받습니다.

연구진은 이 "로봇 설계사"를 2개에서 5개의 큐비트로 늘려가며 다양한 도전 과제에 대해 테스트했습니다. 그들은 에이전트에게 유명하고 미리 정의된 패턴(벨(Bell), GHZ, W, 디크(Dicke) 상태와 같이 잘 알려진 레고 모델 같은 것들)과 완전히 무작위적이고 무질서한 패턴을 구축하도록 요청했습니다.

결과는 인상적이었으며, 특히 작은 시스템에서 그러했습니다. 2-큐비트 및 3-큐비트 작업에서 에이전트는 항상 절대적인 이론적 최소치는 아니더라도 매우 효율적인 솔루션을 찾아냈습니다. 예를 들어, "벨 상태"(단순한 2-큐비트 연결)를 구축하라는 요청을 받았을 때, 에이전트는 (자신의 도구 상위에 없는 도구인) 하다마드(Hadamard) 게이트를 사용하는 정확한 이론적 해법을 찾지는 못했습니다. 대신, 목표를 달기 위해 회전 게이트(RyR_y)를 사용하여 근사치를 구현했습니다. 무작위 2-큐비트 상태를 다룰 때, 에이전트는 일관되게 7개의 게이트를 사용하여 솔루션을 찾아냈는데, 이는 다른 과학자들이 계산한 최소 필요량과 일치합니다. 그러나 논문은 어떤 경우에 에이전트가 최적의 솔루션으로 수렴하지 못할 수도 있다고 언급합니다. 즉, 최적의 게이트는 식별하지만 벌칙이 불충분하여 게이트를 과도하게 사용할 수 있으며, 이 경우 나중에 수동으로 단순화하는 과정이 필요합니다. 이러한 특성에도 불구하고, 에이전트는 매우 정밀하여 오차율을 101410^{-14}까지 낮출 수 있었으며, 이는 결과가 완벽한 목표와 구분이 거의 불가능함을 의미합니다.

하지만 퍼즐이 커질수록 이야기는 조금 더 복잡해집니다. 연구진이 4-큐비트 및 5-큐비트 시스템을 시도했을 때, 에이전트는 여전히 학습은 했지만 매번 절대적으로 가장 짧은 경로를 찾지는 못했습니다. 무작위 4-큐비트 상태의 경우, 에이전트는 보통 47개에서 70개 사이(평균 약 63개)의 게이트를 사용하여 회로를 구축했으나, (수동 정리 후의) "최적화된" 버전은 약 53개까지 줄일 수 있었습니다. 5-큐비트의 경우, 탐색 공간이 너무 방대해져서 에이전트가 허용된 시간 내에 작업을 완벽히 끝내지는 못했지만, 기초적인 사항은 여전히 배울 수 있음을 보여주었습니다.

저자들은 또한 에이전트가 막혔을 때 도움을 줄 수 있는 영리한 트릭을 발견했습니다. 에이전트가 지금까지 찾아낸 최고의 회로 10개를 저장하고 가끔씩 이를 바탕으로 재학습하는 "성공 버퍼(success buffer)"를 사용함으로써, 로봇은 더 나은 솔루션을 더 빠르게 찾을 수 있었습니다. 또한, "보상"을 계산하는 방식, 특히 미세한 개선이 큰 승리처럼 느껴지도록 로그 스케일을 사용하는 방식을 변경함으로써, 에이전트가 이미 99.999% 정확도에 도달했을 때도 계속 학습할 수 있다는 것을 발견했습니다.

결론적으로, 이 논문은 AI 기반 접근 방식이 양자 회로를 설계하는 강력한 새로운 도구임을 시사합니다. 이 방식은 단순히 인간의 아이디어를 복제하는 것이 아니라, 스스로 가능성의 공간을 탐구합니다. 큐비트 수가 증가함에 따라 발생하는 복잡성의 벽(문제의 지수적 특성상 예상된 결과임)에 부딪히기도 하지만, 이 프레임워크는 소-중규모 양자 시스템을 위한 설계 과정을 성공적으로 자동화하며 101410^{-14} 수준의 낮은 오차를 달자했습니다. 저자들은 향론의 과제로 훈련 속도를 더욱 높이고, 이 아이디어들을 더 큰 양자 시스템에 테스트하여, 언젠가 이 AI 설계사들이 실제 세상의 양자 컴퓨터에 필요한 복잡한 회로를 설계할 수 있기를 바란다고 밝혔습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →