← 최신 논문
🤖 machine learning

DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search

DreamQAS는 정확한 회로 역학을 보존하면서도 비용이 많이 드는 VQE 피드백만을 학습함으로써 양자 아키텍처 탐색을 가속화하는 모델 기반 강화 학습 프레임워크이며, 이를 통해 전통적인 모델 프리 방식과 비교하여 최적의 아키텍처를 찾는 데 필요한 실제 양자 호출 횟수를 크게 줄여줍니다.

원저자: Jiayang Niu, Yan Wang, Jie Li, Ke Deng, Azadeh Alavi, Muhammad Usman, Yongli Ren

게시일 2026-08-03
📖 5 분 읽기🧠 심층 분석

원저자: Jiayang Niu, Yan Wang, Jie Li, Ke Deng, Azadeh Alavi, Muhammad Usman, Yongli Ren

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 완벽한 레고 성을 만드는 법을 가르치려 한다고 상상해 보세요. 하지만 함정이 하나 있습니다. 로봇이 브릭을 하나 추가할 때마다, 당신은 그 미완성된 성을 아주 비싸고 느린 슬로 모션 타임머신으로 보내서 그것이 얼마나 안정적인지 정확히 알아내야 합니다. 이 타임머신의 이름은 변분 양자 고유값 솔버(Variational Quantum Eigensolver, VQE)로, 분자 설계가 제대로 작동하는지 확인하는 황금 표준입니다. 하지만 이 타임머신은 너무 비용이 많이 들고 느려서, 예산이 바닥나기 전까지는 단 몇 천 번만 질문할 수 있습니다. 이것이 바로 양자 컴퓨터가 화학 문제를 해결하기 위한 최적의 회로를 설계하려고 노력하는 분야인 양자 아키텍처 탐색(Quantum Architecture Search, QAS)의 일상적인 고충입니다. 문제는, '진실'을 얻는 비용이 너무 높을 때 어떻게 로봇에게 효율적으로 회로를 만드는 법을 가르칠 것인가 하는 점입니다. 무턱대고 추측할 수도 없지만, 매 동작마다 타임머신에 도움을 요청할 여유도 없습니다.

여기서 'DreamQAS'라는 똑똑한 트릭이 등장합니다. 모든 가능한 성의 정확한 에너지를 예측하려고 노력하는 대신(이는 세상의 모든 거리마다 날씨를 예측하려는 것과 같습니다), 저자들은 로봇이 "꿈을 꾸도록" 가르쳤습니다. 그들은 레고의 규칙을 완벽하게 알고 있는(브릭을 허공에 놓을 수 없으며, 특정 모양끼리만 맞물린다는 규칙 등) 세계 모델을 구축했습니다. 다만 이 모델은 값비싼 타임머신으로부터 오는 '피드백'을 추측하는 법만을 배웁니다. 로봇은 꿈속에서 성을 쌓는 연습을 하며, 자신의 성이 어떻게 버틸지 상상합니다. 그리고 정말 확신이 없거나 특히 유망한 설계가 발견되었을 때만 잠에서 깨어나 실제 타임머신에게 물어봅니다. 그 결과, 이 시스템은 이전 방식들보다 훨씬 적은 횟수의 실제, 값비싼 확인 과정을 거쳐 더 나은 양자 회로를 구축하는 법을 배웠으며, 때로는 좋은 상상력이 실험실에서 가장 효율적인 도구가 될 수 있음을 증명했습니다.

문제점: 값비싼 "타임머신"

양자 컴퓨팅의 세계에서 과학자들은 새로운 약물이나 재료를 발견하기 위해 분자를 시뮬레이션하고자 합니다. 이를 위해 그들은 분자를 표현하는 특정 양자 게이트의 배열인 양자 회로를 사용합니다. 목표는 가장 낮은 에너지를 주는 배열, 즉 분자의 가장 안정적인 상태에 해당하는 배열을 찾는 것입니다. 이 과정이 변분 양자 고유값 솔버(VQE)입니다.

VQE를 매우 엄격하고 매우 느린 판사라고 생각해보세요. 만약 당신이 회로 설계를 보여주면, VQE는 복잡한 최적화 과정을 실행하여 정확한 에너지를 알려줍니다. 하지만 문제는 VQE를 실행하는 데 엄청난 시간과 컴퓨팅 파워가 든다는 점입니다. 양자 아키텍처 탐색(QAS)이라는 전통적인 방식에서, 컴퓨터 프로그램(에이전트)은 한 번에 하나의 게이트를 추가하며 회로를 구축하려고 시도합니다. 에이전트는 게이트를 하나 추가할 때마다 멈춰서 VQE 판사에게 점수를 물어봐야 합니다. 만약 에이전트가 수천 번의 시도로부터 배우고 싶다면, 판사에게 수천 번 물어봐야 합니다. 이것은 마치 체스를 배우면서 매 수마다 그랜드마스터에게 당신의 판을 분석해달라고 요청하는 것과 같습니다. 게임을 배우기도 전에 인내심(과 돈)이 바닥날 것입니다.

해결책: 확인하는 대신 꿈꾸기

이 논문의 저자인 지양 뉴(Jiayang Niu)와 동료들은 VQE 피드백은 비싸지만, 회로를 구축하는 규칙 자체는 매우 단순하고 이미 알려져 있다는 점을 깨달았습니다. 게이트를 추가할 때 어떤 일이 일어나는지는 정확히 알 수 있습니다. 회로는 그저 길어질 뿐입니다. 유일하게 확실하지 않은 것은 그 새로운 회로가 얼마나 좋을지 VQE 체크를 하기 전까지는 알 수 없다는 점입니다.

그래서 그들은 DreamQAS를 만들었습니다. 단순히 추측하는 로봇이나 매 동작마다 판사에게 묻는 로봇 대신, DreamQAS는 "꿈을 꾸는 법"을 배우는 로봇입니다.

꿈이 작동하는 방식은 다음과 같습니다:

  1. 실제 세계: 로봇은 실제 세계에서 몇 개의 회로를 구축하고 VQE 판사에게 점수를 물어보며 시작합니다. 이를 통해 "검증된" 데이터의 작은 더미를 확보합니다.
  2. 꿈의 세계: 이 검증된 데이터를 사용하여 로봇은 "세계 모델"을 구축합니다. 이 모델은 게임의 규칙을 완벽하게 알고 있지만(게이트가 추가될 때 회로가 어떻게 변하는지 정확히 압니다), 실제 데이터에서 본 패턴을 바탕으로 VQE 점수를 추측하는 법을 배웠습니다.
  3. 상상된 훈련: 이제 로봇은 머릿속에서(그의 "꿈" 속에서) 수백 개의 새로운 회로를 구축할 수 있습니다. 게이트를 추가할 때 실제 판사에게 묻는 대신, 꿈의 모델에게 점수를 묻습니다. 로봇은 이 과정을 여러 단계 연속으로 수행하여, 어떤 움직임이 더 나은 결과로 이어지는지 학습하는 긴 "상상된 궤적"을 만들어냅니다.
  4. 안전망: 로봇은 자신의 꿈이 틀릴 수 있다는 것을 알고 있습니다. 그래서 로봇은 일련의 안전 규칙을 가지고 있습니다. 만약 꿈 모델이 확신이 없으면(내부 예측 간의 "불일치"가 높으면), 로봇은 꿈을 멈추고 깨어나 실제 판사에게 물어봅니다. 또한 로봇이 꿈속에서 정말 유망해 보이는 설계를 발견하면, 검증을 위해 잠에서 깨어납니다. 이는 로봇이 실제로 무너질 성을 완벽하다고 믿으며 환상 속에 빠져 허우적거리는 것을 방지합니다.

발견한 점: 꿈은 시간을 아껴준다

연구진은 리튬 하이드라이드(LiH)와 같은 간단한 분자부터 서로 다른 수의 큐비트를 가진 베릴륨 하이드라이드(BeH2)와 같은 더 복잡한 분자에 이르기까지 다섯 가지 다양한 분자 작업에 대해 DreamQAS를 테스트했습니다. 그들은 DreamQAS를 꿈을 꾸지 않거나 다른 전략을 사용하는 다른 방법들과 비교했습니다.

결과는 인상적이었습니다. 이 시뮬레이션에서 DreamQAS는 경쟁 방법들보다 훨씬 적은 실제 VQE 호출을 사용하여 고품질의 회로 설계를 찾아냈습니다.

  • 다섯 가지 작업 중 네 가지에서, DreamQ아는 표준 방식과 동일한 정확도에 도달하기 위해 1.6배에서 2.0배 적은 실제 VQE 호출을 사용했습니다.
  • 가장 복잡한 작업(8 큐비트를 가진 BeH2)의 경우, 절감 효과는 엄청났습니다. DreamQAS는 10.6배 적은 실제 VQE 호출을 사용했습니다.

이는 일반적인 컴퓨터에서 모델을 실행하는 "꿈꾸는" 데 약간의 시간을 투자함으로써, 값비싼 양자 판사에게 낭비될 뻔한 엄청난 양의 시간을 아꼈음을 의미합니다.

왜 "꿈꾸기"가 그냥 "추측하기"보다 더 나은가

누군가는 "왜 꿈 모델을 사용하여 직접 최선의 회로를 선택하지 않는가?"라고 생각할 수 있습니다. 논문은 이를 명시적으로 테스트했습니다. 그들은 꿈 모델을 단순한 가이드로 사용하여 다음 최선의 움직임을 선택하는 "탐욕적(greedy)" 접근 방식을 시도했지만, 전체 꿈 꾸는 과정만큼 효과적이지 않았습니다.

핵심 통찰은 꿈 모델이 완성된 성의 정확한 에너지를 예측하는 데는 완벽하지 않을 수 있지만, 움직임의 상대적 가치를 배우는 데는 매우 뛰어나다는 점입니다. 모델은 "이 게이트를 추가하면 점수가 보통 조금 올라간다"는 것을 배우지만, 최종 점수가 정확히 얼마인지는 모릅니다. 이러한 상대적인 힌트를 여러 단계(다단계 상상)에 걸쳐 사용함으로써, 로봇은 단순히 각 단계에서 가장 "좋아 보이는" 브릭을 고르는 것이 아니라, 전체 회로를 구축하기 위한 더 나은 전략을 배웁니다.

또한 논문은 로봇이 자신의 확신도를 판단하는 능력이 매우 중요하다는 것을 보여주었습니다. 모델은 자신이 확신이 없을 때(내부 "꿈꾸는 자들" 사이의 불일치가 높을 때)를 스스로 알 수 있습니다. 확신이 없을 때 로봇은 꿈을 멈추고 실제 세계를 확인합니다. 이러한 "불확실성을 인지하는" 행동은 로봇이 나쁜 아이디어에 시간을 낭비하거나 잘못된 추측의 루프에 빠지는 것을 방지합니다.

결론

DreamQAS는 값비싼 양자 판사를 대체하려는 것이 아니라, 로봇이 언제 도움을 요청해야 할지 더 똑똑하게 판단하도록 만드는 것입니다. 회로 구축의 알려진 규칙과 값비싼 피드백을 분리하고, "꿈" 단계를 통해 연습함으로써, 이 시스템은 훨씬 더 빠르게 더 나은 양자 회로를 구축하는 법을 배웁니다.

모든 계산에 막대한 시간과 에너지가 드는 양자 화학의 세계에서, 이 접근 방식은 새로운 방향을 제시합니다. 문제를 힘으로 밀어붙이지 마세요. 규칙을 이해하는 모델을 만들고, 그것이 가능성을 꿈꾸게 하며, 정말 중요할 때만 깨어나 현실을 확인하세요. 저자들은 이 방법이 더 나은 설계를 찾아낼 뿐만 아니라 훨씬 적은 비용으로 가능하다는 것을 발견했으며, 이는 유용한 양자 시뮬레이션으로 가는 길을 조금 더 완만하게 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →