Scalable Quantum Machine Learning: Trainability, Expressivity and Efficiency
이 논문은 시뮬레이션의 난해함과 학습 비용 사이의 균형을 맞추는 조절 가능한 파라미터 를 통해 배런 플래토(barren plateaus)를 극복하고, 고전적 계산 불가능성을 보장하며, 효율적인 그래디언트 계산을 달성하는 확장 가능한 페르미온 양자 아키텍처인 "유니터리 브릭 월(unitary brick-wall)"을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
지능형 기계를 구축하려는 탐구 과정에서, 과학자들은 오랫동안 양자 세계에서 우위를 점할 수 있는 실마리를 찾아왔습니다. 원자와 빛을 지배하는 기이한 물리 법칙을 활용하는 양자 컴퓨터는 오늘날 우리가 가진 그 어떤 기계보다 특정 문제를 훨씬 빠르게 해결할 것을 약속합니다. 유망한 경로 중 하나는 양자 머신러닝으로, 여기서 이러한 장치들은 현대 인공지능을 구동하는 신경망과 유사하게 패턴을 인식하거나 예측을 수행하도록 훈련됩니다. 그러나 수년 동안 이 분야는 어려운 상황에 처해 있었습니다. 연구자들은 복잡한 양자 회로를 설계할 수는 있었지만, 학습을 가이드할 컴퓨터의 신호가 너무 약해져서 훈련 과정이 완전히 실패하는 벽에 부딪히는 경우가 많았습니다. 더욱이, 훈련이 성공하더라도 이 양자 기계가 실제로 고전 컴퓨터가 할 수 없는 일을 하고 있는지, 혹은 그것을 충분히 효율적으로 수행하여 유용성을 가질 수 있는지에 대한 증명이 없었습니다. 과제는 훈련하기 쉬우면서도 진정한 이점을 제공할 만큼 강력한 설계를 찾는 것이었습니다.
이오다니스 케레니디스(Iordanis Kerenidis)의 새로운 연구는 두 가지 특정 양자 회로 설계를 제안함으로써 이 교착 상태에 대한 해결책을 제시합니다. 이 연구는 이러한 기계들이 신호를 잃지 않고 효과적으로 훈련될 수 있게 하는 동시에, 그들이 수행하는 작업이 가장 잘 알려진 고전 컴퓨터조차 시뮬레이션하기 어려울 정도로 복잡하도록 보장하는 방법을 소개합니다. 이 돌파구의 핵심은 시스템의 특정 속성, 즉 전체 과정 동안 입자의 수가 일정하게 유지된다는 점을 보존하는 정교한 양자 게이트 배치에 있습니다. 이 입자 보존 구조를 특수한 유형의 입력 상태와 결합함으로써, 연구진은 양자 기계가 효율적으로 학습하면서도 고전적 기계에게는 근본적으로 어려운 문제를 다룰 수 있는 프레임워크를 구축했습니다.
이 논문은 서로 다른 유형의 양자 하드웨어에 맞춤화된 두 가지 건축적 청사진에 초점을 맞춥니다. "유니터리 브릭 월(unitary brick-wall)"이라 불리는 한 가지 설계는 큐비트가 일렬로 배열되어 있고 인접한 이웃하고만 통신할 수 있는 기계를 위해 구축되었습니다. 다른 하나인 "유니터리 버터플라이(unitary butterfly)"는 모든 큐비트가 다른 모든 큐비트와 연결될 수 있는 기계를 위해 설계되었습니다. 두 설계는 공통된 전략을 공유합니다: 입자의 특수한 준비 상태에서 시작하여 이를 여러 층의 연산을 통과시킵니다. 이 연산에는 입자를 생성하거나 파괴하지 않고 서로 혼합하는 빔 분할기처럼 작동하는 게이트 유형과, 학습할 데이터를 인코딩하는 위상 게이트 층이 포함됩니다. 이러한 조합은 시스템이 고전 컴퓨터가 추적하기 어려운 상태를 유지하면서도, 양자 기계가 학습할 수 있을 만큼 안정적인 상태를 유지하도록 보장합니다.
양자 머신러닝의 주요 장애물은 "배런 플래토(barren plateau, 척박한 고원)" 현상이었는데, 이는 시스템이 커짐에 따라 모델을 훈련하는 데 사용되는 신호가 사라져 학습을 불가능하게 만드는 현상입니다. 연구진은 새로운 설계가 이 문제를 완전히 피한다는 것을 증명했습니다. 그들은 시스템의 입자 수가 증가하더라도 훈련을 가이드하는 신호가 강하고 명확하게 유지됨을 보여주었습니다. 이는 규모가 커짐에 따라 훈련이 불가능해졌던 이전의 설계들과는 크게 다른 점입니다. 연구진은 훈련 신호의 강도를 측정하는 척도인 그래디언트 분산(gradient variance)이 관리 가능한 수준으로 유지되며, 기계의 크기에 관계없이 효율적으로 학습할 수 있는 방식으로 스케일링된다는 것을 보여주었습니다. 이는 훈련 과정이 단지 이론적으로 가능한 것뿐만 아니라 실질적으로 실행 가능하다는 것을 의미합니다.
훈련 과정을 더욱 빠르게 만들기 위해, 이 논문은 기계의 설정값을 조정하는 데 필요한 계산을 위한 새로운 알고อัล고리즘을 도입합니다. 전통적으로 양자 모델을 훈련하려면 조정이 필요한 각 파라미터마다 회로를 여러 번 실행해야 하며, 이는 대규모 시스템에서는 매우 느려지는 과정이 됩니다. "멀티 레이어 병렬 파라미터 시프트 규칙(multi-layer parallel parameter-shift rule)"이라고 불리는 이 새로운 방법은 필요한 모든 조정을 한 번에 계산할 수 있게 해줍니다. 회로를 수천 번 실행하는 대신, 입자의 수에만 의존하는 횟수만큼만 실행하면 됩니다. 1,000개의 큐비트를 가진 기계의 경우, 이 방법은 필요한 실행 횟수를 16배 이상의 비율로 줄여 대규모 훈련을 가능하게 만듭니다.
이 연구는 또한 이 양자 기계들이 실제로 특별한 일을 하고 있는지에 대한 질문을 다룹니다. 연구진은 자신들의 회로 출력, 특히 입자의 패턴이 고전 컴퓨터가 시뮬레이션하기 매우 어렵다는 것을 보여주었습니다. 그들은 입자 수를 기반으로 난이도의 "사다리"를 구축했습니다. 입자 수가 적을 때는 고전 컴퓨터가 양자 기계를 쉽게 모방할 수 있습니다. 그러나 입자 수가 특정 임계값까지 증가하면 양자 출력을 시뮬레이션하는 작업은 기하급수적으로 어려워집니다. 연구진이 선택한 작동 지점인 60개의 입자가 관여하는 경우, 가장 잘 알려진 고로 알고리즘은 단 하나의 출력을 시뮬레이션하는 데 100경(billion billion) 번 이상의 연산을 필요로 합니다. 이 수준의 복잡성은 해당 과제를 현재의 고전 슈퍼컴퓨터의 능력을 훨씬 넘어서는 곳에 위치시키며, 진정한 양자 우위를 시사합니다.
이 프레임워크는 새로운 데이터를 생성하거나 복잡한 환경에서 결정을 내리는 것과 같은 다양한 머신 러닝 작업에 유연하게 적용될 수 있도록 설계되었습니다. 연구진은 양자 기계가 샘플러로서 역할을 하여 직접 사용하거나 고전 컴퓨터가 처리할 수 있는 일련의 결과물을 생성한다고 설명합니다. 실제 데이터와 유사한 새로운 데이터를 만드는 것이 목표인 생성 모델링과 같은 작업의 경우, 복잡하고 시뮬레이션하기 어려운 패턴을 생성하는 양자 기계의 능력이 핵심적인 이점이 됩니다. 에이전트가 결정을 내리는 방법을 배우는 강화 학습의 경우, 양자 기계는 고전적 방법이 놓칠 수 있는 방대한 가능성의 공간을 탐색할 수 있습니다. 연구진은 훈련의 일부는 고전 컴퓨터에서 수행될 수 있지만, 모델의 최종 배포는 시스템에 힘을 실어주는 어려운 시뮬레이션 샘플을 생성하는 데 양자 장치에 의존한다는 점을 명확히 합니다.
연구진은 증명된 것과 여전히 탐구 중인 것을 엄격히 구분합니다. 그들은 자신들의 설계가 훈련 가능하며 배런 플래토 문제를 피한다는 것을 수학적으로 증명했습니다. 또한 현재 가장 잘 알려진 알고리즘을 기준으로 고전적 시뮬레이션 비용이 입자 수에 따라 기하급수적으로 증가한다는 것도 증명했습니다. 그러나 그들은 절대적인 난이도가 사용되는 입자의 수에 달려 있다고 언급합니다. 60개의 입자가 관여하는 선택된 작동 지점에서 작업은 현재의 고전적 역량을 넘어서기에 충분히 어렵지만, 연구진은 향히 고전 알고리즘의 개선이 이 경계를 이동시킬 수 있음을 인정합니다. 그들은 이 이점을 유지하기 위해 입자 수를 늘림으로써 시스템을 조정할 수 있다고 제안합니다.
이 작업은 양자 머신러닝을 실질적인 현실로 만드는 데 있어 중요한 진전을 나타냅니다. 훈련 가능성과 효율성이라는 두 가지 문제를 해결함으로써, 연구진은 실제로 사용할 수 있는 양자 신경망을 구축할 수 있는 로드맵을 제공했습니다. 이 설계들은 현재 구축되고 있는 하드웨어와 호환되며, 훈련 방법은 근접 미래의 장치(near-term devices)에도 구현될 수 있을 만큼 효율적입니다. 이 연구는 이 기계들이 모든 문제를 해결하거나 고전 컴퓨터를 대체할 것이라고 주장하는 것이 아니라, 고전적 모델이 도달하기 어려운 함수 클래스에 접근할 수 있음을 보여줍니다. 이는 복잡한 리스크 모델링이 필요한 금융 분야나 양자 시스템을 시뮬레이션하는 것이 중요한 과학 분야와 같은 분야에서 새로운 응용의 문을 열어줍니다.
논문은 앞으로의 경로를 설명하며 끝을 맺습니다. 다음 단계는 이러한 설계들을 실제 양자 하드웨어에서 테스트하여 실질적인 이점을 제공하는지 확인하는 것입니다. 연구진은 양자 우위가 나타날 가능성이 가장 높은 포트폴리오 최적화 및 생성 모델링과 같은 구체적인 문제들을 식려냈습니다. 그들은 이론적 토대는 견고하지만, 진정한 시험은 실제 데이터에 대한 이 기계들의 성능이 될 것이라고 강조합니다. 그들이 구축한 프레임워크는 그 미래를 향한 명확하고 확장 가능한 경로를 제공하며, 오랫동안 이 분야를 가로막았던 복잡성에 길을 잃지 않고 양자 역학의 힘을 머신 러닝을 위해 활용할 수 있는 방법을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.