← 최신 논문
🤖 machine learning

Quantum Models with Multi-Stage Training for Compositional Concept Generalization

이 논문은 텐서와 변분 양자 회로를 사용하여 명사와 관계 표현을 분리하는 멀티모달 양자 기계 학습을 위한 다단계 훈련 프레임워크를 제안하며, 고전적 베이스라인보다 훨씬 적은 학습 가능한 파라미터로 CLEVR 데이터셋에서 현저히 향상된 구성적 일반화 성능을 입증한다.

원저자: Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간의 지능은 단순하고 학습된 아이디어들을 완전히 새로운 상황에 재조합하는 놀라운 능력을 갖추고 있습니다. '자동차'가 무엇인지 알고 '노란색'이 무엇을 의미하는지 이해하는 사람은, 한 번도 본 적 없는 노란색 자동차를 즉각적으로 인식하며 이 새로운 조합에 자신의 지식을 적용할 수 있습니다. '구성적 일반화(compositional generalization)'라고 알려진 이 능력 덕분에 우리는 익숙한 부분들이 새롭게 배열된 세상을 탐험할 수 있습니다. 그러나 인공지능에게 있어 이 기술은 여전히 난제로 남아 있습니다. 현대의 시스템들은 훈련 중에 본 패턴을 인식하는 데는 뛰어나지만, 동일한 패턴을 새로운 조합(예: 특정 물체가 새로운 공간적 관계 속에 놓이는 경우)에 적용하라고 요청받으면 종종 실수를 범합니다. 이러한 한계는 현재의 모델들이 사물들이 어떻게 결합되는지에 대한 근본적인 규칙을 진정으로 이해하기보다는 예시들을 암기하고 있음을 시사합니다.

유니버시티 칼리지 런던(UCL)과 암스테르담 대학교의 연구진은 이 문제를 해결하기 위한 다른 경로를 탐구하며, 양자 역학의 기묘하고 강력한 논리에 주목했습니다. IEEE 퀀텀 위크(IEEE Quantum Week) 컨퍼런스에서 발표된 이들의 연구에서, 연구진은 양자 컴퓨터가 정보를 처리하는 방식이 인간이 개념을 결합하는 방식과 자연스럽게 일치할 수 있다고 제안합니다. 사물을 학습하는 것과 사물 사이의 관계를 학습하는 것을 분리하는 모델을 구축함으로써, 그들은 전통적인 방식보다 훨씬 더 효과적으로 보지 못한 시나리오에 일반화할 수 있는 시스템을 만들어냈으며, 이 과정에서 계산 능력 또한 극히 일부만을 사용했습니다.

연구팀은 컴퓨터가 두 가지 기하학적 도형의 이미지를 보고 그들의 관계를 설명하는 두 가지 옵션 중 올바른 설명을 선택해야 하는 과제에 집중했습니다. 예를 들어, 원뿔의 왼쪽에 정육면체가 있는 이미지가 주어졌을 때, 시스템은 "정육면체 왼쪽 원뿔"이라는 올바른 문구를 "정육면체 오른쪽 원뿔"과 같은 방해 요소로부터 구별해내야 합니다. 기계를 가르치기 위해 연구진은 다양한 위치에 있는 구, 원기둥, 원뿔과 같은 모양의 이미지들을 포함하는 데이터셋을 사용했습니다. 과제의 핵심은 '정육면체 오른쪽의 원뿔'과 같은 조합으로 시스템을 훈련시킨 다음, '정육면체 왼쪽의 원뿔'처럼 한 번도 본 적 없는 조합에 대해 테스트하는 것이었습니다. 이 설정은 모델이 단순히 특정 사진을 암기하는 것이 아니라, 어떤 모양에도 적용될 수 있는 독립적인 규칙으로서 '왼쪽'과 '오른쪽'의 개념을 학습하도록 강제합니다.

전체 시스템을 한꺼번에 훈련시키는 대신, 연구진은 커리큘럼을 모방한 2단계 접근 방법을 채택했습니다. 첫 번째 단계에서 모델은 개별 물체를 인식하는 법을 배웠습니다. 모델은 단독 구체나 단일 정육면체와 같은 단일 모양의 이미지를 보여받았으며, 이를 이름과 매칭하는 법을 배웠습니다. 모델이 이러한 기본 구성 요소를 마스터하자, 연구진은 그 형태에 대한 기억을 고정(freeze)했습니다. 두 번째 단계에서 연구서 관계적 과제를 도입했습니다. 이제 모델은 두 개의 모양이 있는 이미지를 보게 되며, 이미 암기한 안정적인 형태 정의를 사용하여 오직 형태들이 서로 어떻게 관계하는지의 규칙만을 배워야 했습니다. 이러한 설계는 시스템이 새로운 관계를 볼 때마다 '정육면체'가 무엇인지 다시 배우려고 시도하지 않도록 보장했으며, 관계를 고정된 대상에 적용되는 별개의 변환으로 취급하도록 강제했습니다.

이를 구현하기 위해 연구진은 언어와 의미를 텐서(tensor)라고 불리는 수학적 구조로 변환하여 양자 회로에 직접 매핑할 수 있는 프레임워크를 사용했습니다. 그들은 이미지 데이터를 양자 회로에 입력하는 다양한 방법을 테스트했습니다. '진폭 인코딩(amplitude encoding)'이라 불리는 한 방법은 원래 이미지 데이터의 정확한 기하학적 구조를 보존하려고 시도했습니다. 반면, '각도 인코딩(angle encoding)'은 데이터를 비선형적으로 변형하여 정보를 재구성함으로써 관계 간의 차이를 더 명확하게 만들었습니다. 또한 그들은 두 개의 분리된 모양을 위한 양자 회로를 물리적으로 결합하여 하나의 관계적 이미지를 나타내는 '콜라주(collage)' 방식도 실험했습니다.

시뮬레이션 결과는 시사하는 바가 컸습니다. 연구진이 다단계 양자 모델을 표준 클래식 시스템과 비교했을 때, 효율성의 차이는 극명했습니다. 클래식 베이스라인은 이 과제를 수행하기 위해 1억 5천만 개 이상의 학습 가능한 파라미터를 필요로 했음에도 불구하고, 보지 못한 조합에 대해서는 일반화에 실패하여 50퍼센트의 정확도, 즉 사실상 추측하는 수준에 그쳤습니다. 반면, 양자 모델은 단 426개의 학습 가능한 파라미터만을 사용하여 강력한 일반화를 달enc했습니다. 콜라주 방식과 각도 인코딩을 결합한 가장 성공적인 버전의 시스템은 보지 못한 테스트 케이스에서 72퍼센트 이상의 정확도를 달성했습니다. 이는 모든 것을 한꺼번에 배우려 했던 단일 단계 양자 모델보다 훨씬 뛰어난 성과였으며, 사물과 관계의 학습을 분리하는 것이 결정적이었음을 입으로 증명했습니다.

연구진은 모델의 성공이 데이터 인코딩 방식에 크게 의존한다는 것을 발견했습니다. 비선형 변환을 도입한 각도 인코딩 방식이 진폭 인코딩 방식보다 우수하다는 것이 밝혀졌습니다. 이는 표준 도구로 처리된 원래의 이미지 데이터가 과제에 필요한 공간적 관계를 명확하게 분리하지 못했음을 시사합니다. 양자 인코딩 과정 자체가 정보를 재구조화하여 '왼쪽'과 '오른쪽'의 구분을 모델에게 더 잘 보이게 만드는 역할을 했습니다. 반면 진폭 인코딩은 데이터의 원래 형태를 보존했지만, 서로 다른 공간적 배치 사이의 혼란스러운 유사성을 그대로 유지하여 구분을 어렵게 만들었습니다.

전적으로 컴퓨터 시뮬레이션을 통해 도출된 이 결과들은 구조화된 양자 표현이 기계에게 구성성을 가르치는 유망한 경로임을 시사합니다. 사물이 무엇인지와 그것들이 어떻게 관계하는지를 명확히 분리하고, 양자 회로를 사용하여 데이터를 더 분리 가능한 형태로 재구성함으로써, 모델은 클래식 시스템이 훨씬 더 많은 자원을 투입하고도 고전하던 수준의 일반화를 달성했습니다. 이 연구는 인공지능 문제를 해결했다고 주장하는 것이 아니라, (원형을 먼저 배우고 그 다음 결합하는) 구조화된 학습 방식이 양자 컴퓨팅의 독특한 특성과 결합했을 때 매우 효과적일 수 있음을 보여줍니다. 저자들은 향후 실제 양자 하드웨어에서 이 아이디어들을 테스트하고, 이 방법들이 더 복잡한 장면과 풍부한 어휘로 확장될 수 있는지 탐구해야 한다고 언급했지만, 현재의 결과는 머신러닝에 대한 새로운 사고방식에 대한 설득력 있는 개념 증명을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →