From Physics to Attention: Building Vision Transformers from Oscillatory Neural Network Hardware
이 논문은 Kuramoto 기반의 합성곱과 Hopfield 기반의 선형 계층을 진동 신경망(Oscillating Neural Network) 구조로 통합한 확장 가능한 합성곱 비전 트랜스포머인 HoKuVit를 소개하며, 이는 CIFAR-10에서 최첨단 성능을 달-성하는 동시에 ONN을 딥 AI 파이프라인으로 확장하기 위한 실행 가능한 경로를 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 컴퓨터는 믿기지 않을 정도로 빠르지만, 동시에 전기를 매우 많이 소모합니다. 인공지능이 점점 더 복잡해짐에 따라, 이러한 시스템을 구동하는 데 필요한 에너지는 중대한 병목 현상이 되고 있습니다. 과학자들은 오랫동안 인간의 뇌에서 영감을 얻어, 뉴런이 작동하는 방식처럼 낮은 전력과 높은 효율성으로 정보를 처리하는 기계를 만들고자 노력해 왔습니다. 한 가지 유망한 경로는 "진동 신경망(oscillatory neural networks)"인데, 이는 작은 전자 회로의 리드미컬한 맥동을 사용하여 데이터를 저장하고 처리하는 유형의 컴퓨팅입니다. 전통적인 칩의 안정적인 이진 온-오프 스위치에 의존하는 대신, 이 시스템은 파동의 타이밍과 동기화를 사용합니다. 연구자들이 단순한 퍼즐을 풀기 위해 이러한 네트워크의 작은 버전을 구축하는 데는 성공했지만, 이를 확장하는 데는 어려움을 겪어 왔습니다. 문제는 이러한 리드미컬한 회로를 오늘날 가장 발전된 시각 시스템을 구동하는 깊고 층이 있는 구조로 연결하는 것이었습니다. 이러한 시스템은 사진 속의 물체를 인간과 같은 정확도로 인식할 수 있습니다.
헝가리의 파즈마니 페테르 가톨릭 대학교(Pázmány Péter Catholic University) 연구팀은 이 확장 문제를 해결하는 데 중요한 진전을 이루었습니다. 그들은 진동하는 구성 요소들로 거의 전적으로 구축된 호쿠비트(HoKuVit)라는 새로운 유형의 인공지능 모델을 설계했습니다. 연구진은 두 가지 특정 물리적 원리를 하나의 작동하는 시스템으로 결합하는 데 성공했습니다. 첫 번째 원리는 결합된 진동자(oscillators) 네트워크가 필터 역할을 하여, 이미지의 서로 다른 부분들이 서로 얼마나 잘 동기화되는지에 따라 시각 정보를 분류하는 것입니다. 두 번째 원리는 시스템이 인식된 패턴을 나타내는 안정적인 상태로 정착하는 메모리 역할을 하는 네트워크를 사용합니다. 이 두 가지 물리적 행동을 계층적 구조로 엮음으로써, 연구팀은 디지털 논리가 아닌 물리 법칙에 따라 작동하며 이미지를 분석할 수 있는 현대적 AI 구조인 비전 트랜스포머(vision transformer)를 만들어냈습니다.
연구진은 이들의 결과물을 비행기, 고양이, 트럭 등 10가지 서로 다른 카테고리를 포함한 6만 장의 컬러 이미지 모음인 CIFAR-10 데이터셋을 통해 테스트했습니다. 이는 진동 네트워크를 테스트하는 데 주로 사용되는 단순한 숫자 인식 실험보다 훨씬 어려운 과제입니다. 호쿠비트 모델은 거의 80%에 달하는 정확도를 달았는데, 이는 진동 역학에 기반하여 구축된 그 어떤 구조에서도 보고된 것 중 가장 높은 수치입니다. 비록 이것이 동일한 구조의 표준 디지털 버전이 달성한 92%의 정확도보다는 낮지만, 이러한 차이는 의도된 것입니다. 목표는 현재의 디지털 칩이 가진 순수한 속도를 따라잡는 것이 아니라, 이러한 물리적 회로가 복잡한 실제 시각 작업을 처리하도록 훈련될 수 있음을 증명하는 것입니다. 이 모델은 약 87만 개의 파라미터를 포함하며, 이 중 약 88%가 진동 구성 요소를 통해 구현되었고, 최종 결정 단계의 레이어들만이 디지털로 남아 있습니다.
이 연구가 특히 주목할 만한 점은 연구진이 시스템을 훈련시킨 방식입니다. 전통적으로 진동 네트워크는 복잡한 데이터에 적응할 수 없는 고정된 규칙이나 단순한 학습 방법을 가지고 설계되었습니다. 본 연구에서 연구팀은 현대 딥러닝 모델을 훈련하는 표준 방법인 역전파(backpropagation) 기술을 사용했습니다. 그들은 진동 회로가 오류를 최소화하기 위해 스스로의 내부 연결과 리듬을 조정하도록 가르쳤으며, 이를 통해 시스템이 이미지로부터 직접 학습할 수 있게 했습니다. 네트워크의 "메모리" 부분은 각 물체 카테 カテゴ리(category)에 대해 뚜렷하고 안정적인 패턴으로 정착하는 법을 배웠고, "필터" 부분은 이미지의 중요한 특징을 강조하기 위해 리듬을 동기화하는 법을 배웠습니다. 연구진은 이러한 디지털 시뮬레이션이 물리적 장치에서와 똑같이 작동함을 확인했는데, 시스템의 에너지가 정답을 찾을 때 마치 공이 가장 낮은 지점을 찾아 언덕을 내려가는 것처럼 감소하는 것을 확인했습니다.
또한 이 연구는 실제의 불완전한 하드웨어로 구축했을 때 이 시스템들이 얼마나 견고할지를 조사했습니다. 물리적 회로는 종종 구성 요소의 미세한 변동이나 신호의 노이즈로 인해 문제를 겪습니다. 연구진은 계산에 무작위 노이즈를 추가하고 메모리 가중치의 정밀도를 낮춤으로써 이러한 불완전함을 시뮬레이션했습니다. 시스템은 놀라울 정도로 탄력적이었습니다. 메모리 가중치가 매우 낮은 정밀도로 감소하거나 상당한 노이즈가 도입되었을 때도 정확도는 1% 미만으로 떨어졌습니다. 이는 이 구조가 디지털 컴퓨터가 요구하는 완벽한 정밀도를 필요로 하지 않기 때문에 물리적 구현에 매우 적합하다는 것을 시사합니다. 연구진은 만약 특수 하드웨어로 구축된다면, 진동 부분이 소비하는 전력이 무시할 수 있는 수준이라는 전제하에 에너지 절감 효과가 상당하여, 완전한 디지털 시스템에 비해 4배의 효율성 향상을 제공할 수 있을 것으로 추정합니다.
이 작업은 이론 물리학과 실용적인 인공지능 사이의 간극이 좁아지고 있음을 보여줍니다. 전자 회로의 리드미컬한 동작을 제한 사항이 아닌 핵심 계산 엔진으로 취급함으로써, 연구진은 오늘날 우리가 사용하는 모델과는 근본적으로 다른 딥러닝 모델을 구축하는 것이 가능하다는 것을 보여주었습니다. 호쿠비트 모델은 인공지능이 물리적 시스템의 자연스러운 역학 위에서 구동되는 미래를 향한 청사진 역할을 하며, 더 똑똑할 뿐만 아니라 훨씬 더 에너지 효율적인 기계로 나아가는 길을 제시합니다. 현재 모델은 여전히 시뮬레이션 단계이지만, 개념 증명은 명확합니다. 즉, 진동자의 리드미컬한 맥동이 세상을 보고 이해하는 데 실제로 활용될 수 있다는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.