Distributed Training using an Intelligent Network
본 논문은 광역 네트워크 전반에 걸친 분산 학습을 위해 멀티캐스트와 인라인 FPGA 집계(in-line FPGA aggregation)를 최적화된 동기화 스케줄과 결합하여 대역폭 및 지연 시간 제약을 극복함으로써, 동일 지역 내 배치된 학습과의 성능 격차를 좁히는 지능형 네트워크 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
세계에서 가장 강력한 인공지능 모델들은 너무 거대해져서 단 하나의 건물 안에 담을 수 없는 수준에 이르고 있습니다. 이러한 시스템을 훈련하려면 수천 대의 컴퓨터가 함께 작동해야 하지만, 전력과 공간의 물리적 한계로 인해 더 이상 단일 데이터 센터가 이들을 모두 수용할 수 없습니다. 대신, 연구자들은 컴퓨팅 파워를 여러 위치로 분산시켜야 하며, 때로는 대양을 사이에 두고 떨어져 있기도 합니다. 이는 어려운 문제를 야기합니다. 컴퓨터들이 상태를 유지하기 위해 끊임없이 서로 통신해야 하지만, 방대한 양의 데이터를 먼 거리로 보내는 것은 느리고 비용이 많이 들기 때문입니다. 멀리 떨어진 사이트 간의 연결은 종-종 좁고 불균형하여, 정보가 도착하기를 기다리는 동안 컴퓨터들이 유휴 상태로 머물게 만듭니다. 만약 컴퓨터들이 자신들의 진행 상황을 빠르게 공유하지 못하면, 전체 훈련 과정이 느려져 귀중한 시간과 에너지를 낭비하게 됩니다.
더블제로 재단(DoubleZero Foundation)의 연구팀은 네트워크 자체를 능동적인 조력자로 전환함으로써 이 병목 현상을 해결하는 새로운 방법을 제안했습니다. 인터넷 연결을 단순히 데이터를 운반하는 수동적인 파이프로 취급하는 대신, 그들은 네트워크 내부에 특화된 하드웨어를 사용하여 정보의 흐름을 관리할 것을 제안합니다. 그들의 접근 방식은 두 가지 기존 기술을 광역 연결을 위해 참신한 방식으로 결합합니다. 첫째, 그들은 멀티캐스트(multicast)라고 불리는 방법을 사용하는데, 이는 한 대의 컴퓨터가 메시지를 보내면 네트워크가 이를 자동으로 복사하여 여러 목적지에 동시에 전달할 수 있게 하여, 각 목적지에 별도의 복사본을 보내는 대신 효율을 높이는 방식입니다. 둘째, 그들은 각 컴퓨터 클러스터 근처인 네트워크의 가장자리(edge)에 FPGA라고 알려진 프로그래밍 가능한 칩을 배치합니다. 이 칩들은 스마트한 집계기(aggregator) 역할을 수행하며, 다양한 소스에서 들어오는 데이터 스트림을 모아 로컬 컴퓨터에 도달하기 전에 하나의 깨끗한 스트림으로 병합합니다. 네트워크 내부에서 복사와 결합이라는 무거운 작업을 수행함으로써, 이 시스템은 멀리 떨어진 사이트 간의 제한된 연결에 가해지는 부담을 줄여줍니다.
이 시스템을 효과적으로 작동시키기 위해, 연구진은 또한 컴퓨터들이 정확히 언제, 어떻게 서로 통신해야 하는지를 결정하는 새로운 수학적 프레임워크를 개발했습니다. 전통적인 설정에서는 모든 컴퓨터가 동시에 모든 다른 컴퓨터와 대화하려고 시도하여 네트워크를 막힐 수 있습니다. 새로운 프레임워크는 네트워크를 특정 도로와 교통 규칙이 있는 지도처럼 취급합니다. 이는 컴퓨터들을 작고 순환하는 통신 그룹으로 나누는 최적의 방법을 계산합니다. 각 라운드에서는 특정 그룹의 컴퓨터들이 정보를 교환하는 동안 다른 그룹은 대기하며, 다음 라운드에서는 그룹이 이동합니다. 목표는 컴퓨터가 대기하는 시간과 공유하는 정보의 양 사이에서 완벽한 균형을 찾는 것입니다. 연구진은 도쿄, 뉴욕, 런던과 같은 도시들 사이의 실제 이동 시간과 연결 속도를 모델링하여 다양한 그룹화 전략이 어떻게 수행되는지 확인하기 위해, 세 대륙에 걸쳐 9개 도시를 잇는 실제 프로그래밍 가능한 네트워크를 기반으로 한 시뮬레이션을 사용하여 이 아이디어를 테스트했습니다.
시뮬레이션 결과, 최적의 전략은 하드웨어의 역량에 크게 의존한다는 것이 밝혀졌습니다. 네트워크 칩의 메모리가 매우 적을 때는, 세 대의 컴퓨터가 다양한 조합을 통해 순환하는 작은 그룹을 형성하는 것이 가장 효율적이었습니다. 이를 통해 시스템의 정보 보유 능력을 압도하지 않으면서도 데이터가 빠르게 흐를 수 있었습니다. 그러나 연구진이 칩에 더 많은 메모리를 제공했을 때, 최적의 전략은 완전히 바뀌었습니다. 장거리 이동으로 인한 지연을 처리할 수 있을 만큼 충분한 메모리가 있다면, 시스템은 모든 컴퓨터가 동시에 모든 다른 컴퓨터와 대화하는 전략을 지원할 수 있었습니다. 이 "올 투 올(all-to-all)" 방식은 이전에는 장거리에서 불가능했던 방식이었지만, 정보를 가장 짧은 시간 안에 모두에게 퍼뜨릴 수 있기 때문에 가장 빠른 방법이 되었습니다. 이 연구는 스마트한 네트워크 기술과 하드웨어의 한계에 적응하는 스케줄링을 결합함으로써, 전 세계에 흩어져 있는 훈련용 컴퓨터와 같은 방에 나란히 앉아 있는 컴퓨터 사이의 격차를 좁힐 수 있음을 보여주었습니다.
연구진은 자신들의 작업이 현재 구축 중인 라이브 네트워크를 기반으로 한 시뮬레이션임을 강조합니다. 더블제로 네트워크는 존재하며 트래픽을 운반하고 있지만, 아직 거대한 모델을 실제로 훈련할 만큼 연결된 컴퓨터 클러스터가 충분하지 않습니다. 제시된 결과는 개념 증명(proof of concept)이며, 이론적인 이득이 실재한다는 것과 적절한 네트워크 하드웨어와 스케줄링 로직의 조합이 전통적인 거리의 장벽을 극복할 수 있다는 것을 입증합니다. 이 연구 결과는 거대한 인공지능 모델을 훈련하는 미래가 단순히 더 빠른 컴퓨터에만 의존하는 것이 아니라, 먼 거리를 약점이 아닌 관리 가능한 시스템의 일부로 바꾸어 학습 과정에 능동적으로 참여하는 더 스마트한 네트워크에 달려 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.