Multi-tenant Kubernetes Use Cases for AI, Secure Computing and Data Services, and More
이 논문은 신뢰할 수 있는 의료 연구 환경과 기밀 AI 모델 호스팅을 위한 유연한 멀티 테넌트 유스케이스를 가능하게 함으로써 기존의 단일 테넌트 배치 시스템의 한계를 해결하기 위해 HPE Cray EX 슈퍼컴퓨터 Isambard-AI에 쿠버네티스를 배포하는 것을 평가하며, 이러한 고성능 플랫폼에서 쿠버네티스-애즈-어-서비스(Kubernetes-as-a-Service)를 프로덕션화하기 위한 과제와 향후 단계들을 개설한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
슈퍼컴퓨터가 거대하고 빠른 기차역과 같은 세상이 있다고 상상해 보십시오. 수십 년 동안 이 역들은 한 가지 특정 유형의 승객, 즉 "배치(batch)" 여행객을 위해 설계되어 왔습니다. 이들은 거대하고 빽빽하게 모인 데이터 집단으로, 함께 도착하여 전체 여정이 끝날 때까지 단 하나의 전용 객실에 머무릅니다. 이 시스템은 전통적인 과학 분야에서는 완벽하게 작동합니다. 하지만 세상이 변하고 있습니다. 이제 우리는 새로운 종류의 여행객인 "클라우드 네이티브(cloud-native)" 승객을 맞이하고 있습니다. 이들은 유연하고 개별적인 데이터 컨테이너로, 즉각적으로 기차에 타고 내리기를 원하며, 낯선 이들과 안전하게 객실을 공유하고, AI 챗봇이나 보안이 철저한 의료 데이터베이스와 같은 복잡하고 상호작용적인 앱을 실행하고자 합니다.
문제는 기존의 기차역(전통적인 슈퍼컴퓨터)이 이런 용도로 만들어지지 않았다는 점입니다. 이 역들은 거대한 화물을 옮기는 데는 뛰어나지만, 모두가 자신만의 보안 공간을 필요로 하는 북적이는 다중 테넌트(multi-tenant) 역을 관리하는 데는 서툽니다. 이때 쿠버네티스(Kubernetes)가 등장합니다. 쿠버네티스를 컨테이너화된 승객들을 위한 궁극의 교통 관제사라고 생각하십시오. 이는 모든 사람이 좌석을 확보하고, 다른 사람의 가방을 훔쳐볼 수 없도록 하며, 수천 개의 서로 다른 앱이 동시에 실행되는 중에도 역이 원활하게 운영되도록 보장하는 소프트웨어입니다. 하지만 이 유연한 교통 관제사를 경직된 고속 슈퍼컴퓨터에 설치하는 것은, 마치 증기 기관차 안에 현대적인 지하철 발권 시스템을 설치하려는 것과 같습니다. 시스템 전체를 무너뜨리지 않고 이들을 조화롭게 작동시키려면 엄청난 공학적 마법이 필요합니다.
이 논문은 한 엔지니어 팀이 그 현대적인 교통 관제사를 가져와 '이삼바드-AI(Isambard-AI)'라고 불리는 세계에서 가장 진보된 슈퍼컴퓨터 중 하나에 성공적으로 설치한 이야기를 들려줍니다. 그들은 단순히 작동하게 만든 것에 그치지 않고, 매우 다르고 중요한 두 가지 작업을 통해 이를 테스트했습니다. 첫째, 그들은 "신뢰할 수 있는 연구 환경(Trusted Research Environment)"을 구축했습니다. 이는 과학자들이 민감한 의료 데이터를 볼 수는 있지만, 결코 데이터를 훔치거나 유출할 수는 없는, 마치 아주 견고한 유리 방과 같은 환경입니다. 둘째, 그들은 AI 모델을 위한 "샌드박스(sandbox)"를 설정하여, 여러 연구자가 강력한 AI 두뇌를 동시에 실행하고 테스트하면서도 서로의 영역을 침범하지 않도록 했습니다.
팀은 새로운 시스템이 놀라울 정도로 잘 작동한다는 것을 발견했습니다. 그들은 이 유연한 다중 테넌트 서비스를 슈퍼컴퓨터의 속도를 저하시키지 않고 실행할 수 있음을 증명했습니다. 실제로 네트워크 속도를 테스트했을 때, 이 보안 계층을 추가해도 약 0.89 마이크로초라는 아주 미세하고 거의 눈에 띄지 않는 지연 시간만 발생했습니다. 이를 체감하기 위해 설명하자면, 컴퓨터의 관점에서도 눈 깜빡임보다 짧은 시간입니다. 또한 그들은 이 설정이 거대한 AI 모델을 처리하며, 여러 컴퓨터에 걸쳐 모델을 실행하면서도 보안을 유지할 수 있음을 보여주었습니다.
하지만 이 여정에 턱이 없었던 것은 아닙니다. 팀은 결정적인 하드웨어 병목 현상을 발견했습니다. 기반이 되는 네트워크 카드(Cassini NIC)가 발행할 수 있는 보안 "서비스 ID"의 개수가 엄격히 제한되어 있다는 점입니다. 현재 시스템은 모든 컨테이너에 고유한 ID를 할당하기 때문에, 너무 많은 사용자가 동시에 접속하려고 하면 시스템이 멈춰버릴 위험이 있습니다. 나아가, 그들은 현재 설정에서 주요한 보안 결함을 확인했습니다. 고속 네트워크에 접속하기 위해, 현재의 보안 "유리 방"들은 "특권(privileged)" 키를 가지고 구축되어야 합니다. 이는 보안 요원들이 승객들에게 역의 마스터 키를 건네주는 것과 같으며, 시스템이 설계된 본래의 목적 인 격리성을 훼st하는 일입니다.
그들은 시스템 설정이 여전히 다소 복잡하며, 이러한 하드웨어 제한과 보안 격차를 해결하기 위해 향후 보완 작업이 필요하다는 점을 인정하면서도, 클라우드의 유연성을 슈퍼컴퓨터의 강력한 성능과 결합하는 것이 가능하다는 것을 입증했습니다. 이는 과학자와 AI 연구자들이 매번 새로운 유형의 작업을 위해 완전히 새로운 하드웨어를 구축할 필요 없이, 동일한 강력한 기계 위에서 안전하고 효율적으로 협업할 수 있는 미래의 문을 열어줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.