← 최신 논문
💻 computer science

Performance Optimization and Comparative Analysis of Generative AI Models on Advanced Accelerators

본 논문은 다양한 다운스트림 태스크와 이질적인 첨단 가속기 전반에 걸쳐 여러 생성형 AI 모델의 성능을 최적화하고 비교하는 체계적인 연구를 제시하며, 새로운 혼합 정밀도 양자화 평가, 미세 조정 전략, 그리고 현대적인 고성능 컴퓨팅 시스템에 대한 평가를 통해 주요 배포 과제들을 다룬다.

원저자: Amitash Nanda, Javier Hernandez Nicolau, Madhusudan Gujral, Mahidhar Tatineni, Amitava Majumdar, Debashis Sahoo

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Amitash Nanda, Javier Hernandez Nicolau, Madhusudan Gujral, Mahidhar Tatineni, Amitava Majumdar, Debashis Sahoo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 거대하고 믿을 수 없을 정도로 똑똑한 책의 도서관(생성형 AI 모델)이 있다고 상상해 보세요. 이 도서관은 이야기를 쓰거나, 수수께끼를 풀거나, 이미지를 만들어낼 수 있습니다. 문제는 이 도서관들이 너무 거대해서 일반적인 책꽂이에는 들어가지도 않고, 페이지 하나를 찾는 데도 한참이 걸리며, 이를 가동하기 위한 전기 요금이 천문학적이라는 점입니다.

이 논문은 마치 세 곳의 서로 다른 하이테크 차고(슈퍼컴퓨터)를 방문하여, 서로 다른 종류의 엔진에서 이 거대한 도서관들을 얼마나 빨리 구동할 수 있는지 확인하러 간 엔지니어와 정비사 팀과 같습니다. 그들은 세 가지 특정 "엔진"을 테스트했습니다: NVIDIA GPU(업계 표준), Intel Gaudi(새로운 특화 엔진), 그리고 Gaudi 엔진의 다양한 세대(Gen 1, 2, 3)입니다.

다음은 이들이 발견한 내용을 쉬운 개념으로 나누어 정리한 것입니다:

1. "축소하는" 기술 (양자화, Quantization)

무거운 돌 조각상을 방 건너편으로 옮기려고 한다고 상상해 보세요. 너무 무거워서 빠르게 움직일 수 없습니다. 엔지니어들은 **양자화(Quantization)**라는 기술을 시도했습니다. 조각상의 모든 세세한 디테일을 그대로 유지하며 옮기는 대신, 중요하지 않은 작은 흠집이나 디테일 위에 페인트를 덧칠하여 무거운 돌을 가벼운 스티로폼 버전으로 만드는 것입니다.

  • 목표: AI 모델의 "두뇌 능력"을 크게 잃지 않으면서도 모델을 더 작고 빠르게 만드는 것입니다.
  • 방법: 그들은 단순히 전체를 한꺼번에 줄인 것이 아닙니다. "민감도 지도(sensitivity map)"를 사용했습니다. 이것은 마치 신체 스캔과 같습니다. 조각상의 어떤 부분(예: 얼굴)은 매우 민감하여 상세함(높은 정밀도)을 유지해야 하지만, 밑받침이나 옷 같은 부분은 더 가벼운 스티로폼(낮은 정밀도)으로 만들 수 있습니다.
  • 결과: NVIDIA와 Intel 기기 모두에서, 그들은 모델을 2배에서 6배까지 성공적으로 축소했습니다. 모델은 훨씬 빨라지고 메모리도 적게 사용하게 되었으며, 놀랍게도 거대하고 무거운 원래 버전만큼이나 거의 정확하게 질문에 답했습니다.

2. 엔진 업그레이드 경주 (미세 조정, Fine-Tuning)

"미세 조정(Fine-tuning)"은 범용 드라이버를 데려와 포뮬러 1 레이서로 훈련시키는 것과 같습니다. 팀은 서로 다른 세대의 Intel Gaudi 엔진에서 이 훈련이 얼마나 빠르게 진행되는지 테스트했습니다.

  • Gen 1 vs. Gen 2 vs. Gen 3: 그들은 새로운 엔진이 훨씬 더 빠르다는 것을 발견했습니다.
    • Gen 2는 Gen 1보다 약 2.5배에서 3배 더 빨랐습니다.
    • Gen 3는 Gen 2보다 또 다른 1.8배에서 2배 더 빨랐습니다.
  • "플래시(Flash)" 지름길: 그들은 또한 "플래시 어텐션(Flash Attention)"이라는 특별한 기술을 사용했습니다. 이는 마치 사서가 책을 가지러 도서관 뒤쪽에서 앞쪽까지 매번 걸어가야 하는 상황에서, 사서의 손으로 책을 직접 가져다주는 컨베이어 벨트를 갖게 되는 것과 같습니다. 이 기술은 훈련 속도를 10%에서 20% 더 빠르게 만들었습니다.
  • 크기 제한: 한 가지 걸림돌이 있었습니다. 모델이 너무 거대하면(예: 700억 개의 파라미터를 가진 모델), 엔진 카드가 아무리 빨라도 단일 엔진 카드에 담을 수 없었습니다.
    • 이를 해결하기 위해 그들은 "샤딩(sharding, 모델 분할)" 기술을 사용해야 했습니다(모델을 여러 카드에 나누어 담는 것).
    • 발견한 점: 모델을 나누면 카드들이 끊임없이 서로 대화를 주고받아야 하기 때문에 속도가 느려집니다. 팀은 만약 모델이 하나의 카드에 들어간다면, 그냥 카드 한 장만 사용하라는 결론을 내렸습니다. 그것이 모델을 나누는 것보다 훨씬 빠릅니다. 반드시 그래야만 하는 상황이 아니라면 나누지 마십시오.

3. 이미지 향상기 (확산 모델, Diffusion Models)

그들은 또한 흐릿하고 저화질인 이미지를 선명하게 만드는(초해상도, Super-Resolution) 모델을 테스트했습니다. 이는 과학자들이 우주 먼지 이미지를 관찰할 때 사용됩니다.

  • 비교: 그들은 NVIDIA GPU(V100, A100, H100)와 Intel Gaudi 카드를 대상으로 동일한 작업을 수행했습니다.
  • 결과:
    • NVIDIA의 경우, 새로운 세대의 칩이 나올 때마다 이전 세대보다 약 2배씩 더 빨라졌습니다.
    • Intel Gaudi의 경우, Gen 1에서 Gen 2로 넘어갈 때의 도약은 엄청났습니다(4배 더 빠름). 하지만 Gen 2에서 Gen 3로 넘어갈 때는 그만큼의 거대한 도약이 나타나지 않았습니다. 즉, 속도 향상 폭이 둔화되었습니다.
  • 확장성(Scaling): 더 많은 카드를 조합에 추가했을 때, 속도는 고속도로의 차선을 늘리는 것처럼 거의 완벽하게 증가했습니다.

핵심 요약

이 논문의 결론은 다음과 같습니다:

  1. **모델 축소(양자화)**는 NVIDIA와 Intel 하드웨어 모두에서 잘 작동하며, 품질 저하를 거의 없이 공간과 시간을 절약해 줍니다.
  2. **최신 하드웨어(Intel Gaudi Gen 2 및 3)**는 이전 버전보다 현저히 빠릅니다.
  3. 모델을 나누지 마십시오. 강력한 카드 한 장에서 모델을 실행하는 것이 여러 장의 카드에 나누어 실행하는 것보다 항상 더 빠릅니다.
  4. Intel Gaudi는 NVIDIA의 매우 강력한 경쟁자이며, 특정 작업에서 엄청난 속도 향상을 제공하지만, 세대 간의 속도 향상이 항상 선형적으로 완벽하게 나타나는 것은 아닙니다.

요약하자면, 그들은 서로 다른 종류의 슈퍼컴퓨터 엔진에서 이 거대한 AI 두뇌를 더 가볍고, 빠르고, 저렴하게 구동하는 방법을 알아냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →