← 최신 논문
🤖 AI

Fine-Tuning and Serving Gemma 4 31B on Google Cloud TPU: A Technical Comparison with GPU Baselines

본 논문은 구글 클라우드 TPU 에서 Gemma 4 31B 의 파인튜닝과 서빙을 처음 종단간으로 구현한 사례를 제시하며, GPU 네이티브 워크플로우를 JAX 스택으로 포팅하기 위해 필요한 코드 적응 사항을 상세히 설명하고, H100 GPU 베이스라인과 비교해 추론 처리량은 동등하게 유지하면서 지연 시간은 크게 줄이고 1.61 배 빠른 학습 속도와 1.82 배 낮은 비용 달성을 위한 TPU 구성의 성과를 입증합니다.

원저자: Jatin Kishnani, Mayank Goel, Amit Singh, Pulkit Agrawal, Sairanjan Mishra

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jatin Kishnani, Mayank Goel, Amit Singh, Pulkit Agrawal, Sairanjan Mishra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 전자 회로 (Verilog) 를 위한 컴퓨터 코드를 작성하는 새로운 기술을 가르치려고 하는 천재적이지만 매우 비싼 로봇 (AI 모델) 을 상상해 보십시오. 이 훈련이 이루어지는 "학교"에는 두 가지 옵션이 있습니다:

  1. GPU 학교: 엔비디아 (NVIDIA) 가 운영하며, 유명한 H100 칩을 사용합니다. 이는 많은 경험 많은 교사들이 있는 표준적이고 널리 알려진 길입니다.
  2. TPU 학교: 구글 (Google) 이 운영하며, 자체 TPU 칩을 사용합니다. 이는 더 빠르고 저렴하지만, 입학하려면 완전히 새로운 언어를 배워야 하는 새롭고 매우 전문화된 캠퍼스입니다.

h2loop.ai의 이 보고서는 구글 TPU 학교를 시도하기로 결정한 엔지니어들이 작성한 "현장 가이드"입니다. 그들은 310 억 파라미터 AI 모델 (Gemma 4) 을 가져와 코드를 작성하도록 가르친 후, 표준 NVIDIA 학교와 비교하여 얼마나 잘 작동하는지 평가했습니다.

다음은 그들의 여정을 간단히 설명한 내용입니다:

1. 언어 장벽 (이식 문제)

가장 큰 장애물은 하드웨어 자체가 아니라 소프트웨어였습니다.

  • GPU 학교는 대부분의 AI 개발자가 이미 알고 있는 인기 있는 프로그래밍 언어인 PyTorch를 사용합니다.
  • TPU 학교는 다른 사고방식을 요구하는 다른 언어인 JAX를 사용합니다.

저자들은 전체 "수업 계획"을 PyTorch 에서 JAX 로 번역해야 했습니다. 그들은 다음을 수행해야 했습니다:

  • 여러 칩에 걸쳐 분할된 모델의 뇌를 재배치하기 (2 개가 아닌 4 개의 방에 책이 흩어져 있는 도서관을 정리하는 것과 같은 방식).
  • TPU 학교가 다른 용어를 사용하기 때문에 모델의 특정 부분을 이름 변경하기 (예: "q_proj"를 "q_einsum"으로 부름).
  • TPU 학교는 세계 나머지 부분 (Safetensors) 과 다른 파일 시스템 (Orbax) 을 사용하므로 작업을 저장하기 위한 맞춤형 "다리"를 구축하기.

비유: 집을 옮기는 것과 같습니다. 가구 (AI 모델) 는 동일하지만, 새로운 집 (TPU) 은 다른 출입구와 평면도를 가지고 있습니다. 가구를 분해하여 새로운 문을 통해 운반하고 다시 조립하지 않으면 들어맞지 않습니다.

2. 훈련 레이스 (로봇 가르치기)

모델을 설정한 후, 그들은 훈련 레이스를 시작했습니다.

  • 속도: TPU 학교는 1.6 배 더 빨랐습니다. 훈련 과정을 3.3 시간 만에 완료한 반면, GPU 학교는 5.4 시간이 걸렸습니다.
  • 비용: TPU 학교는 시간당 요금이 더 저렴할 뿐만 아니라 더 빠르게 완료하므로 총 비용은 2.1 배 더 저렴했습니다.
    • GPU 비용: 약 $119
    • TPU 비용: 약 $56

왜 TPU 가 더 빨랐을까요?
TPU 칩을 데이터 (봉투) 를 서로 매우 빠르게 전달하는 초고속 내부 고속도로 (ICI) 를 통해 서로 연결된 4 명의 주자 팀으로 생각하십시오. GPU 학교에는 2 명의 주자만 있었습니다. 개별 GPU 주자가 약간 더 빨랐지만, TPU 팀의 데이터 조정 및 이동 능력 덕분에 전체 팀이 승리했습니다.

3. 시험 (로봇이 배웠는가?)

훈련 후, 그들은 로봇들을 Verilog 코딩 시험으로 테스트했습니다.

  • 결과: GPU 에서 훈련된 로봇이 가장 어려운 질문에서 약간 더 높은 점수 (약 5% 더 좋음) 를 받았습니다.
  • 주의할 점: 저자들은 이 차이가 한 로봇이 본질적으로 더 똑똑해서가 아니라 두 학교가 시험을 약간 다르게 채점했기 때문일 가능성이 높다고 지적했습니다 (하나는 질문의 "프롬프트" 부분을 무시했고 다른 하나는 무시하지 않았습니다). 이 차이는 통계적으로 크지 않았습니다.

4. 취업 면접 (모델 서비스)

훈련 후, 모델은 실시간으로 사용자의 질문에 답하도록 배치되어야 합니다. 이를 "추론"이라고 합니다. 그들은 모델이 다양한 길이의 질문에 얼마나 빠르게 답할 수 있는지 테스트했습니다.

  • 짧은 질문 (간단한 작업):

    • GPU 학교는 매우 짧은 질문에 답하는 데 약간 더 빨랐습니다.
    • 또한 이러한 빠른 작업에 대한 답변당 비용도 약간 더 저렴했습니다.
    • 비유: 커피 한 잔만 사야 한다면, 지역 상점 (GPU) 이 약간 더 효율적입니다.
  • 긴 질문 (복잡한 작업):

    • 질문이 길어지면 (4,000 단어 이상), TPU 학교가 압도적으로 우위를 점했습니다.
    • 속도: TPU 는 긴 질문에 대한 답변을 시작하는 속도 (Time-to-First-Token) 가 23 배 더 빨랐습니다.
    • 용량: TPU 는 속도가 느려지지 않으면서 동시에 4 배 더 많은 사람들이 긴 질문을 할 수 있었습니다.
    • 비유: 전체 소설을 써야 한다면, TPU 학교는 매끄럽게 협력할 수 있는 팀과 거대한 도서관을 가지고 있습니다. GPU 학교는 압도되어 책을 떨어뜨리기 시작합니다.

5. 최종 판결

저자들은 특정 요구 사항 (대규모 모델 훈련 및 사용자에게 서비스 제공) 에 대해 구글의 TPU 가 승리자라고 결론지었습니다.

  • 훈련: TPU 는 명확한 챔피언입니다 (더 빠르고 훨씬 저렴함).
  • 추론: TPU 는 복잡하거나 긴 모든 작업의 챔피언입니다. 매우 간단하고 짧은 작업의 경우 GPU 가 여전히 약간 더 좋습니다.
  • 총 비용: 훈련 비용과 하루 동안 사용자에게 서비스를 제공하는 비용을 합치면, TPU 설정은 전체적으로 1.8 배 더 저렴했습니다.

핵심 요약:
TPU 학교로 전환하려면 많은 초기 노력이 필요했습니다 (새로운 언어 학습, 가구 수리, 다리 건설). 하지만 정착한 후에는 학교가 더 빠르게 운영되었고, 비용이 더 적게 들었으며, 전통적인 GPU 학교보다 훨씬 더 크고 복잡한 작업을 처리했습니다. 중대한 AI 작업을 수행하는 회사에게는 전환을 위한 추가 노력이 비용 절감과 성능 향상으로 충분히 가치가 있었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →