GPU 가속기 정보

AI 하이퍼컴퓨터는 까다로운 인공지능 (AI) 및 머신러닝 (ML) 워크로드에 최적화된 수직 통합 인프라를 제공합니다. 고성능 NVIDIA GPU는 시스템에서 수명 주기 이벤트와 유지보수를 처리하는 방식에 따라 일반 GPU 와 클러스터링된 GPU로 분류됩니다.

워크로드에 가장 적합한 인프라 카테고리를 확인하려면 액셀러레이터 인프라 선택을 참고하세요.

일반 GPU

일반 GPU는 표준 Compute Engine 및 Google Kubernetes Engine (GKE) API를 사용하여 Google Cloud제어 영역과 직접 통합함으로써 독립적인 컴퓨팅 단위로 관리됩니다.

일반 GPU에는 다음 머신 시리즈가 포함됩니다.

  • 1, 2 또는 4개의 (NVIDIA H100) GPU가 있는 A3 High: 8개의 GPU 동기화 클러스터가 필요하지 않은 표준 학습 및 추론 워크로드에 최적화되어 있습니다.
  • A3 Edge (NVIDIA H100): 표준 VPC 네트워킹을 사용하여 높은 처리량으로 여러 호스트에 분산된 추론에 최적화되어 있습니다.
  • A2 (NVIDIA A100): 고성능 단일 노드 서빙 및 소규모 미세 조정을 위해 최적화되어 있습니다.
  • G4 (NVIDIA RTX PRO 6000): 비용 효율적인 보급형 추론 및 그래픽 워크로드에 최적화되어 있습니다.
  • G2 (NVIDIA L4): 주류 추론 및 RAG에 최적화되어 있습니다.
  • N1 (NVIDIA T4 또는 V100): 고성능 상호 연결보다 비용을 우선시하는 보급형 추론 및 연구 작업에 최적화되어 있습니다.

클러스터링된 GPU

클러스터링된 GPU는 Cluster Director를 사용하여 상호 연결된 수천 개의 액셀러레이터로 구성된 단일의 긴밀하게 결합된 시스템으로 관리됩니다.

클러스터링된 GPU에는 다음 머신 시리즈가 포함됩니다.

GPU 성능 고려사항

워크로드의 성능을 평가하고 최적화하려면 CUDA 코어 및 텐서 코어 사용률과 같은 하드웨어 수준 측정항목을 추적하면 됩니다. 리소스 모니터링 및 일반 환경과 클러스터링된 환경 모두에서 성능을 평가하려면 다음을 참고하세요.

  • 모니터링 대시보드: 개별 독립형 인스턴스 또는 오케스트레이션된 클러스터 Fleet의 실시간 GPU 사용률 및 메모리 사용량을 추적합니다.
  • 유효 처리량 측정항목 레시피: 액셀러레이터가 유용한 계산을 수행하는 시간의 비율을 시스템 오버헤드와 비교하여 측정합니다. 클러스터링된 하드웨어에서 대규모 분산 학습을 수행하는 데 매우 권장됩니다.

다음 단계