AI 하이퍼컴퓨터는 까다로운 인공지능 (AI) 및 머신러닝 (ML) 워크로드에 최적화된 수직 통합 인프라를 제공합니다. 고성능 NVIDIA GPU는 시스템에서 수명 주기 이벤트와 유지보수를 처리하는 방식에 따라 일반 GPU 와 클러스터링된 GPU로 분류됩니다.
워크로드에 가장 적합한 인프라 카테고리를 확인하려면 액셀러레이터 인프라 선택을 참고하세요.
일반 GPU
일반 GPU는 표준 Compute Engine 및 Google Kubernetes Engine (GKE) API를 사용하여 Google Cloud제어 영역과 직접 통합함으로써 독립적인 컴퓨팅 단위로 관리됩니다.
일반 GPU에는 다음 머신 시리즈가 포함됩니다.
- 1, 2 또는 4개의 (NVIDIA H100) GPU가 있는 A3 High: 8개의 GPU 동기화 클러스터가 필요하지 않은 표준 학습 및 추론 워크로드에 최적화되어 있습니다.
- A3 Edge (NVIDIA H100): 표준 VPC 네트워킹을 사용하여 높은 처리량으로 여러 호스트에 분산된 추론에 최적화되어 있습니다.
- A2 (NVIDIA A100): 고성능 단일 노드 서빙 및 소규모 미세 조정을 위해 최적화되어 있습니다.
- G4 (NVIDIA RTX PRO 6000): 비용 효율적인 보급형 추론 및 그래픽 워크로드에 최적화되어 있습니다.
- G2 (NVIDIA L4): 주류 추론 및 RAG에 최적화되어 있습니다.
- N1 (NVIDIA T4 또는 V100): 고성능 상호 연결보다 비용을 우선시하는 보급형 추론 및 연구 작업에 최적화되어 있습니다.
클러스터링된 GPU
클러스터링된 GPU는 Cluster Director를 사용하여 상호 연결된 수천 개의 액셀러레이터로 구성된 단일의 긴밀하게 결합된 시스템으로 관리됩니다.
클러스터링된 GPU에는 다음 머신 시리즈가 포함됩니다.
- A4X Max (NVIDIA GB300): NVIDIA GB300 Grace Blackwell Ultra Superchips를 탑재한 베어메탈 엑사스케일 학습 및 고성능 컴퓨팅을 위해 설계되었습니다.
- A4X (NVIDIA GB200) 및 A4 (NVIDIA B200): 파운데이션 모델 학습 및 엑사스케일 파운데이션 모델 학습을 위해 설계되었습니다.
- A3 Ultra (NVIDIA H200), A3 Mega (NVIDIA H100), 8개의 (NVIDIA H100) GPU가 있는 A3 High: 대규모 분산 학습 및 다중 호스트 추론에 최적화되어 있습니다. 대규모 데이터 테이블과 관련됩니다.
GPU 성능 고려사항
워크로드의 성능을 평가하고 최적화하려면 CUDA 코어 및 텐서 코어 사용률과 같은 하드웨어 수준 측정항목을 추적하면 됩니다. 리소스 모니터링 및 일반 환경과 클러스터링된 환경 모두에서 성능을 평가하려면 다음을 참고하세요.
- 모니터링 대시보드: 개별 독립형 인스턴스 또는 오케스트레이션된 클러스터 Fleet의 실시간 GPU 사용률 및 메모리 사용량을 추적합니다.
- 유효 처리량 측정항목 레시피: 액셀러레이터가 유용한 계산을 수행하는 시간의 비율을 시스템 오버헤드와 비교하여 측정합니다. 클러스터링된 하드웨어에서 대규모 분산 학습을 수행하는 데 매우 권장됩니다.
다음 단계
- 인프라 요구사항을 평가하려면 액셀러레이터 인프라 선택을 참고하세요.
- 클러스터를 시작할 때 수행할 프로세스 및 선택사항을 검토하려면 AI 인프라 계획 및 만들기를 참고하세요.