AI Hypercomputer menyediakan infrastruktur terintegrasi secara vertikal yang dioptimalkan untuk workload kecerdasan buatan (AI) dan machine learning (ML) yang berat. GPU NVIDIA berperforma tinggi dikategorikan berdasarkan cara sistem menangani peristiwa siklus proses dan pemeliharaannya: GPU Umum dan GPU Bercluster.
Untuk mengidentifikasi kategori infrastruktur yang optimal untuk workload Anda, lihat Memilih infrastruktur akselerator.
GPU Umum
GPU Umum dikelola sebagai unit komputasi independen, dengan menggunakan Compute Engine standar dan Google Kubernetes Engine (GKE) API untuk berintegrasi langsung dengan Google Cloud's bidang kontrol.
GPU Umum mencakup seri mesin berikut:
- A3 High dengan 1, 2, atau 4 (NVIDIA H100) GPU: dioptimalkan untuk workload pelatihan dan inferensi standar yang tidak memerlukan cluster tersinkronisasi 8 GPU.
- A3 Edge (NVIDIA H100): dioptimalkan untuk inferensi yang didistribusikan ke beberapa host dengan throughput tinggi menggunakan jaringan VPC standar.
- A2 (NVIDIA A100): dioptimalkan untuk penayangan node tunggal berperforma tinggi dan penyetelan lanjutan skala kecil.
- G4 (NVIDIA RTX PRO 6000): dioptimalkan untuk workload inferensi dan grafis tingkat awal yang hemat biaya.
- G2 (NVIDIA L4): dioptimalkan untuk inferensi dan RAG mainstream.
- N1 (NVIDIA T4 atau V100): dioptimalkan untuk tugas inferensi dan riset tingkat awal yang memprioritaskan biaya daripada interkoneksi berperforma tinggi.
GPU Bercluster
GPU Bercluster dikelola sebagai sistem tunggal yang terhubung erat dengan ribuan akselerator yang saling terhubung menggunakan Cluster Director.
GPU Bercluster mencakup seri mesin berikut:
- A4X Max (NVIDIA GB300): dirancang untuk pelatihan exascale bare metal dan komputasi berperforma tinggi, yang menampilkan NVIDIA GB300 Grace Blackwell Ultra Superchip.
- A4X (NVIDIA GB200) dan A4 (NVIDIA B200): dirancang untuk pelatihan model dasar dan pelatihan model dasar exascale training.
- A3 Ultra (NVIDIA H200), A3 Mega (NVIDIA H100), dan A3 High dengan 8 (NVIDIA H100) GPU: dioptimalkan untuk pelatihan terdistribusi skala besar dan inferensi multi-host yang melibatkan tabel data besar.
Pertimbangan performa GPU
Untuk mengevaluasi dan mengoptimalkan performa workload, Anda dapat melacak metrik tingkat hardware seperti penggunaan core CUDA dan Tensor Core. Untuk memantau resource dan mengevaluasi performa di lingkungan Umum dan Bercluster, lihat hal berikut:
- Dasbor pemantauan: melacak penggunaan GPU dan penggunaan memori real-time untuk setiap instance mandiri atau fleet cluster yang diatur.
- Resep metrik goodput: mengukur persentase waktu akselerator Anda melakukan komputasi yang berguna dibandingkan dengan overhead sistem, yang sangat direkomendasikan untuk skala besar pelatihan terdistribusi pada hardware bercluster.
Langkah berikutnya
- Untuk mengevaluasi persyaratan infrastruktur, lihat Memilih infrastruktur akselerator.
- Untuk meninjau proses dan pilihan yang harus dibuat saat Anda memulai cluster, lihat Merencanakan dan membuat infrastruktur AI.