AI Hypercomputer fornisce un'infrastruttura integrata verticalmente ottimizzata per i workload di intelligenza artificiale (AI) e machine learning (ML) impegnativi. Le GPU NVIDIA ad alte prestazioni sono classificate in base alla modalità di gestione degli eventi del ciclo di vita e della manutenzione da parte del sistema: GPU generali e GPU in cluster.
Per identificare la categoria di infrastruttura ottimale per il tuo workload, consulta la pagina Scegliere l'infrastruttura dell'acceleratore.
GPU generali
Le GPU generali vengono gestite come unità di calcolo indipendenti, utilizzando le API standard di Compute Engine e Google Kubernetes Engine (GKE) per l'integrazione diretta con Google Cloud's piano di controllo.
Le GPU generali includono le seguenti serie di macchine:
- A3 High con 1, 2 o 4 GPU (NVIDIA H100): ottimizzate per i workload di addestramento e inferenza standard che non richiedono un cluster sincronizzato a 8 GPU.
- A3 Edge (NVIDIA H100): ottimizzate per l'inferenza distribuita su più host con un'elevata velocità effettiva utilizzando la rete VPC standard.
- A2 (NVIDIA A100): ottimizzate per il serving a nodo singolo ad alte prestazioni e la messa a punto su piccola scala.
- G4 (NVIDIA RTX PRO 6000): ottimizzate per i workload di inferenza e grafica di livello base convenienti.
- G2 (NVIDIA L4): ottimizzate per l'inferenza mainstream e RAG.
- N1 (NVIDIA T4 o V100): ottimizzate per le attività di inferenza e ricerca di livello base che danno la priorità al costo rispetto alle interconnessioni ad alte prestazioni.
GPU in cluster
Le GPU in cluster vengono gestite come un unico sistema strettamente accoppiato di migliaia di acceleratori interconnessi utilizzando Cluster Director.
Le GPU in cluster includono le seguenti serie di macchine:
- A4X Max (NVIDIA GB300): progettate per l'addestramento exascale bare metal e il computing ad alte prestazioni, con NVIDIA GB300 Grace Blackwell Ultra Superchip.
- A4X (NVIDIA GB200) e A4 (NVIDIA B200): progettate per l'addestramento di foundation model e l'addestramento di foundation model exascale.
- A3 Ultra (NVIDIA H200), A3 Mega (NVIDIA H100) e A3 High con 8 GPU (NVIDIA H100): ottimizzate per l'addestramento distribuito su larga scala e l'inferenza multi-host che coinvolge tabelle di dati di grandi dimensioni.
Considerazioni sulle prestazioni della GPU
Per valutare e ottimizzare le prestazioni del workload, puoi monitorare le metriche a livello hardware, come l'utilizzo dei core CUDA e dei Tensor Core. Per monitorare le risorse e valutare le prestazioni sia negli ambienti generali che in quelli in cluster, consulta le seguenti pagine:
- Dashboard di monitoraggio: monitora l'utilizzo della GPU e l'utilizzo della memoria in tempo reale per le singole istanze autonome o le flotte di cluster orchestrate.
- Ricette per le metriche di goodput: misura la percentuale di tempo in cui gli acceleratori eseguono calcoli utili rispetto all'overhead di sistema, il che è altamente consigliato per l'addestramento distribuito su larga scala su hardware in cluster.
Passaggi successivi
- Per valutare i requisiti dell'infrastruttura, consulta la pagina Scegliere l'infrastruttura dell'acceleratore.
- Per esaminare la procedura e le scelte da fare quando avvii un cluster, consulta la pagina Pianificare e creare l'infrastruttura AI.