Tentang akselerator GPU

AI Hypercomputer menyediakan infrastruktur terintegrasi secara vertikal yang dioptimalkan untuk workload kecerdasan buatan (AI) dan machine learning (ML) yang berat. GPU NVIDIA berperforma tinggi dikategorikan berdasarkan cara sistem menangani peristiwa siklus proses dan pemeliharaannya: GPU Umum dan GPU Bercluster.

Untuk mengidentifikasi kategori infrastruktur yang optimal untuk workload Anda, lihat Memilih infrastruktur akselerator.

GPU Umum

GPU Umum dikelola sebagai unit komputasi independen, dengan menggunakan Compute Engine standar dan Google Kubernetes Engine (GKE) API untuk berintegrasi langsung dengan Google Cloud's bidang kontrol.

GPU Umum mencakup seri mesin berikut:

GPU Bercluster

GPU Bercluster dikelola sebagai sistem tunggal yang terhubung erat dengan ribuan akselerator yang saling terhubung menggunakan Cluster Director.

GPU Bercluster mencakup seri mesin berikut:

Pertimbangan performa GPU

Untuk mengevaluasi dan mengoptimalkan performa workload, Anda dapat melacak metrik tingkat hardware seperti penggunaan core CUDA dan Tensor Core. Untuk memantau resource dan mengevaluasi performa di lingkungan Umum dan Bercluster, lihat hal berikut:

  • Dasbor pemantauan: melacak penggunaan GPU dan penggunaan memori real-time untuk setiap instance mandiri atau fleet cluster yang diatur.
  • Resep metrik goodput: mengukur persentase waktu akselerator Anda melakukan komputasi yang berguna dibandingkan dengan overhead sistem, yang sangat direkomendasikan untuk skala besar pelatihan terdistribusi pada hardware bercluster.

Langkah berikutnya