Panoramica delle GPU in cluster

Le GPU in cluster sono ottimizzate per i workload di intelligenza artificiale (AI) e machine learning (ML) che danno la priorità all'addestramento distribuito su larga scala, all'inferenza multihost e a complesse attività di computing ad alte prestazioni (HPC).

Le GPU in cluster consentono ai team di eseguire il deployment e scalare migliaia di acceleratori interconnessi come un unico sistema strettamente accoppiato utilizzando tessuti di rete specializzati e manutenzione sincronizzata. Sono ideali per carichi di lavoro che richiedono sincronizzazione di calcolo, memoria e rete ad alta velocità estremi. I casi d'uso comuni includono l'addestramento preliminare di modelli di base con miliardi di parametri, il servizio di modelli all'avanguardia e simulazioni per la scoperta di farmaci.

Caratteristiche principali delle GPU in cluster

  • Manutenzione sincronizzata: Google Cloud aggiorna tutti i nodi del cluster contemporaneamente, impedendo che il riavvio di un singolo nodo blocchi un job.
  • Monitoraggio automatico dell'integrità: il sistema identifica in modo proattivo i nodi in ritardo e monitora gli errori hardware o il danneggiamento silenzioso dei dati.
  • Sostituzione proattiva dei nodi: il sistema espelle e riprogramma le VM con prestazioni insufficienti su macchine integre da un pool di riserva.
  • Topologia con allineamento ai rail: una topologia con allineamento ai rail isola il traffico da GPU a GPU dalla comunicazione host standard per garantire prestazioni senza jitter per il coordinamento di più nodi di grandi dimensioni.
  • Protocolli avanzati: queste serie di macchine supportano interconnessioni ad alta larghezza di banda, tra cui GPUDirect RDMA (basato su RoCE).

Famiglie di GPU in cluster e specifiche tecniche

Esamina i workload e le specifiche hardware per la serie di macchine con GPU cluster premium in queste tabelle. Per l'addestramento exascale, utilizza le serie A4X o A3 Ultra.

Serie A4X e A4X Max

Se esegui l'addestramento di modelli di base exascale di grandi dimensioni o simulazioni di computing ad alte prestazioni (HPC) bare metal molto complesse, utilizza le serie di macchine A4X Max o A4X. Queste serie sono dotate di NVIDIA GB300 Grace Blackwell Ultra Superchip per gestire esigenze estreme di calcolo e memoria.

A4X Max (Bare Metal)

I tipi di macchine A4X Max utilizzano i superchip NVIDIA GB300 Grace Blackwell Ultra (nvidia-gb300) e sono ideali per l'addestramento e la pubblicazione di foundation model. I tipi di macchine A4X Max sono disponibili come istanze bare metal.

A4X Max è una piattaforma exascale basata su NVIDIA GB300 NVL72. Ogni macchina ha due socket con CPU NVIDIA Grace con core Arm Neoverse V2. Queste CPU sono collegate a quattro GPU NVIDIA B300 Blackwell con comunicazione chip-to-chip (NVLink-C2C) veloce.

Superchip NVIDIA GB300 Grace Blackwell Ultra collegati
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM3e)
a4x-maxgpu-4g-metal 144 960 12.000 6 3600 4 1116

1 Una vCPU viene implementata come un singolo hyperthread hardware su una delle piattaforme CPU disponibili.
2 La larghezza di banda in uscita massima non può superare il numero specificato. La larghezza di banda in uscita effettiva dipende dall'indirizzo IP di destinazione e da altri fattori. Per saperne di più sulla larghezza di banda di rete, consulta Larghezza di banda di rete.
3 La memoria GPU è la memoria di un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload ad alta intensità grafica.

A4X

I tipi di macchine A4X utilizzano i superchip NVIDIA GB200 Grace Blackwell (nvidia-gb200) e sono ideali per l'addestramento e l'erogazione di foundation model.

A4X è una piattaforma exascale basata su NVIDIA GB200 NVL72. Ogni macchina ha due socket con CPU NVIDIA Grace con core Arm Neoverse V2. Queste CPU sono collegate a quattro GPU NVIDIA B200 Blackwell con comunicazione chip-to-chip (NVLink-C2C) veloce.

Superchip NVIDIA GB200 Grace Blackwell collegati
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM3e)
a4x-highgpu-4g 140 884 12.000 6 2000 4 744

1 Una vCPU viene implementata come un singolo hyperthread hardware su una delle piattaforme CPU disponibili.
2 La larghezza di banda in uscita massima non può superare il numero specificato. La larghezza di banda in uscita effettiva dipende dall'indirizzo IP di destinazione e da altri fattori. Per saperne di più sulla larghezza di banda di rete, consulta Larghezza di banda di rete.
3 La memoria GPU è la memoria di un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload ad alta intensità grafica.

Serie A4

Se il tuo obiettivo è addestrare foundation model allo stato dell'arte che richiedono una scalabilità dell'elaborazione parallela massiccia, utilizza la serie di macchine A4 per ottimizzare il tempo di elaborazione e massimizzare il throughput hardware.

I tipi di macchine A4 sono collegate a GPU NVIDIA B200 Blackwell (nvidia-b200) e sono ideali per l'addestramento e la pubblicazione di modelli di base.

GPU NVIDIA B200 Blackwell collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM3e)
a4-highgpu-8g 224 3968 12.000 10 3600 8 1440

1 Una vCPU viene implementata come un singolo hyperthread hardware su una delle piattaforme CPU disponibili.
2 La larghezza di banda in uscita massima non può superare il numero specificato. La larghezza di banda in uscita effettiva dipende dall'indirizzo IP di destinazione e da altri fattori. Per ulteriori informazioni sulla larghezza di banda di rete, consulta Larghezza di banda di rete.
3 La memoria GPU è la memoria di un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload ad alta intensità grafica.

Serie A3 (Ultra, Mega e High con 8 GPU)

Se devi eseguire addestramenti distribuiti su larga scala o pubblicare modelli all'avanguardia su più host con tabelle di set di dati di grandi dimensioni, utilizza la serie di macchine A3 per ridurre al minimo la latenza di rete da host a host.

A3 Ultra

GPU NVIDIA H200 collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM3e)
a3-ultragpu-8g 224 2952 12.000 10 3600 8 1128

A3 Mega

GPU NVIDIA H100 collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM3)
a3-megagpu-8g 208 1872 6000 9 1800 8 640

A3 High

GPU NVIDIA H100 collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1500 1 50 2 160
a3-highgpu-4g 104 936 3000 1 100 4 320
a3-highgpu-8g 208 1872 6000 5 1000 8 640

1 Una vCPU viene implementata come un singolo hyperthread hardware su una delle piattaforme CPU disponibili.
2 La larghezza di banda in uscita massima non può superare il numero specificato. La larghezza di banda in uscita effettiva dipende dall'indirizzo IP di destinazione e da altri fattori. Per saperne di più sulla larghezza di banda di rete, consulta Larghezza di banda di rete.
3 La memoria GPU è la memoria di un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload ad alta intensità grafica.

Acquisizione di capacità

L'acquisizione di capacità di calcolo per le GPU in cluster richiede il coordinamento per gestire l'offerta e la domanda di acceleratori ad alte prestazioni. Poiché queste risorse si trovano fisicamente all'interno di fabric di rete specializzati, devi richiederle tramite flussi di lavoro gestiti.

Puoi prenotare la capacità tramite il team dedicato all'account o utilizzare le prenotazioni future e Dynamic Workload Scheduler.

Passaggi successivi