Panoramica generale delle GPU

Le GPU generiche sono ottimizzate per i workload di intelligenza artificiale (AI) e machine learning (ML) che danno la priorità a flessibilità operativa, indipendenza delle risorse ed efficacia in termini di costi.

Le GPU generiche consentono ai team di eseguire il deployment e scalare gli acceleratori NVIDIA con completa autonomia operativa, bypassando la complessità architetturale dei cluster di supercomputing coordinati. Sono ideali per i workload che danno la priorità ad alta affidabilità, provisioning self-service e scalabilità indipendente. I casi d'uso comuni includono inferenza in tempo reale, RAG, prototipazione e addestramento di modelli di dimensioni piccole e medie.

Caratteristiche principali delle GPU generiche

  • Flessibilità operativa: puoi gestire le risorse utilizzando le interfacce standard GKE (Autopilot e Standard) e Compute Engine per semplificare il deployment e lo scaling.
  • Alta affidabilità: Google Cloud aggiorna le singole istanze in modo indipendente per garantire che gli aggiornamenti su un nodo non influiscano sulla disponibilità degli altri, consentendo al bilanciatore del carico di reindirizzare il traffico senza bloccare i fleet di servizio.
  • Semplicità del networking: i tuoi carichi di lavoro utilizzano servizi VPC (Virtual Private Cloud) standard e TCP/IP standard su interfacce gVNIC (Google Virtual NIC) per eliminare fabric complessi a livello hardware.
  • Ottimizzazione dei costi: puoi utilizzare le VM spot per la ricerca a tolleranza di errore per ottenere un risparmio sui costi fino al 90% rispetto alle tariffe standard on demand.
  • Acquisizione self-service: puoi ottenere capacità direttamente tramite richieste on demand e prenotazioni standard senza richiedere flussi di lavoro gestiti dal team dell'account.

Famiglie di GPU generiche e specifiche tecniche

Esamina le specifiche dei carichi di lavoro e dell'hardware per la serie di macchine GPU generiche. Per l'inferenza ad alto throughput, utilizza la serie A3 Edge.

Serie A3 (High con 1, 2 o 4 GPU ed Edge)

A3 High (1, 2 o 4 GPU)

Se esegui carichi di lavoro di inferenza o di addestramento standard che richiedono prestazioni elevate, ma non hai bisogno di un cluster sincronizzato completo di 8 GPU, utilizza la serie di macchine A3 High con 1, 2 o 4 GPU collegate.

I tipi di macchine A3 High dispongono di GPU NVIDIA H100 SXM e sono adatti sia per l'inferenza di modelli di grandi dimensioni sia per l'ottimizzazione dei modelli.

GPU NVIDIA H100 collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1500 1 50 2 160
a3-highgpu-4g 104 936 3000 1 100 4 320
a3-highgpu-8g 208 1872 6000 5 1000 8 640

1 Una vCPU viene implementata come un singolo hyperthread hardware su una delle piattaforme CPU disponibili.
2 La larghezza di banda in uscita massima non può superare il numero specificato. La larghezza di banda in uscita effettiva dipende dall'indirizzo IP di destinazione e da altri fattori. Per saperne di più sulla larghezza di banda di rete, consulta Larghezza di banda di rete.
3 La memoria GPU è la memoria di un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload ad alta intensità grafica.

A3 Edge

Se esegui carichi di lavoro di inferenza distribuita ad alto throughput su più host senza una struttura di cluster coordinata, utilizza la serie A3 Edge per semplificare il deployment su reti private virtuali standard.

I tipi di macchine A3 Edge sono dotati di GPU NVIDIA H100 SXM e sono progettati specificamente per la pubblicazione e sono disponibili in un insieme limitato di regioni.

GPU NVIDIA H100 collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM3)
a3-edgegpu-8g 208 1872 6000 5
  • 600: per asia-south1 e northamerica-northeast2
  • 400: per tutte le altre regioni A3 Edge
8 640

Serie A2 (Standard e Ultra)

Se devi eseguire la gestione di modelli a nodo singolo ad alte prestazioni o il perfezionamento di modelli su piccola scala, utilizza la serie di macchine A2 per accedere alle risorse GPU NVIDIA A100 dedicate.

A2 Ultra

GPU NVIDIA A100 da 80 GB collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale collegato (GiB) Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM2e)
a2-ultragpu-1g 12 170 375 24 1 80
a2-ultragpu-2g 24 340 750 32 2 160
a2-ultragpu-4g 48 680 1500 50 4 320
a2-ultragpu-8g 96 1360 3000 100 8 640

1 Una vCPU viene implementata come un singolo hyperthread hardware su una delle piattaforme CPU disponibili.
2 La larghezza di banda in uscita massima non può superare il numero specificato. La larghezza di banda in uscita effettiva dipende dall'indirizzo IP di destinazione e da altri fattori. Per saperne di più sulla larghezza di banda di rete, consulta Larghezza di banda di rete.
3 La memoria GPU è la memoria di un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload ad alta intensità grafica.

A2 Standard

GPU NVIDIA A100 da 40 GB collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD locale supportato Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3
(GB HBM2)
a2-highgpu-1g 12 85 24 1 40
a2-highgpu-2g 24 170 32 2 80
a2-highgpu-4g 48 340 50 4 160
a2-highgpu-8g 96 680 100 8 320
a2-megagpu-16g 96 1360 100 16 640

1 Una vCPU viene implementata come un singolo hyperthread hardware su una delle piattaforme CPU disponibili.
2 La larghezza di banda in uscita massima non può superare il numero specificato. La larghezza di banda in uscita effettiva dipende dall'indirizzo IP di destinazione e da altri fattori. Per saperne di più sulla larghezza di banda di rete, consulta Larghezza di banda di rete.
3 La memoria GPU è la memoria di un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload ad alta intensità grafica.

Serie G4

Se il tuo team richiede inferenza entry-level conveniente o workload di rendering grafici standard, utilizza la serie di macchine G4 con GPU NVIDIA RTX PRO 6000.

I tipi di macchina G4 utilizzano GPU NVIDIA RTX PRO 6000 Blackwell Server Edition (nvidia-rtx-pro-6000) e sono adatti per i workload di simulazione NVIDIA Omniverse, le applicazioni ad alta intensità di grafica, la transcodifica video e i desktop virtuali. I tipi di macchine G4 forniscono anche una soluzione a basso costo per l'esecuzione dell'inferenza su un singolo host e l'ottimizzazione del modello rispetto ai tipi di macchine della serie A.

GPU NVIDIA RTX PRO 6000 collegate
Tipo di macchina Numero di vCPU1 Memoria istanza (GB) SSD Titanium massimo supportato (GiB)2 Numero di NIC fisiche Larghezza di banda massima della rete (Gbps)3 Conteggio GPU Memoria GPU4
(GB GDDR7)
g4-standard-6 6 22 0 1 20 1/8 12
g4-standard-12 12 45 375 1 20 1/4 24
g4-standard-24 24 90 750 1 20 1/2 48
g4-standard-48 48 180 1500 1 50 1 96
g4-standard-96 96 360 3000 1 100 2 192
g4-standard-192 192 720 6000 1 200 4 384
g4-standard-384 384 1440 12.000 2 400 8 768

*La memoria GPU è la memoria disponibile su un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload accelerati, come machine learning e workload ad alta intensità grafica.

Serie G2

Se esegui il deployment di applicazioni di inferenza in tempo reale mainstream o pipeline di generazione aumentata dal recupero (RAG), utilizza la serie di macchine G2 per bilanciare prestazioni ed efficienza dei costi con le GPU NVIDIA L4.

GPU NVIDIA L4 collegate
Tipo di macchina Numero di vCPU1 Memoria istanza predefinita (GB) Intervallo di memoria istanza personalizzato (GB) SSD locale massimo supportato (GiB) Larghezza di banda massima della rete (Gbps)2 Conteggio GPU Memoria GPU3 (GB GDDR6)
g2-standard-4 4 16 16-32 375 10 1 24
g2-standard-8 8 32 32-54 375 16 1 24
g2-standard-12 12 48 48-54 375 16 1 24
g2-standard-16 16 64 54-64 375 32 1 24
g2-standard-24 24 96 96-108 750 32 2 48
g2-standard-32 32 128 96-128 375 32 1 24
g2-standard-48 48 192 192-216 1500 50 4 96
g2-standard-96 96 384 384-432 3000 100 8 192

1 Una vCPU viene implementata come un singolo hyperthread hardware su una delle piattaforme CPU disponibili.
2 La larghezza di banda in uscita massima non può superare il numero specificato. La larghezza di banda in uscita effettiva dipende dall'indirizzo IP di destinazione e da altri fattori. Per saperne di più sulla larghezza di banda di rete, consulta Larghezza di banda di rete.
3 La memoria GPU è la memoria di un dispositivo GPU che può essere utilizzata per l'archiviazione temporanea dei dati. È separata dalla memoria dell'istanza ed è progettata specificamente per gestire le richieste di larghezza di banda più elevate dei workload ad alta intensità grafica.

Serie N1 (NVIDIA T4 o V100)

Se la tua priorità è l'esecuzione di esperimenti sensibili ai costi o l'inferenza di base a bassa concorrenza, utilizza la serie di macchine N1 per collegare le GPU NVIDIA T4 o V100.

NVIDIA T4

Tipo di acceleratore Conteggio GPU Memoria GPU1 (GB GDDR6) Numero di vCPU Memoria istanza (GB) SSD locale supportato
nvidia-tesla-t4 o
nvidia-tesla-t4-vws
1 16 1-48 1-312
2 32 1-48 1-312
4 64 1-96 1-624

NVIDIA V100

Tipo di acceleratore Conteggio GPU Memoria GPU1 (GB HBM2) Numero di vCPU Memoria istanza (GB) SSD locale supportato2
nvidia-tesla-v100 1 16 1-12 1-78
2 32 1-24 1-156
4 64 1-48 1-312
8 128 1-96 1-624

Acquisizione di capacità

Gli acceleratori GPU generici utilizzano il provisioning standard self-service. Puoi ottenere capacità tramite prenotazioni standard, richieste on demand o VM spot. Poiché la capacità on demand può esaurirsi, utilizza le VM spot o l'avvio flessibile, se possibile.

Passaggi successivi