Servizi di rete per i deployment

I servizi di rete che configuri dipendono dall'opzione di deployment scelta (VM o cluster) e dall'infrastruttura.

Questo documento è destinato ad architetti, ingegneri di rete e sviluppatori che vogliono comprendere i servizi di rete per i deployment di AI Hypercomputer. Questo documento presuppone una conoscenza di base dei concetti di networking cloud e computing distribuito. Per ulteriori informazioni sulle opzioni di deployment, consulta la panoramica delle opzioni di deployment.

Per informazioni dettagliate sull'architettura di rete, sui protocolli e sulle topologie hardware , consulta la panoramica del networking GPU.

Networking per i deployment di GKE ottimizzati per l'AI con configurazioni predefinite

Quando crei un cluster GKE ottimizzato per l'AI con le impostazioni predefinite, il progetto iniziale di Cluster Toolkit configura la rete nel seguente modo:

  • Il progetto iniziale utilizza la rete VPC predefinita per il cluster GKE principale.
  • Crea due VPC aggiuntivi: uno per una seconda scheda di interfaccia di rete (NIC) host e un altro per il traffico di accesso diretto alla memoria remota (RDMA) da GPU a GPU.
  • Il progetto iniziale applica un profilo di rete preconfigurato e gestito da Google al VPC utilizzato per il traffico GPU. Questo profilo configura automaticamente la rete per prestazioni RDMA ad alta velocità e a bassa latenza.
  • Il progetto iniziale crea automaticamente otto subnet dedicate all'interno del VPC RDMA, una per ogni NIC RDMA su una VM con acceleratore.
  • Configura le regole firewall che consentono tutto il traffico TCP, UDP e ICMP tra i nodi all'interno del cluster.

Networking per i deployment di GKE con configurazione personalizzata

La configurazione di rete per le configurazioni GKE personalizzate dipende dal tipo di workload e dall'infrastruttura:

  • Per le GPU generiche o i workload non distribuiti, crea un cluster GKE senza GPUDirect RDMA. Questa configurazione utilizza una singola rete VPC per tutte le comunicazioni.
  • Per le GPU in cluster o i workload distribuiti, crea un cluster GKE con GPUDirect RDMA abilitato. Questa configurazione utilizza un ambiente multi-VPC che separa il traffico per uso generico dalla comunicazione da GPU a GPU a larghezza di banda elevata.

Networking per i deployment di cluster Slurm

Utilizza Cluster Toolkit per eseguire il deployment dei workload AI e ML tramite progetti iniziali personalizzabili, ad esempio per le serie A4 o A3 Ultra.

I componenti di rete configurati dal progetto iniziale per i deployment di Slurm con GPU in cluster sono i seguenti:

  • Il progetto iniziale crea tre VPC distinti: un VPC principale per il piano di controllo Slurm, un VPC secondario per il traffico a livello di host per uso generico e un VPC dedicato ad alte prestazioni per la comunicazione da GPU a GPU.
  • Per il piano dati GPU, il progetto iniziale applica un profilo di rete preconfigurato e gestito da Google ottimizzato per RoCE.
  • Il progetto iniziale imposta un intervallo di indirizzi IP dedicato richiesto dal servizio Filestore, che fornisce la directory /home condivisa per il cluster.
  • Crea un VPC di creazione di immagini temporaneo e isolato utilizzato solo durante il processo di creazione dell'immagine VM personalizzata per i nodi del cluster.

Networking per le istanze di Compute Engine

Puoi utilizzare Compute Engine per creare VM autonome, istanze di calcolo collettive e gruppi di istanze gestite (MIG). I requisiti di rete specifici dipendono dal modello di infrastruttura del tipo di macchina:

  • GPU in cluster: queste serie di macchine (A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High con 8 GPU) richiedono una configurazione di rete multi-VPC per separare il traffico host-to-host per uso generico dalla comunicazione da GPU a GPU a larghezza di banda elevata.
  • GPU generiche: queste serie di macchine (G2, G4, A2 e N1 con T4 o V100) utilizzano un'architettura a singolo VPC su interfacce gVNIC per tutte le comunicazioni. A3 Edge è un'eccezione che richiede quattro VPC dati e GPUDirect-TCPX.

Per informazioni dettagliate sulle NIC e sulla configurazione di rete per il tuo tipo di macchina, consulta Networking e macchine GPU.

Passaggi successivi