Informazioni sulle policy del workload nei MIG

Questo documento spiega i requisiti e le limitazioni che si applicano quando utilizzi le policy del workload con i gruppi di istanze gestite (MIG). Per impostazione predefinita, gestisci la località delle istanze Compute Engine solo specificando le relative zone. Le policy del workload ti consentono di definire il posizionamento fisico e la topologia delle istanze di computing all'interno di una zona. Questo approccio ti aiuta, ad esempio, a ridurre al minimo la latenza di rete tra le istanze di computing posizionandole più vicine tra loro.

Puoi applicare le policy del workload solo ai MIG che utilizzano istanze A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High (8 GPU), H4D o TPU (TPU7x, v6e o v5p). Se utilizzi istanze A4X Max o A4X o crei un MIG con uno slice TPU multi-host, è necessaria una policy del workload, a meno che tu non crei una singola istanza di computing per scopi di test. Per le altre serie di macchine supportate, le policy del workload sono facoltative.

Per controllare il posizionamento delle istanze di computing che utilizzano altre serie di macchine, utilizza le policy di posizionamento.

Informazioni sulle policy del workload

Le sezioni seguenti descrivono i casi d'uso delle policy del workload e le proprietà che specifichi quando le crei.

Gestire il posizionamento e la topologia delle istanze di computing

Dopo aver creato una policy del workload e averla applicata a un MIG, le policy del workload ti aiutano a ottenere quanto segue:

  • Crea istanze di computing vicine tra loro: se la capacità è disponibile, Compute Engine crea istanze di computing vicine tra loro. In caso contrario, Compute Engine crea solo alcune o nessuna delle istanze di computing richieste.

  • Ottieni visibilità sulla topologia delle istanze di computing: dopo aver applicato una policy del workload di tipo a throughput elevato (HIGH_THROUGHPUT) a un MIG, e il MIG crea istanze di computing, puoi visualizzare la posizione delle istanze di computing l'una rispetto all'altra. Queste informazioni ti aiutano a ridurre al minimo la latenza di rete e a risolvere gli errori. Per saperne di più, consulta Visualizzare la topologia delle istanze Compute Engine.

Puoi applicare la stessa policy del workload a più MIG. In questo caso, Compute Engine applica le regole di posizionamento a ogni MIG in modo indipendente.

La sezione seguente descrive le proprietà che devi specificare quando crei le policy del workload.

Configurare le proprietà delle policy del workload

Quando crei una policy del workload, devi specificare le seguenti proprietà:

  • Tipo di workload (type): questo campo definisce l'obiettivo di alto livello del cluster. Puoi specificare solo HIGH_THROUGHPUT, che indica a Compute Engine di posizionare le istanze di computing il più vicino possibile per velocizzare la comunicazione.

  • In base alla serie di macchine utilizzata dalle istanze di computing nel MIG, puoi specificare facoltativamente una delle seguenti proprietà:

    • Topologia dell'acceleratore (acceleratorTopology): questa proprietà ti aiuta a ottenere prestazioni elevate per i workload distribuiti eseguiti su più istanze A4X Max o A4X o slice TPU multi-host che utilizzano una configurazione di rete inter-acceleratore specializzata. Per saperne di più, consulta Proprietà della topologia dell'acceleratore.

    • Distanza topologia massima (maxTopologyDistance): questa proprietà definisce il limite fisico più rigoroso per la creazione delle istanze A4, A3 Ultra, A3 Mega, A3 High (8 GPU) o H4D, ad esempio lo stesso blocco o sotto-blocco. Se Compute Engine non riesce a rispettare questo limite rigoroso a causa di errori di disponibilità delle risorse, crea solo una parte o nessuna delle istanze di computing richieste. Per saperne di più, consulta Proprietà della distanza topologia massima.

Proprietà della topologia dell'acceleratore

Per ottenere prestazioni di rete non bloccanti su larga scala, Compute Engine organizza le istanze A4X Max e A4X in una gerarchia fisica di blocchi e sotto-blocchi.

Per creare un MIG con istanze A4X Max o A4X o slice TPU multi-host, devi applicare al MIG una policy del workload che specifichi la proprietà della topologia dell'acceleratore (acceleratorTopology). Questa proprietà definisce la configurazione di rete fisica per uno slice di istanze di computing. Uno slice funge da singolo acceleratore di grandi dimensioni che fornisce il massimo throughput per i workload di AI o ML distribuiti.

La tabella seguente mostra i valori della topologia dell'acceleratore per A4X Max e A4X. Per saperne di più sui valori della topologia per gli slice TPU multi-host, consulta Topologia TPU.

Valore della topologia dell'acceleratore Descrizione Serie di macchine supportate Numero massimo di istanze di computing
1x72 Compute Engine organizza le istanze di computing in sotto-blocchi allocati densamente di 18 istanze di computing, per un totale di 72 GPU. Poiché ogni sotto-blocco richiede il proprio MIG, puoi creare un massimo di 18 istanze di computing per MIG. Un blocco completo è composto da 25 MIG, per un totale di 450 istanze di computing. A4X Max e A4X 18

Per saperne di più sulle istanze A4X Max e A4X, consulta La serie di macchine A4X Max e A4X.

Proprietà della distanza topologia massima

Quando crei e applichi una policy del workload a un MIG, Compute Engine tenta di creare le istanze di computing vicine tra loro. Se hai bisogno della massima compattezza in una zona, ti consigliamo di specificare la proprietà della distanza topologia massima (maxTopologyDistance). Un valore di distanza topologia massima specifica di creare istanze A4, A3 Ultra, A3 Mega, A3 High (8 GPU) o H4D nello stesso cluster, blocco, o sotto-blocco.

La tabella seguente mostra i valori della distanza topologia massima e le serie di macchine che supportano:

Valore della distanza topologia massima Descrizione Serie di macchine supportate Numero massimo di istanze di computing
Non specificato (non consigliato) Compute Engine tenta di posizionare le istanze di computing il più vicino possibile, ma senza alcuna garanzia di distanza massima tra le istanze di computing in una zona. A4, A3 Ultra, A3 Mega, A3 High (8 GPU) e H4D 1500
CLUSTER Compute Engine crea istanze di computing in blocchi adiacenti all'interno di un cluster. A4 e H4D 1500
BLOCK Compute Engine crea istanze di computing nello stesso blocco. A4, A3 Ultra, A3 Mega, A3 High (8 GPU) o H4D
  • Per A4 o H4D: 150
  • Per A3 Ultra, A3 Mega o A3 High (8 GPU): 256
SUBBLOCK Compute Engine crea istanze di computing nello stesso sotto-blocco, riducendo al minimo la latenza di rete. A4, A3 Ultra e H4D 22

Prezzi

Non sono previsti costi aggiuntivi per la creazione, l'eliminazione o l'applicazione di policy del workload a un MIG.

Serie di macchine supportate

Puoi applicare le policy del workload solo ai MIG con istanze di computing che utilizzano le seguenti combinazioni di serie di macchine e modelli di provisioning:

Serie di macchine Avvio flessibile Spot Con prenotazione Standard
A4X Max No No No
A4X No No No
A4 No
A3 Ultra No
A3 Mega No No
A3 High (8 GPU) No No
H4D No
TPU7x
TPU v6e
TPU v5p

Limitazioni

Per le policy del workload nei MIG si applicano le seguenti limitazioni:

  • Puoi applicare una policy del workload a un MIG esistente o modificarne la policy del workload solo se nel MIG non sono presenti istanze di computing.

  • Puoi applicare le policy del workload ai MIG a livello di regione solo se i MIG utilizzano le seguenti forme di distribuzione target:

    • Per i MIG con una dimensione target: ANY o ANY_SINGLE_ZONE

    • Per le richieste di ridimensionamento del MIG: ANY_SINGLE_ZONE

  • Non puoi aggiornare una policy del workload dopo averla creata.

  • Non puoi configurare un secondo modello di istanza se il MIG utilizza una policy del workload.

  • Non puoi utilizzare le policy del workload insieme alle policy di posizionamento.

Passaggi successivi