Funzionalità di gestione dei cluster

Le serie di macchine con GPU in cluster, come A4X Max, A4X, A4, A3 Ultra, A3 Mega, e A3 High (8 GPU), sono progettate per consentirti di eseguire cluster di intelligenza artificiale (AI) e machine learning (ML) su larga scala e forniscono le seguenti funzionalità di gestione dei cluster:

Serie di macchine supportate

Le funzionalità di gestione dei cluster descritte in questa pagina sono disponibili per le serie di macchine con GPU in cluster, che sono ottimizzate per workload su larga scala e multi-nodo.

Queste funzionalità non si applicano alle serie di macchine con GPU generiche, che sono costituite da risorse di calcolo indipendenti che utilizzano la rete VPC standard e non supportano le modalità operative di manutenzione o la collocazione densa.

La seguente tabella riassume le serie di macchine supportate in AI Hypercomputer:

Categoria Serie di macchine Supporta la gestione dei cluster
GPU in cluster A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High
GPU generiche A3 Edge, A2, G2, G4, N1 No

Per saperne di più su ogni serie di macchine, consulta Informazioni sugli acceleratori GPU.

La maggior parte delle funzionalità di gestione dei cluster è supportata solo per la capacità vincolata alla prenotazione, ovvero l'infrastruttura che utilizza il modello di provisioning vincolato alla prenotazione, che supporta solo i tipi di macchine con GPU in cluster. Per la capacità che utilizza qualsiasi altro modello di provisioning, sono disponibili solo le seguenti funzionalità di gestione dei cluster:

Collocazione dell'infrastruttura GPU in cluster

Quando utilizzi GPU in cluster, come A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPU), puoi richiedere macchine host di cui Compute Engine esegue il provisioning il più vicino possibile. Queste macchine offrono le seguenti funzionalità:

  • Compute Engine esegue il provisioning delle macchine come blocchi di risorse.

  • Una rete di interconnessione dinamica di machine learning (ML) interconnette le macchine.

Questa disposizione delle risorse riduce al minimo gli hop di rete e ottimizza la latenza di rete più bassa. Per eseguire il deployment di blocchi di macchine ottimizzate per l'acceleratore di cui Compute Engine esegue l'allocazione densa, puoi utilizzare le seguenti opzioni:

Posizionamento in base alla topologia del cluster

Dopo aver creato le GPU in cluster, puoi ottenere informazioni sulla topologia a livello di nodo e cluster. Queste informazioni ti aiutano a:

  • Modificare la progettazione dell'applicazione o del workload per ridurre ulteriormente la latenza di rete.

  • Comprendere e risolvere i problemi di latenza e prestazioni di rete per le istanze che comunicano frequentemente tra loro. Questi problemi possono verificarsi se le istanze si trovano inaspettatamente molto distanti tra loro.

In particolare, il supporto per le funzionalità di topologia è il seguente:

Per saperne di più, consulta Visualizzare la topologia delle istanze di computing.

Modalità operativa dei cluster

Quando prenoti la capacità per creare istanze di computing o cluster utilizzando GPU in cluster, il tipo di macchina che prenoti determina la modalità operativa del cluster per le istanze. Questa modalità specifica il comportamento delle istanze dopo errori dell'host o report di host difettosi. Le modalità operative disponibili per un'istanza sono modalità gestita, in cui Compute Engine sostituisce automaticamente le macchine difettose, ma trattiene una parte della capacità riservata per fornire alle istanze le risorse necessarie per il riavvio. In alternativa, puoi utilizzare la modalità a capacità totale, in cui hai accesso alla capacità riservata completa, ma sei responsabile della gestione di guasti e manutenzione pianificata.

Per saperne di più, consulta Modalità operativa della prenotazione.

Pianificazione e controlli della manutenzione dei cluster

Puoi controllare la manutenzione delle GPU in cluster utilizzando la pianificazione in base alla topologia in un blocco di risorse. Questa funzionalità consente di sincronizzare gli upgrade in modo che i workload siano più resilienti agli eventi sull'host e di ridurre al minimo le interruzioni. Questo approccio contribuisce a migliorare il goodput del workload.

Per facilitare il controllo completo degli eventi di manutenzione, puoi utilizzare le seguenti funzionalità:

Tipo di pianificazione della manutenzione

Quando prenoti la capacità per creare istanze di computing o cluster di GPU in cluster, puoi definire in che modo Compute Engine gestisce l'infrastruttura su cui vengono eseguite le istanze. In base al tipo di macchina che vuoi utilizzare per le istanze, puoi scegliere tra la manutenzione sincronizzata tra le istanze (raggruppata) o pianificazioni di manutenzione diverse (indipendenti).

Per saperne di più, consulta Tipi di pianificazione della manutenzione.

Gestisci gli eventi sull'host

Dopo aver creato le GPU in cluster e avviato il workload, puoi configurare gli avvisi e ricevere notifiche quando la manutenzione delle istanze o dei blocchi riservati è pianificata, inizia o viene completata. Puoi anche visualizzare e, se necessario, avviare manualmente la manutenzione di un'istanza o di un blocco riservato prima dell'orario pianificato. Queste opzioni ti aiutano a controllare in modo proattivo e a ridurre al minimo i tempi di inattività dei workload.

Per saperne di più, consulta le seguenti risorse:

Strumenti di monitoraggio e diagnostica dei cluster

Per il monitoraggio e la risoluzione dei problemi, le GPU in cluster includono i seguenti servizi:

Passaggi successivi