Scegliere l'infrastruttura dell'acceleratore

Utilizza questo documento per identificare l'infrastruttura di accelerazione ottimale per i workload di intelligenza artificiale (AI) e machine learning (ML) in base alla fase del ciclo di vita, ad esempio prototipazione su piccola scala, inferenza in tempo reale e addestramento distribuito su larga scala. AI Hypercomputer organizza le offerte di accelerazione in due categorie: GPU generiche e GPU in cluster.

Infrastruttura GPU

AI Hypercomputer offre due categorie distinte di GPU. Ogni categoria ha un modello di gestione distinto che determina il modo in cui il sistema gestisce gli eventi del ciclo di vita, gestisce la manutenzione e ottimizza il networking per il tuo workload:

Modello di gestione delle GPU generiche

Il modello di gestione delle GPU generiche è progettato per i workload che danno la priorità all'indipendenza delle risorse e all'alta affidabilità. Questo modello utilizza il piano di gestione standard Google Cloud , fornendo un'esperienza familiare per i team che utilizzano già Compute Engine o GKE.

  • Manutenzione: asincrona. Le singole istanze vengono aggiornate in modo indipendente. In un parco risorse di pubblicazione multi-nodo, un evento di manutenzione su un nodo non influisce sulla disponibilità degli altri, consentendo di reindirizzare il traffico ai nodi integri senza bloccare l'intero job.

  • Casi d'uso principali: consigliato per attività mainstream come inferenza in tempo reale, pubblicazione di modelli, prototipazione su piccola scala e ambienti di sviluppo in cui non è richiesta la scala di supercomputing.

Serie di macchine GPU generiche

Le seguenti serie di macchine sono GPU generiche:

  • A3 High con 1, 2 o 4 GPU
  • A3 Edge
  • A2
  • G4
  • G2
  • NT1+T4
  • N1+V100

Per informazioni tecniche su ciascuna delle macchine GPU generiche, vedi Tipi di macchine GPU.

Modello di gestione delle GPU in cluster

Il modello di gestione delle GPU in cluster è un ambiente di classe supercomputing progettato per l'addestramento distribuito su larga scala. Le risorse vengono gestite come un unico sistema strettamente accoppiato utilizzando uno stack di GPU in cluster.

  • Manutenzione: coordinata. Questo modello coordina gli eventi di manutenzione per supportare i workload strettamente accoppiati. Per l'addestramento distribuito, puoi utilizzare la manutenzione sincronizzata, in cui gli aggiornamenti vengono applicati contemporaneamente a tutti i nodi. Questo approccio impedisce il riavvio dei nodi che bloccano i job e massimizza il goodput. Questo modello offre anche notifiche di manutenzione di 90 giorni.

  • Casi d'uso principali: progettato per l'addestramento di modelli di base exascale con trilioni di parametri o per l'esecuzione di simulazioni complesse di computing ad alte prestazioni (HPC), come la scoperta di farmaci e il ripiegamento delle proteine.

Serie di macchine GPU in cluster

Le seguenti serie di macchine sono GPU in cluster:

  • A4X Max
  • A4X
  • A4
  • A3 Ultra
  • A3 Mega
  • A3 High con 8 GPU

Per informazioni tecniche su ciascuna delle macchine GPU in cluster, vedi Tipi di macchine GPU.

Matrice delle funzionalità

Confronta le caratteristiche tecniche e operative dei modelli di gestione delle GPU generiche e delle GPU in cluster:

Caratteristica Modello di gestione delle GPU generiche Modello di gestione delle GPU in cluster
Casi d'uso principali Inferenza, pubblicazione di modelli, prototipazione e sviluppo Addestramento distribuito su larga scala e HPC
Manutenzione Asincrona: gli aggiornamenti dei nodi indipendenti consentono di reindirizzare il traffico senza bloccare i job Coordinata: supporta gli aggiornamenti coordinati (sincronizzati) a livello di cluster per mantenere sincronizzati i nodi e massimizzare il goodput
Hardware di destinazione A3 High (1, 2 o 4 GPU), A3 Edge, G4, G2, A2, N1+T4 e N1+V100 A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPU)
Networking Networking VPC standard tramite interfacce gVNIC (ad eccezione di A3 Edge, che utilizza GPUDirect-TCPX su più VPC) Fabric specializzati a bassa latenza (RDMA, RoCE, TCPX o NVIDIA NVLink)
Stack di gestione Piano standard Google Cloud (Compute Engine o GKE) Stack di gestione specializzato (ad esempio, Cluster Director)
Affidabilità Riparazione automatica dei nodi standard e uptime a livello di pod Suite specializzata per risorse e ripristino

Matrice decisionale

Utilizza questa matrice per identificare le famiglie di hardware che si allineano all'intento specifico del tuo workload:

Se il tuo workload prevede... Infrastruttura GPU consigliata Serie di macchine consigliata
Prototipazione e sviluppo GPU generiche A3 High (1, 2 o 4 GPU), A3 Edge, A2, G4, G2, N1+T4, N1+V100
Inferenza in tempo reale (< 100 miliardi di parametri) GPU generiche A3 High (1, 2 o 4 GPU), A3 Edge, A2, G4, G2, N1+T4, N1+V100
Inferenza su più GPU GPU in cluster A4, A3 Ultra, A3 Mega, A3 High (8 GPU)
Addestramento e inferenza su larga scala GPU in cluster A4, A3 Ultra, A3 Mega, A3 High (8 GPU)
Addestramento su larga scala (> 500 miliardi di parametri) e inferenza disaggregata GPU in cluster A4X Max, A4X, A4

Per un albero decisionale dettagliato che mappa le architetture dei modelli direttamente all'hardware, vedi Scegliere un acceleratore.

Dopo aver stabilito questi criteri principali, scegli una piattaforma di orchestrazione. Questa scelta dipende dalla preferenza del tuo team per la gestione automatizzata o il controllo granulare del sistema operativo e dei driver.

Passaggi successivi