Utilizza questo documento per identificare l'infrastruttura di accelerazione ottimale per i workload di intelligenza artificiale (AI) e machine learning (ML) in base alla fase del ciclo di vita, ad esempio prototipazione su piccola scala, inferenza in tempo reale e addestramento distribuito su larga scala. AI Hypercomputer organizza le offerte di acceleratori in due categorie: GPU generali e GPU in cluster.
Infrastruttura GPU
AI Hypercomputer offre due categorie distinte di GPU. Ogni categoria ha un modello di gestione distinto che determina il modo in cui il sistema gestisce gli eventi del ciclo di vita, gestisce la manutenzione e ottimizza il networking per il tuo workload:
Modello di gestione delle GPU generali
Il modello di gestione delle GPU generali è progettato per i workload che danno la priorità all'indipendenza delle risorse e all'alta affidabilità. Questo modello utilizza il piano di gestione standard Google Cloud , fornendo un'esperienza familiare ai team che utilizzano già Compute Engine o GKE.
Manutenzione: asincrona. Le singole istanze vengono aggiornate in modo indipendente. In un parco risorse di pubblicazione multi-nodo, un evento di manutenzione su un nodo non influisce sulla disponibilità degli altri, consentendo di reindirizzare il traffico ai nodi integri senza bloccare l'intero job.
Casi d'uso principali: consigliato per attività mainstream come inferenza in tempo reale, erogazione del modello, prototipazione su piccola scala e ambienti di sviluppo in cui non è richiesta la scala di supercomputing.
Serie di macchine GPU generali
Le seguenti serie di macchine sono GPU generali:
- G2 (L4)
- G4 (RTX PRO 6000)
- A2 (A100)
- NT1+T4
- A3 Edge
- A3 High (1, 2 o 4 GPU)
Per informazioni tecniche su ciascuna delle macchine GPU generali, vedi Tipi di macchine GPU.
Modello di gestione delle GPU in cluster
Il modello di gestione delle GPU in cluster è un ambiente di classe supercomputing progettato per l'addestramento distribuito su larga scala. Le risorse vengono gestite come un unico sistema strettamente accoppiato utilizzando uno stack di GPU in cluster.
Manutenzione: coordinata. Questo modello coordina gli eventi di manutenzione per supportare i workload strettamente accoppiati. Per l'addestramento distribuito, puoi utilizzare la manutenzione sincronizzata, in cui gli aggiornamenti vengono applicati contemporaneamente a tutti i nodi. Questo approccio impedisce il riavvio dei nodi che bloccano i job e massimizza il goodput. Questo modello offre anche notifiche di manutenzione di 90 giorni.
Casi d'uso principali: progettato per l'addestramento di modelli di base exascale con trilioni di parametri o per l'esecuzione di simulazioni complesse di computing ad alte prestazioni (HPC), come la scoperta di farmaci e il ripiegamento delle proteine.
Serie di macchine GPU in cluster
Le seguenti serie di macchine sono GPU in cluster:
- A4X
- A4 (Blackwell)
- A3 Ultra
- A3 Mega
- A3 High (8 GPU)
Per informazioni tecniche su ciascuna delle macchine GPU in cluster, vedi Tipi di macchine GPU.
Matrice delle funzionalità
Confronta le caratteristiche tecniche e operative dei modelli di gestione delle GPU generali e delle GPU in cluster:
| Caratteristica | Modello di gestione delle GPU generali | Modello di gestione delle GPU in cluster |
|---|---|---|
| Casi d'uso principali | Inferenza, erogazione del modello, prototipazione e sviluppo | Addestramento distribuito su larga scala e HPC |
| Manutenzione | Asincrona: gli aggiornamenti dei nodi indipendenti consentono di reindirizzare il traffico senza bloccare i job | Coordinata: supporta gli aggiornamenti coordinati (sincronizzati) a livello di cluster per mantenere sincronizzati i nodi e massimizzare il goodput |
| Hardware di destinazione | G2 (L4), G4 (RTX PRO 6000), A2 (A100), NT1+T4, A3 Edge e A3 High (1, 2 o 4 GPU) | A4X, A4 (Blackwell), A3 Ultra, A3 Mega e A3 High (8 GPU) |
| Networking | Networking VPC standard tramite interfacce gVNIC (ad eccezione di A3 Edge, che utilizza GPUDirect-TCPX su più VPC) | Strutture specializzate a bassa latenza (RDMA, RoCE, TCPX o NVIDIA NVLink) |
| Stack di gestione | Piano standard Google Cloud (Compute Engine o GKE) | Stack di gestione specializzato (ad esempio, Cluster Director) |
| Affidabilità | Riparazione automatica dei nodi standard e uptime a livello di pod | Suite specializzata per risorse e ripristino |
Matrice decisionale
Utilizza questa matrice per identificare le famiglie di hardware che si allineano all'intento specifico del tuo workload:
| Se il tuo workload prevede... | Infrastruttura GPU consigliata | Serie di macchine consigliata |
|---|---|---|
| Prototipazione e sviluppo | GPU generali | G2, G4, A2, NT1+T4, A3 Edge |
| Inferenza in tempo reale (< 100 miliardi di parametri) | GPU generali | G2, G4, A2, NT1+T4, A3 Edge |
| Inferenza su più GPU | GPU in cluster | A3, A4 |
| Addestramento e inferenza su larga scala | GPU in cluster | A4, A3 |
| Addestramento su larga scala (> 500 miliardi di parametri) e inferenza disaggregata | GPU in cluster | A4X Max, A4X, A4 |
Per un albero decisionale dettagliato che mappa le architetture dei modelli direttamente all'hardware, vedi Scegliere un acceleratore.
Dopo aver stabilito questi criteri principali, scegli una piattaforma di orchestrazione. Questa scelta dipende dalla preferenza del tuo team per la gestione automatizzata o il controllo granulare del sistema operativo e dei driver.
Passaggi successivi
- Per selezionare un orchestratore e un'opzione di deployment, vedi Scegliere un orchestratore e un'opzione di deployment.
- Per eseguire il deployment dei workload di inferenza o eseguire l'addestramento su larga scala, vedi Tutorial di AI Hypercomputer.
- Per ottimizzare l'efficienza del sistema, vedi Ricette di ottimizzazione del goodput.