AI Hypercomputer è un sistema di supercomputing integrato e ottimizzato per supportare i workload di intelligenza artificiale (AI) e machine learning (ML). È il portfolio unificato per Google Cloudl'infrastruttura AI di e fornisce un unico punto di accesso per esplorare, configurare ed eseguire il deployment di hardware ottimizzato per le prestazioni, software open e modelli di consumo flessibili.
AI Hypercomputer incorpora la progettazione a livello di sistema e le best practice per aumentare l'efficienza durante l'intero ciclo di vita dello sviluppo dell'AI, dalla prototipazione e dallo sviluppo all'addestramento su larga scala e all'erogazione in tempo reale.
Architettura di sistema
AI Hypercomputer integra verticalmente questi tre componenti per massimizzare il goodput, la misura della produttività effettiva del machine learning:
- Infrastruttura ottimizzata per le prestazioni: fornisce acceleratori (GPU NVIDIA
e Google Cloud TPU), risorse di rete e di archiviazione.
- GPU: classificate in base alla modalità di gestione degli eventi del ciclo di vita
e della manutenzione da parte del sistema:
- GPU generali: infrastruttura gestita come unità di calcolo indipendenti con manutenzione asincrona.
- GPU in cluster: cluster ad alte prestazioni gestiti come un unico sistema strettamente accoppiato con manutenzione sincronizzata.
- TPU: utilizza hardware progettato per eseguire operazioni su matrici di grandi dimensioni e dispone di memoria a banda larga (HBM) su chip per modelli e dimensioni batch più grandi. Le TPU possono essere collegate in gruppi chiamati slice che fanno lo scale up dei workload con modifiche minime o nulle al codice. Per informazioni sull'infrastruttura TPU, consulta la documentazione di Cloud TPU.
- GPU: classificate in base alla modalità di gestione degli eventi del ciclo di vita
e della manutenzione da parte del sistema:
- Software open: offre versioni ottimizzate di framework di machine learning
(PyTorch, JAX e TensorFlow) e piattaforme di orchestrazione. Per eseguire il deployment e gestire gli acceleratori, puoi scegliere tra le seguenti opzioni:
- Google Kubernetes Engine per la scalabilità automatica nativa dei container
- Slurm tramite Cluster Director
- Progetti base di Cluster Toolkit
- Opzioni di consumo: offre opzioni di provisioning flessibili in base alle esigenze del
workload:
- VM con avvio flessibile, VM spot e prenotazioni: forniscono opzioni flessibili per diversi workload.
- Dynamic Workload Scheduler: fornisce il provisioning atomico per interi blocchi di nodi interconnessi per l'addestramento su larga scala.
Vantaggi
- Prestazioni elevate e goodput: ottimizza i livelli di pianificazione e runtime per massimizzare il goodput, aiutando gli acceleratori a dedicare più tempo al calcolo produttivo e meno tempo all'overhead di sistema.
- Affidabilità integrata: accedi a funzionalità di affidabilità specializzate:
- GPU in cluster: include il monitoraggio automatico dell'integrità dell'hardware e la sostituzione proattiva dei nodi.
- GPU generali: utilizza la riparazione automatica standard Google Cloud dei nodi per mantenere l'uptime a livello di pod per le flotte di erogazione.
- Archiviazione ottimizzata: utilizza servizi di archiviazione ad alta velocità effettiva, come Google Cloud Managed Lustre e Cloud Storage Rapid, per eliminare i colli di bottiglia di I/O.
Casi d'uso
AI Hypercomputer soddisfa le esigenze di questi casi d'uso:
| Caso d'uso | Workload di esempio |
|---|---|
| Workload di AI e ML su larga scala |
|
| Inferenza ed erogazione del modello |
|
| Prototipazione e sviluppo |
|
Passaggi successivi
- Scopri di più sull'infrastruttura ottimizzata per le prestazioni di AI Hypercomputer:
- Esamina i modelli di consumo.
- Scopri di più sulla gestione dei cluster.