Panoramica di AI Hypercomputer

AI Hypercomputer è un sistema di supercomputing integrato e ottimizzato per supportare i workload di intelligenza artificiale (AI) e machine learning (ML). È il portfolio unificato per Google Cloudl'infrastruttura AI di e fornisce un unico punto di accesso per esplorare, configurare ed eseguire il deployment di hardware ottimizzato per le prestazioni, software open e modelli di consumo flessibili.

AI Hypercomputer incorpora la progettazione a livello di sistema e le best practice per aumentare l'efficienza durante l'intero ciclo di vita dello sviluppo dell'AI, dalla prototipazione e dallo sviluppo all'addestramento su larga scala e all'erogazione in tempo reale.

Architettura di sistema

AI Hypercomputer integra verticalmente questi tre componenti per massimizzare il goodput, la misura della produttività effettiva del machine learning:

  • Infrastruttura ottimizzata per le prestazioni: fornisce acceleratori (GPU NVIDIA e Google Cloud TPU), risorse di rete e di archiviazione.
    • GPU: classificate in base alla modalità di gestione degli eventi del ciclo di vita e della manutenzione da parte del sistema:
      • GPU generali: infrastruttura gestita come unità di calcolo indipendenti con manutenzione asincrona.
      • GPU in cluster: cluster ad alte prestazioni gestiti come un unico sistema strettamente accoppiato con manutenzione sincronizzata.
    • TPU: utilizza hardware progettato per eseguire operazioni su matrici di grandi dimensioni e dispone di memoria a banda larga (HBM) su chip per modelli e dimensioni batch più grandi. Le TPU possono essere collegate in gruppi chiamati slice che fanno lo scale up dei workload con modifiche minime o nulle al codice. Per informazioni sull'infrastruttura TPU, consulta la documentazione di Cloud TPU.
  • Software open: offre versioni ottimizzate di framework di machine learning (PyTorch, JAX e TensorFlow) e piattaforme di orchestrazione. Per eseguire il deployment e gestire gli acceleratori, puoi scegliere tra le seguenti opzioni:
    • Google Kubernetes Engine per la scalabilità automatica nativa dei container
    • Slurm tramite Cluster Director
    • Progetti base di Cluster Toolkit
  • Opzioni di consumo: offre opzioni di provisioning flessibili in base alle esigenze del workload:

Vantaggi

  • Prestazioni elevate e goodput: ottimizza i livelli di pianificazione e runtime per massimizzare il goodput, aiutando gli acceleratori a dedicare più tempo al calcolo produttivo e meno tempo all'overhead di sistema.
  • Affidabilità integrata: accedi a funzionalità di affidabilità specializzate:
    • GPU in cluster: include il monitoraggio automatico dell'integrità dell'hardware e la sostituzione proattiva dei nodi.
    • GPU generali: utilizza la riparazione automatica standard Google Cloud dei nodi per mantenere l'uptime a livello di pod per le flotte di erogazione.
  • Archiviazione ottimizzata: utilizza servizi di archiviazione ad alta velocità effettiva, come Google Cloud Managed Lustre e Cloud Storage Rapid, per eliminare i colli di bottiglia di I/O.

Casi d'uso

AI Hypercomputer soddisfa le esigenze di questi casi d'uso:

Caso d'uso Workload di esempio
Workload di AI e ML su larga scala
  • Addestramento distribuito per l'AI generativa
  • Inferenza per l'AI generativa
  • Rilevamento di frodi
  • Modelli per i suggerimenti
Inferenza ed erogazione del modello
  • Rilevamento di frodi in tempo reale
  • Motori per suggerimenti per i risultati in tempo reale
Prototipazione e sviluppo
  • Esperimenti su piccola scala
  • Sviluppo in fase iniziale

Passaggi successivi