AI Hypercomputer est un système de supercalcul intégré optimisé pour gérer vos charges de travail d'intelligence artificielle (IA) et de machine learning (ML). Il s'agit du portefeuille unifié de l'infrastructure d'IA de Google Cloud, qui fournit un point d'entrée unique pour explorer, configurer et déployer du matériel optimisé pour les performances, des logiciels ouverts et des modèles de consommation flexibles.
AI Hypercomputer intègre une conception au niveau du système et des bonnes pratiques pour améliorer l'efficacité tout au long du cycle de développement de l'IA, du prototypage et du développement à l'entraînement à grande échelle et à l'exécution en temps réel.
Architecture du système
AI Hypercomputer intègre verticalement ces trois composants pour maximiser le débit utile, qui mesure la productivité réelle du machine learning :
- Infrastructure optimisée pour les performances : fournit des accélérateurs (GPU NVIDIA
et Google Cloud TPU), des ressources de mise en réseau et de stockage.
- GPU : classés en fonction de la manière dont le système gère leurs événements de cycle de vie
et leur maintenance :
- GPU généraux : infrastructure gérée en tant qu'unités de calcul indépendantes avec une maintenance asynchrone.
- GPU en cluster : clusters hautes performances gérés en tant que système unique étroitement couplé avec une maintenance synchronisée.
- TPU : utilisent du matériel conçu pour effectuer des opérations matricielles volumineuses et disposent d'une mémoire à haut débit (HBM) intégrée pour les modèles et les tailles de lots plus importants. Les TPU peuvent être connectés dans des groupes appelés tranches qui vous permettent d'effectuer un scaling à la hausse de vos charges de travail avec peu ou pas de modifications de code. Pour en savoir plus sur l'infrastructure TPU, consultez la documentation Cloud TPU.
- GPU : classés en fonction de la manière dont le système gère leurs événements de cycle de vie
et leur maintenance :
- Logiciels ouverts : proposent des versions optimisées des frameworks de machine learning
(PyTorch, JAX et TensorFlow) et des plates-formes d'orchestration. Pour déployer et gérer vos accélérateurs, vous pouvez choisir parmi les options suivantes :
- Google Kubernetes Engine pour le scaling automatisé natif des conteneurs
- Slurm via Cluster Director
- Plans Cluster Toolkit
- Options de consommation : proposent des options de provisionnement flexibles en fonction des besoins de votre
charge de travail :
- VM à démarrage flexible, VM Spot et Réservations : offrent des options flexibles pour différentes charges de travail.
- Planificateur de charges de travail dynamique: fournit un provisionnement atomique pour des blocs entiers de nœuds interconnectés pour l'entraînement à grande échelle.
Avantages
- Hautes performances et débit utile : optimisez les couches de planification et d'exécution pour maximiser le débit utile, ce qui permet aux accélérateurs de consacrer plus de temps au calcul productif et moins de temps à la surcharge du système.
- Fiabilité intégrée : accédez à des fonctionnalités de fiabilité spécialisées :
- GPU en cluster : incluent la surveillance automatisée de l'état du matériel et le remplacement proactif des nœuds.
- GPU généraux : utilisent la réparation automatique standard Google Cloud des nœuds pour maintenir la disponibilité au niveau des pods pour les flottes de diffusion.
- Stockage optimisé : utilisez des services de stockage à haut débit, tels que Google Cloud Managed Lustre et Cloud Storage Rapid, pour éliminer les goulots d'étranglement des E/S.
Cas d'utilisation
AI Hypercomputer répond aux besoins des cas d'utilisation suivants :
| Cas d'utilisation | Exemples de charges de travail |
|---|---|
| Charges de travail d'IA et de ML à grande échelle |
|
| Inférence et diffusion de modèles |
|
| Prototypage et développement |
|
Étape suivante
- Découvrez l'infrastructure optimisée pour les performances d'AI Hypercomputer :
- Consultez les modèles de consommation.
- Découvrez la gestion des clusters.