Les GPU en cluster, tels que les séries de machines A4X Max, A4X, A4, A3 Ultra, A3 Mega et A3 High (8 GPU), sont conçus pour vous permettre d'exécuter des clusters d'intelligence artificielle (IA) et de machine learning (ML) à grande échelle. Ils offrent les fonctionnalités de gestion de cluster suivantes :
- Colocation d'une infrastructure de GPU en cluster
- Placement tenant compte de la topologie du cluster
- Mode de fonctionnement du cluster
- Planification et contrôles de la maintenance des clusters
- Outils de surveillance et de diagnostic des clusters
Séries de machines compatibles
Les fonctionnalités de gestion de cluster décrites sur cette page sont disponibles pour la série de machines GPU en cluster, qui est optimisée pour les charges de travail à grande échelle et multinœuds.
Ces fonctionnalités ne s'appliquent pas à la série de machines GPU à usage général, qui se compose de ressources de calcul indépendantes utilisant la mise en réseau VPC standard et ne prenant pas en charge les modes opérationnels de maintenance ni la colocation dense.
Le tableau suivant récapitule les séries de machines compatibles avec AI Hypercomputer :
| Catégorie | Série de machines | Compatible avec la gestion des clusters |
|---|---|---|
| GPU en cluster | A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High | Oui |
| GPU généraux | A3 Edge, A2, G2, G4, N1 | Non |
Pour en savoir plus sur chaque série de machines, consultez À propos des accélérateurs GPU.
La plupart des fonctionnalités de gestion des clusters ne sont compatibles qu'avec la capacité liée à une réservation, c'est-à-dire l'infrastructure qui utilise le modèle de provisionnement lié à une réservation, qui n'est compatible qu'avec les types de machines à GPU en cluster. Pour la capacité qui utilise un autre modèle de provisionnement, seules les fonctionnalités de gestion de cluster suivantes sont disponibles :
- Colocation des ressources d'infrastructure d'IA
- Placement tenant compte de la topologie du cluster
- Gérer les événements hôtes sur les instances
Colocation d'une infrastructure de GPU en cluster
Lorsque vous utilisez des GPU en cluster, tels que les GPU A4X Max, A4X, A4, A3 Ultra, A3 Mega et A3 High (8 GPU), vous pouvez demander des machines hôtes que Compute Engine provisionne le plus près possible les unes des autres. Ces machines offrent les fonctionnalités suivantes :
Compute Engine provisionne les machines sous forme de blocs de ressources.
Un maillage réseau de machine learning (ML) dynamique interconnecte les machines.
Cette organisation des ressources minimise les sauts de réseau et permet d'obtenir la latence réseau la plus faible possible. Pour déployer des blocs de machines optimisées pour les accélérateurs que Compute Engine alloue de manière dense, vous pouvez utiliser les options suivantes :
Les ressources doivent être allouées de manière dense les unes aux autres lorsque vous effectuez une ou plusieurs des opérations suivantes :
Créez des ressources qui utilisent la même réservation future dans AI Hypercomputer ou la même réservation future en mode Agenda.
Déployez un groupe d'instances géré (MIG) qui utilise des demandes de redimensionnement et créez les ressources dans la même requête.
Spécifiez que les ressources utilisent la même stratégie d'emplacement compact ou de charge de travail qui spécifie une valeur de distance maximale. Plus précisément, les ressources ne doivent être aussi proches que la valeur de distance maximale spécifiée dans la règle.
Les ressources peuvent éventuellement être allouées de manière dense les unes aux autres, en fonction de la disponibilité au mieux, lorsque vous effectuez une ou plusieurs des opérations suivantes :
Créez des ressources dans la même requête pour les VM à démarrage flexible.
Spécifiez que les ressources utilisent la même stratégie d'emplacement compact ou de charge de travail qui ne spécifie pas de distance maximale.
Placement tenant compte de la topologie du cluster
Une fois que vous avez créé des GPU en cluster, vous pouvez obtenir des informations sur la topologie au niveau des nœuds et des clusters. Ces informations vous aident à effectuer les opérations suivantes :
Ajustez la conception de votre application ou de votre charge de travail pour minimiser davantage la latence du réseau.
Comprendre et résoudre les problèmes de latence et de performances réseau pour les instances qui communiquent fréquemment entre elles. Ces problèmes peuvent se produire si les instances sont situées à une distance inattendue.
Plus précisément, la compatibilité avec les fonctionnalités de topologie est la suivante :
Les informations sur la topologie fonctionnent mieux avec la capacité liée à la réservation, qui est requise pour afficher la topologie d'une réservation.
Les fonctionnalités de topologie ne sont compatibles qu'avec les types de machines compatibles avec les stratégies d'emplacement compact.
Pour les VM Spot, les informations sur la topologie ne s'affichent que lorsqu'une machine utilise une stratégie d'emplacement compact.
Pour en savoir plus, consultez Afficher la topologie des instances de calcul.
Mode de fonctionnement du cluster
Lorsque vous réservez de la capacité pour créer des instances ou des clusters de calcul à l'aide de GPU en cluster, le type de machine que vous réservez détermine le mode opérationnel du cluster pour les instances. Ce mode spécifie le comportement de vos instances après des erreurs d'hôte ou des rapports d'hôte défectueux. Les modes opérationnels disponibles pour une instance sont les suivants : le mode géré, dans lequel Compute Engine remplace automatiquement toute machine défectueuse, mais retient une partie de votre capacité réservée pour s'assurer que vos instances disposent des ressources nécessaires pour redémarrer. Le mode pleine capacité, dans lequel vous avez accès à l'intégralité de votre capacité réservée, mais êtes responsable de la gestion des défaillances et de la maintenance planifiée.
Pour en savoir plus, consultez Mode opérationnel des réservations.
Programmation et contrôles de la maintenance des clusters
Vous contrôlez la maintenance des GPU en cluster à l'aide de la planification tenant compte de la topologie dans un bloc de ressources. Cette fonctionnalité permet de synchroniser les mises à niveau afin que vos charges de travail soient plus résilientes aux événements hôtes et de minimiser les perturbations. Cette approche permet d'améliorer le débit utile de votre charge de travail.
Pour faciliter le contrôle total des événements de maintenance, vous pouvez utiliser les fonctionnalités suivantes :
Type de planification de la maintenance
Lorsque vous réservez de la capacité pour créer des instances de calcul ou des clusters de GPU regroupés, vous pouvez définir la façon dont Compute Engine gère l'infrastructure sur laquelle vos instances s'exécutent. En fonction du type de machine que vous souhaitez utiliser pour vos instances, vous pouvez choisir entre une maintenance synchronisée sur les instances (groupée) ou des plannings de maintenance différents (indépendants).
Pour en savoir plus, consultez Types de planification de la maintenance.
Gérer les événements de l'hôte
Une fois que vous avez créé des GPU en cluster et démarré votre charge de travail, vous pouvez configurer des alertes et recevoir des notifications lorsque la maintenance de vos instances ou blocs réservés est planifiée, démarre ou se termine. Vous pouvez également afficher et, si nécessaire, démarrer manuellement la maintenance d'une instance ou d'un bloc réservé avant l'heure prévue. Ces options vous aident à contrôler et à minimiser de manière proactive les temps d'arrêt de vos charges de travail.
Pour en savoir plus, consultez les ressources suivantes :
Outils de surveillance et de diagnostic des clusters
Pour la surveillance et le dépannage, les GPU en cluster incluent les services suivants :
La prédiction de la dégradation de l'état de santé des VM, qui vous aide à identifier les VM susceptibles de se dégrader au cours des cinq prochaines heures.
Le signalement d'hôtes défectueux, que vous pouvez utiliser pour signaler des problèmes avec des machines hôtes individuelles.
Prise en charge des métriques Cloud Monitoring, qui vous aident à surveiller les performances des réseaux et des GPU.