Les GPU en cluster sont optimisés pour les charges de travail d'intelligence artificielle (IA) et de machine learning (ML) qui privilégient l'entraînement distribué à grande échelle, l'inférence multi-hôte et les tâches complexes de calcul hautes performances (HPC).
Les GPU en cluster permettent aux équipes de déployer et de faire évoluer des milliers d'accélérateurs interconnectés en tant que système unique et étroitement couplé à l'aide de fabrics réseau spécialisés et d'une maintenance synchronisée. Ils sont idéaux pour les charges de travail qui nécessitent une synchronisation extrême du calcul, de la mémoire et du réseau à haut débit. Les cas d'utilisation courants incluent le pré-entraînement de modèles de fondation avec des milliers de milliards de paramètres, la mise en service de modèles de pointe et les simulations pour la découverte de médicaments.
Caractéristiques clés des GPU en cluster
- Maintenance synchronisée: Google Cloud met à jour tous les nœuds du cluster simultanément, ce qui empêche le redémarrage d'un seul nœud de bloquer une tâche.
- Surveillance automatisée de l'état : le système identifie de manière proactive les nœuds en retard et surveille les défaillances matérielles ou la corruption silencieuse des données.
- Remplacement proactif des nœuds : le système évince et replanifie les VM sous-performantes sur des machines saines à partir d'un pool de secours.
- Topologie alignée sur rails : une topologie alignée sur rails isole le trafic GPU à GPU de la communication hôte standard pour garantir des performances sans gigue pour la coordination massive de plusieurs nœuds.
- Protocoles avancés : ces séries de machines sont compatibles avec les interconnexions à bande passante élevée , y compris GPUDirect RDMA (basé sur RoCE).
Familles de GPU en cluster et spécifications techniques
Consultez les charges de travail et les spécifications matérielles des séries de machines GPU en cluster premium dans ces tableaux. Pour l'entraînement exaflopique, utilisez les séries A4X ou A3 Ultra.
Séries A4X Max et A4X
Si vous entraînez des modèles de fondation exaflopiques massifs ou exécutez des simulations de calcul hautes performances (HPC) bare metal très complexes, utilisez les séries de machines A4X Max ou A4X. Ces séries sont équipées de superchips NVIDIA GB300 Grace Blackwell Ultra pour gérer les demandes extrêmes en termes de calcul et de mémoire.
A4X Max (bare metal)
Les types de machines A4X Max
utilisent des superchips NVIDIA GB300 Grace Blackwell Ultra (nvidia-gb300) et
sont idéaux pour l'entraînement et la mise en service de modèles de fondation. Les types de machines A4X Max sont disponibles
en tant qu'instances bare metal.
A4X Max est une plate-forme exaflopique basée sur NVIDIA GB300 NVL72. Chaque machine dispose de deux sockets avec des processeurs NVIDIA Grace dotés de cœurs Arm Neoverse V2. Ces processeurs sont connectés à quatre GPU NVIDIA B300 Blackwell avec une communication puce à puce (NVLink-C2C) rapide.
| Superchips NVIDIA GB300 Grace Blackwell Ultra associés | |||||||
|---|---|---|---|---|---|---|---|
| Type de machine | Nombre de vCPU1 | Mémoire de l'instance (Go) | SSD local associé (Gio) | Nombre de cartes d'interface réseau physiques | Bande passante réseau maximale (Gbit/s)2 | Nombre de GPU | Mémoire GPU3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12 000 | 6 | 3 600 | 4 | 1 116 |
1 Un vCPU est mis en œuvre sous la forme d'une technologie hyper-threading matérielle unique sur l'une des
plates-formes de processeur disponibles.
2 La bande passante de sortie maximale ne peut pas dépasser le nombre donné. La bande passante de sortie réelle dépend de l'adresse IP de destination et d'autres facteurs.
Pour en savoir plus sur la bande passante réseau, consultez Bande passante réseau.
3 La mémoire de GPU est la mémoire disponible sur un GPU pouvant être utilisée pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail exigeantes en ressources graphiques.
A4X
Les types de machines A4X
utilisent des superchips NVIDIA GB200 Grace Blackwell (nvidia-gb200) et
sont idéaux pour l'entraînement et la mise en service de modèles de fondation.
A4X est une plate-forme exaflopique basée sur NVIDIA GB200 NVL72. Chaque machine dispose de deux sockets avec des processeurs NVIDIA Grace dotés de cœurs Arm Neoverse V2. Ces processeurs sont connectés à quatre GPU NVIDIA B200 Blackwell avec une communication puce à puce (NVLink-C2C) rapide.
| Superchips NVIDIA GB200 Grace Blackwell associés | |||||||
|---|---|---|---|---|---|---|---|
| Type de machine | Nombre de vCPU1 | Mémoire de l'instance (Go) | SSD local associé (Gio) | Nombre de cartes d'interface réseau physiques | Bande passante réseau maximale (Gbit/s)2 | Nombre de GPU | Mémoire de GPU3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12 000 | 6 | 2 000 | 4 | 744 |
1 Un vCPU est mis en œuvre sous la forme d'une technologie hyper-threading matérielle unique sur l'une des
plates-formes de processeur disponibles.
2 La bande passante de sortie maximale ne peut pas dépasser le nombre donné. La bande passante de sortie réelle dépend de l'adresse IP de destination et d'autres facteurs.
Pour en savoir plus sur la bande passante réseau, consultez Bande passante réseau.
3 La mémoire de GPU est la mémoire disponible sur un GPU pouvant être utilisée pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail exigeantes en ressources graphiques.
Série A4
Si votre objectif est d'entraîner des modèles de fondation de pointe nécessitant une mise à l'échelle massive du traitement parallèle, utilisez la série de machines A4 pour optimiser le temps de traitement et maximiser le débit matériel.
Les types de machines A4
sont associés à des
GPU NVIDIA B200 Blackwell
(nvidia-b200). Ils sont idéaux pour l'entraînement et la mise en service de modèles de fondation
.
| GPU NVIDIA B200 Blackwell associés | |||||||
|---|---|---|---|---|---|---|---|
| Type de machine | Nombre de vCPU1 | Mémoire de l'instance (Go) | SSD local associé (Gio) | Nombre de cartes d'interface réseau physiques | Bande passante réseau maximale (Gbit/s)2 | Nombre de GPU | Mémoire de GPU3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3 968 | 12 000 | 10 | 3 600 | 8 | 1 440 |
1 Un vCPU est mis en œuvre sous la forme d'une technologie hyper-threading matérielle unique sur l'une des plates-formes de processeur disponibles.
2 La bande passante de sortie maximale ne peut pas dépasser le nombre donné. La bande passante de sortie réelle dépend de l'adresse IP de destination et d'autres facteurs.
Pour en savoir plus sur la bande passante réseau, consultez Bande passante réseau.
3 La mémoire de GPU est la mémoire disponible sur un GPU pouvant être utilisée pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail exigeantes en ressources graphiques.
Série A3 (Ultra, Mega et High avec 8 GPU)
Si vous devez exécuter des entraînements distribués à grande échelle ou mettre en service des modèles de pointe sur plusieurs hôtes avec de grandes tables d'ensembles de données, utilisez la série de machines A3 pour minimiser la latence réseau entre les hôtes.
A3 Ultra
| GPU NVIDIA H200 associés | |||||||
|---|---|---|---|---|---|---|---|
| Type de machine | Nombre de vCPU1 | Mémoire de l'instance (Go) | SSD local associé (Gio) | Nombre de cartes d'interface réseau physiques | Bande passante réseau maximale (Gbit/s)2 | Nombre de GPU | Mémoire de GPU3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2 952 | 12 000 | 10 | 3 600 | 8 | 1128 |
A3 Mega
| GPU NVIDIA H100 associés | |||||||
|---|---|---|---|---|---|---|---|
| Type de machine | Nombre de vCPU1 | Mémoire de l'instance (Go) | SSD local associé (Gio) | Nombre de cartes d'interface réseau physiques | Bande passante réseau maximale (Gbit/s)2 | Nombre de GPU | Mémoire GPU3 (GB HBM3) |
a3-megagpu-8g |
208 | 1 872 | 6 000 | 9 | 1 800 | 8 | 640 |
A3 High
| GPU NVIDIA H100 associés | |||||||
|---|---|---|---|---|---|---|---|
| Type de machine | Nombre de vCPU1 | Mémoire de l'instance (Go) | SSD local associé (Gio) | Nombre de cartes d'interface réseau physiques | Bande passante réseau maximale (Gbit/s)2 | Nombre de GPU | Mémoire GPU3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1 500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3 000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1 872 | 6 000 | 5 | 1 000 | 8 | 640 |
1 Un vCPU est mis en œuvre sous la forme d'une technologie hyper-threading matérielle unique sur l'une des plates-formes de processeur disponibles.
2 La bande passante de sortie maximale ne peut pas dépasser le nombre donné. La bande passante de sortie réelle dépend de l'adresse IP de destination et d'autres facteurs.
Pour en savoir plus sur la bande passante réseau, consultez Bande passante réseau.
3 La mémoire de GPU est la mémoire disponible sur un GPU pouvant être utilisée pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail exigeantes en ressources graphiques.
Acquisition de capacité
L'acquisition de capacité de calcul pour les GPU en cluster nécessite une coordination pour gérer l'offre et la demande d'accélérateurs hautes performances. Étant donné que ces ressources sont physiquement situées dans des fabrics réseau spécialisés, vous devez les demander via des workflows gérés.
Vous pouvez réserver de la capacité auprès de votre équipe de compte ou utiliser des réservations futures et le programmeur de charge de travail dynamique.
Étape suivante
- Pour savoir comment acquérir de la capacité, consultez la section Options de consommation.
- Pour évaluer les exigences de votre infrastructure, consultez la section Choisir une infrastructure.
- Pour planifier votre topologie réseau, consultez la section Exigences réseau des GPU pour les environnements en cluster.
- Pour réserver des ressources de calcul, consultez la section Réserver de la capacité.