Présentation générale des GPU

Les GPU à usage général sont optimisés pour les charges de travail d'intelligence artificielle (IA) et de machine learning (ML) qui privilégient la flexibilité opérationnelle, l'indépendance des ressources et la rentabilité.

Les GPU généraux permettent aux équipes de déployer et de mettre à l'échelle les accélérateurs NVIDIA en toute autonomie opérationnelle, en contournant la complexité architecturale des clusters de supercalcul coordonnés. Elles sont idéales pour les charges de travail qui privilégient la haute disponibilité, le provisionnement en libre-service et le scaling indépendant. Les cas d'utilisation courants incluent l'inférence en temps réel, le RAG, le prototypage et l'entraînement de modèles de petite à moyenne taille.

Principales caractéristiques des GPU généraux

  • Flexibilité opérationnelle : vous pouvez gérer les ressources à l'aide des interfaces standards GKE (Autopilot et Standard) et Compute Engine pour simplifier le déploiement et le scaling.
  • Haute disponibilité : Google Cloud met à jour les instances individuelles de manière indépendante pour s'assurer que les mises à jour sur un nœud n'ont pas d'incidence sur la disponibilité des autres, ce qui permet à votre équilibreur de charge de rediriger le trafic sans bloquer les parcs de diffusion.
  • Simplicité du réseau : vos charges de travail utilisent des services de cloud privé virtuel (VPC) standards et le protocole TCP/IP standard sur les interfaces Google Virtual NIC (gVNIC) pour éliminer les fabrics complexes au niveau matériel.
  • Optimisation des coûts : vous pouvez utiliser des VM Spot pour la recherche tolérante aux pannes afin de réaliser jusqu'à 90% d'économies par rapport aux tarifs standards à la demande.
  • Acquisition en libre-service : vous pouvez obtenir de la capacité directement via des réservations standards et des demandes à la demande, sans avoir besoin de workflows gérés par l'équipe chargée du compte.

Familles de GPU générales et spécifications techniques

Consultez les charges de travail et les spécifications matérielles de la série de machines GPU à usage général. Pour un service à haut débit, utilisez la gamme A3 Edge.

Série A3 (High avec 1, 2 ou 4 GPU et Edge)

A3 High (1, 2 ou 4 GPU)

Si vous exécutez des charges de travail d'inférence ou d'entraînement standard qui nécessitent des performances élevées, mais pas un cluster synchronisé à huit GPU, utilisez la série de machines A3 High avec un, deux ou quatre GPU associés.

Les types de machines A3 High sont associés à des GPU NVIDIA H100 SXM et conviennent aussi bien à l'inférence de grands modèles qu'à leur affinement.

GPU NVIDIA H100 associés
Type de machine Nombre de vCPU1 Mémoire de l'instance (Go) SSD local associé (Gio) Nombre de cartes d'interface réseau physiques Bande passante réseau maximale (Gbit/s)2 Nombre de GPU Mémoire GPU3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1 500 1 50 2 160
a3-highgpu-4g 104 936 3 000 1 100 4 320
a3-highgpu-8g 208 1 872 6 000 5 1 000 8 640

1 Un vCPU est mis en œuvre sous la forme d'une technologie hyper-threading matérielle unique sur l'une des plates-formes de processeur disponibles.
2 La bande passante de sortie maximale ne peut pas dépasser le nombre donné. La bande passante de sortie réelle dépend de l'adresse IP de destination et d'autres facteurs. Pour en savoir plus sur la bande passante réseau, consultez Bande passante réseau.
3 La mémoire de GPU est la mémoire disponible sur un GPU pouvant être utilisée pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail exigeantes en ressources graphiques.

A3 Edge

Si vous exécutez des charges de travail d'inférence distribuée à haut débit sur plusieurs hôtes sans structure de cluster coordonnée, utilisez la gamme A3 Edge pour simplifier le déploiement sur des réseaux privés virtuels standards.

Les types de machines A3 Edge sont dotés de GPU NVIDIA H100 SXM et sont conçus spécifiquement pour la mise en service. Ils sont disponibles dans un ensemble limité de régions.

GPU NVIDIA H100 associés
Type de machine Nombre de vCPU1 Mémoire de l'instance (Go) SSD local associé (Gio) Nombre de cartes d'interface réseau physiques Bande passante réseau maximale (Gbit/s)2 Nombre de GPU Mémoire GPU3
(GB HBM3)
a3-edgegpu-8g 208 1 872 6 000 5
  • 600 : pour asia-south1 et northamerica-northeast2
  • 400 : pour toutes les autres régions A3 Edge
8 640

Série A2 (Standard et Ultra)

Si vous devez effectuer un service de modèle à nœud unique hautes performances ou un affinement de modèle à petite échelle, utilisez la série de machines A2 pour accéder aux ressources GPU NVIDIA A100 dédiées.

A2 Ultra

GPU NVIDIA A100 80 Go associés
Type de machine Nombre de vCPU1 Mémoire de l'instance (Go) SSD local associé (Gio) Bande passante réseau maximale (Gbit/s)2 Nombre de GPU Mémoire GPU3
(GB HBM2e)
a2-ultragpu-1g 12 170 375 24 1 80
a2-ultragpu-2g 24 340 750 32 2 160
a2-ultragpu-4g 48 680 1 500 50 4 320
a2-ultragpu-8g 96 1 360 3 000 100 8 640

1 Un vCPU est mis en œuvre sous la forme d'une technologie hyper-threading matérielle unique sur l'une des plates-formes de processeur disponibles.
2 La bande passante de sortie maximale ne peut pas dépasser le nombre donné. La bande passante de sortie réelle dépend de l'adresse IP de destination et d'autres facteurs. Pour en savoir plus sur la bande passante réseau, consultez Bande passante réseau.
3 La mémoire de GPU est la mémoire disponible sur un GPU pouvant être utilisée pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail exigeantes en ressources graphiques.

A2 Standard

GPU NVIDIA A100 40 Go associés
Type de machine Nombre de vCPU1 Mémoire de l'instance (Go) SSD local pris en charge Bande passante réseau maximale (Gbit/s)2 Nombre de GPU Mémoire GPU3
(GB HBM2)
a2-highgpu-1g 12 85 Oui 24 1 40
a2-highgpu-2g 24 170 Oui 32 2 80
a2-highgpu-4g 48 340 Oui 50 4 160
a2-highgpu-8g 96 680 Oui 100 8 320
a2-megagpu-16g 96 1 360 Oui 100 16 640

1 Un vCPU est mis en œuvre sous la forme d'une technologie hyper-threading matérielle unique sur l'une des plates-formes de processeur disponibles.
2 La bande passante de sortie maximale ne peut pas dépasser le nombre donné. La bande passante de sortie réelle dépend de l'adresse IP de destination et d'autres facteurs. Pour en savoir plus sur la bande passante réseau, consultez Bande passante réseau.
3 La mémoire de GPU est la mémoire disponible sur un GPU pouvant être utilisée pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail exigeantes en ressources graphiques.

Série G4

Si votre équipe a besoin de charges de travail d'inférence d'entrée de gamme ou de rendu graphique standard économiques, utilisez la série de machines G4 avec des GPU NVIDIA RTX PRO 6000.

Les types de machines G4 utilisent des GPU NVIDIA RTX PRO 6000 Blackwell Server Edition (nvidia-rtx-pro-6000) et conviennent aux charges de travail de simulation NVIDIA Omniverse, aux applications exigeantes en ressources graphiques, au transcodage vidéo et aux bureaux virtuels. Les types de machines G4 offrent également une solution à faible coût pour l'inférence et le réglage de modèle sur un seul hôte, par rapport aux types de machines de la série A.

GPU NVIDIA RTX PRO 6000 associés
Type de machine Nombre de vCPU1 Mémoire de l'instance (Go) Volumes Titanium SSD maximaux pris en charge (Gio)2 Nombre de cartes d'interface réseau physiques Bande passante réseau maximale (Gbit/s)3 Nombre de GPU Mémoire de GPU4
(Go GDDR7)
g4-standard-6 6 22 0 1 20 1/8 12
g4-standard-12 12 45 375 1 20 1/4 24
g4-standard-24 24 90 750 1 20 1/2 48
g4-standard-48 48 180 1 500 1 50 1 96
g4-standard-96 96 360 3 000 1 100 2 192
g4-standard-192 192 720 6 000 1 200 4 384
g4-standard-384 384 1 440 12 000 2 400 8 768

*La mémoire du GPU est la mémoire disponible sur un GPU pouvant être utilisé pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail accélérées, telles que le machine learning et les charges de travail gourmandes en ressources graphiques.

Série G2

Si vous déployez des applications d'inférence en temps réel courantes ou des pipelines de génération augmentée par récupération (RAG), utilisez la série de machines G2 pour équilibrer les performances et le rapport coût/efficacité avec les GPU NVIDIA L4.

GPU NVIDIA L4 associés
Type de machine Nombre de vCPU1 Mémoire d'instance par défaut (Go) Plage de mémoire d'instance personnalisée (Go) Disque SSD local maximal pris en charge (Gio) Bande passante réseau maximale (Gbit/s)2 Nombre de GPU Mémoire de GPU3 (Go GDDR6)
g2-standard-4 4 16 16 à 32 375 10 1 24
g2-standard-8 8 32 32 à 54 375 16 1 24
g2-standard-12 12 48 48 à 54 375 16 1 24
g2-standard-16 16 64 54 à 64 375 32 1 24
g2-standard-24 24 96 96 à 108 750 32 2 48
g2-standard-32 32 128 96 à 128 375 32 1 24
g2-standard-48 48 192 192 à 216 1 500 50 4 96
g2-standard-96 96 384 384 à 432 3 000 100 8 192

1 Un vCPU est mis en œuvre sous la forme d'une technologie hyper-threading matérielle unique sur l'une des plates-formes de processeur disponibles.
2 La bande passante de sortie maximale ne peut pas dépasser le nombre donné. La bande passante de sortie réelle dépend de l'adresse IP de destination et d'autres facteurs. Pour en savoir plus sur la bande passante réseau, consultez Bande passante réseau.
3 La mémoire de GPU est la mémoire disponible sur un GPU pouvant être utilisée pour le stockage temporaire de données. Elle est distincte de la mémoire de l'instance et est spécialement conçue pour gérer les demandes de bande passante plus élevées de vos charges de travail exigeantes en ressources graphiques.

Série N1 (NVIDIA T4 ou V100)

Si votre priorité est d'effectuer des tests à moindre coût ou d'exécuter une inférence d'entrée de gamme à faible concurrence, utilisez la série de machines N1 pour associer des GPU NVIDIA T4 ou V100.

NVIDIA T4

Type d'accélérateur Nombre de GPU Mémoire de GPU1 (Go GDDR6) Nombre de vCPU Mémoire de l'instance (Go) SSD local pris en charge
nvidia-tesla-t4 ou
nvidia-tesla-t4-vws
1 16 Entre 1 et 48 Entre 1 et 312 Oui
2 32 Entre 1 et 48 Entre 1 et 312 Oui
4 64 Entre 1 et 96 Entre 1 et 624 Oui

NVIDIA V100

Type d'accélérateur Nombre de GPU Mémoire GPU1 (GB HBM2) Nombre de vCPU Mémoire de l'instance (Go) SSD local compatible2
nvidia-tesla-v100 1 16 Entre 1 et 12 Entre 1 et 78 Oui
2 32 Entre 1 et 24 Entre 1 et 156 Oui
4 64 Entre 1 et 48 Entre 1 et 312 Oui
8 128 Entre 1 et 96 Entre 1 et 624 Oui

Acquisition de capacité

Les accélérateurs GPU généraux utilisent un provisionnement standard en libre-service. Vous pouvez obtenir de la capacité grâce à des réservations standards, des requêtes à la demande ou des VM Spot. Étant donné que la capacité à la demande peut être épuisée, utilisez des VM Spot ou à démarrage flexible dans la mesure du possible.

Étapes suivantes