Choisir entre des GPU généraux et des GPU en cluster

Ce document fournit des recommandations concernant les accélérateurs, les options de consommation et les outils de déploiement les mieux adaptés aux différentes charges de travail d'intelligence artificielle (IA), de machine learning (ML) et de calcul hautes performances (HPC). Utilisez ce document pour identifier le meilleur déploiement pour votre charge de travail.

Pour obtenir des informations et des recommandations sur les piliers d'infrastructure pour les charges de travail d'IA, de ML et de HPC, consultez les documents suivants :

Présentation des charges de travail

L'architecture AI Hypercomputer prend en charge les cas d'utilisation suivants :

Charge de travail Description Recommandation
Pré-entraînement des modèles de fondation Cela implique de créer un modèle de langage à l'aide d'un grand ensemble de données. Le résultat du pré-entraînement des modèles de fondation est un nouveau modèle qui est performant pour les tâches générales.
Les modèles sont classés en fonction de leur taille comme suit :
  • Modèle Frontier : modèles de ML qui couvrent des centaines de milliards à des milliers de milliards de paramètres, voire plus. Il s'agit, par exemple, des grands modèles de langage (LLM) tels que Gemini.
  • Grand modèle : modèles de ML qui couvrent des dizaines ou des centaines de milliards de paramètres, voire plus.
Consultez les recommandations pour les modèles de pré-entraînement.
Réglage fin Cela implique de prendre un modèle entraîné et de l'adapter pour effectuer des tâches spécifiques à l'aide d'ensembles de données spécialisés ou d'autres techniques. L'affinage est généralement effectué sur des modèles volumineux. Consultez les recommandations pour affiner les modèles.
Inférence ou mise en service Cela implique de prendre un modèle entraîné ou affiné et de le mettre à la disposition des utilisateurs ou des applications.
Les charges de travail d'inférence sont classées en fonction de la taille des modèles comme suit :
  • Inférence pour les modèles de fondation sur plusieurs hôtes : effectuer l'inférence avec des modèles de ML entraînés qui couvrent des centaines de milliards à des milliers de milliards de paramètres, voire plus. Pour ces charges de travail d'inférence, la charge de calcul est répartie sur plusieurs machines hôtes.
  • Inférence de modèle de fondation à hôte unique : inférence avec des modèles de ML entraînés qui couvrent des dizaines à des centaines de milliards de paramètres. Pour ces charges de travail d'inférence, la charge de calcul est limitée à une seule machine hôte.
  • Inférence de grands modèles : effectuer une inférence avec des modèles de ML entraînés ou affinés qui comportent des dizaines à des centaines de milliards de paramètres.
Consultez les recommandations pour l'inférence.
ML pour les modèles de petite ou moyenne taille Cela implique d'entraîner et de diffuser des modèles de ML de taille et de complexité plus petites, généralement pour des tâches plus spécialisées. Consultez les recommandations de ML pour les modèles de petite ou moyenne taille.
HPC Il s'agit d'agréger des ressources informatiques afin d'obtenir des performances supérieures à celles d'une station de travail, d'un serveur ou d'un ordinateur unique. Le HPC permet de résoudre des problèmes dans les domaines de la recherche universitaire, de la science, de la conception, de la simulation et de l'informatique décisionnelle. Consultez les recommandations pour le HPC.

Recommandations pour les modèles de pré-entraînement

Pour pré-entraîner les modèles de fondation, de grands clusters d'accélérateurs lisent en continu de grands volumes de données. Ces accélérateurs ajustent les pondérations par le biais de passes avant et arrière pour apprendre à partir des données. Ces tâches d'entraînement s'exécutent pendant des semaines, voire des mois.

Les sections suivantes décrivent les accélérateurs et les options de consommation que nous vous recommandons d'utiliser pour pré-entraîner les modèles de fondation.

Accélérateurs recommandés

Pour pré-entraîner des modèles de fondation sur Google Cloud, nous vous recommandons d'utiliser les types de machines A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go) optimisés pour les accélérateurs, et d'utiliser un orchestrateur pour déployer le cluster.

Pour déployer ces clusters d'accélérateurs, nous vous recommandons également d'utiliser Cluster Director ou Cluster Toolkit. Pour en savoir plus, consultez le guide de déploiement de cluster correspondant au type de machine de votre choix dans le tableau suivant.

Charges de travail Recommandations Guide de déploiement des clusters
Type de machine Outil d'orchestration
Pré-entraînement des modèles de fondation
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut
Slurm
Entraînement de grands modèles A3 Ultra (NVIDIA H200 141 Go) GKE Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut
Slurm
Entraînement de grands modèles
  • A3 Mega (NVIDIA H100 80 Go)
  • A3 High (NVIDIA H100 80 Go)
GKE Maximiser la bande passante réseau des GPU dans les clusters en mode Standard
Slurm

Option de consommation recommandée

Pour obtenir un niveau de garantie élevé pour les grands clusters d'accélérateurs, nous vous recommandons d'utiliser une réservation. Plus précisément, pour minimiser les coûts des ressources réservées, nous vous recommandons de demander une durée de réservation suffisamment longue pour bénéficier de remises sur engagement d'utilisation. Pour en savoir plus sur les options de consommation, consultez Choisir une option de consommation.

Recommandations pour affiner les modèles

Pour affiner de grands modèles de fondation, des clusters d'accélérateurs plus petits lisent des volumes de données modérés. Ces accélérateurs ajustent le modèle pour effectuer des tâches spécifiques. Ces jobs d'affinage s'exécutent pendant des jours, voire des semaines.

Les sections suivantes décrivent les accélérateurs et l'option de consommation recommandés à utiliser lors du réglage fin des modèles.

Pour affiner des modèles sur Google Cloud, nous vous recommandons d'utiliser les types de machines optimisés pour les accélérateurs A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go), et d'utiliser un orchestrateur pour déployer le cluster.

Pour déployer ces clusters d'accélérateurs, nous vous recommandons également d'utiliser Cluster Director ou Cluster Toolkit. Pour en savoir plus, consultez le guide de déploiement de cluster correspondant au type de machine de votre choix dans le tableau suivant.

Charges de travail Recommandations Guide de déploiement des clusters
Type de machine Outil d'orchestration
Affinage de grands modèles A3 Ultra (NVIDIA H200 141 Go) GKE Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut
Slurm
Affinage de grands modèles
  • A3 Mega (NVIDIA H100 80 Go)
  • A3 High (NVIDIA H100 80 Go)
GKE Maximiser la bande passante réseau des GPU dans les clusters en mode Standard
Slurm

Option de consommation recommandée

Pour les charges de travail d'affinage, utilisez une réservation future en mode Agenda pour provisionner des ressources. Pour en savoir plus sur les options de consommation, consultez Choisir une option de consommation.

Recommandations pour l'inférence

Les sections suivantes décrivent les accélérateurs et les options de consommation recommandés à utiliser lors de l'inférence.

Accélérateurs recommandés

Les accélérateurs recommandés pour l'inférence dépendent du type d'inférence que vous effectuez : inférence de modèle volumineux ou de pointe multihôte, ou inférence de pointe monohôte.

Accélérateurs recommandés (multihôte)

Pour effectuer une inférence de grands modèles ou de modèles de pointe multi-hôtes sur Google Cloud, utilisez un type de machine optimisé pour les accélérateurs A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go), puis déployez la machine à l'aide d'un orchestrateur. Pour déployer ces clusters d'accélérateurs, nous vous recommandons également d'utiliser Cluster Director ou Cluster Toolkit. Le tableau fournit des liens vers des guides de déploiement de clusters pour chaque type de machine recommandé.

Charges de travail Recommandations Guide de déploiement des clusters
Type de machine Outil d'orchestration
Inférence de la frontière multihôte
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut
Slurm
Inférence de grands modèles A3 Ultra (NVIDIA H200 141 Go) GKE Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut
Slurm
Inférence de grands modèles
  • A3 Mega (NVIDIA H100 80 Go)
  • A3 High (NVIDIA H100 80 Go)
GKE Maximiser la bande passante réseau des GPU dans les clusters en mode Standard
Slurm

Accélérateurs recommandés (hôte unique)

Le tableau ci-dessous présente les accélérateurs que nous vous recommandons d'utiliser pour effectuer une inférence frontier à hôte unique. Le tableau fournit des liens vers des guides de déploiement de VM pour chaque type de machine recommandé.

Charges de travail Recommandations Guide de déploiement des VM
Type de machine Outil d'orchestration
Inférence de pointe et courante à hôte unique
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141 Go)
N/A Créer une instance A4 ou A3 Ultra
  • A3 High (NVIDIA H100 80 Go)
  • A3 Edge (NVIDIA H100 80 Go)
Créer une instance A3 High ou A3 Edge
G4 (NVIDIA RTX PRO 6000) Créer une instance G4
A2 (NVIDIA A100) Créer une instance A2
G2 (NVIDIA L4) Créer une instance G2
N1 (NVIDIA T4 ou V100) Créer une instance N1

Option de consommation recommandée

Pour l'inférence, utilisez une réservation de longue durée ou une réservation future en mode Agenda. Pour en savoir plus sur les options de consommation, consultez Choisir une option de consommation.

Recommandations pour les modèles de petite ou moyenne taille

Pour les charges de travail de ML impliquant des modèles de petite ou moyenne taille, l'objectif principal est d'atteindre un équilibre optimal entre prix et performances.

Accélérateurs recommandés

Le tableau suivant présente les accélérateurs recommandés pour les charges de travail de ML de modèles de petite à moyenne taille.

Charges de travail Recommandations Guide de déploiement des VM
Type de machine Outil d'orchestration
ML pour les modèles de petite ou moyenne taille G4 (NVIDIA RTX PRO 6000) N/A Créer une instance G4
G2 (NVIDIA L4) Créer une instance G2
A2 (NVIDIA A100) Créer une instance A2
A3 Edge (NVIDIA H100 80 Go) Créer une instance A3 Edge
N1 (NVIDIA T4 ou V100) Créer une instance N1

Recommandations pour le HPC

Pour les charges de travail HPC, n'importe quelle série de machines optimisées pour les accélérateurs ou série de machines optimisées pour le calcul convient. Si vous utilisez une série de machines optimisée pour les accélérateurs, la solution la plus adaptée dépend de la quantité de calculs devant être déchargée sur le GPU. Pour obtenir une liste détaillée des recommandations concernant les charges de travail HPC, consultez Bonnes pratiques pour exécuter des charges de travail HPC.

Récapitulatif des recommandations

Le tableau suivant récapitule les accélérateurs et les options de consommation recommandés pour chaque charge de travail.

Ressource Recommandation
Pré-entraînement du modèle
Famille de machines Utilisez l'un des types de machines optimisés pour les accélérateurs suivants : A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go).
Option d'utilisation "Utiliser les réservations futures standards
Affinage de modèles
Famille de machines Utilisez les types de machines optimisés pour les accélérateurs A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go).
Option d'utilisation "Utiliser les réservations futures standards
Inférence
Famille de machines Utilisez l'un des types de machines suivants : A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go), A3 High (NVIDIA H100 80 Go), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 Go) ou N1 (NVIDIA T4 ou V100).
Option d'utilisation Utiliser des réservations, des instances à la demande ou Spot
ML pour les modèles de petite ou moyenne taille
Famille de machines Utilisez l'un des types de machines suivants : G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 Go) ou N1 (NVIDIA T4 ou V100).
Option d'utilisation Utiliser des réservations à la demande, Spot ou standards
Stockage Utiliser Cloud Storage FUSE
HPC
Consultez la section récapitulative des bonnes pratiques pour exécuter des charges de travail HPC.

Étapes suivantes