Ce document fournit des recommandations concernant les accélérateurs, les options de consommation et les outils de déploiement les mieux adaptés aux différentes charges de travail d'intelligence artificielle (IA), de machine learning (ML) et de calcul hautes performances (HPC). Utilisez ce document pour identifier le meilleur déploiement pour votre charge de travail.
Pour obtenir des informations et des recommandations sur les piliers d'infrastructure pour les charges de travail d'IA, de ML et de HPC, consultez les documents suivants :
Présentation des charges de travail
L'architecture AI Hypercomputer prend en charge les cas d'utilisation suivants :
| Charge de travail | Description | Recommandation |
|---|---|---|
| Pré-entraînement des modèles de fondation | Cela implique de créer un modèle de langage à l'aide d'un grand ensemble de données. Le résultat du pré-entraînement des modèles de fondation est un nouveau modèle qui est performant pour les tâches générales. Les modèles sont classés en fonction de leur taille comme suit :
|
Consultez les recommandations pour les modèles de pré-entraînement. |
| Réglage fin | Cela implique de prendre un modèle entraîné et de l'adapter pour effectuer des tâches spécifiques à l'aide d'ensembles de données spécialisés ou d'autres techniques. L'affinage est généralement effectué sur des modèles volumineux. | Consultez les recommandations pour affiner les modèles. |
| Inférence ou mise en service | Cela implique de prendre un modèle entraîné ou affiné et de le mettre à la disposition des utilisateurs ou des applications. Les charges de travail d'inférence sont classées en fonction de la taille des modèles comme suit :
|
Consultez les recommandations pour l'inférence. |
| ML pour les modèles de petite ou moyenne taille | Cela implique d'entraîner et de diffuser des modèles de ML de taille et de complexité plus petites, généralement pour des tâches plus spécialisées. | Consultez les recommandations de ML pour les modèles de petite ou moyenne taille. |
| HPC | Il s'agit d'agréger des ressources informatiques afin d'obtenir des performances supérieures à celles d'une station de travail, d'un serveur ou d'un ordinateur unique. Le HPC permet de résoudre des problèmes dans les domaines de la recherche universitaire, de la science, de la conception, de la simulation et de l'informatique décisionnelle. | Consultez les recommandations pour le HPC. |
Recommandations pour les modèles de pré-entraînement
Pour pré-entraîner les modèles de fondation, de grands clusters d'accélérateurs lisent en continu de grands volumes de données. Ces accélérateurs ajustent les pondérations par le biais de passes avant et arrière pour apprendre à partir des données. Ces tâches d'entraînement s'exécutent pendant des semaines, voire des mois.
Les sections suivantes décrivent les accélérateurs et les options de consommation que nous vous recommandons d'utiliser pour pré-entraîner les modèles de fondation.
Accélérateurs recommandés
Pour pré-entraîner des modèles de fondation sur Google Cloud, nous vous recommandons d'utiliser les types de machines A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go) optimisés pour les accélérateurs, et d'utiliser un orchestrateur pour déployer le cluster.
Pour déployer ces clusters d'accélérateurs, nous vous recommandons également d'utiliser Cluster Director ou Cluster Toolkit. Pour en savoir plus, consultez le guide de déploiement de cluster correspondant au type de machine de votre choix dans le tableau suivant.
| Charges de travail | Recommandations | Guide de déploiement des clusters | |
|---|---|---|---|
| Type de machine | Outil d'orchestration | ||
| Pré-entraînement des modèles de fondation |
|
GKE | Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut |
| Slurm | |||
| Entraînement de grands modèles | A3 Ultra (NVIDIA H200 141 Go) | GKE | Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut |
| Slurm | |||
| Entraînement de grands modèles |
|
GKE | Maximiser la bande passante réseau des GPU dans les clusters en mode Standard |
| Slurm | |||
Option de consommation recommandée
Pour obtenir un niveau de garantie élevé pour les grands clusters d'accélérateurs, nous vous recommandons d'utiliser une réservation. Plus précisément, pour minimiser les coûts des ressources réservées, nous vous recommandons de demander une durée de réservation suffisamment longue pour bénéficier de remises sur engagement d'utilisation. Pour en savoir plus sur les options de consommation, consultez Choisir une option de consommation.
Recommandations pour affiner les modèles
Pour affiner de grands modèles de fondation, des clusters d'accélérateurs plus petits lisent des volumes de données modérés. Ces accélérateurs ajustent le modèle pour effectuer des tâches spécifiques. Ces jobs d'affinage s'exécutent pendant des jours, voire des semaines.
Les sections suivantes décrivent les accélérateurs et l'option de consommation recommandés à utiliser lors du réglage fin des modèles.
Accélérateurs recommandés
Pour affiner des modèles sur Google Cloud, nous vous recommandons d'utiliser les types de machines optimisés pour les accélérateurs A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go), et d'utiliser un orchestrateur pour déployer le cluster.
Pour déployer ces clusters d'accélérateurs, nous vous recommandons également d'utiliser Cluster Director ou Cluster Toolkit. Pour en savoir plus, consultez le guide de déploiement de cluster correspondant au type de machine de votre choix dans le tableau suivant.
| Charges de travail | Recommandations | Guide de déploiement des clusters | |
|---|---|---|---|
| Type de machine | Outil d'orchestration | ||
| Affinage de grands modèles | A3 Ultra (NVIDIA H200 141 Go) | GKE | Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut |
| Slurm | |||
| Affinage de grands modèles |
|
GKE | Maximiser la bande passante réseau des GPU dans les clusters en mode Standard |
| Slurm | |||
Option de consommation recommandée
Pour les charges de travail d'affinage, utilisez une réservation future en mode Agenda pour provisionner des ressources. Pour en savoir plus sur les options de consommation, consultez Choisir une option de consommation.
Recommandations pour l'inférence
Les sections suivantes décrivent les accélérateurs et les options de consommation recommandés à utiliser lors de l'inférence.
Accélérateurs recommandés
Les accélérateurs recommandés pour l'inférence dépendent du type d'inférence que vous effectuez : inférence de modèle volumineux ou de pointe multihôte, ou inférence de pointe monohôte.
Accélérateurs recommandés (multihôte)
Pour effectuer une inférence de grands modèles ou de modèles de pointe multi-hôtes sur Google Cloud, utilisez un type de machine optimisé pour les accélérateurs A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go), puis déployez la machine à l'aide d'un orchestrateur. Pour déployer ces clusters d'accélérateurs, nous vous recommandons également d'utiliser Cluster Director ou Cluster Toolkit. Le tableau fournit des liens vers des guides de déploiement de clusters pour chaque type de machine recommandé.
| Charges de travail | Recommandations | Guide de déploiement des clusters | |
|---|---|---|---|
| Type de machine | Outil d'orchestration | ||
| Inférence de la frontière multihôte |
|
GKE | Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut |
| Slurm | |||
| Inférence de grands modèles | A3 Ultra (NVIDIA H200 141 Go) | GKE | Créer un cluster GKE optimisé pour l'IA avec la configuration par défaut |
| Slurm | |||
| Inférence de grands modèles |
|
GKE | Maximiser la bande passante réseau des GPU dans les clusters en mode Standard |
| Slurm | |||
Accélérateurs recommandés (hôte unique)
Le tableau ci-dessous présente les accélérateurs que nous vous recommandons d'utiliser pour effectuer une inférence frontier à hôte unique. Le tableau fournit des liens vers des guides de déploiement de VM pour chaque type de machine recommandé.
| Charges de travail | Recommandations | Guide de déploiement des VM | |
|---|---|---|---|
| Type de machine | Outil d'orchestration | ||
| Inférence de pointe et courante à hôte unique |
|
N/A | Créer une instance A4 ou A3 Ultra |
|
Créer une instance A3 High ou A3 Edge | ||
| G4 (NVIDIA RTX PRO 6000) | Créer une instance G4 | ||
| A2 (NVIDIA A100) | Créer une instance A2 | ||
| G2 (NVIDIA L4) | Créer une instance G2 | ||
| N1 (NVIDIA T4 ou V100) | Créer une instance N1 | ||
Option de consommation recommandée
Pour l'inférence, utilisez une réservation de longue durée ou une réservation future en mode Agenda. Pour en savoir plus sur les options de consommation, consultez Choisir une option de consommation.
Recommandations pour les modèles de petite ou moyenne taille
Pour les charges de travail de ML impliquant des modèles de petite ou moyenne taille, l'objectif principal est d'atteindre un équilibre optimal entre prix et performances.
Accélérateurs recommandés
Le tableau suivant présente les accélérateurs recommandés pour les charges de travail de ML de modèles de petite à moyenne taille.
| Charges de travail | Recommandations | Guide de déploiement des VM | |
|---|---|---|---|
| Type de machine | Outil d'orchestration | ||
| ML pour les modèles de petite ou moyenne taille | G4 (NVIDIA RTX PRO 6000) | N/A | Créer une instance G4 |
| G2 (NVIDIA L4) | Créer une instance G2 | ||
| A2 (NVIDIA A100) | Créer une instance A2 | ||
| A3 Edge (NVIDIA H100 80 Go) | Créer une instance A3 Edge | ||
| N1 (NVIDIA T4 ou V100) | Créer une instance N1 | ||
Recommandations pour le HPC
Pour les charges de travail HPC, n'importe quelle série de machines optimisées pour les accélérateurs ou série de machines optimisées pour le calcul convient. Si vous utilisez une série de machines optimisée pour les accélérateurs, la solution la plus adaptée dépend de la quantité de calculs devant être déchargée sur le GPU. Pour obtenir une liste détaillée des recommandations concernant les charges de travail HPC, consultez Bonnes pratiques pour exécuter des charges de travail HPC.
Récapitulatif des recommandations
Le tableau suivant récapitule les accélérateurs et les options de consommation recommandés pour chaque charge de travail.
| Ressource | Recommandation |
|---|---|
| Pré-entraînement du modèle | |
| Famille de machines | Utilisez l'un des types de machines optimisés pour les accélérateurs suivants : A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go). |
| Option d'utilisation | "Utiliser les réservations futures standards |
| Affinage de modèles | |
| Famille de machines | Utilisez les types de machines optimisés pour les accélérateurs A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go) ou A3 High (NVIDIA H100 80 Go). |
| Option d'utilisation | "Utiliser les réservations futures standards |
| Inférence | |
| Famille de machines | Utilisez l'un des types de machines suivants : A4X Max (NVIDIA GB300), A4X (NVIDIA GB200), A4 (NVIDIA B200), A3 Ultra (NVIDIA H200 141 Go), A3 Mega (NVIDIA H100 80 Go), A3 High (NVIDIA H100 80 Go), G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 Go) ou N1 (NVIDIA T4 ou V100). |
| Option d'utilisation | Utiliser des réservations, des instances à la demande ou Spot |
| ML pour les modèles de petite ou moyenne taille | |
| Famille de machines | Utilisez l'un des types de machines suivants : G2 (NVIDIA L4), G4 (NVIDIA RTX PRO 6000), A2 (NVIDIA A100), A3 Edge (NVIDIA H100 80 Go) ou N1 (NVIDIA T4 ou V100). |
| Option d'utilisation | Utiliser des réservations à la demande, Spot ou standards |
| Stockage | Utiliser Cloud Storage FUSE |
| HPC | |
| Consultez la section récapitulative des bonnes pratiques pour exécuter des charges de travail HPC. | |
Étapes suivantes
- Découvrez comment créer un cluster GKE optimisé pour l'IA.
- Découvrez comment créer un cluster Slurm entièrement géré.
- Découvrez comment créer une instance optimisée pour l'IA.