Terminologie

Les conditions suivantes s'appliquent à AI Hypercomputer.

Accélérateur
Appareil matériel spécialisé, tel qu'un GPU ou une TPU, conçu pour effectuer des tâches spécifiques, telles que des charges de travail de machine learning, plus efficacement qu'un processeur à usage général.

Bloc
Ensemble de sous-blocs interconnectés. Dans un bloc, n'importe quel GPU est accessible via le fabric réseau, ce qui garantit une communication à très faible latence pour vos tâches d'entraînement distribuées.

Cluster
Ensemble de blocs interconnectés reliés par un fabric à haut débit. Le fabric réseau est-ouest non bloquant vous permet de mettre à l'échelle des tâches d'entraînement massives sur des milliers de GPU sans rencontrer de goulots d'étranglement en termes de performances ou de bande passante.

GPU en cluster
Catégorie de familles de machines pour les GPU, y compris A4X, A4, A3 Ultra, A3 Mega et A3 High (8 GPU). Les GPU en cluster permettent aux équipes de déployer et de mettre à l'échelle des milliers d'accélérateurs interconnectés en tant que système unique et étroitement couplé à l'aide de fabrics réseau spécialisés et d'une maintenance synchronisée. Ils sont idéaux pour les charges de travail qui nécessitent une puissance de calcul, une mémoire et une synchronisation réseau à haut débit extrêmes. Les cas d'utilisation courants incluent le pré-entraînement de modèles de base avec des milliers de milliards de paramètres, la diffusion de modèles de pointe et les simulations pour la découverte de médicaments.

Maintenance d'urgence
Parfois appelée maintenance d'urgence. Événement de maintenance non planifié causé par un problème matériel, logiciel ou de sécurité critique. Pour les types de machines d'accélérateur compatibles, la maintenance d'urgence fournit une notification anticipée au lieu d'une interruption immédiate. Cette notification vous permet de vider vos charges de travail et, si vous le souhaitez, de déclencher la réparation avant que le système ne mette fin aux VM.

GPU général
Catégorie de familles de machines GPU, y compris G2, G4, A2, N1+T4 et A3 Edge. Les GPU généraux permettent aux équipes de déployer et de mettre à l'échelle des accélérateurs NVIDIA en toute autonomie opérationnelle, en contournant la complexité architecturale des clusters de supercalcul coordonnés. Ils sont idéaux pour les charges de travail qui privilégient la haute disponibilité, le provisionnement en libre-service et la mise à l'échelle indépendante. Les cas d'utilisation courants incluent l'inférence en temps réel, la RAG, le prototypage et l'entraînement de modèles de petite à moyenne taille.

Fabric réseau
Un fabric réseau fournit une connectivité à faible latence et à bande passante élevée entre tous les blocs et Google Cloud services d'un cluster. Jupiter est l'architecture de réseau de centre de données de Google qui utilise la mise en réseau définie par logiciel et les commutateurs de circuits optiques pour faire évoluer le réseau et optimiser ses performances.

Nœud ou hôte
Machine serveur physique unique dans le centre de données. Chaque hôte est associé à des ressources de calcul, telles que des accélérateurs. Le nombre et la configuration de ces ressources de calcul dépendent de la famille de machines. Les instances Compute Engine sont provisionnées sur un hôte physique.

Un domaine NVLink, également appelé sous-bloc, est l'unité de capacité de base pour les machines A4X Max et A4X. Un domaine NVLink se compose de 18 instances A4X Max ou A4X (72 GPU) connectées par un système NVLink à plusieurs nœuds.

Sous-bloc
Groupe d'hôtes et de matériel de connectivité associé qui se trouvent sur un seul rack physique. Dans le contexte des machines A4X Max et A4X, un sous-bloc est également appelé domaine NVLink.

Superbloc
Regroupement physique de machines interconnectées dans des centres de données. En plaçant des machines dans un superbloc, vous obtenez le débit réseau extrême et la latence inférieure à la milliseconde nécessaires pour exécuter des charges de travail d'entraînement étroitement couplées.

En savoir plus

Les documents suivants fournissent des explications supplémentaires sur les terminologies pertinentes pour les sujets correspondants :