Présentation d'AI Hypercomputer

AI Hypercomputer est un système de supercalcul intégré optimisé pour gérer vos charges de travail d'intelligence artificielle (IA) et de machine learning (ML). Il s'agit du portefeuille unifié de l'infrastructure d'IA de Google Cloud, qui fournit un point d'entrée unique pour explorer, configurer et déployer du matériel optimisé pour les performances, des logiciels ouverts et des modèles de consommation flexibles.

AI Hypercomputer intègre une conception au niveau du système et des bonnes pratiques pour améliorer l'efficacité tout au long du cycle de développement de l'IA, du prototypage et du développement à l'entraînement à grande échelle et à l'exécution en temps réel.

Architecture du système

AI Hypercomputer intègre verticalement ces trois composants pour maximiser le débit utile, qui mesure la productivité réelle du machine learning :

  • Infrastructure optimisée pour les performances : fournit des accélérateurs (GPU NVIDIA et Google Cloud TPU), des ressources de mise en réseau et de stockage.
    • GPU : classés en fonction de la manière dont le système gère leurs événements de cycle de vie et leur maintenance :
      • GPU généraux : infrastructure gérée en tant qu'unités de calcul indépendantes avec une maintenance asynchrone.
      • GPU en cluster : clusters hautes performances gérés en tant que système unique étroitement couplé avec une maintenance synchronisée.
    • TPU : utilisent du matériel conçu pour effectuer des opérations matricielles volumineuses et disposent d'une mémoire à haut débit (HBM) intégrée pour les modèles et les tailles de lots plus importants. Les TPU peuvent être connectés dans des groupes appelés tranches qui vous permettent d'effectuer un scaling à la hausse de vos charges de travail avec peu ou pas de modifications de code. Pour en savoir plus sur l'infrastructure TPU, consultez la documentation Cloud TPU.
  • Logiciels ouverts : proposent des versions optimisées des frameworks de machine learning (PyTorch, JAX et TensorFlow) et des plates-formes d'orchestration. Pour déployer et gérer vos accélérateurs, vous pouvez choisir parmi les options suivantes :
    • Google Kubernetes Engine pour le scaling automatisé natif des conteneurs
    • Slurm via Cluster Director
    • Plans Cluster Toolkit
  • Options de consommation : proposent des options de provisionnement flexibles en fonction des besoins de votre charge de travail :
    • VM à démarrage flexible, VM Spot et Réservations : offrent des options flexibles pour différentes charges de travail.
    • Planificateur de charges de travail dynamique: fournit un provisionnement atomique pour des blocs entiers de nœuds interconnectés pour l'entraînement à grande échelle.

Avantages

  • Hautes performances et débit utile : optimisez les couches de planification et d'exécution pour maximiser le débit utile, ce qui permet aux accélérateurs de consacrer plus de temps au calcul productif et moins de temps à la surcharge du système.
  • Fiabilité intégrée : accédez à des fonctionnalités de fiabilité spécialisées :
    • GPU en cluster : incluent la surveillance automatisée de l'état du matériel et le remplacement proactif des nœuds.
    • GPU généraux : utilisent la réparation automatique standard Google Cloud des nœuds pour maintenir la disponibilité au niveau des pods pour les flottes de diffusion.
  • Stockage optimisé : utilisez des services de stockage à haut débit, tels que Google Cloud Managed Lustre et Cloud Storage Rapid, pour éliminer les goulots d'étranglement des E/S.

Cas d'utilisation

AI Hypercomputer répond aux besoins des cas d'utilisation suivants :

Cas d'utilisation Exemples de charges de travail
Charges de travail d'IA et de ML à grande échelle
  • Entraînement distribué pour l'IA générative
  • Inférence pour l'IA générative
  • Détection de fraudes
  • Modèles de recommandation
Inférence et diffusion de modèles
  • Détection de fraudes en temps réel
  • Moteurs de recommandations pour les résultats en temps réel
Prototypage et développement
  • Tests à petite échelle
  • Développement en phase initiale

Étape suivante