アクセラレータ インフラストラクチャを選択する

このドキュメントでは、小規模なプロトタイピング、リアルタイム推論、大規模な分散トレーニングなど、ライフサイクル ステージに基づいて、人工知能(AI)と機械学習(ML)のワークロードに最適なアクセラレータ インフラストラクチャを特定する方法について説明します。AI Hypercomputer は、アクセラレータのオファリングを 2 つの カテゴリに分類しています。一般的な GPUクラスタ化された GPUです。

GPU インフラストラクチャ

AI Hypercomputer には、2 つの異なるカテゴリの GPU が用意されています。各カテゴリには、システムがライフサイクル イベントを処理する方法、メンテナンスを管理する方法、ワークロードのネットワーキングを最適化する方法を決定する、異なる管理モデルがあります。

一般的な GPU 管理モデル

一般的な GPU 管理モデルは、リソースの独立性と高可用性を優先するワークロード向けに設計されています。この モデルでは、標準の Google Cloud 管理プレーンを使用するため、Compute Engine または GKE をすでに使用しているチームは使い慣れた 操作感で利用できます。

  • メンテナンス: 非同期。個々のインスタンスは個別に更新されます。マルチノード サービング フリートでは、1 つのノードでメンテナンス イベントが発生しても他のノードの可用性に影響しないため、ジョブ全体を停止することなく、トラフィックを正常なノードにリダイレクトできます。

  • 主なユースケース: リアルタイム推論、モデル提供、小規模なプロトタイピング、スーパーコンピューティング スケールを必要としない開発環境など、主流のタスクにおすすめします。

一般的な GPU マシンシリーズ

次のマシンシリーズは一般的な GPU です。

  • G2(L4)
  • G4(RTX PRO 6000)
  • A2(A100)
  • N1+T4
  • A3 Edge
  • A3 High(1、2、4 個の GPU)

一般的な GPU マシンの技術情報については、GPU マシンタイプをご覧ください。

クラスタ化された GPU 管理モデル

クラスタ化された GPU 管理モデルは、大規模な分散トレーニング向けに設計されたスーパーコンピューティング クラスの環境です。リソースは、クラスタ化された GPU スタックを使用して、単一の緊密に結合されたシステムとして管理されます。

  • メンテナンス: 調整済み。このモデルは、緊密に結合されたワークロードをサポートするために、メンテナンス イベントを調整します。分散トレーニングでは、すべてのノードに同時に更新を適用する同期メンテナンスを使用できます。このアプローチにより、ノードの再起動によってジョブが停止するのを防ぎ、 goodputを最大化できます。このモデルでは、90 日間のメンテナンス通知も提供されます。

  • 主なユースケース: 数兆のパラメータを持つエクサスケールの基盤モデルのトレーニングや、創薬やタンパク質フォールディングなどの複雑なハイ パフォーマンス コンピューティング(HPC)シミュレーションの実行向けに設計されています。

クラスタ化された GPU マシンシリーズ

次のマシンシリーズはクラスタ化された GPU です。

  • A4X
  • A4(Blackwell)
  • A3 Ultra
  • A3 Mega
  • A3 High(8 個の GPU)

クラスタ化された GPU マシンの技術情報については、GPU マシンタイプをご覧ください。

機能マトリックス

一般的な GPU 管理モデルとクラスタ化された GPU 管理モデルの技術的特性と運用特性を比較します。

特性 一般的な GPU 管理モデル クラスタ化された GPU 管理モデル
主なユースケース 推論、モデル提供、プロトタイピング、開発 大規模な分散トレーニングと HPC
メンテナンス 非同期: 個別のノード更新により、ジョブを停止することなくトラフィックをリダイレクトできます 調整済み: クラスタ全体の調整済み(同期)更新をサポートし、ノードの同期を維持して goodput を最大化します
ターゲット ハードウェア G2(L4)G4(RTX PRO 6000)A2(A100)N1+T4A3 EdgeA3 High(1、2、4 個の GPU) A4XA4(Blackwell)A3 UltraA3 Mega、およびA3 High(8 個の GPU)
ネットワーキング gVNIC インターフェース上の標準 VPC ネットワーキング(複数の VPC で GPUDirect-TCPX を使用する A3 Edge を除く) 特殊な低レイテンシ ファブリック(RDMA、RoCE、TCPX、NVIDIA NVLink)
管理スタック 標準 Google Cloud プレーン(Compute Engine または GKE) 特殊な管理スタック(Cluster Director など)
信頼性 標準のノード自動修復と Pod レベルのアップタイム 特殊なリソースと復旧スイート

判断マトリックス

このマトリックスを使用して、特定のワークロードの意図に合致するハードウェア ファミリーを特定します。

ワークロードに次のものが含まれる場合... 推奨される GPU インフラストラクチャ 推奨されるマシンシリーズ
プロトタイピングと開発 一般的な GPU G2G4A2N1+T4A3 Edge
リアルタイム推論(< 1,000 億個のパラメータ) 一般的な GPU G2G4A2N1+T4A3 Edge
複数の GPU での推論 クラスタ化された GPU A3A4
大規模なトレーニングと推論 クラスタ化された GPU A4A3 シリーズ
大規模なトレーニング(> 5,000 億個のパラメータ)と分離された推論 クラスタ化された GPU A4X MaxA4XA4

モデル アーキテクチャをハードウェアに直接マッピングする詳細なデシジョン ツリーについては、 アクセラレータを選択するをご覧ください。

これらの主要な基準を確立したら、オーケストレーション プラットフォームを選択します。 この選択は、オペレーティング システムとドライバの自動管理または詳細な制御に対するチームの優先度によって異なります。

次のステップ