このドキュメントでは、ワークロードの有効なデータ転送速度であるグッドプットを最適化する方法について説明します。この最適化を実現するために、一般的な機械学習(ML)フレームワークとモデルを使用する再現可能なグッドプット レシピを厳選しました。これらのレシピを確認するには、 AI Hypercomputer GitHub 組織をご覧ください。 グッドプット レシピは、Cluster Toolkit を使用して作成されたクラスタでテストされています。
ワークロードの信頼性を最適化し、グッドプットを最大化するために、今後 5 時間以内にパフォーマンスが低下する可能性のある Google Kubernetes Engine(GKE)クラスタ内のノードを事前に特定することもできます。この早期警告により、リスクのある VM に新しいワークロードをスケジュール設定することを回避できるため、ジョブの中断のリスクを軽減できます。詳細については、 ノードのヘルス予測を有効にするをご覧ください。
始める前に
このドキュメントのグッドプット レシピを使用する前に、次の手順をまだ行っていない場合は完了してください。
レシピ
GKE クラスタでの事前トレーニングには、次の再現可能なグッドプット レシピを使用できます。
| レシピ名 | アクセラレータ | モデル | フレームワーク | ワークロード タイプ |
|---|---|---|---|---|
| Llama3.1 70B - A3 Mega | A3 Mega | Llama3.1 70B | NeMo | GKE での事前トレーニング |
次のステップ
- NCCL/gIB を使用してクラスタ ネットワーキングを 最適化する方法を学習する。