In diesem Dokument erfahren Sie, wie Sie den Goodput, die Rate der übertragenen Nutzdaten , für Ihre Arbeitslasten optimieren. Zu diesem Zweck haben wir reproduzierbare Goodput-Rezepte zusammengestellt, die gängige Frameworks und Modelle für maschinelles Lernen (ML) verwenden. Diese Rezepte finden Sie in der GitHub-Organisation AI Hypercomputer. Die Goodput-Rezepte wurden auf Clustern getestet, die mit dem Cluster Toolkit erstellt wurden.
Um die Zuverlässigkeit von Arbeitslasten zu optimieren und den Goodput zu maximieren, können Sie auch proaktiv Knoten in einem Google Kubernetes Engine-Cluster (GKE-Cluster) identifizieren, bei denen die Leistung in den nächsten fünf Stunden wahrscheinlich nachlassen wird. Diese Frühwarnung hilft Ihnen, neue Arbeitslasten nicht auf gefährdeten VMs zu planen, wodurch das Risiko von Unterbrechungen Ihrer Jobs verringert wird. Weitere Informationen finden Sie unter Knoten-Systemdiagnose aktivieren.
Hinweis
Führen Sie die folgenden Schritte aus, bevor Sie die Goodput-Rezepte in diesem Dokument verwenden, falls Sie dies noch nicht getan haben:
Wählen Sie einen Beschleuniger aus, der am besten zu Ihrer Arbeitslast passt.
Wählen Sie eine Verbrauchsmethode basierend auf dem ausgewählten Beschleuniger aus.
Rezepte
Die folgenden reproduzierbaren Goodput-Rezepte sind für das Vortraining auf GKE-Clustern verfügbar:
| Name des Rezepts | Beschleuniger | Modell | Framework | Arbeitslasttyp |
|---|---|---|---|---|
| Llama3.1 70B – A3 Mega | A3 Mega | Llama3.1 70B | NeMo | Vortraining in der GKE |
Nächste Schritte
- Informationen zum Optimieren von Cluster-Netzwerken mit NCCL/gIB