Goodput-Optimierungsschemas

In diesem Dokument erfahren Sie, wie Sie den Goodput, die Rate der übertragenen Nutzdaten , für Ihre Arbeitslasten optimieren. Zu diesem Zweck haben wir reproduzierbare Goodput-Rezepte zusammengestellt, die gängige Frameworks und Modelle für maschinelles Lernen (ML) verwenden. Diese Rezepte finden Sie in der GitHub-Organisation AI Hypercomputer. Die Goodput-Rezepte wurden auf Clustern getestet, die mit dem Cluster Toolkit erstellt wurden.

Um die Zuverlässigkeit von Arbeitslasten zu optimieren und den Goodput zu maximieren, können Sie auch proaktiv Knoten in einem Google Kubernetes Engine-Cluster (GKE-Cluster) identifizieren, bei denen die Leistung in den nächsten fünf Stunden wahrscheinlich nachlassen wird. Diese Frühwarnung hilft Ihnen, neue Arbeitslasten nicht auf gefährdeten VMs zu planen, wodurch das Risiko von Unterbrechungen Ihrer Jobs verringert wird. Weitere Informationen finden Sie unter Knoten-Systemdiagnose aktivieren.

Hinweis

Führen Sie die folgenden Schritte aus, bevor Sie die Goodput-Rezepte in diesem Dokument verwenden, falls Sie dies noch nicht getan haben:

  1. Wählen Sie einen Beschleuniger aus, der am besten zu Ihrer Arbeitslast passt.

  2. Wählen Sie eine Verbrauchsmethode basierend auf dem ausgewählten Beschleuniger aus.

  3. Cluster erstellen

Rezepte

Die folgenden reproduzierbaren Goodput-Rezepte sind für das Vortraining auf GKE-Clustern verfügbar:

Name des Rezepts Beschleuniger Modell Framework Arbeitslasttyp
Llama3.1 70B – A3 Mega A3 Mega Llama3.1 70B NeMo Vortraining in der GKE

Nächste Schritte