Dokumen ini membantu Anda mengoptimalkan goodput, yaitu kecepatan transfer data yang berguna untuk workload Anda. Untuk mencapai pengoptimalan ini, kami telah menyusun resep goodput yang dapat direproduksi yang menggunakan framework dan model machine learning (ML) umum. Untuk meninjau resep ini, lihat organisasi GitHub AI Hypercomputer. Resep goodput diuji pada cluster yang dibuat menggunakan Cluster Toolkit.
Untuk membantu memastikan keandalan workload yang optimal dan memaksimalkan goodput, Anda juga dapat secara proaktif mengidentifikasi node di cluster Google Kubernetes Engine (GKE) yang kemungkinan akan mengalami penurunan kualitas dalam lima jam ke depan. Peringatan awal ini membantu Anda menghindari penjadwalan workload baru pada VM yang berisiko, sehingga mengurangi risiko gangguan pada tugas Anda. Untuk mengetahui informasi selengkapnya, lihat Mengaktifkan prediksi kesehatan node.
Sebelum memulai
Sebelum menggunakan resep goodput dalam dokumen ini, selesaikan langkah-langkah berikut jika Anda belum melakukannya:
Resep
Resep goodput yang dapat direproduksi berikut tersedia untuk pelatihan awal di cluster GKE:
| Nama resep | Akselerator | Model | Framework | Jenis workload |
|---|---|---|---|---|
| Llama3.1 70B - A3 Mega | A3 Mega | Llama3.1 70B | NeMo | Pelatihan awal di GKE |
Langkah berikutnya
- Pelajari cara mengoptimalkan jaringan cluster menggunakan NCCL/gIB.