Mode kapasitas TPU
TPU menawarkan dua mode kapasitas: mode kapasitas terkelola dan mode Semua Kapasitas. Setiap mode menentukan cara penanganan pemeliharaan hardware dan error host, serta tingkat visibilitas dan kontrol Anda terhadap topologi hardware TPU.
Ringkasan mode kapasitas TPU
Tabel berikut merangkum perbedaan utama antara mode kapasitas terkelola dan mode Semua Kapasitas:
| Mode kapasitas terkelola | Mode Semua Kapasitas | |
|---|---|---|
| Akses kapasitas | Google mengelola alokasi kapasitas dan pemulihan host di seluruh infrastruktur yang tersedia. | 100% kapasitas yang dipesan dapat diakses untuk workload. Anda bertanggung jawab mengelola kapasitas cadangan untuk pemulihan kegagalan. Anda dapat menargetkan blok atau sub-blok tertentu untuk penempatan workload yang presisi dan sesuai topologi. |
| Visibilitas topologi hardware | Compute Engine mengabstraksi topologi fisik. | Visibilitas penuh ke topologi dan pemanfaatan cluster, blok, sub-blok, dan host. |
| Pemulihan kesalahan | Compute Engine secara otomatis mendeteksi slice TPU yang rusak dan memulai ulang slice tersebut di hardware yang berfungsi dengan baik. | Google otomatis mendeteksi dan memperbaiki hardware yang rusak. Anda bertanggung jawab untuk memantau kondisi slice TPU dan menjadwalkan ulang slice yang tidak responsif ke hardware cadangan yang responsif yang Anda sisihkan dalam reservasi Anda. |
| Kontrol pemeliharaan | Compute Engine menjadwalkan dan mengelola peristiwa pemeliharaan. Anda dapat memulai pemeliharaan sebelum waktu pemeliharaan terjadwal. | Anda memiliki kontrol terperinci untuk menjadwalkan dan memulai pemeliharaan di tingkat reservasi, blok, atau sub-blok. |
| Versi TPU yang didukung | Semua versi TPU. | TPU v6e (Trillium) dan TPU7x (Ironwood) |
| Opsi pemakaian yang didukung | Semua opsi pemakaian. | Anda harus memiliki pemesanan untuk masa mendatang dengan ukuran kapasitas minimum selama satu tahun atau lebih. Pemesanan untuk masa mendatang dalam mode kalender tidak didukung. Hubungi Google Cloud tim akun Anda untuk mengetahui detailnya dan meminta reservasi mode Semua Kapasitas. |
Mode kapasitas terkelola
Secara default, kapasitas TPU beroperasi dalam mode kapasitas terkelola. Dalam mode ini, Compute Engine secara otomatis mendeteksi kesalahan hardware dan mengganti instance TPU yang terpengaruh untuk memastikan workload Anda dapat dimulai ulang di hardware yang berfungsi dengan baik.
Mode kapasitas terkelola memiliki fitur berikut:
- Pemulihan instance otomatis: Untuk opsi penggunaan reservasi, Flex-start, dan on-demand, Compute Engine secara otomatis mendeteksi kesalahan hardware dan mengganti instance TPU yang terpengaruh.
- Pengelolaan yang disederhanakan: Tidak memerlukan intervensi manual untuk operasi pemeliharaan atau perbaikan host.
Mode Semua Kapasitas
Mode Semua Kapasitas dirancang untuk memberi Anda kontrol langsung berbasis reservasi atas resource TPU. Dalam mode All Capacity, Anda memiliki akses ke 100% kapasitas yang dipesan. Anda bertanggung jawab untuk mengelola pemulihan slice TPU menggunakan kapasitas cadangan yang cukup dan sehat serta untuk menjadwalkan peristiwa pemeliharaan.
Semua mode Kapasitas memiliki fitur berikut:
- Alokasi kapasitas penuh: Akses semua kapasitas yang dicadangkan tanpa penahanan, termasuk kapasitas cadangan yang dialokasikan untuk pemulihan kegagalan atau lonjakan workload.
- Penempatan sesuai topologi: Dapatkan visibilitas penuh ke topologi cluster, blok, sub-blok, dan host untuk mengoptimalkan penempatan workload.
- Kontrol pemeliharaan lanjutan: Jadwalkan dan picu peristiwa pemeliharaan di tingkat reservasi, blok, atau sub-blok.
- Laporkan dan reparasi: Laporkan hardware berperforma rendah untuk direparasi.
Hubungi Google Cloud tim akun Anda untuk meminta reservasi mode Semua Kapasitas. Untuk mengetahui informasi selengkapnya, lihat Ringkasan mode Semua Kapasitas.