Terminologi

Istilah berikut berlaku untuk AI Hypercomputer.

Accelerator
Perangkat hardware khusus, seperti GPU atau TPU, yang dirancang untuk melakukan tugas tertentu, seperti workload machine learning, secara lebih efisien daripada prosesor tujuan umum.

Block
Kumpulan sub-blok yang saling terhubung oleh jaringan berkecepatan tinggi non-blok yang menyediakan bandwidth tinggi untuk semua mesin host di blok.

Cluster
Kumpulan blok yang saling terhubung oleh fabric jaringan berkecepatan tinggi. Setiap cluster bersifat unik secara global. Untuk mesin A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU), cluster menyediakan fabric jaringan non-blok umum untuk blok kapasitas akselerator Anda. Dalam cluster, komunikasi antar-node (traffic timur-barat ) tidak diblokir untuk seluruh kumpulan blok.

Clustered GPU
Kategori family mesin untuk GPU, termasuk A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU). Clustered GPU memungkinkan tim men-deploy dan menskalakan ribuan akselerator yang saling terhubung sebagai satu sistem yang terhubung erat menggunakan fabric jaringan khusus dan pemeliharaan yang disinkronkan. GPU ini ideal untuk workload yang memerlukan komputasi, memori, dan sinkronisasi jaringan berkecepatan tinggi yang ekstrem. Kasus penggunaan umum mencakup pra-pelatihan model dasar dengan triliunan parameter, penayangan model termutakhir, dan simulasi untuk penemuan obat.

Emergent maintenance
Terkadang disebut sebagai pemeliharaan darurat. Peristiwa pemeliharaan yang tidak direncanakan yang disebabkan oleh masalah hardware, software, atau keamanan yang penting. Untuk jenis mesin akselerator yang didukung, pemeliharaan darurat memberikan notifikasi lanjutan, bukan gangguan langsung. Notifikasi ini memberi Anda waktu untuk menghentikan workload secara normal dan secara opsional memicu perbaikan sebelum sistem menghentikan VM.

General GPU
Kategori family mesin GPU, termasuk G2, G4, A2, N1+T4, dan A3 Edge. General GPU memungkinkan tim men-deploy dan menskalakan akselerator NVIDIA dengan otonomi operasional lengkap, tanpa perlu melalui kompleksitas arsitektur cluster superkomputer terkoordinasi. GPU ini ideal untuk workload yang memprioritaskan ketersediaan tinggi, penyediaan layanan mandiri, dan penskalaan independen. Kasus penggunaan umum mencakup inferensi real-time, RAG, pembuatan prototipe, dan pelatihan model skala kecil hingga menengah.

Network fabric
Infrastruktur jaringan berkecepatan tinggi yang menyediakan bandwidth tinggi dan latensi rendah di semua blok dan Google Cloud layanan dalam cluster. Fabric menggunakan arsitektur jaringan Jupiter. Untuk mengoptimalkan performa, fabric menggunakan jaringan yang ditentukan software dan switch optik.

Node atau host
Satu mesin server fisik di pusat data. Setiap host memiliki resource komputasi terkait, seperti akselerator. Jumlah dan konfigurasi resource komputasi ini bergantung pada kelompok mesin. Instance Compute Engine disediakan di atas host fisik.

Domain NVLink, yang juga disebut sebagai sub-blok, adalah unit kapasitas inti untuk mesin A4X Max dan A4X. Domain NVLink terdiri dari 18 instance A4X Max atau A4X (72 GPU) yang terhubung oleh sistem NVLink multi-node.

Sub-block
Sekelompok host dan hardware konektivitas terkait yang berada di satu blok fisik. Dalam konteks mesin A4X Max dan A4X, sub-blok juga disebut sebagai domain NVLink.

Superblock
Pengelompokan fisik mesin yang saling terhubung dalam pusat data. Dengan menempatkan mesin di dalam superblock, Anda akan mendapatkan throughput jaringan ekstrem dan latensi sub-milidetik yang diperlukan untuk menjalankan workload pelatihan yang terhubung erat.

Informasi selengkapnya

Dokumen berikut memberikan penjelasan lebih lanjut tentang terminologi yang relevan dengan topik terkait: