클러스터링된 GPU는 대규모 분산 학습, 멀티 호스트 추론, 복잡한 고성능 컴퓨팅 (HPC) 작업을 우선시하는 인공지능 (AI) 및 머신러닝 (ML) 워크로드에 최적화되어 있습니다.
클러스터링된 GPU를 사용하면 팀이 특수 네트워킹 패브릭과 동기화된 유지보수를 사용하여 수천 개의 상호 연결된 액셀러레이터를 단일의 긴밀하게 결합된 시스템으로 배포하고 확장할 수 있습니다. 이는 극도의 컴퓨팅, 메모리, 고속 네트워킹 동기화가 필요한 워크로드에 적합합니다. 일반적인 사용 사례로는 수조 개의 매개변수가 포함된 파운데이션 모델 사전 학습, 프런티어 모델 서빙, 신약 개발 시뮬레이션 등이 있습니다.
클러스터링된 GPU의 주요 특성
- 동기화된 유지보수: Google Cloud 클러스터의 모든 노드를 동시에 업데이트하여 단일 노드 재시작으로 인해 작업이 중단되지 않도록 합니다.
- 자동화된 상태 모니터링: 시스템이 사전에 지연되는 노드를 식별하고 하드웨어 오류 또는 자동 데이터 손상을 모니터링합니다.
- 사전 노드 교체: 시스템이 예비 풀에서 정상적인 머신의 성능이 저하된 VM을 제거하고 재예약합니다.
- 레일 정렬 토폴로지: 레일 정렬 토폴로지는 GPU 간 트래픽을 표준 호스트 통신과 격리하여 지터 없는 성능을 보장합니다. 대규모 멀티 노드 조정
- 고급 프로토콜: 이러한 머신 시리즈는 GPUDirect RDMA (RoCE 기반)를 비롯한 고대역폭 상호 연결을 지원합니다.
클러스터링된 GPU 제품군 및 기술 사양
이 표에서 프리미엄 클러스터링된 GPU 머신 시리즈의 워크로드 및 하드웨어 사양을 검토하세요. 엑사스케일 학습에는 A4X 또는 A3 Ultra 시리즈를 사용하세요.
A4X Max 및 A4X 시리즈
대규모 엑사스케일 파운데이션 모델을 학습하거나 매우 복잡한 베어메탈 고성능 컴퓨팅 (HPC) 시뮬레이션을 실행하는 경우 A4X Max 또는 A4X 머신 시리즈를 사용하세요. 이러한 시리즈는 극도의 컴퓨팅 및 메모리 요구사항을 처리하기 위해 NVIDIA GB300 Grace Blackwell Ultra Superchips를 제공합니다.
A4X Max (베어메탈)
A4X Max
머신 유형은 NVIDIA GB300 Grace Blackwell Ultra Superchips (nvidia-gb300)를 사용하며
파운데이션 모델 학습과 서빙에 적합합니다. A4X Max 머신 유형은
베어메탈 인스턴스로 제공됩니다.
A4X Max는 NVIDIA GB300 NVL72를 기반으로 하는 엑사스케일 플랫폼입니다. 각 머신에는 Arm Neoverse V2 코어가 있는 NVIDIA Grace CPU가 있는 소켓이 2개 있습니다. 이러한 CPU는 고속 칩 간 (NVLink-C2C) 통신을 통해 NVIDIA B300 Blackwell GPU 4개에 연결됩니다.
| 연결된 NVIDIA GB300 Grace Blackwell Ultra Superchips | |||||||
|---|---|---|---|---|---|---|---|
| 머신 유형 | vCPU 수1 | 인스턴스 메모리(GB) | 연결된 로컬 SSD(GiB) | 물리적 NIC 수 | 최대 네트워크 대역폭(Gbps)2 | GPU 수 | GPU 메모리3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12,000 | 6 | 3,600 | 4 | 1,116 |
1vCPU는 사용 가능한
CPU 플랫폼 중 하나에서 단일 하드웨어 하이퍼 스레드로 구현됩니다.
2 최대 이그레스 대역폭은 지정된 수를 초과할 수 없습니다. 실제 이그레스 대역폭은 대상 IP 주소와 기타 요인에 따라 다릅니다.
네트워크 대역폭에 대한 자세한 내용은 네트워크 대역폭을 참조하세요.
3GPU 메모리는 임시 데이터 스토리지에 사용할 수 있는 GPU 기기의 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 그래픽 집약적인 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.
A4X
A4X
머신 유형은 NVIDIA GB200 Grace Blackwell Superchips (nvidia-gb200)를 사용하며
파운데이션 모델 학습과 서빙에 적합합니다.
A4X는 NVIDIA GB200 NVL72를 기반으로 하는 엑사스케일 플랫폼입니다. 각 머신에는 Arm Neoverse V2 코어가 있는 NVIDIA Grace CPU가 있는 소켓이 2개 있습니다. 이러한 CPU는 고속 칩 간 (NVLink-C2C) 통신을 통해 NVIDIA B200 Blackwell GPU 4개에 연결됩니다.
| 연결된 NVIDIA GB200 Grace Blackwell Superchips | |||||||
|---|---|---|---|---|---|---|---|
| 머신 유형 | vCPU 수1 | 인스턴스 메모리(GB) | 연결된 로컬 SSD(GiB) | 물리적 NIC 수 | 최대 네트워크 대역폭(Gbps)2 | GPU 수 | GPU 메모리3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12,000 | 6 | 2,000 | 4 | 744 |
1vCPU는 사용 가능한
CPU 플랫폼 중 하나에서 단일 하드웨어 하이퍼 스레드로 구현됩니다.
2 최대 이그레스 대역폭은 지정된 수를 초과할 수 없습니다. 실제 이그레스 대역폭은 대상 IP 주소와 기타 요인에 따라 다릅니다.
네트워크 대역폭에 대한 자세한 내용은 네트워크 대역폭을 참조하세요.
3GPU 메모리는 임시 데이터 스토리지에 사용할 수 있는 GPU 기기의 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 그래픽 집약적인 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.
A4 시리즈
대규모 병렬 처리 규모가 필요한 최첨단 파운데이션 모델을 학습하는 것이 목표라면 A4 머신 시리즈를 사용하여 처리 시간을 최적화하고 하드웨어 처리량을 극대화하세요.
A4
머신 유형에는
NVIDIA B200 Blackwell GPU
(nvidia-b200)가 연결되어 있으며 파운데이션 모델
학습과 서빙에 적합합니다.
| 연결된 NVIDIA B200 Blackwell GPU | |||||||
|---|---|---|---|---|---|---|---|
| 머신 유형 | vCPU 수1 | 인스턴스 메모리(GB) | 연결된 로컬 SSD(GiB) | 물리적 NIC 수 | 최대 네트워크 대역폭(Gbps)2 | GPU 수 | GPU 메모리3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3,968 | 12,000 | 10 | 3,600 | 8 | 1,440 |
1vCPU는 사용 가능한 CPU 플랫폼 중 하나에서 단일 하드웨어 하이퍼 스레드로 구현됩니다.
2 최대 이그레스 대역폭은 지정된 수를 초과할 수 없습니다. 실제 이그레스 대역폭은 대상 IP 주소와 기타 요인에 따라 다릅니다.
네트워크 대역폭에 대한 자세한 내용은 네트워크 대역폭을 참조하세요.
3GPU 메모리는 임시 데이터 스토리지에 사용할 수 있는 GPU 기기의 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 그래픽 집약적인 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.
A3 시리즈 (GPU가 8개인 Ultra, Mega, High)
대규모 분산 학습 실행을 실행하거나 대규모 데이터세트 테이블이 있는 여러 호스트에서 프런티어 모델을 제공해야 하는 경우 A3 머신 시리즈를 사용하여 호스트 간 네트워크 지연 시간을 최소화하세요.
A3 Ultra
| 연결된 NVIDIA H200 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 머신 유형 | vCPU 수1 | 인스턴스 메모리(GB) | 연결된 로컬 SSD(GiB) | 물리적 NIC 수 | 최대 네트워크 대역폭(Gbps)2 | GPU 수 | GPU 메모리3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2,952 | 12,000 | 10 | 3,600 | 8 | 1128 |
A3 Mega
| 연결된 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 머신 유형 | vCPU 수1 | 인스턴스 메모리(GB) | 연결된 로컬 SSD(GiB) | 물리적 NIC 수 | 최대 네트워크 대역폭(Gbps)2 | GPU 수 | GPU 메모리3 (GB HBM3) |
a3-megagpu-8g |
208 | 1,872 | 6,000 | 9 | 1,800 | 8 | 640 |
A3 High
| 연결된 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 머신 유형 | vCPU 수1 | 인스턴스 메모리(GB) | 연결된 로컬 SSD(GiB) | 물리적 NIC 수 | 최대 네트워크 대역폭(Gbps)2 | GPU 수 | GPU 메모리3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3,000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6,000 | 5 | 1,000 | 8 | 640 |
1vCPU는 사용 가능한 CPU 플랫폼 중 하나에서 단일 하드웨어 하이퍼 스레드로 구현됩니다.
2 최대 이그레스 대역폭은 지정된 수를 초과할 수 없습니다. 실제 이그레스 대역폭은 대상 IP 주소와 기타 요인에 따라 다릅니다.
네트워크 대역폭에 대한 자세한 내용은 네트워크 대역폭을 참조하세요.
3GPU 메모리는 임시 데이터 스토리지에 사용할 수 있는 GPU 기기의 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 그래픽 집약적인 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.
용량 확보
클러스터링된 GPU의 컴퓨팅 용량을 확보하려면 고성능 액셀러레이터의 수요와 공급을 관리하기 위한 조정이 필요합니다. 이러한 리소스는 특수 네트워킹 패브릭 내에 물리적으로 위치하므로 관리형 워크플로를 통해 요청해야 합니다.
계정팀을 통해 용량을 예약하거나 미래용 예약 및 동적 워크로드 스케줄러를 사용할 수 있습니다.
다음 단계
- 용량을 확보하는 방법을 알아보려면 소비 옵션을 참조하세요.
- 인프라 요구사항을 평가하려면 인프라 선택을 참조하세요.
- 네트워크 토폴로지를 계획하려면 클러스터링된 환경의 GPU 네트워킹 요구사항을 참조하세요.
- 컴퓨팅 리소스를 예약하려면 용량 예약을 참조하세요.