일반 GPU 개요

일반 GPU는 운영 유연성, 리소스 독립성, 비용 효율성을 우선시하는 인공지능 (AI) 및 머신러닝 (ML) 워크로드에 최적화되어 있습니다.

일반 GPU를 사용하면 팀에서 완전한 운영 자율성을 가지고 NVIDIA 액셀러레이터를 배포하고 확장하여 조정된 슈퍼컴퓨팅 클러스터의 아키텍처 복잡성을 우회할 수 있습니다. 고가용성, 셀프 서비스 프로비저닝, 독립적인 확장성을 우선시하는 워크로드에 적합합니다. 일반적인 사용 사례로는 실시간 추론, RAG, 프로토타입 제작, 중소 규모 모델 학습이 있습니다.

일반 GPU의 주요 특징

  • 운영 유연성: 표준 GKE (Autopilot 및 Standard) 및 Compute Engine 인터페이스를 사용하여 리소스를 관리하여 배포 및 확장을 간소화할 수 있습니다.
  • 고가용성: Google Cloud 한 노드의 업데이트가 다른 노드의 가용성에 영향을 미치지 않도록 개별 인스턴스를 독립적으로 업데이트하여 부하 분산기가 Fleet 제공을 중단하지 않고 트래픽을 리디렉션할 수 있습니다.
  • 간단한 네트워킹: 워크로드가 표준 가상 프라이빗 클라우드 (VPC) 서비스와 Google 가상 NIC (gVNIC) 인터페이스를 통한 표준 TCP/IP를 사용하여 복잡한 하드웨어 수준 패브릭을 제거합니다.
  • 비용 최적화: 내결함성 연구에 스팟 VM을 사용하여 표준 주문형 요금에 비해 최대 90% 의 비용을 절감할 수 있습니다.
  • 셀프서비스 획득: 계정팀에서 관리하는 워크플로 없이 표준 예약 및 주문형 요청을 통해 직접 용량을 확보할 수 있습니다.

일반 GPU 제품군 및 기술 사양

일반 GPU 머신 시리즈의 워크로드 및 하드웨어 사양을 검토합니다. 처리량이 많은 서빙에는 A3 Edge 시리즈를 사용하세요.

A3 시리즈 (GPU가 1개, 2개 또는 4개인 High 및 Edge)

A3 High (GPU 1개, 2개 또는 4개)

높은 성능이 필요하지만 전체 8 GPU 동기화 클러스터가 필요하지 않은 추론 또는 표준 학습 워크로드를 실행하는 경우 GPU가 1개, 2개 또는 4개 연결된 A3 High 머신 시리즈를 사용하세요.

A3 High 머신 유형에는 NVIDIA H100 SXM GPU가 있으며 대규모 모델 추론과 모델 미세 조정 모두에 적합합니다.

연결된 NVIDIA H100 GPU
머신 유형 vCPU 수1 인스턴스 메모리(GB) 연결된 로컬 SSD(GiB) 물리적 NIC 수 최대 네트워크 대역폭(Gbps)2 GPU 수 GPU 메모리3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1,500 1 50 2 160
a3-highgpu-4g 104 936 3,000 1 100 4 320
a3-highgpu-8g 208 1,872 6,000 5 1,000 8 640

1vCPU는 사용 가능한 CPU 플랫폼 중 하나에서 단일 하드웨어 하이퍼 스레드로 구현됩니다.
2 최대 이그레스 대역폭은 지정된 수를 초과할 수 없습니다. 실제 이그레스 대역폭은 대상 IP 주소와 기타 요인에 따라 다릅니다. 네트워크 대역폭에 대한 자세한 내용은 네트워크 대역폭을 참조하세요.
3GPU 메모리는 임시 데이터 스토리지에 사용할 수 있는 GPU 기기의 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 그래픽 집약적인 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.

A3 Edge

조정된 클러스터 패브릭 없이 여러 호스트에서 높은 처리량의 분산 추론 워크로드를 실행하는 경우 A3 Edge 시리즈를 사용하여 표준 가상 사설망을 통한 배포를 간소화하세요.

A3 Edge 머신 유형에는 NVIDIA H100 SXM GPU가 있으며 이 머신 유형은 서빙 전용으로 설계되었고 제한된 리전 집합에서 사용 가능합니다.

연결된 NVIDIA H100 GPU
머신 유형 vCPU 수1 인스턴스 메모리(GB) 연결된 로컬 SSD(GiB) 물리적 NIC 수 최대 네트워크 대역폭(Gbps)2 GPU 수 GPU 메모리3
(GB HBM3)
a3-edgegpu-8g 208 1,872 6,000 5
  • 600: asia-south1 및 northamerica-northeast2
  • 400: 기타 모든 A3 Edge 리전
8 640

A2 시리즈 (Standard 및 Ultra)

고성능 단일 노드 모델 서빙 또는 소규모 모델 미세 조정이 필요한 경우 A2 머신 시리즈를 사용하여 전용 NVIDIA A100 GPU 리소스에 액세스하세요.

A2 울트라

연결된 NVIDIA A100 80GB GPU
머신 유형 vCPU 수1 인스턴스 메모리(GB) 연결된 로컬 SSD(GiB) 최대 네트워크 대역폭(Gbps)2 GPU 수 GPU 메모리3
(GB HBM2e)
a2-ultragpu-1g 12 170 375 24 1 80
a2-ultragpu-2g 24 340 750 32 2 160
a2-ultragpu-4g 48 680 1,500 50 4 320
a2-ultragpu-8g 96 1,360 3,000 100 8 640

1vCPU는 사용 가능한 CPU 플랫폼 중 하나에서 단일 하드웨어 하이퍼 스레드로 구현됩니다.
2 최대 이그레스 대역폭은 지정된 수를 초과할 수 없습니다. 실제 이그레스 대역폭은 대상 IP 주소와 기타 요인에 따라 다릅니다. 네트워크 대역폭에 대한 자세한 내용은 네트워크 대역폭을 참조하세요.
3GPU 메모리는 임시 데이터 스토리지에 사용할 수 있는 GPU 기기의 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 그래픽 집약적인 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.

A2 표준

연결된 NVIDIA A100 40GB GPU
머신 유형 vCPU 수1 인스턴스 메모리(GB) 지원되는 로컬 SSD 최대 네트워크 대역폭(Gbps)2 GPU 수 GPU 메모리3
(GB HBM2)
a2-highgpu-1g 12 85 24 1 40
a2-highgpu-2g 24 170 32 2 80
a2-highgpu-4g 48 340 50 4 160
a2-highgpu-8g 96 680 100 8 320
a2-megagpu-16g 96 1,360 100 16 640

1vCPU는 사용 가능한 CPU 플랫폼 중 하나에서 단일 하드웨어 하이퍼 스레드로 구현됩니다.
2 최대 이그레스 대역폭은 지정된 수를 초과할 수 없습니다. 실제 이그레스 대역폭은 대상 IP 주소와 기타 요인에 따라 다릅니다. 네트워크 대역폭에 대한 자세한 내용은 네트워크 대역폭을 참조하세요.
3GPU 메모리는 임시 데이터 스토리지에 사용할 수 있는 GPU 기기의 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 그래픽 집약적인 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.

G4 시리즈

팀에 비용 효율적인 엔트리급 추론 또는 표준 그래픽 렌더링 워크로드가 필요한 경우 NVIDIA RTX PRO 6000 GPU가 탑재된 G4 머신 시리즈를 사용하세요.

G4 머신 유형은 NVIDIA RTX PRO 6000 Blackwell 서버 에디션 GPU (nvidia-rtx-pro-6000)를 사용하며 NVIDIA Omniverse 시뮬레이션 워크로드, 그래픽 집약적 애플리케이션, 동영상 트랜스코딩, 가상 데스크톱에 적합합니다. 또한 G4 머신 유형은 A 시리즈 머신 유형에 비해 단일 호스트 추론 및 모델 조정을 수행할 수 있는 저비용 솔루션을 제공합니다.

연결된 NVIDIA RTX PRO 6000 GPU
머신 유형 vCPU 수1 인스턴스 메모리(GB) 지원되는 최대 티타늄 SSD(GiB)2 물리적 NIC 수 최대 네트워크 대역폭(Gbps)3 GPU 수 GPU 메모리4
(GB GDDR7)
g4-standard-6 6 22 0 1 20 1/8 12
g4-standard-12 12 45 375 1 20 1/4 24
g4-standard-24 24 90 750 1 20 1/2 48
g4-standard-48 48 180 1,500 1 50 1 96
g4-standard-96 96 360 3,000 1 100 2 192
g4-standard-192 192 720 6,000 1 200 4 384
g4-standard-384 384 1,440 12,000 2 400 8 768

*GPU 메모리는 데이터의 임시 저장에 사용할 수 있는 GPU 기기에서 사용 가능한 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 머신러닝 및 그래픽 집약적인 워크로드와 같은 가속화된 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.

G2 시리즈

일반적인 실시간 추론 애플리케이션 또는 검색 증강 생성 (RAG) 파이프라인을 배포하는 경우 G2 머신 시리즈를 사용하여 NVIDIA L4 GPU로 성능과 비용 효율성을 균형 있게 유지하세요.

연결된 NVIDIA L4 GPU
머신 유형 vCPU 수1 기본 인스턴스 메모리(GB) 커스텀 인스턴스 메모리 범위(GB) 지원되는 최대 로컬 SSD(GiB) 최대 네트워크 대역폭(Gbps)2 GPU 수 GPU 메모리3(GB GDDR6)
g2-standard-4 4 16 16~32 375 10 1 24
g2-standard-8 8 32 32~54 375 16 1 24
g2-standard-12 12 48 48~54 375 16 1 24
g2-standard-16 16 64 54~64 375 32 1 24
g2-standard-24 24 96 96~108 750 32 2 48
g2-standard-32 32 128 96~128 375 32 1 24
g2-standard-48 48 192 192~216 1,500 50 4 96
g2-standard-96 96 384 384~432 3,000 100 8 192

1vCPU는 사용 가능한 CPU 플랫폼 중 하나에서 단일 하드웨어 하이퍼 스레드로 구현됩니다.
2 최대 이그레스 대역폭은 지정된 수를 초과할 수 없습니다. 실제 이그레스 대역폭은 대상 IP 주소와 기타 요인에 따라 다릅니다. 네트워크 대역폭에 대한 자세한 내용은 네트워크 대역폭을 참조하세요.
3GPU 메모리는 임시 데이터 스토리지에 사용할 수 있는 GPU 기기의 메모리입니다. 인스턴스의 메모리와는 별개이며 특히 그래픽 집약적인 워크로드의 더 높은 대역폭 수요를 처리하도록 설계되었습니다.

N1 시리즈 (NVIDIA T4 또는 V100)

비용에 민감한 실험을 하거나 동시성이 낮은 엔트리 레벨 추론을 실행하는 것이 우선이라면 N1 머신 시리즈를 사용하여 NVIDIA T4 또는 V100 GPU를 연결하세요.

NVIDIA T4

가속기 유형 GPU 수 GPU 메모리1(GB GDDR6) vCPU 수 인스턴스 메모리(GB) 지원되는 로컬 SSD
nvidia-tesla-t4 또는
nvidia-tesla-t4-vws
1 16 1~48 1~312
2 32 1~48 1~312
4 64 1~96 1~624

NVIDIA V100

가속기 유형 GPU 수 GPU 메모리1(GB HBM2) vCPU 수 인스턴스 메모리(GB) 지원되는 로컬 SSD2
nvidia-tesla-v100 1 16 1~12 1~78
2 32 1~24 1~156
4 64 1~48 1~312
8 128 1~96 1~624

용량 획득

일반 GPU 가속기는 표준 셀프 서비스 프로비저닝을 사용합니다. 표준 예약, 온디맨드 요청 또는 스팟 VM을 통해 용량을 확보할 수 있습니다. 주문형 용량은 품절될 수 있으므로 가능한 경우 스팟 VM 또는 Flex-start를 사용하세요.

다음 단계