액셀러레이터 인프라 선택

이 문서를 사용하여 소규모 프로토타입 제작, 실시간 추론, 대규모 분산 학습과 같은 수명 주기 단계에 따라 인공지능 (AI) 및 머신러닝 (ML) 워크로드에 최적화된 가속기 인프라를 식별하세요. AI 하이퍼컴퓨터는 가속기 제품을 두 가지 카테고리로 구성합니다. 일반 GPU클러스터링된 GPU.

GPU 인프라

AI 하이퍼컴퓨터는 두 가지 고유한 GPU 카테고리를 제공합니다. 각 카테고리에는 시스템이 수명 주기 이벤트를 처리하고, 유지보수를 관리하고, 워크로드의 네트워킹을 최적화하는 방법을 결정하는 고유한 관리 모델이 있습니다.

일반 GPU 관리 모델

일반 GPU 관리 모델은 리소스 독립성과 고가용성을 우선시하는 워크로드용으로 설계되었습니다. 이 모델은 표준 Google Cloud 관리 플레인을 사용하므로 Compute Engine 또는 GKE를 이미 사용 중인 팀에게 익숙한 환경을 제공합니다.

  • 유지보수: 비동기식입니다. 개별 인스턴스가 독립적으로 업데이트됩니다. 다중 노드 서빙 Fleet에서 한 노드의 유지보수 이벤트는 다른 노드의 가용성에 영향을 미치지 않으므로 전체 작업을 중단하지 않고 트래픽을 정상 노드로 리디렉션할 수 있습니다.

  • 주요 사용 사례: 슈퍼컴퓨팅 규모가 필요하지 않은 실시간 추론, 모델 서빙, 소규모 프로토타입 제작, 개발 환경과 같은 일반적인 작업에 권장됩니다.

일반 GPU 머신 시리즈

다음 머신 시리즈는 일반 GPU입니다.

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • N1+T4
  • A3 Edge
  • A3 High (GPU 1개, 2개 또는 4개)

각 일반 GPU 머신에 대한 기술 정보는 GPU 머신 유형을 참조하세요.

클러스터링된 GPU 관리 모델

클러스터링된 GPU 관리 모델은 대규모 분산 학습을 위해 설계된 슈퍼컴퓨팅급 환경입니다. 클러스터링된 GPU 스택을 사용하여 리소스가 단일의 긴밀하게 결합된 시스템으로 관리됩니다.

  • 유지보수: 조정됩니다. 이 모델은 긴밀하게 결합된 워크로드를 지원하기 위해 유지보수 이벤트를 조정합니다. 분산 학습의 경우 업데이트가 모든 노드에 동시에 적용되는 동기화된 유지보수를 사용할 수 있습니다. 이 접근 방식을 사용하면 노드 재시작으로 인해 작업이 중단되는 것을 방지하고 goodput 을 극대화할 수 있습니다. 이 모델은 90일 유지보수 알림도 제공합니다.

  • 주요 사용 사례: 수조 개의 매개변수가 있는 엑사스케일 기본 모델을 학습시키거나 신약 개발 및 단백질 접힘과 같은 복잡한 고성능 컴퓨팅 (HPC) 시뮬레이션을 실행하도록 설계되었습니다.

클러스터링된 GPU 머신 시리즈

다음 머신 시리즈는 클러스터링된 GPU입니다.

  • A4X
  • A4 (Blackwell)
  • A3 Ultra
  • A3 Mega
  • A3 High (GPU 8개)

각 클러스터링된 GPU 머신에 대한 기술 정보는 GPU 머신 유형을 참조하세요.

기능 매트릭스

일반 GPU 및 클러스터링된 GPU 관리 모델의 기술적 특성과 운영적 특성을 비교합니다.

특성 일반 GPU 관리 모델 클러스터링된 GPU 관리 모델
주요 사용 사례 추론, 모델 서빙, 프로토타입 제작, 개발 대규모 분산 학습 및 HPC
유지보수 비동기식: 독립적인 노드 업데이트를 통해 작업을 중단하지 않고 트래픽을 리디렉션할 수 있습니다. 조정됨: 클러스터 전체의 조정된 (동기화된) 업데이트를 지원하여 노드를 동기화하고 goodput을 극대화합니다.
타겟 하드웨어 G2 (L4), G4 (RTX PRO 6000), A2 (A100), N1+T4, A3 Edge, A3 High (GPU 1개, 2개 또는 4개) A4X, A4 (Blackwell), A3 Ultra, A3 Mega, A3 High (GPU 8개)
네트워킹 gVNIC 인터페이스를 통한 표준 VPC 네트워킹 (여러 VPC에서 GPUDirect-TCPX를 사용하는 A3 Edge 제외) 특수 지연 시간이 짧은 패브릭 (RDMA, RoCE, TCPX 또는 NVIDIA NVLink)
관리 스택 표준 Google Cloud 플레인 (Compute Engine 또는 GKE) 특수 관리 스택 (예: Cluster Director)
안정성 표준 노드 자동 복구 및 포드 수준 가동시간 특수 리소스 및 복구 제품군

의사 결정 매트릭스

이 매트릭스를 사용하여 특정 워크로드 의도에 맞는 하드웨어 계열을 식별하세요.

워크로드에 다음이 포함된 경우... 권장 GPU 인프라 권장 머신 시리즈
프로토타입 제작 및 개발 일반 GPU G2, G4, A2, N1+T4, A3 Edge
실시간 추론(매개변수 1,000억 미만) 일반 GPU G2, G4, A2, N1+T4, A3 Edge
여러 GPU에서 추론 클러스터링된 GPU A3, A4
대규모 학습 및 추론 클러스터링된 GPU A4, A3 시리즈
대규모 학습(매개변수 5,000억 초과) 및 분리된 추론 클러스터링된 GPU A4X Max, A4X, A4

모델 아키텍처를 하드웨어에 직접 매핑하는 자세한 의사 결정 트리는 가속기 선택을 참조하세요.

이러한 기본 기준을 설정한 후 조정 플랫폼을 선택합니다. 이 선택은 자동 관리 또는 운영체제 및 드라이버에 대한 세부적인 제어를 선호하는 팀의 선호도에 따라 달라집니다.

다음 단계