배포를 위한 네트워크 서비스

구성하는 네트워크 서비스는 선택한 배포 옵션 (VM 또는 클러스터) 및 인프라에 따라 다릅니다.

이 문서는 AI 하이퍼컴퓨터 배포를 위한 네트워크 서비스를 이해하려는 아키텍트, 네트워크 엔지니어, 개발자를 대상으로 합니다. 이 문서에서는 클라우드 네트워킹 및 분산 컴퓨팅 개념에 대한 기본적인 지식이 있다고 가정합니다. 배포 옵션에 대한 자세한 내용은 배포 옵션 개요를 참조하세요.

네트워크 아키텍처, 프로토콜, 하드웨어 토폴로지에 대한 자세한 내용은 GPU 네트워킹 개요를 참조하세요.

기본 구성으로 AI에 최적화된 GKE 배포를 위한 네트워킹

기본 설정으로 AI에 최적화된 GKE 클러스터를 만들면 Cluster Toolkit 청사진이 다음과 같이 네트워크를 구성합니다.

  • 청사진은 기본 VPC 네트워크를 기본 GKE 클러스터에 사용합니다.
  • 두 개의 추가 VPC를 만듭니다. 하나는 두 번째 호스트 네트워크 인터페이스 카드 (NIC)용이고 다른 하나는 GPU 간 원격 직접 메모리 액세스(RDMA) 트래픽용입니다.
  • 청사진은 사전 구성된 Google 관리형 네트워크 프로필을 GPU 트래픽에 사용되는 VPC에 적용합니다. 이 프로필은 고속 저지연 RDMA 성능을 위해 네트워크를 자동으로 구성합니다.
  • 청사진은 RDMA VPC 내에 8개(가속기 VM에 있는 8개의 RDMA NIC용으로 하나씩)의 전용 서브넷을 자동으로 생성합니다.
  • 클러스터 내 노드 간의 모든 TCP, UDP, ICMP 트래픽을 허용하는 방화벽 규칙을 구성합니다.

커스텀 구성으로 GKE 배포를 위한 네트워킹

커스텀 GKE 설정의 네트워크 구성은 워크로드 유형 및 인프라에 따라 다릅니다.

  • 일반 GPU 또는 비분산 워크로드의 경우 GPUDirect RDMA 없이 GKE 클러스터를 만듭니다. 이 구성은 모든 통신에 대해 단일 VPC 네트워크를 사용합니다.
  • 클러스터링된 GPU 또는 분산 워크로드의 경우 GPUDirect RDMA가 사용 설정된 GKE 클러스터를 만듭니다. 이 구성은 범용 트래픽과 고대역폭 GPU 간 통신을 분리하는 멀티 VPC 환경을 사용합니다.

Slurm 클러스터 배포를 위한 네트워킹

Cluster Toolkit을 사용하여 A4 또는 A3 Ultra 시리즈와 같은 맞춤설정 가능한 청사진을 통해 AI 및 ML 워크로드를 배포합니다.

클러스터링된 GPU Slurm 배포를 위해 청사진에서 구성하는 네트워크 구성요소는 다음과 같습니다.

  • 청사진은 세 개의 고유한 VPC를 만듭니다. Slurm 컨트롤 플레인을 위한 기본 VPC, 일반 호스트 수준 트래픽을 위한 보조 VPC, GPU 간 통신을 위한 전용 고성능 VPC입니다.
  • GPU 데이터 영역의 경우 청사진은 RoCE에 최적화된 사전 구성된 Google 관리형 네트워크 프로필을 적용합니다.
  • 청사진은 클러스터의 공유 /home 디렉터리를 제공하는 Filestore 서비스에 필요한 전용 IP 주소 범위를 설정합니다.
  • 클러스터 노드의 커스텀 VM 이미지를 빌드하는 프로세스 중에만 사용되는 격리된 임시 이미지 빌드 VPC를 만듭니다.

Compute Engine 인스턴스를 위한 네트워킹

Compute Engine을 사용하여 독립형 VM, 대량 컴퓨팅 인스턴스, 관리형 인스턴스 그룹 (MIG)을 만들 수 있습니다. 구체적인 네트워크 요구사항은 머신 유형의 인프라 모델에 따라 다릅니다.

  • 클러스터링된 GPU: 이러한 머신 시리즈 (A4X Max, A4X, A4, A3 Ultra, A3 Mega, 8개의 GPU가 있는 A3 High)는 일반 호스트 간 트래픽과 고대역폭 GPU 간 통신을 분리하기 위해 멀티 VPC 네트워크 구성이 필요합니다.
  • 일반 GPU: 이러한 머신 시리즈 (T4 또는 V100이 있는 G2, G4, A2, N1)는 모든 통신에 gVNIC 인터페이스를 통해 단일 VPC 아키텍처를 사용합니다. A3 Edge는 4개의 데이터 VPC와 GPUDirect-TCPX가 필요한 예외입니다.

머신 유형의 NIC 및 네트워크 구성에 대한 자세한 내용은 네트워킹 및 GPU 머신을 참조하세요.

다음 단계