TPU 용량 모드
TPU는 관리형 용량 모드와 모든 용량 모드라는 두 가지 용량 모드를 제공합니다. 각 모드는 하드웨어 유지보수 및 호스트 오류가 처리되는 방식과 TPU 하드웨어 토폴로지에 대한 가시성 및 제어 수준을 정의합니다.
TPU 용량 모드 개요
다음 표에는 관리형 용량 모드와 모든 용량 모드의 주요 차이점이 요약되어 있습니다.
| 관리형 용량 모드 | 모든 용량 모드 | |
|---|---|---|
| 용량 액세스 | Google은 사용 가능한 인프라 전반에서 용량 할당 및 호스트 복구를 관리합니다. | 예약된 용량의 100% 를 워크로드에 액세스할 수 있습니다. 장애 복구를 위한 예비 용량 관리는 사용자의 책임입니다. 정확한 토폴로지 인식 워크로드 배치를 위해 특정 블록 또는 하위 블록을 타겟팅할 수 있습니다. |
| 하드웨어 토폴로지 공개 상태 | Compute Engine은 물리적 토폴로지를 추상화합니다. | 클러스터, 블록, 하위 블록, 호스트 토폴로지 및 사용률을 완전히 파악할 수 있습니다. |
| 오류 복구 | Compute Engine은 결함이 있는 TPU 슬라이스를 자동으로 감지하고 정상 하드웨어에서 다시 시작합니다. | Google은 결함이 있는 하드웨어를 자동으로 감지하고 복구합니다. TPU 슬라이스 상태를 모니터링하고 비정상 슬라이스를 예약 시 확보한 정상 예비 하드웨어로 다시 예약하는 것은 사용자의 책임입니다. |
| 유지보수 관리 | Compute Engine은 유지보수 이벤트를 예약하고 관리합니다. 원하는 경우 예약된 유지보수 시간 전에 유지보수를 시작할 수 있습니다. | 예약, 블록 또는 하위 블록 수준에서 유지보수를 예약하고 시작할 수 있는 세부적인 제어 기능이 있습니다. |
| 지원되는 TPU 버전 | 모든 TPU 버전 | TPU v6e (Trillium) 및 TPU7x (Ironwood) |
| 지원되는 소비 옵션 | 모든 소비 옵션 | 최소 용량 크기가 1년 이상인 미래용 예약이 있어야 합니다. 캘린더 모드의 미래용 예약은 지원되지 않습니다. Google Cloud 계정팀에 문의하여 자세한 내용을 확인하고 모든 용량 모드 예약을 요청하세요. |
관리형 용량 모드
기본적으로 TPU 용량은 관리형 용량 모드로 작동합니다. 이 모드에서 Compute Engine은 하드웨어 오류를 자동으로 감지하고 영향을 받는 TPU 인스턴스를 교체하여 워크로드가 정상 하드웨어에서 다시 시작될 수 있도록 합니다.
관리형 용량 모드에는 다음과 같은 기능이 있습니다.
- 자동 인스턴스 복구: 주문형, Flex-start, 예약 소비 옵션의 경우 Compute Engine이 하드웨어 오류를 자동으로 감지하고 영향을 받는 TPU 인스턴스를 교체합니다.
- 간소화된 관리: 호스트 유지보수 또는 복구 작업을 위해 수동으로 개입할 필요가 없습니다.
모든 용량 모드
모든 용량 모드는 TPU 리소스를 예약 기반으로 직접 제어할 수 있도록 설계되었습니다. 모든 용량 모드에서는 예약된 용량의 100% 에 액세스할 수 있습니다. 충분한 정상 예비 용량을 사용하여 TPU 슬라이스 복구를 관리하고 유지보수 이벤트를 예약할 책임은 사용자에게 있습니다.
모든 용량 모드에는 다음과 같은 기능이 있습니다.
- 전체 용량 할당: 장애 복구 또는 워크로드 버스팅을 위해 할당된 예비 용량을 포함하여 예약된 모든 용량에 제한 없이 액세스합니다.
- 토폴로지 인식 배치: 클러스터, 블록, 하위 블록, 호스트 토폴로지를 완전히 파악하여 워크로드 배치를 최적화합니다.
- 고급 유지보수 제어: 예약, 블록 또는 하위 블록 수준에서 유지보수 이벤트를 예약하고 트리거합니다.
- 보고 및 수리: 실적이 저조한 하드웨어를 수리하도록 보고합니다.
Google Cloud 계정팀에 문의하여 모든 용량 모드 예약을 요청하세요. 자세한 내용은 모든 용량 모드 개요를 참조하세요.