Fleet 전체 용량 모니터링
Fleet 전체 용량 측정항목은 전체 TPU Fleet의 상태, 가용성, 효율성에 관한 주요 정보를 제공합니다. 용량 측정항목을 사용하여 최적화 기회를 파악하고, 리소스 할당을 개선하고, 워크로드 성능을 향상할 수 있습니다.
측정항목
다음과 같은 Fleet 전체 용량 측정항목은 compute.googleapis.com 네임스페이스에서 사용할 수 있습니다. 또한 특정 시점에 Fleet 전체 사용량과 효율성을 측정하는 Fleet 전체
용량 측정항목을 사용하는
파생 용량 측정항목의 빌딩 블록 역할도 합니다.
약정된 칩 수
약정된 칩 수(compute.googleapis.com/tpu/slice/capacity/committed_chips)는 예약에서 현재 구매한 TPU 칩 수를 나타냅니다.
| 라벨 | 유형 | 설명 | 값 |
|---|---|---|---|
accelerator_type |
문자열 | 가속기 유형 및 세대입니다. | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
문자열 | 물리적 머신 예약의 ID입니다. | <String> |
provisioning_model |
문자열 | 연결된 프로비저닝 모델입니다. | [RESERVED, ON-DEMAND] |
protection_tier |
문자열 | 연결된 보호 모델입니다. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | 칩이 모든 용량 모드 예약 (확장 예약)의 일부인지 여부입니다. | [TRUE, FALSE] |
block_id |
문자열 | 연결된 슬라이스의 블록 ID입니다. | <String> |
subblock_id |
문자열 | 연결된 슬라이스의 하위 블록 ID입니다. | <String> |
사용 가능한 칩 수
사용 가능한 칩 수(compute.googleapis.com/tpu/slice/capacity/available_chips)는 예약에서 현재 사용 가능하고 사용할 준비가 된 TPU 칩 수를 나타냅니다.
| 라벨 | 유형 | 설명 | 값 |
|---|---|---|---|
accelerator_type |
문자열 | 가속기 유형 및 세대입니다. | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
문자열 | 물리적 머신 예약의 ID입니다. | <String> |
provisioning_model |
문자열 | 연결된 프로비저닝 모델입니다. | [RESERVED, ON-DEMAND] |
protection_tier |
문자열 | 연결된 보호 모델입니다. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | 칩이 모든 용량 모드 예약 (확장 예약)의 일부인지 여부입니다. | [TRUE, FALSE] |
block_id |
문자열 | 연결된 슬라이스의 블록 ID입니다. | <String> |
subblock_id |
문자열 | 연결된 슬라이스의 하위 블록 ID입니다. | <String> |
예약된 칩 수
예약된 칩 수(compute.googleapis.com/instance/tpu/scheduled_chips)는 VM에 할당된 HEALTHY 상태의 현재 칩 수를 나타냅니다. 이 측정항목은 DISABLED 라벨이 지정된 칩을 제외합니다.
| 라벨 | 유형 | 설명 | 값 |
|---|---|---|---|
accelerator_type |
문자열 | 가속기 유형 및 세대입니다. | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
문자열 | 물리적 머신 예약의 ID입니다. | <String> |
provisioning_model |
문자열 | 연결된 프로비저닝 모델입니다. | [RESERVED, ON-DEMAND] |
protection_tier |
문자열 | 연결된 보호 모델입니다. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
문자열 | VM을 호스팅하는 클러스터 내 블록의 ID입니다. | <String> |
subblock_id |
문자열 | VM을 호스팅하는 하위 블록의 ID입니다. | <String> |
is_exr |
Bool | 칩이 모든 용량 모드 예약 (확장 예약)의 일부인지 여부입니다. | [TRUE, FALSE] |
활성 칩 수
활성 칩 수 (compute.googleapis.com/instance/tpu/active_chips)는 현재 활발하게 사용되는 칩 수를 나타냅니다.
| 라벨 | 유형 | 설명 | 값 |
|---|---|---|---|
accelerator_type |
문자열 | 가속기 유형 및 세대입니다. | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
문자열 | 물리적 머신 예약의 ID입니다. | <String> |
provisioning_model |
문자열 | 연결된 프로비저닝 모델입니다. | [RESERVED, ON-DEMAND] |
protection_tier |
문자열 | 연결된 보호 모델입니다. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
문자열 | VM을 호스팅하는 클러스터 내 블록의 ID입니다. | <String> |
subblock_id |
문자열 | VM을 호스팅하는 하위 블록의 ID입니다. | <String> |
is_exr |
Bool | 칩이 모든 용량 모드 예약 (확장 예약)의 일부인지 여부입니다. | [TRUE, FALSE] |
파생 용량 측정항목
Fleet 전체 용량 측정항목을 사용하여 특정 시점에 Fleet 전체 사용량과 효율성을 측정하는 고급 측정항목을 파생시킬 수 있습니다. PromQL PromQL 쿼리를 사용하여 이러한 측정항목을 정의하고 집계할 수 있습니다. 예를 들어 다음 쿼리는 평균 Fleet 활성화 효율성 측정항목을 만듭니다.
(
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/active_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
/
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
) * 100
다음 측정항목은 TPU Fleet의 상태에 관한 더 세분화되고 자세한 통계를 제공할 수 있습니다.
Fleet 가용성 비율
Fleet 가용성 비율은 사용 가능하고 사용할 준비가 된 약정된 칩 의 비율을 측정합니다. 이 측정항목은 예약된 전체 Fleet의 사용성을 나타냅니다.
Fleet 예약 비율
Fleet 예약 비율은 VM에 예약된 약정된 칩 의 비율을 측정합니다. 이 측정항목은 칩이 얼마나 효율적으로 예약되는지를 나타냅니다.
Fleet 활성화 비율
Fleet 활성화 비율은 활성 상태인 예약된 칩 의 비율을 측정합니다. 이 측정항목은 런타임 환경의 효율성을 나타냅니다.