監控全機群容量
機群容量指標可提供整個 TPU 機群的健康狀態、可用性和效率等重要資訊。您可以運用容量指標找出可改善之處、提升資源分配效率,以及提高工作負載效能。
指標
下列全車隊容量指標位於 compute.googleapis.com 命名空間。這些指標也是衍生容量指標的建構基礎,後者會使用整個車隊的容量指標,評估特定時間點的車隊用量和效率。
承諾使用的晶片數量
「已承諾的晶片數量」(compute.googleapis.com/tpu/slice/capacity/committed_chips) 代表預訂中目前購買的 TPU 晶片數量。
| 標籤 | 類型 | 說明 | 值 |
|---|---|---|---|
accelerator_type |
字串 | 加速器類型和代別。 | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
字串 | 實體機器預訂 ID。 | <String> |
provisioning_model |
字串 | 相關的佈建模型。 | [RESERVED, ON-DEMAND] |
protection_tier |
字串 | 相關聯的保護模型。 | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
布林值 | 晶片是否屬於「所有容量」模式預留項目 (延長預留項目)。 | [TRUE, FALSE] |
block_id |
字串 | 相關聯切片的區塊 ID。 | <String> |
subblock_id |
字串 | 相關聯切片的子區塊 ID。 | <String> |
可用晶片數量
「可用晶片數」(compute.googleapis.com/tpu/slice/capacity/available_chips) 代表預訂中目前可供使用且已準備就緒的 TPU 晶片數量。
| 標籤 | 類型 | 說明 | 值 |
|---|---|---|---|
accelerator_type |
字串 | 加速器類型和代別。 | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
字串 | 實體機器預訂 ID。 | <String> |
provisioning_model |
字串 | 相關的佈建模型。 | [RESERVED, ON-DEMAND] |
protection_tier |
字串 | 相關聯的保護模型。 | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
布林值 | 晶片是否屬於「所有容量」模式預留項目 (延長預留項目)。 | [TRUE, FALSE] |
block_id |
字串 | 相關聯切片的區塊 ID。 | <String> |
subblock_id |
字串 | 相關聯切片的子區塊 ID。 | <String> |
已排定晶片數量
「預定晶片數」(compute.googleapis.com/instance/tpu/scheduled_chips) 代表目前分配給 VM 的晶片數,這些晶片處於 HEALTHY 狀態。這項指標不包含標示為 DISABLED 的晶片。
| 標籤 | 類型 | 說明 | 值 |
|---|---|---|---|
accelerator_type |
字串 | 加速器類型和代別。 | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
字串 | 實體機器預訂 ID。 | <String> |
provisioning_model |
字串 | 相關的佈建模型。 | [RESERVED, ON-DEMAND] |
protection_tier |
字串 | 相關聯的保護模型。 | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
字串 | 叢集中代管 VM 的區塊 ID。 | <String> |
subblock_id |
字串 | 代管 VM 的子區塊 ID。 | <String> |
is_exr |
布林值 | 晶片是否屬於「所有容量」模式預留項目 (延長預留項目)。 | [TRUE, FALSE] |
有效晶片數量
「有效晶片數」(compute.googleapis.com/instance/tpu/active_chips) 代表目前正在使用的晶片數量。
| 標籤 | 類型 | 說明 | 值 |
|---|---|---|---|
accelerator_type |
字串 | 加速器類型和代別。 | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
字串 | 實體機器預訂 ID。 | <String> |
provisioning_model |
字串 | 相關的佈建模型。 | [RESERVED, ON-DEMAND] |
protection_tier |
字串 | 相關聯的保護模型。 | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
字串 | 叢集中代管 VM 的區塊 ID。 | <String> |
subblock_id |
字串 | 代管 VM 的子區塊 ID。 | <String> |
is_exr |
布林值 | 晶片是否屬於「所有容量」模式預留項目 (延長預留項目)。 | [TRUE, FALSE] |
衍生容量指標
您可以使用全車隊容量指標,推導出更進階的指標,藉此評估特定時間點的全車隊用量和效率。您可以使用 PromQL (Prometheus 查詢語言) 查詢定義及匯總這些指標。舉例來說,下列查詢會建立「車隊平均啟用效率」指標:
(
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/active_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
/
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
) * 100
下列指標可提供 TPU 機群狀態的更精細詳細洞察。
車隊可用率
機群可用率是指可供使用且已準備就緒的承諾晶片比例。這項指標代表整個預留機群的可用性。
機群排程率
機群排程率會評估排定至 VM 的已承諾晶片比例。這項指標代表晶片的排程效率。
車隊啟用率
車隊啟用率會測量排定晶片的啟用比例。這項指標代表執行階段環境的效率。