監控全機群容量

機群容量指標可提供整個 TPU 機群的健康狀態、可用性和效率等重要資訊。您可以運用容量指標找出可改善之處、提升資源分配效率,以及提高工作負載效能。

指標

下列全車隊容量指標位於 compute.googleapis.com 命名空間。這些指標也是衍生容量指標的建構基礎,後者會使用整個車隊的容量指標,評估特定時間點的車隊用量和效率。

承諾使用的晶片數量

「已承諾的晶片數量」(compute.googleapis.com/tpu/slice/capacity/committed_chips) 代表預訂中目前購買的 TPU 晶片數量。

標籤 類型 說明
accelerator_type 字串 加速器類型和代別。 [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id 字串 實體機器預訂 ID。 <String>
provisioning_model 字串 相關的佈建模型。 [RESERVED, ON-DEMAND]
protection_tier 字串 相關聯的保護模型。 [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr 布林值 晶片是否屬於「所有容量」模式預留項目 (延長預留項目)。 [TRUE, FALSE]
block_id 字串 相關聯切片的區塊 ID。 <String>
subblock_id 字串 相關聯切片的子區塊 ID。 <String>

可用晶片數量

「可用晶片數」(compute.googleapis.com/tpu/slice/capacity/available_chips) 代表預訂中目前可供使用且已準備就緒的 TPU 晶片數量。

標籤 類型 說明
accelerator_type 字串 加速器類型和代別。 [TPU_7X, TPU_V6_LITEPOD, ...]
reservation_id 字串 實體機器預訂 ID。 <String>
provisioning_model 字串 相關的佈建模型。 [RESERVED, ON-DEMAND]
protection_tier 字串 相關聯的保護模型。 [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr 布林值 晶片是否屬於「所有容量」模式預留項目 (延長預留項目)。 [TRUE, FALSE]
block_id 字串 相關聯切片的區塊 ID。 <String>
subblock_id 字串 相關聯切片的子區塊 ID。 <String>

已排定晶片數量

「預定晶片數」(compute.googleapis.com/instance/tpu/scheduled_chips) 代表目前分配給 VM 的晶片數,這些晶片處於 HEALTHY 狀態。這項指標不包含標示為 DISABLED 的晶片。

標籤 類型 說明
accelerator_type 字串 加速器類型和代別。 [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id 字串 實體機器預訂 ID。 <String>
provisioning_model 字串 相關的佈建模型。 [RESERVED, ON-DEMAND]
protection_tier 字串 相關聯的保護模型。 [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id 字串 叢集中代管 VM 的區塊 ID。 <String>
subblock_id 字串 代管 VM 的子區塊 ID。 <String>
is_exr 布林值 晶片是否屬於「所有容量」模式預留項目 (延長預留項目)。 [TRUE, FALSE]

有效晶片數量

「有效晶片數」(compute.googleapis.com/instance/tpu/active_chips) 代表目前正在使用的晶片數量。

標籤 類型 說明
accelerator_type 字串 加速器類型和代別。 [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id 字串 實體機器預訂 ID。 <String>
provisioning_model 字串 相關的佈建模型。 [RESERVED, ON-DEMAND]
protection_tier 字串 相關聯的保護模型。 [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id 字串 叢集中代管 VM 的區塊 ID。 <String>
subblock_id 字串 代管 VM 的子區塊 ID。 <String>
is_exr 布林值 晶片是否屬於「所有容量」模式預留項目 (延長預留項目)。 [TRUE, FALSE]

衍生容量指標

您可以使用全車隊容量指標,推導出更進階的指標,藉此評估特定時間點的全車隊用量和效率。您可以使用 PromQL (Prometheus 查詢語言) 查詢定義及匯總這些指標。舉例來說,下列查詢會建立「車隊平均啟用效率」指標:

(
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/active_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
  /
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
) * 100

下列指標可提供 TPU 機群狀態的更精細詳細洞察。

車隊可用率

機群可用率是指可供使用且已準備就緒的承諾晶片比例。這項指標代表整個預留機群的可用性。

$$ \text{Fleet Availability Rate} = \frac{\text{Available Chips}}{\text{Committed Chips}} $$

機群排程率

機群排程率會評估排定至 VM 的已承諾晶片比例。這項指標代表晶片的排程效率。

$$ \text{Fleet Scheduling Rate} = \frac{\text{Scheduled Chips}}{\text{Committed Chips}} $$

車隊啟用率

車隊啟用率會測量排定晶片的啟用比例。這項指標代表執行階段環境的效率。

$$ \text{Fleet Activation Rate} = \frac{\text{Active Chips}}{\text{Scheduled Chips}} $$