监控舰队范围内的容量

舰队范围内的容量指标可为您提供有关整个 TPU 舰队的健康状态、可用性和效率的关键信息。您可以使用容量指标来发现优化机会、改进资源分配并提升工作负载性能。

指标

以下舰队范围内的容量指标位于 compute.googleapis.com 命名空间下。它们也是 衍生容量指标的基础,后者使用舰队范围内的 容量指标来衡量给定时间点的舰队范围内的用量和效率。

承诺的芯片数量

“承诺的芯片数量”(compute.googleapis.com/tpu/slice/capacity/committed_chips) 表示预留中当前购买的 TPU 芯片数量。

标签 类型 说明
accelerator_type 字符串 加速器类型和代系。 [TPU_7XTPU_V6_LITEPOD 等]
reservation_id 字符串 物理机预留的 ID。 <String>
provisioning_model 字符串 关联的预配模型。 [RESERVEDON-DEMAND]
protection_tier 字符串 关联的保护模型。 [STANDARDCAPACITY_OPTIMIZEDUNKNOWN]
is_exr 布尔值 芯片是否属于全容量模式预留(扩展预留)。 [TRUEFALSE]
block_id 字符串 关联切片的块的 ID。 <String>
subblock_id 字符串 关联切片的子块的 ID。 <String>

可用芯片数量

“可用芯片数量”(compute.googleapis.com/tpu/slice/capacity/available_chips) 表示预留中当前可供使用且已准备就绪的 TPU 芯片数量。

标签 类型 说明
accelerator_type 字符串 加速器类型和代系。 [TPU_7XTPU_V6_LITEPOD 等]
reservation_id 字符串 物理机预留的 ID。 <String>
provisioning_model 字符串 关联的预配模型。 [RESERVEDON-DEMAND]
protection_tier 字符串 关联的保护模型。 [STANDARDCAPACITY_OPTIMIZEDUNKNOWN]
is_exr 布尔值 芯片是否属于全容量模式预留(扩展预留)。 [TRUEFALSE]
block_id 字符串 关联切片的块的 ID。 <String>
subblock_id 字符串 关联切片的子块的 ID。 <String>

已安排的芯片数量

“已安排的芯片数量”(compute.googleapis.com/instance/tpu/scheduled_chips) 表示当前分配给虚拟机的状态为 HEALTHY 的芯片数量。此指标不包括标记为 DISABLED 的芯片。

标签 类型 说明
accelerator_type 字符串 加速器类型和代系。 [TPU_7XTPU_V6_LITEPOD 等]
reservation_id 字符串 物理机预留的 ID。 <String>
provisioning_model 字符串 关联的预配模型。 [RESERVEDON-DEMAND]
protection_tier 字符串 关联的保护模型。 [STANDARDCAPACITY_OPTIMIZEDUNKNOWN]
block_id 字符串 托管虚拟机的集群中的块的 ID。 <String>
subblock_id 字符串 托管虚拟机的子块的 ID。 <String>
is_exr 布尔值 芯片是否属于全容量模式预留(扩展预留)。 [TRUEFALSE]

活跃的芯片数量

“活跃的芯片数量”(compute.googleapis.com/instance/tpu/active_chips) 表示当前正在积极使用的芯片数量。

标签 类型 说明
accelerator_type 字符串 加速器类型和代系。 [TPU_7XTPU_V6_LITEPOD 等]
reservation_id 字符串 物理机预留的 ID。 <String>
provisioning_model 字符串 关联的预配模型。 [RESERVEDON-DEMAND]
protection_tier 字符串 关联的保护模型。 [STANDARDCAPACITY_OPTIMIZEDUNKNOWN]
block_id 字符串 托管虚拟机的集群中的块的 ID。 <String>
subblock_id 字符串 托管虚拟机的子块的 ID。 <String>
is_exr 布尔值 芯片是否属于全容量模式预留(扩展预留)。 [TRUEFALSE]

衍生容量指标

您可以使用舰队范围内的容量指标来推导更高级的指标,以衡量给定时间点的舰队范围内的用量和效率。您可以使用 PromQL (Prometheus 查询语言)查询来定义和汇总这些指标。例如,以下查询会创建“平均舰队激活效率”指标:

(
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/active_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
  /
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
) * 100

以下指标可以更精细、更详细地洞察 TPU 舰队的状态。

舰队可用率

“舰队可用率”用于衡量可用且可供使用的 承诺的芯片 所占的比例。此指标表示整个预留舰队的可用性。

$$ \text{Fleet Availability Rate} = \frac{\text{Available Chips}}{\text{Committed Chips}} $$

舰队调度率

“舰队调度率”用于衡量已调度到虚拟机的 承诺的芯片 所占的比例。此指标表示芯片的调度效率。

$$ \text{Fleet Scheduling Rate} = \frac{\text{Scheduled Chips}}{\text{Committed Chips}} $$

舰队激活率

“舰队激活率”用于衡量活跃的 已安排的芯片 所占的比例。此指标表示运行时环境的效率。

$$ \text{Fleet Activation Rate} = \frac{\text{Active Chips}}{\text{Scheduled Chips}} $$