监控舰队范围内的容量
舰队范围内的容量指标可为您提供有关整个 TPU 舰队的健康状态、可用性和效率的关键信息。您可以使用容量指标来发现优化机会、改进资源分配并提升工作负载性能。
指标
以下舰队范围内的容量指标位于 compute.googleapis.com 命名空间下。它们也是
衍生容量指标的基础,后者使用舰队范围内的
容量指标来衡量给定时间点的舰队范围内的用量和效率。
承诺的芯片数量
“承诺的芯片数量”(compute.googleapis.com/tpu/slice/capacity/committed_chips) 表示预留中当前购买的 TPU 芯片数量。
| 标签 | 类型 | 说明 | 值 |
|---|---|---|---|
accelerator_type |
字符串 | 加速器类型和代系。 | [TPU_7X、TPU_V6_LITEPOD 等] |
reservation_id |
字符串 | 物理机预留的 ID。 | <String> |
provisioning_model |
字符串 | 关联的预配模型。 | [RESERVED、ON-DEMAND] |
protection_tier |
字符串 | 关联的保护模型。 | [STANDARD、CAPACITY_OPTIMIZED、UNKNOWN] |
is_exr |
布尔值 | 芯片是否属于全容量模式预留(扩展预留)。 | [TRUE、FALSE] |
block_id |
字符串 | 关联切片的块的 ID。 | <String> |
subblock_id |
字符串 | 关联切片的子块的 ID。 | <String> |
可用芯片数量
“可用芯片数量”(compute.googleapis.com/tpu/slice/capacity/available_chips) 表示预留中当前可供使用且已准备就绪的 TPU 芯片数量。
| 标签 | 类型 | 说明 | 值 |
|---|---|---|---|
accelerator_type |
字符串 | 加速器类型和代系。 | [TPU_7X、TPU_V6_LITEPOD 等] |
reservation_id |
字符串 | 物理机预留的 ID。 | <String> |
provisioning_model |
字符串 | 关联的预配模型。 | [RESERVED、ON-DEMAND] |
protection_tier |
字符串 | 关联的保护模型。 | [STANDARD、CAPACITY_OPTIMIZED、UNKNOWN] |
is_exr |
布尔值 | 芯片是否属于全容量模式预留(扩展预留)。 | [TRUE、FALSE] |
block_id |
字符串 | 关联切片的块的 ID。 | <String> |
subblock_id |
字符串 | 关联切片的子块的 ID。 | <String> |
已安排的芯片数量
“已安排的芯片数量”(compute.googleapis.com/instance/tpu/scheduled_chips) 表示当前分配给虚拟机的状态为 HEALTHY 的芯片数量。此指标不包括标记为 DISABLED 的芯片。
| 标签 | 类型 | 说明 | 值 |
|---|---|---|---|
accelerator_type |
字符串 | 加速器类型和代系。 | [TPU_7X、TPU_V6_LITEPOD 等] |
reservation_id |
字符串 | 物理机预留的 ID。 | <String> |
provisioning_model |
字符串 | 关联的预配模型。 | [RESERVED、ON-DEMAND] |
protection_tier |
字符串 | 关联的保护模型。 | [STANDARD、CAPACITY_OPTIMIZED、UNKNOWN] |
block_id |
字符串 | 托管虚拟机的集群中的块的 ID。 | <String> |
subblock_id |
字符串 | 托管虚拟机的子块的 ID。 | <String> |
is_exr |
布尔值 | 芯片是否属于全容量模式预留(扩展预留)。 | [TRUE、FALSE] |
活跃的芯片数量
“活跃的芯片数量”(compute.googleapis.com/instance/tpu/active_chips) 表示当前正在积极使用的芯片数量。
| 标签 | 类型 | 说明 | 值 |
|---|---|---|---|
accelerator_type |
字符串 | 加速器类型和代系。 | [TPU_7X、TPU_V6_LITEPOD 等] |
reservation_id |
字符串 | 物理机预留的 ID。 | <String> |
provisioning_model |
字符串 | 关联的预配模型。 | [RESERVED、ON-DEMAND] |
protection_tier |
字符串 | 关联的保护模型。 | [STANDARD、CAPACITY_OPTIMIZED、UNKNOWN] |
block_id |
字符串 | 托管虚拟机的集群中的块的 ID。 | <String> |
subblock_id |
字符串 | 托管虚拟机的子块的 ID。 | <String> |
is_exr |
布尔值 | 芯片是否属于全容量模式预留(扩展预留)。 | [TRUE、FALSE] |
衍生容量指标
您可以使用舰队范围内的容量指标来推导更高级的指标,以衡量给定时间点的舰队范围内的用量和效率。您可以使用 PromQL (Prometheus 查询语言)查询来定义和汇总这些指标。例如,以下查询会创建“平均舰队激活效率”指标:
(
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/active_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
/
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
) * 100
以下指标可以更精细、更详细地洞察 TPU 舰队的状态。
舰队可用率
“舰队可用率”用于衡量可用且可供使用的 承诺的芯片 所占的比例。此指标表示整个预留舰队的可用性。
舰队调度率
“舰队调度率”用于衡量已调度到虚拟机的 承诺的芯片 所占的比例。此指标表示芯片的调度效率。
舰队激活率
“舰队激活率”用于衡量活跃的 已安排的芯片 所占的比例。此指标表示运行时环境的效率。