フリート全体の容量をモニタリングする
フリート全体の容量指標は、TPU フリート全体の健全性、可用性、効率性に関する重要な情報を提供します。容量指標を使用して、最適化の機会を特定し、リソース割り当てを改善し、ワークロードのパフォーマンスを向上させることができます。
指標
次のフリート全体の容量指標は、compute.googleapis.com 名前空間で使用できます。これらは、
派生容量指標の構成要素としても機能します。派生容量指標は、フリート全体の
容量指標を使用して、特定の時点でのフリート全体の使用量と効率性を測定します。
コミット済みチップ数
コミット済みチップ数(compute.googleapis.com/tpu/slice/capacity/committed_chips)は、予約で購入した TPU チップの現在の数を表します。
| ラベル | 型 | 説明 | 値 |
|---|---|---|---|
accelerator_type |
文字列 | アクセラレータのタイプと世代。 | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
文字列 | 物理マシンの予約の ID。 | <String> |
provisioning_model |
文字列 | 関連付けられたプロビジョニング モデル。 | [RESERVED, ON-DEMAND] |
protection_tier |
文字列 | 関連付けられた保護モデル。 | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | チップが All Capacity モードの予約(拡張予約)の一部であるかどうか。 | [TRUE, FALSE] |
block_id |
文字列 | 関連付けられたスライスのブロックの ID。 | <String> |
subblock_id |
文字列 | 関連付けられたスライスのサブブロックの ID。 | <String> |
使用可能なチップ数
使用可能なチップ数(compute.googleapis.com/tpu/slice/capacity/available_chips)は、予約で使用可能で、使用する準備ができている TPU チップの現在の数を表します。
| ラベル | 型 | 説明 | 値 |
|---|---|---|---|
accelerator_type |
文字列 | アクセラレータのタイプと世代。 | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
文字列 | 物理マシンの予約の ID。 | <String> |
provisioning_model |
文字列 | 関連付けられたプロビジョニング モデル。 | [RESERVED, ON-DEMAND] |
protection_tier |
文字列 | 関連付けられた保護モデル。 | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | チップが All Capacity モードの予約(拡張予約)の一部であるかどうか。 | [TRUE, FALSE] |
block_id |
文字列 | 関連付けられたスライスのブロックの ID。 | <String> |
subblock_id |
文字列 | 関連付けられたスライスのサブブロックの ID。 | <String> |
スケジュールされたチップ数
スケジュールされたチップ数(compute.googleapis.com/instance/tpu/scheduled_chips)は、VM に割り当てられた HEALTHY ステータスのチップの現在の数を表します。この指標には、DISABLED というラベルが付いたチップは含まれません。
| ラベル | 型 | 説明 | 値 |
|---|---|---|---|
accelerator_type |
文字列 | アクセラレータのタイプと世代。 | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
文字列 | 物理マシンの予約の ID。 | <String> |
provisioning_model |
文字列 | 関連付けられたプロビジョニング モデル。 | [RESERVED, ON-DEMAND] |
protection_tier |
文字列 | 関連付けられた保護モデル。 | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
文字列 | VM をホストするクラスタ内のブロックの ID。 | <String> |
subblock_id |
文字列 | VM をホストするサブブロックの ID。 | <String> |
is_exr |
Bool | チップが All Capacity モードの予約(拡張予約)の一部であるかどうか。 | [TRUE, FALSE] |
アクティブなチップ数
アクティブなチップ数(compute.googleapis.com/instance/tpu/active_chips)は、現在使用されているチップの数を表します。
| ラベル | 型 | 説明 | 値 |
|---|---|---|---|
accelerator_type |
文字列 | アクセラレータのタイプと世代。 | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
文字列 | 物理マシンの予約の ID。 | <String> |
provisioning_model |
文字列 | 関連付けられたプロビジョニング モデル。 | [RESERVED, ON-DEMAND] |
protection_tier |
文字列 | 関連付けられた保護モデル。 | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
文字列 | VM をホストするクラスタ内のブロックの ID。 | <String> |
subblock_id |
文字列 | VM をホストするサブブロックの ID。 | <String> |
is_exr |
Bool | チップが All Capacity モードの予約(拡張予約)の一部であるかどうか。 | [TRUE, FALSE] |
派生容量指標
フリート全体の容量指標を使用して、より高度な指標を導き出し、特定の時点でのフリート全体の使用量と効率性を測定できます。PromQL PromQL クエリを使用して、これらの指標を定義して集計できます。たとえば、次のクエリでは、フリートの平均アクティベーション効率指標が作成されます。
(
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/active_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
/
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
) * 100
次の指標を使用すると、TPU フリートの状態に関する詳細な分析情報を取得できます。
フリートの可用性率
フリートの可用性率は、使用可能で、使用する準備ができている コミット済みチップの割合を測定します。この指標は、予約済みフリート全体の使いやすさを表します。
フリートのスケジューリング率
フリートのスケジューリング率は、VM にスケジュールされた コミット済みチップの割合を測定します。この指標は、チップのスケジューリングの効率性を表します。
フリートのアクティベーション率
フリートのアクティベーション率は、アクティブな スケジュールされたチップの割合を測定します。この指標は、ランタイム環境の効率性を表します。