Surveiller la capacité à l'échelle du parc
Les métriques de capacité à l'échelle du parc vous fournissent des informations clés sur l'état, la disponibilité et l'efficacité de l'ensemble de votre parc de TPU. Vous pouvez utiliser les métriques de capacité pour identifier les opportunités d'optimisation, améliorer l'allocation des ressources et optimiser les performances des charges de travail.
Métriques
Les métriques de capacité à l'échelle du parc suivantes sont disponibles dans l'espace de noms compute.googleapis.com. Elles servent également de blocs de construction pour
les métriques de capacité dérivées, qui utilisent les métriques de capacité à l'échelle du parc
pour évaluer l'utilisation et l'efficacité à l'échelle du parc à un moment donné.
Nombre de chips engagés
Le nombre de chips engagés (compute.googleapis.com/tpu/slice/capacity/committed_chips) représente le nombre actuel de chips TPU achetés dans la réservation.
| Label | Type | Description | Valeurs |
|---|---|---|---|
accelerator_type |
Chaîne | Type et génération de l'accélérateur. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
Chaîne | ID de la réservation de la machine physique. | <String> |
provisioning_model |
Chaîne | Modèle de provisionnement associé. | [RESERVED, ON-DEMAND] |
protection_tier |
Chaîne | Modèle de protection associé. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | Indique si les chips font partie d'une réservation en mode "Toute la capacité" (réservation étendue). | [TRUE, FALSE] |
block_id |
Chaîne | ID du bloc de la tranche associée. | <String> |
subblock_id |
Chaîne | ID du sous-bloc de la tranche associée. | <String> |
Nombre de chips disponibles
Le nombre de chips disponibles (compute.googleapis.com/tpu/slice/capacity/available_chips) représente le nombre actuel de chips TPU dans la réservation qui sont disponibles et prêts à être utilisés.
| Label | Type | Description | Valeurs |
|---|---|---|---|
accelerator_type |
Chaîne | Type et génération de l'accélérateur. | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
Chaîne | ID de la réservation de la machine physique. | <String> |
provisioning_model |
Chaîne | Modèle de provisionnement associé. | [RESERVED, ON-DEMAND] |
protection_tier |
Chaîne | Modèle de protection associé. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | Indique si les chips font partie d'une réservation en mode "Toute la capacité" (réservation étendue). | [TRUE, FALSE] |
block_id |
Chaîne | ID du bloc de la tranche associée. | <String> |
subblock_id |
Chaîne | ID du sous-bloc de la tranche associée. | <String> |
Nombre de chips planifiés
Le nombre de chips planifiés (compute.googleapis.com/instance/tpu/scheduled_chips) représente le nombre actuel de chips dont l'état est HEALTHY et qui sont alloués à une VM. Cette métrique exclut les chips libellés DISABLED.
| Label | Type | Description | Valeurs |
|---|---|---|---|
accelerator_type |
Chaîne | Type et génération de l'accélérateur. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
Chaîne | ID de la réservation de la machine physique. | <String> |
provisioning_model |
Chaîne | Modèle de provisionnement associé. | [RESERVED, ON-DEMAND] |
protection_tier |
Chaîne | Modèle de protection associé. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
Chaîne | ID du bloc dans le cluster hébergeant la VM. | <String> |
subblock_id |
Chaîne | ID du sous-bloc hébergeant la VM. | <String> |
is_exr |
Bool | Indique si le chip fait partie d'une réservation en mode "Toute la capacité" (réservation étendue). | [TRUE, FALSE] |
Nombre de chips actifs
Le nombre de chips actifs (compute.googleapis.com/instance/tpu/active_chips) représente le nombre actuel de chips qui sont activement utilisés.
| Label | Type | Description | Valeurs |
|---|---|---|---|
accelerator_type |
Chaîne | Type et génération de l'accélérateur. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
Chaîne | ID de la réservation de la machine physique. | <String> |
provisioning_model |
Chaîne | Modèle de provisionnement associé. | [RESERVED, ON-DEMAND] |
protection_tier |
Chaîne | Modèle de protection associé. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
Chaîne | ID du bloc dans le cluster hébergeant la VM. | <String> |
subblock_id |
Chaîne | ID du sous-bloc hébergeant la VM. | <String> |
is_exr |
Bool | Indique si le chip fait partie d'une réservation en mode "Toute la capacité" (réservation étendue). | [TRUE, FALSE] |
Métriques de capacité dérivées
Vous pouvez utiliser les métriques de capacité à l'échelle du parc pour dériver des métriques plus avancées afin d'évaluer l'utilisation et l'efficacité à l'échelle du parc à un moment donné. Vous pouvez utiliser une PromQL (Prometheus Query Language) pour définir et agréger ces métriques. Par exemple, la requête suivante crée la métrique d'efficacité moyenne d'activation du parc :
(
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/active_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
/
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
) * 100
Les métriques suivantes peuvent fournir des insights plus précis et détaillés sur l'état de votre parc de TPU.
Taux de disponibilité du parc
Le taux de disponibilité du parc mesure la proportion de chips engagés qui sont disponibles et prêts à être utilisés. La métrique représente la facilité d'utilisation de l'ensemble du parc réservé.
Taux de planification du parc
Le taux de planification du parc mesure la proportion de chips engagés planifiés pour une VM. La métrique représente l'efficacité de la planification des chips.
Taux d'activation du parc
Le taux d'activation du parc mesure la proportion de chips planifiés qui sont actifs. La métrique représente l'efficacité de l'environnement d'exécution.