Surveiller la capacité à l'échelle du parc

Les métriques de capacité à l'échelle du parc vous fournissent des informations clés sur l'état, la disponibilité et l'efficacité de l'ensemble de votre parc de TPU. Vous pouvez utiliser les métriques de capacité pour identifier les opportunités d'optimisation, améliorer l'allocation des ressources et optimiser les performances des charges de travail.

Métriques

Les métriques de capacité à l'échelle du parc suivantes sont disponibles dans l'espace de noms compute.googleapis.com. Elles servent également de blocs de construction pour les métriques de capacité dérivées, qui utilisent les métriques de capacité à l'échelle du parc pour évaluer l'utilisation et l'efficacité à l'échelle du parc à un moment donné.

Nombre de chips engagés

Le nombre de chips engagés (compute.googleapis.com/tpu/slice/capacity/committed_chips) représente le nombre actuel de chips TPU achetés dans la réservation.

Label Type Description Valeurs
accelerator_type Chaîne Type et génération de l'accélérateur. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id Chaîne ID de la réservation de la machine physique. <String>
provisioning_model Chaîne Modèle de provisionnement associé. [RESERVED, ON-DEMAND]
protection_tier Chaîne Modèle de protection associé. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr Bool Indique si les chips font partie d'une réservation en mode "Toute la capacité" (réservation étendue). [TRUE, FALSE]
block_id Chaîne ID du bloc de la tranche associée. <String>
subblock_id Chaîne ID du sous-bloc de la tranche associée. <String>

Nombre de chips disponibles

Le nombre de chips disponibles (compute.googleapis.com/tpu/slice/capacity/available_chips) représente le nombre actuel de chips TPU dans la réservation qui sont disponibles et prêts à être utilisés.

Label Type Description Valeurs
accelerator_type Chaîne Type et génération de l'accélérateur. [TPU_7X, TPU_V6_LITEPOD, ...]
reservation_id Chaîne ID de la réservation de la machine physique. <String>
provisioning_model Chaîne Modèle de provisionnement associé. [RESERVED, ON-DEMAND]
protection_tier Chaîne Modèle de protection associé. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr Bool Indique si les chips font partie d'une réservation en mode "Toute la capacité" (réservation étendue). [TRUE, FALSE]
block_id Chaîne ID du bloc de la tranche associée. <String>
subblock_id Chaîne ID du sous-bloc de la tranche associée. <String>

Nombre de chips planifiés

Le nombre de chips planifiés (compute.googleapis.com/instance/tpu/scheduled_chips) représente le nombre actuel de chips dont l'état est HEALTHY et qui sont alloués à une VM. Cette métrique exclut les chips libellés DISABLED.

Label Type Description Valeurs
accelerator_type Chaîne Type et génération de l'accélérateur. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id Chaîne ID de la réservation de la machine physique. <String>
provisioning_model Chaîne Modèle de provisionnement associé. [RESERVED, ON-DEMAND]
protection_tier Chaîne Modèle de protection associé. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id Chaîne ID du bloc dans le cluster hébergeant la VM. <String>
subblock_id Chaîne ID du sous-bloc hébergeant la VM. <String>
is_exr Bool Indique si le chip fait partie d'une réservation en mode "Toute la capacité" (réservation étendue). [TRUE, FALSE]

Nombre de chips actifs

Le nombre de chips actifs (compute.googleapis.com/instance/tpu/active_chips) représente le nombre actuel de chips qui sont activement utilisés.

Label Type Description Valeurs
accelerator_type Chaîne Type et génération de l'accélérateur. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id Chaîne ID de la réservation de la machine physique. <String>
provisioning_model Chaîne Modèle de provisionnement associé. [RESERVED, ON-DEMAND]
protection_tier Chaîne Modèle de protection associé. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id Chaîne ID du bloc dans le cluster hébergeant la VM. <String>
subblock_id Chaîne ID du sous-bloc hébergeant la VM. <String>
is_exr Bool Indique si le chip fait partie d'une réservation en mode "Toute la capacité" (réservation étendue). [TRUE, FALSE]

Métriques de capacité dérivées

Vous pouvez utiliser les métriques de capacité à l'échelle du parc pour dériver des métriques plus avancées afin d'évaluer l'utilisation et l'efficacité à l'échelle du parc à un moment donné. Vous pouvez utiliser une PromQL (Prometheus Query Language) pour définir et agréger ces métriques. Par exemple, la requête suivante crée la métrique d'efficacité moyenne d'activation du parc :

(
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/active_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
  /
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
) * 100

Les métriques suivantes peuvent fournir des insights plus précis et détaillés sur l'état de votre parc de TPU.

Taux de disponibilité du parc

Le taux de disponibilité du parc mesure la proportion de chips engagés qui sont disponibles et prêts à être utilisés. La métrique représente la facilité d'utilisation de l'ensemble du parc réservé.

$$ \text{Fleet Availability Rate} = \frac{\text{Available Chips}}{\text{Committed Chips}} $$

Taux de planification du parc

Le taux de planification du parc mesure la proportion de chips engagés planifiés pour une VM. La métrique représente l'efficacité de la planification des chips.

$$ \text{Fleet Scheduling Rate} = \frac{\text{Scheduled Chips}}{\text{Committed Chips}} $$

Taux d'activation du parc

Le taux d'activation du parc mesure la proportion de chips planifiés qui sont actifs. La métrique représente l'efficacité de l'environnement d'exécution.

$$ \text{Fleet Activation Rate} = \frac{\text{Active Chips}}{\text{Scheduled Chips}} $$