Monitora la capacità a livello di parco risorse

Le metriche della capacità a livello di parco risorse forniscono informazioni chiave sugli stati di integrità, sulla disponibilità e sull'efficienza dell'intero parco risorse TPU. Puoi utilizzare le metriche della capacità per identificare le opportunità di ottimizzazione, migliorare l'allocazione delle risorse e migliorare il rendimento dei workload.

Metriche

Le seguenti metriche della capacità a livello di parco risorse sono disponibili nello spazio dei nomi compute.googleapis.com. Servono anche come blocchi predefiniti per le metriche della capacità derivate, che utilizzano le metriche della capacità a livello di parco risorse per misurare l'utilizzo e l'efficienza a livello di parco risorse in un determinato momento.

Conteggio chip con impegno

Il conteggio chip con impegno (compute.googleapis.com/tpu/slice/capacity/committed_chips) rappresenta il numero attuale di chip TPU acquistati nella prenotazione.

Etichetta Tipo Descrizione Valori
accelerator_type Stringa Il tipo e la generazione dell'acceleratore. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id Stringa L'ID della prenotazione della macchina fisica. <String>
provisioning_model Stringa Il modello di provisioning associato. [RESERVED, ON-DEMAND]
protection_tier Stringa Il modello di protezione associato. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr Bool Indica se i chip fanno parte di una prenotazione in modalità Capacità totale (prenotazione estesa). [TRUE, FALSE]
block_id Stringa L'ID del blocco della slice associata. <String>
subblock_id Stringa L'ID del sottoblocco della slice associata. <String>

Conteggio chip disponibili

Il conteggio chip disponibili (compute.googleapis.com/tpu/slice/capacity/available_chips) rappresenta il numero attuale di chip TPU nella prenotazione che sono disponibili e pronti all'uso.

Etichetta Tipo Descrizione Valori
accelerator_type Stringa Il tipo e la generazione dell'acceleratore. [TPU_7X, TPU_V6_LITEPOD, ...]
reservation_id Stringa L'ID della prenotazione della macchina fisica. <String>
provisioning_model Stringa Il modello di provisioning associato. [RESERVED, ON-DEMAND]
protection_tier Stringa Il modello di protezione associato. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr Bool Indica se i chip fanno parte di una prenotazione in modalità Capacità totale (prenotazione estesa). [TRUE, FALSE]
block_id Stringa L'ID del blocco della slice associata. <String>
subblock_id Stringa L'ID del sottoblocco della slice associata. <String>

Conteggio chip pianificati

Il conteggio chip pianificati (compute.googleapis.com/instance/tpu/scheduled_chips) rappresenta il numero attuale di chip con stato HEALTHY allocati a una VM. Questa metrica esclude i chip con etichetta DISABLED.

Etichetta Tipo Descrizione Valori
accelerator_type Stringa Il tipo e la generazione dell'acceleratore. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id Stringa L'ID della prenotazione della macchina fisica. <String>
provisioning_model Stringa Il modello di provisioning associato. [RESERVED, ON-DEMAND]
protection_tier Stringa Il modello di protezione associato. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id Stringa L'ID del blocco all'interno del cluster che ospita la VM. <String>
subblock_id Stringa L'ID del sottoblocco che ospita la VM. <String>
is_exr Bool Indica se il chip fa parte di una prenotazione in modalità Capacità totale (prenotazione estesa). [TRUE, FALSE]

Conteggio chip attivi

Il conteggio chip attivi (compute.googleapis.com/instance/tpu/active_chips) rappresenta il numero attuale di chip utilizzati attivamente.

Etichetta Tipo Descrizione Valori
accelerator_type Stringa Il tipo e la generazione dell'acceleratore. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id Stringa L'ID della prenotazione della macchina fisica. <String>
provisioning_model Stringa Il modello di provisioning associato. [RESERVED, ON-DEMAND]
protection_tier Stringa Il modello di protezione associato. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id Stringa L'ID del blocco all'interno del cluster che ospita la VM. <String>
subblock_id Stringa L'ID del sottoblocco che ospita la VM. <String>
is_exr Bool Indica se il chip fa parte di una prenotazione in modalità Capacità totale (prenotazione estesa). [TRUE, FALSE]

Metriche della capacità derivate

Puoi utilizzare le metriche della capacità a livello di parco risorse per derivare metriche più avanzate per misurare l'utilizzo e l'efficienza a livello di parco risorse in un determinato momento. Puoi utilizzare una PromQL (Prometheus Query Language) per definire e aggregare queste metriche. Ad esempio, la seguente query crea la metrica Efficienza di attivazione media del parco risorse:

(
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/active_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
  /
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
) * 100

Le seguenti metriche possono fornire insight più granulari e dettagliati sugli stati del tuo parco risorse TPU.

Tasso di disponibilità del parco risorse

Il tasso di disponibilità del parco risorse misura la proporzione di chip con impegno disponibili e pronti all'uso. La metrica rappresenta l'usabilità dell'intero parco risorse riservato.

$$ \text{Fleet Availability Rate} = \frac{\text{Available Chips}}{\text{Committed Chips}} $$

Tasso di pianificazione del parco risorse

Il tasso di pianificazione del parco risorse misura la proporzione di chip con impegno pianificati per una VM. La metrica rappresenta l'efficienza con cui vengono pianificati i chip.

$$ \text{Fleet Scheduling Rate} = \frac{\text{Scheduled Chips}}{\text{Committed Chips}} $$

Tasso di attivazione del parco risorse

Il tasso di attivazione del parco risorse misura la proporzione di chip pianificati attivi. La metrica rappresenta l'efficienza dell'ambiente di runtime.

$$ \text{Fleet Activation Rate} = \frac{\text{Active Chips}}{\text{Scheduled Chips}} $$