Monitora la capacità a livello di parco risorse
Le metriche della capacità a livello di parco risorse forniscono informazioni chiave sugli stati di integrità, sulla disponibilità e sull'efficienza dell'intero parco risorse TPU. Puoi utilizzare le metriche della capacità per identificare le opportunità di ottimizzazione, migliorare l'allocazione delle risorse e migliorare il rendimento dei workload.
Metriche
Le seguenti metriche della capacità a livello di parco risorse sono disponibili nello spazio dei nomi compute.googleapis.com. Servono anche come blocchi predefiniti per
le metriche della capacità derivate, che utilizzano le metriche della capacità a livello di parco risorse per misurare l'utilizzo e l'efficienza a livello di parco risorse in un determinato momento.
Conteggio chip con impegno
Il conteggio chip con impegno (compute.googleapis.com/tpu/slice/capacity/committed_chips) rappresenta il numero attuale di chip TPU acquistati nella prenotazione.
| Etichetta | Tipo | Descrizione | Valori |
|---|---|---|---|
accelerator_type |
Stringa | Il tipo e la generazione dell'acceleratore. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
Stringa | L'ID della prenotazione della macchina fisica. | <String> |
provisioning_model |
Stringa | Il modello di provisioning associato. | [RESERVED, ON-DEMAND] |
protection_tier |
Stringa | Il modello di protezione associato. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | Indica se i chip fanno parte di una prenotazione in modalità Capacità totale (prenotazione estesa). | [TRUE, FALSE] |
block_id |
Stringa | L'ID del blocco della slice associata. | <String> |
subblock_id |
Stringa | L'ID del sottoblocco della slice associata. | <String> |
Conteggio chip disponibili
Il conteggio chip disponibili (compute.googleapis.com/tpu/slice/capacity/available_chips) rappresenta il numero attuale di chip TPU nella prenotazione che sono disponibili e pronti all'uso.
| Etichetta | Tipo | Descrizione | Valori |
|---|---|---|---|
accelerator_type |
Stringa | Il tipo e la generazione dell'acceleratore. | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
Stringa | L'ID della prenotazione della macchina fisica. | <String> |
provisioning_model |
Stringa | Il modello di provisioning associato. | [RESERVED, ON-DEMAND] |
protection_tier |
Stringa | Il modello di protezione associato. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | Indica se i chip fanno parte di una prenotazione in modalità Capacità totale (prenotazione estesa). | [TRUE, FALSE] |
block_id |
Stringa | L'ID del blocco della slice associata. | <String> |
subblock_id |
Stringa | L'ID del sottoblocco della slice associata. | <String> |
Conteggio chip pianificati
Il conteggio chip pianificati (compute.googleapis.com/instance/tpu/scheduled_chips) rappresenta il numero attuale di chip con stato HEALTHY allocati a una VM. Questa metrica esclude i chip con etichetta DISABLED.
| Etichetta | Tipo | Descrizione | Valori |
|---|---|---|---|
accelerator_type |
Stringa | Il tipo e la generazione dell'acceleratore. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
Stringa | L'ID della prenotazione della macchina fisica. | <String> |
provisioning_model |
Stringa | Il modello di provisioning associato. | [RESERVED, ON-DEMAND] |
protection_tier |
Stringa | Il modello di protezione associato. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
Stringa | L'ID del blocco all'interno del cluster che ospita la VM. | <String> |
subblock_id |
Stringa | L'ID del sottoblocco che ospita la VM. | <String> |
is_exr |
Bool | Indica se il chip fa parte di una prenotazione in modalità Capacità totale (prenotazione estesa). | [TRUE, FALSE] |
Conteggio chip attivi
Il conteggio chip attivi (compute.googleapis.com/instance/tpu/active_chips) rappresenta il numero attuale di chip utilizzati attivamente.
| Etichetta | Tipo | Descrizione | Valori |
|---|---|---|---|
accelerator_type |
Stringa | Il tipo e la generazione dell'acceleratore. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
Stringa | L'ID della prenotazione della macchina fisica. | <String> |
provisioning_model |
Stringa | Il modello di provisioning associato. | [RESERVED, ON-DEMAND] |
protection_tier |
Stringa | Il modello di protezione associato. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
Stringa | L'ID del blocco all'interno del cluster che ospita la VM. | <String> |
subblock_id |
Stringa | L'ID del sottoblocco che ospita la VM. | <String> |
is_exr |
Bool | Indica se il chip fa parte di una prenotazione in modalità Capacità totale (prenotazione estesa). | [TRUE, FALSE] |
Metriche della capacità derivate
Puoi utilizzare le metriche della capacità a livello di parco risorse per derivare metriche più avanzate per misurare l'utilizzo e l'efficienza a livello di parco risorse in un determinato momento. Puoi utilizzare una PromQL (Prometheus Query Language) per definire e aggregare queste metriche. Ad esempio, la seguente query crea la metrica Efficienza di attivazione media del parco risorse:
(
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/active_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
/
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
) * 100
Le seguenti metriche possono fornire insight più granulari e dettagliati sugli stati del tuo parco risorse TPU.
Tasso di disponibilità del parco risorse
Il tasso di disponibilità del parco risorse misura la proporzione di chip con impegno disponibili e pronti all'uso. La metrica rappresenta l'usabilità dell'intero parco risorse riservato.
Tasso di pianificazione del parco risorse
Il tasso di pianificazione del parco risorse misura la proporzione di chip con impegno pianificati per una VM. La metrica rappresenta l'efficienza con cui vengono pianificati i chip.
Tasso di attivazione del parco risorse
Il tasso di attivazione del parco risorse misura la proporzione di chip pianificati attivi. La metrica rappresenta l'efficienza dell'ambiente di runtime.