Supervisa la capacidad de toda la flota
Las métricas de capacidad de toda la flota te proporcionan información clave sobre los estados de estado, la disponibilidad y la eficiencia de toda tu flota de TPU. Puedes usar las métricas de capacidad para identificar oportunidades de optimización, mejorar la asignación de recursos y mejorar el rendimiento de las cargas de trabajo.
Métricas
Las siguientes métricas de capacidad de toda la flota están disponibles en el espacio de nombres compute.googleapis.com. También sirven como bloques de construcción para
las métricas de capacidad derivadas, que usan las métricas de capacidad de toda la flota
para medir el uso y la eficiencia de toda la flota en un momento determinado.
Recuento de chips comprometidos
El recuento de chips comprometidos (compute.googleapis.com/tpu/slice/capacity/committed_chips) representa la cantidad actual de chips TPU comprados en la reserva.
| Etiqueta | Tipo | Descripción | Valores |
|---|---|---|---|
accelerator_type |
String | El tipo y la generación del acelerador. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
String | El ID de la reserva de la máquina física. | <String> |
provisioning_model |
String | El modelo de aprovisionamiento asociado. | [RESERVED, ON-DEMAND] |
protection_tier |
String | El modelo de protección asociado. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | Indica si los chips forman parte de una reserva en el modo All Capacity (reserva extendida). | [TRUE, FALSE] |
block_id |
String | El ID del bloque de la porción asociada. | <String> |
subblock_id |
String | El ID del subbloque de la porción asociada. | <String> |
Recuento de chips disponibles
El recuento de chips disponibles (compute.googleapis.com/tpu/slice/capacity/available_chips) representa la cantidad actual de chips TPU en la reserva que están disponibles y listos para usar.
| Etiqueta | Tipo | Descripción | Valores |
|---|---|---|---|
accelerator_type |
String | El tipo y la generación del acelerador. | [TPU_7X, TPU_V6_LITEPOD, ...] |
reservation_id |
String | El ID de la reserva de la máquina física. | <String> |
provisioning_model |
String | El modelo de aprovisionamiento asociado. | [RESERVED, ON-DEMAND] |
protection_tier |
String | El modelo de protección asociado. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
is_exr |
Bool | Indica si los chips forman parte de una reserva en el modo All Capacity (reserva extendida). | [TRUE, FALSE] |
block_id |
String | El ID del bloque de la porción asociada. | <String> |
subblock_id |
String | El ID del subbloque de la porción asociada. | <String> |
Recuento de chips programados
El recuento de chips programados (compute.googleapis.com/instance/tpu/scheduled_chips) representa la cantidad actual de chips con un estado HEALTHY asignado a una VM. Esta métrica excluye los chips etiquetados como DISABLED.
| Etiqueta | Tipo | Descripción | Valores |
|---|---|---|---|
accelerator_type |
String | El tipo y la generación del acelerador. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
String | El ID de la reserva de la máquina física. | <String> |
provisioning_model |
String | El modelo de aprovisionamiento asociado. | [RESERVED, ON-DEMAND] |
protection_tier |
String | El modelo de protección asociado. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
String | El ID del bloque dentro del clúster que aloja la VM. | <String> |
subblock_id |
String | El ID del subbloque que aloja la VM. | <String> |
is_exr |
Bool | Indica si el chip forma parte de una reserva en el modo All Capacity (reserva extendida). | [TRUE, FALSE] |
Recuento de chips activos
El recuento de chips activos (compute.googleapis.com/instance/tpu/active_chips) representa la cantidad actual de chips que se utilizan de forma activa.
| Etiqueta | Tipo | Descripción | Valores |
|---|---|---|---|
accelerator_type |
String | El tipo y la generación del acelerador. | [TPU_7X, TPU_V6_LITEPOD, …] |
reservation_id |
String | El ID de la reserva de la máquina física. | <String> |
provisioning_model |
String | El modelo de aprovisionamiento asociado. | [RESERVED, ON-DEMAND] |
protection_tier |
String | El modelo de protección asociado. | [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN] |
block_id |
String | El ID del bloque dentro del clúster que aloja la VM. | <String> |
subblock_id |
String | El ID del subbloque que aloja la VM. | <String> |
is_exr |
Bool | Indica si el chip forma parte de una reserva en el modo All Capacity (reserva extendida). | [TRUE, FALSE] |
Métricas de capacidad derivadas
Puedes usar las métricas de capacidad de toda la flota para derivar métricas más avanzadas para medir el uso y la eficiencia de toda la flota en un momento determinado. Puedes usar una PromQL (lenguaje de consulta de Prometheus) para definir y agregar estas métricas. Por ejemplo, la siguiente consulta crea la métrica de eficiencia de activación promedio de la flota:
(
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/active_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
/
sum(
avg_over_time(
{"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
"monitored_resource"="gce_instance"
}
[5m]
)
)
) * 100
Las siguientes métricas pueden proporcionar estadísticas más detalladas y detalladas sobre los estados de tu flota de TPU.
Tasa de disponibilidad de la flota
La tasa de disponibilidad de la flota mide la proporción de chips comprometidos que están disponibles y listos para usar. La métrica representa la usabilidad de toda la flota reservada.
Tasa de programación de la flota
La tasa de programación de la flota mide la proporción de chips comprometidos programados para una VM. La métrica representa la eficiencia con la que se programan los chips.
Tasa de activación de la flota
La tasa de activación de la flota mide la proporción de chips programados que están activos. La métrica representa la eficiencia del entorno de ejecución.