Supervisa la capacidad de toda la flota

Las métricas de capacidad de toda la flota te proporcionan información clave sobre los estados de estado, la disponibilidad y la eficiencia de toda tu flota de TPU. Puedes usar las métricas de capacidad para identificar oportunidades de optimización, mejorar la asignación de recursos y mejorar el rendimiento de las cargas de trabajo.

Métricas

Las siguientes métricas de capacidad de toda la flota están disponibles en el espacio de nombres compute.googleapis.com. También sirven como bloques de construcción para las métricas de capacidad derivadas, que usan las métricas de capacidad de toda la flota para medir el uso y la eficiencia de toda la flota en un momento determinado.

Recuento de chips comprometidos

El recuento de chips comprometidos (compute.googleapis.com/tpu/slice/capacity/committed_chips) representa la cantidad actual de chips TPU comprados en la reserva.

Etiqueta Tipo Descripción Valores
accelerator_type String El tipo y la generación del acelerador. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id String El ID de la reserva de la máquina física. <String>
provisioning_model String El modelo de aprovisionamiento asociado. [RESERVED, ON-DEMAND]
protection_tier String El modelo de protección asociado. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr Bool Indica si los chips forman parte de una reserva en el modo All Capacity (reserva extendida). [TRUE, FALSE]
block_id String El ID del bloque de la porción asociada. <String>
subblock_id String El ID del subbloque de la porción asociada. <String>

Recuento de chips disponibles

El recuento de chips disponibles (compute.googleapis.com/tpu/slice/capacity/available_chips) representa la cantidad actual de chips TPU en la reserva que están disponibles y listos para usar.

Etiqueta Tipo Descripción Valores
accelerator_type String El tipo y la generación del acelerador. [TPU_7X, TPU_V6_LITEPOD, ...]
reservation_id String El ID de la reserva de la máquina física. <String>
provisioning_model String El modelo de aprovisionamiento asociado. [RESERVED, ON-DEMAND]
protection_tier String El modelo de protección asociado. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr Bool Indica si los chips forman parte de una reserva en el modo All Capacity (reserva extendida). [TRUE, FALSE]
block_id String El ID del bloque de la porción asociada. <String>
subblock_id String El ID del subbloque de la porción asociada. <String>

Recuento de chips programados

El recuento de chips programados (compute.googleapis.com/instance/tpu/scheduled_chips) representa la cantidad actual de chips con un estado HEALTHY asignado a una VM. Esta métrica excluye los chips etiquetados como DISABLED.

Etiqueta Tipo Descripción Valores
accelerator_type String El tipo y la generación del acelerador. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id String El ID de la reserva de la máquina física. <String>
provisioning_model String El modelo de aprovisionamiento asociado. [RESERVED, ON-DEMAND]
protection_tier String El modelo de protección asociado. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id String El ID del bloque dentro del clúster que aloja la VM. <String>
subblock_id String El ID del subbloque que aloja la VM. <String>
is_exr Bool Indica si el chip forma parte de una reserva en el modo All Capacity (reserva extendida). [TRUE, FALSE]

Recuento de chips activos

El recuento de chips activos (compute.googleapis.com/instance/tpu/active_chips) representa la cantidad actual de chips que se utilizan de forma activa.

Etiqueta Tipo Descripción Valores
accelerator_type String El tipo y la generación del acelerador. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id String El ID de la reserva de la máquina física. <String>
provisioning_model String El modelo de aprovisionamiento asociado. [RESERVED, ON-DEMAND]
protection_tier String El modelo de protección asociado. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id String El ID del bloque dentro del clúster que aloja la VM. <String>
subblock_id String El ID del subbloque que aloja la VM. <String>
is_exr Bool Indica si el chip forma parte de una reserva en el modo All Capacity (reserva extendida). [TRUE, FALSE]

Métricas de capacidad derivadas

Puedes usar las métricas de capacidad de toda la flota para derivar métricas más avanzadas para medir el uso y la eficiencia de toda la flota en un momento determinado. Puedes usar una PromQL (lenguaje de consulta de Prometheus) para definir y agregar estas métricas. Por ejemplo, la siguiente consulta crea la métrica de eficiencia de activación promedio de la flota:

(
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/active_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
  /
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
) * 100

Las siguientes métricas pueden proporcionar estadísticas más detalladas y detalladas sobre los estados de tu flota de TPU.

Tasa de disponibilidad de la flota

La tasa de disponibilidad de la flota mide la proporción de chips comprometidos que están disponibles y listos para usar. La métrica representa la usabilidad de toda la flota reservada.

$$ \text{Fleet Availability Rate} = \frac{\text{Available Chips}}{\text{Committed Chips}} $$

Tasa de programación de la flota

La tasa de programación de la flota mide la proporción de chips comprometidos programados para una VM. La métrica representa la eficiencia con la que se programan los chips.

$$ \text{Fleet Scheduling Rate} = \frac{\text{Scheduled Chips}}{\text{Committed Chips}} $$

Tasa de activación de la flota

La tasa de activación de la flota mide la proporción de chips programados que están activos. La métrica representa la eficiencia del entorno de ejecución.

$$ \text{Fleet Activation Rate} = \frac{\text{Active Chips}}{\text{Scheduled Chips}} $$