Monitorar a capacidade da frota

As métricas de capacidade da frota fornecem informações importantes sobre os estados de integridade, a disponibilidade e a eficiência de toda a frota de TPUs. É possível usar as métricas de capacidade para identificar oportunidades de otimização, melhorar a alocação de recursos e aprimorar a performance da carga de trabalho.

Métricas

As seguintes métricas de capacidade da frota estão disponíveis no namespace compute.googleapis.com. Elas também servem como blocos de construção para as métricas de capacidade derivadas, que usam as métricas de capacidade da frota para avaliar o uso e a eficiência da frota em um determinado momento.

Contagem de chips comprometidos

A contagem de chips comprometidos (compute.googleapis.com/tpu/slice/capacity/committed_chips) representa o número atual de chips de TPU comprados na reserva.

Rótulo Tipo Descrição Valores
accelerator_type String O tipo e a geração do acelerador. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id String O ID da reserva de máquina física. <String>
provisioning_model String O modelo de provisionamento associado. [RESERVED, ON-DEMAND]
protection_tier String O modelo de proteção associado. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr Booleano Indica se os chips fazem parte de uma reserva no modo "Toda a capacidade" (reserva estendida). [TRUE, FALSE]
block_id String O ID do bloco da fração associada. <String>
subblock_id String O ID do sub-bloco da fração associada. <String>

Contagem de chips disponíveis

A contagem de chips disponíveis (compute.googleapis.com/tpu/slice/capacity/available_chips) representa o número atual de chips de TPU na reserva que estão disponíveis e prontos para uso.

Rótulo Tipo Descrição Valores
accelerator_type String O tipo e a geração do acelerador. [TPU_7X, TPU_V6_LITEPOD, ...]
reservation_id String O ID da reserva de máquina física. <String>
provisioning_model String O modelo de provisionamento associado. [RESERVED, ON-DEMAND]
protection_tier String O modelo de proteção associado. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
is_exr Booleano Indica se os chips fazem parte de uma reserva no modo "Toda a capacidade" (reserva estendida). [TRUE, FALSE]
block_id String O ID do bloco da fração associada. <String>
subblock_id String O ID do sub-bloco da fração associada. <String>

Contagem de chips programados

A contagem de chips programados (compute.googleapis.com/instance/tpu/scheduled_chips) representa o número atual de chips com um status HEALTHY alocado a uma VM. Essa métrica exclui chips marcados como DISABLED.

Rótulo Tipo Descrição Valores
accelerator_type String O tipo e a geração do acelerador. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id String O ID da reserva de máquina física. <String>
provisioning_model String O modelo de provisionamento associado. [RESERVED, ON-DEMAND]
protection_tier String O modelo de proteção associado. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id String O ID do bloco no cluster que hospeda a VM. <String>
subblock_id String O ID do sub-bloco que hospeda a VM. <String>
is_exr Booleano Indica se o chip faz parte de uma reserva no modo "Toda a capacidade" (reserva estendida). [TRUE, FALSE]

Contagem de chips ativos

A contagem de chips ativos (compute.googleapis.com/instance/tpu/active_chips) representa o número atual de chips que estão sendo usados ativamente.

Rótulo Tipo Descrição Valores
accelerator_type String O tipo e a geração do acelerador. [TPU_7X, TPU_V6_LITEPOD, …]
reservation_id String O ID da reserva de máquina física. <String>
provisioning_model String O modelo de provisionamento associado. [RESERVED, ON-DEMAND]
protection_tier String O modelo de proteção associado. [STANDARD, CAPACITY_OPTIMIZED, UNKNOWN]
block_id String O ID do bloco no cluster que hospeda a VM. <String>
subblock_id String O ID do sub-bloco que hospeda a VM. <String>
is_exr Booleano Indica se o chip faz parte de uma reserva no modo "Toda a capacidade" (reserva estendida). [TRUE, FALSE]

Métricas de capacidade derivadas

É possível usar as métricas de capacidade da frota para derivar métricas mais avançadas para avaliar o uso e a eficiência da frota em um determinado momento. Você pode usar uma PromQL (linguagem de consulta do Prometheus) para definir e agregar essas métricas. Por exemplo, a consulta a seguir cria a métrica de eficiência média de ativação da frota:

(
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/active_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
  /
  sum(
    avg_over_time(
      {"__name__"="compute.googleapis.com/instance/tpu/scheduled_chips",
      "monitored_resource"="gce_instance"
      }
      [5m]
    )
  )
) * 100

As métricas a seguir podem fornecer insights mais detalhados sobre os estados da sua frota de TPUs.

Taxa de disponibilidade da frota

A taxa de disponibilidade da frota mede a proporção de chips comprometidos que estão disponíveis e prontos para uso. A métrica representa a usabilidade de toda a frota reservada.

$$ \text{Fleet Availability Rate} = \frac{\text{Available Chips}}{\text{Committed Chips}} $$

Taxa de programação da frota

A taxa de programação da frota mede a proporção de chips comprometidos programados para uma VM. A métrica representa a eficiência com que os chips são programados.

$$ \text{Fleet Scheduling Rate} = \frac{\text{Scheduled Chips}}{\text{Committed Chips}} $$

Taxa de ativação da frota

A taxa de ativação da frota mede a proporção de chips programados que estão ativos. A métrica representa a eficiência do ambiente de execução.

$$ \text{Fleet Activation Rate} = \frac{\text{Active Chips}}{\text{Scheduled Chips}} $$