Este documento lista os documentos de solução de problemas comuns que você pode encontrar ao usar o Google Kubernetes Engine (GKE). Se você estiver diagnosticando erros de carga de trabalho, como ImagePullBackOff e CrashLoopBackOff, depurando o comportamento de escalonamento automático do cluster, resolvendo problemas de PersistentVolume ou solucionando problemas de registro de nós, os documentos listados aqui podem ajudar.
Se você não conhece a solução de problemas no GKE, comece com
a Introdução à solução de problemas.
Para diagnosticar e resolver problemas encontrados, consulte os documentos nas seções a seguir:
Para resolver problemas de rede do GKE, consulte
Resolver problemas de rede do GKE
na documentação de rede do GKE.
Este documento é destinado a administradores e arquitetos, especialistas em segurança, especialistas em rede ou especialistas em armazenamento que resolvem problemas de configurações do GKE. Para saber mais sobre os papéis do GKE,
consulte
Papéis e tarefas comuns do usuário do GKE.
Introdução à solução de problemas
Configuração do cluster
| Tópico |
Descrição |
| Criação de clusters |
Resolver problemas com a criação de clusters. |
| Clusters do Autopilot |
Diagnosticar e resolver problemas de clusters do Autopilot do GKE, incluindo criação de clusters, exclusão de namespace, escalonamento e problemas de carga de trabalho. |
| Ferramenta de linha de comando kubectl |
Resolver problemas da ferramenta de linha de comando kubectl no
GKE, incluindo problemas de autenticação e autorização.
Esta página também inclui orientações sobre como
resolver problemas do proxy Konnectivity
para verificar se ele está fazendo com que os comandos kubectl logs, attach,
exec ou port-forward parem de responder. |
| Pools de nós padrão |
Resolver problemas em pools de nós do GKE Standard,
incluindo problemas com a criação de pool de nós, provisionamento de melhor esforço,
metadados de instâncias corrompidos e migração de cargas de trabalho para novos pools de nós. |
Status NotReady do nó |
Saiba como diagnosticar e resolver o status NotReady
do nó no GKE, resolvendo causas comuns, como
escassez de recursos, problemas de rede e falhas de componentes. |
| Registro de nós |
Resolver problemas que ocorrem ao adicionar nós ao seu
cluster GKE Standard, como falhas de registro de nós
e pré-requisitos ausentes para o registro bem-sucedido de nós. |
| Ambiente de execução do contêiner |
Resolver problemas de ambientes de execução de contêineres no GKE, incluindo
problemas com containerd e dockershim, e
registros particulares. |
| Pools de nós do Windows Server |
Resolver problemas com pools de nós do Windows Server no GKE,
incluindo falhas de inicialização de pods, erros de extração de imagens, problemas de conectividade de rede
e problemas de status de nós. |
Escalonamento automático
| Tópico |
Descrição |
| O escalonador automático de clusters não está reduzindo a escala vertical |
Diagnosticar e resolver motivos comuns pelos quais o cluster não está removendo
nós subutilizados. Saiba como verificar problemas como restritivos
PodDisruptionBudgets, pods com armazenamento local ou anotações específicas
(por exemplo, "cluster-autoscaler.kubernetes.io/safe-to-evict": "false")
que impedem a remoção de nós. |
| O escalonador automático de clusters não está aumentando a escala vertical |
Saiba por que o escalonador automático de clusters não está adicionando novos nós para atender à demanda.
Verifique se há pods não programáveis, se você não atingiu os limites de tamanho do cluster ou do pool de nós
e identifique possíveis problemas de cota de recursos ou disponibilidade de VMs regionais. |
| Escalonamento automático horizontal de pods |
Resolver problemas com o Escalonador automático horizontal de pods que não está escalonando
as réplicas de pods do aplicativo. Resolver problemas comuns, como
recursos HorizontalPodAutoscaler mal configurados ou problemas com o pipeline de métricas. |
| Escalonamento automático vertical de pods |
Resolver problemas com o VerticalPodAutoscaler que não está escalonando
os recursos de pods do aplicativo. Resolver problemas comuns, como
recursos VerticalPodAutoscaler mal configurados ou problemas com o pipeline de métricas
pipeline. |
Armazenamento
| Tópico |
Descrição |
| Armazenamento |
Resolver problemas de armazenamento, incluindo problemas com discos permanentes regionais,
desempenho do disco e expansão de volume. |
Segurança do cluster
A autoridade certificadora raiz do cluster expira em breve
Cargas de trabalho
| Tópico |
Descrição |
| Cargas de trabalho implantadas |
Resolver problemas de erros em cargas de trabalho executadas em um cluster do GKE
incluindo
PodUnschedulable.
Leia a seção PodUnschedulable para receber orientações sobre erros como
MatchNodeSelector e
Does not have minimum availability.
|
| Extrações de imagens |
Resolver problemas de extração de imagens. Saiba o que causa status como
ImagePullBackOff e ErrImagePull
e como resolver esses status corrigindo problemas comuns, como
autenticação e conectividade de rede. |
| Eventos CrashLoopBackOff |
Resolver problemas de eventos CrashLoopBackOff no
GKE. Diagnosticar problemas como esgotamento de recursos, configurações incorretas de apps
e falhas de verificação de atividade. |
| Eventos OOM |
Resolver problemas de eventos de falta de memória (OOM, na sigla em inglês) do Kubernetes. Identificar causas,
distinguir tipos de eventos e aplicar soluções eficazes para eliminações de OOM no contêiner
e no nó. |
| Cargas de trabalho Arm |
Resolver problemas com cargas de trabalho Arm, incluindo pods em nós Arm
que falham. |
| TPUs |
Resolver problemas de TPUs, incluindo problemas com cota, provisionamento automático de nós
, configuração de carga de trabalho e programação. |
| GPUs |
Resolver problemas de GPUs, incluindo problemas com instalação de drivers de GPU,
erros de plug-in de dispositivos e imagens de contêiner. |
Gerenciamento de clusters
| Tópico |
Descrição |
| Upgrades de cluster |
Resolver problemas de upgrade de cluster e de nó do GKE
incluindo upgrades longos ou incompletos, upgrades automáticos inesperados
falhas e problemas pós-upgrade. |
| Webhooks |
Entenda como resolver problemas e garantir a estabilidade do seu
plano de controle do cluster ao usar webhooks de admissão. |
Namespace travado no estado Terminating |
Resolver problemas com namespaces travados no
estadoTerminating identificando e removendo os componentes não íntegros
que estão impedindo a exclusão. |
| Operações simultâneas |
Resolver problemas de operações simultâneas aprendendo a identificar
esses erros e resolvê-los aguardando a conclusão das operações. |
Monitoramento
| Tópico |
Descrição |
| Métricas do sistema |
Resolver problemas de métricas do sistema que não aparecem no Cloud Monitoring. |
| Painéis de monitoramento |
Resolver problemas de painéis de monitoramento, incluindo problemas com a ativação do
monitoramento, recursos do Kubernetes ausentes e permissões. |
| Resolver problemas de registros ausentes |
Resolver problemas de registros do GKE ausentes. Saiba como verificar o status da API
, as configurações do cluster, as permissões, as cotas, os filtros e o comportamento do aplicativo. |
Erros 4xx
Problemas conhecidos
| Tópico |
Descrição |
| Problemas conhecidos |
Identificar e resolver problemas conhecidos que podem afetar o uso do GKE. |
A seguir