Questo documento elenca i documenti per la risoluzione dei problemi comuni che potresti riscontrare durante l'utilizzo di Google Kubernetes Engine (GKE). Che tu stia diagnosticando errori di workload come ImagePullBackOff e CrashLoopBackOff, eseguendo il debug del comportamento di scalabilità automatica del cluster, risolvendo problemi di PersistentVolume o risolvendo i problemi di registrazione dei nodi, i documenti elencati qui possono aiutarti.
Se non hai mai risolto i problemi in GKE, inizia con
Introduzione alla risoluzione dei problemi.
Per diagnosticare e risolvere i problemi riscontrati, consulta i documenti nelle seguenti sezioni:
Per risolvere i problemi di rete GKE, consulta
Risolvere i problemi di rete GKE
nella documentazione di rete GKE.
Questo documento è destinato ad amministratori e architetti, specialisti della sicurezza, specialisti di Networking o specialisti di archiviazione che risolvono i problemi di configurazione di GKE. Per saperne di più sui ruoli GKE,
consulta
Ruoli e attività utente GKE comuni.
Introduzione alla risoluzione dei problemi
Configurazione del cluster
| Argomento |
Descrizione |
| Creazione del cluster |
Risolvi i problemi relativi alla creazione dei cluster. |
| Cluster Autopilot |
Diagnostica e risolvi i problemi dei cluster GKE Autopilot, inclusi la creazione di cluster, l'eliminazione di spazi dei nomi, la scalabilità e i problemi dei workload. |
| Strumento a riga di comando Kubectl |
Risolvi i problemi dello strumento a riga di comando kubectl in
GKE, inclusi i problemi di autenticazione e autorizzazione.
Questa pagina include anche consigli su come
risolvere i problemi del proxy Konnectivity
per verificare se causa l'interruzione della risposta dei comandi kubectl logs, attach,
exec, o port-forward. |
| Node pool standard |
Risolvi i problemi dei node pool GKE Standard,
inclusi i problemi relativi alla creazione di pool di nodi, al provisioning best-effort,
ai metadati delle istanze danneggiati e alla migrazione dei workload a nuovi node pool. |
Stato NotReady del nodo |
Scopri come diagnosticare e risolvere lo stato NotReady
del nodo in GKE risolvendo le cause comuni, come
carenze di risorse, problemi di rete ed errori dei componenti. |
| Registrazione dei nodi |
Risolvi i problemi che si verificano quando aggiungi nodi al tuo
cluster GKE Standard, come errori di registrazione dei nodi
e prerequisiti mancanti per la registrazione dei nodi. |
| Runtime container |
Risolvi i problemi dei runtime container in GKE, inclusi
i problemi relativi a containerd e dockershim, nonché ai
registri privati. |
| Node pool Windows Server |
Risolvi i problemi relativi ai node pool Windows Server in GKE,
inclusi errori di avvio dei pod, errori di pull delle immagini, problemi di connettività di rete
e problemi di stato dei nodi. |
Scalabilità automatica
| Argomento |
Descrizione |
| Il gestore della scalabilità automatica del cluster non esegue lo scale down |
Diagnostica e risolvi i motivi comuni per cui il cluster non rimuove i nodi sottoutilizzati. Scopri come verificare la presenza di problemi come restrittivi
PodDisruptionBudgets, pod con spazio di archiviazione locale o annotazioni specifiche
(ad esempio, "cluster-autoscaler.kubernetes.io/safe-to-evict": "false")
che impediscono l'espulsione dei nodi. |
| Il gestore della scalabilità automatica del cluster non esegue lo scale up |
Scopri perché il gestore della scalabilità automatica del cluster non aggiunge nuovi nodi per soddisfare la domanda.
Verifica la presenza di pod non pianificabili, assicurati di non aver raggiunto i limiti di dimensioni del cluster o del node
pool e identifica potenziali problemi di quota di risorse o di disponibilità delle VM
availability issues. |
| Scalabilità automatica orizzontale dei pod |
Risolvi i problemi relativi al Horizontal Pod Autoscaler che non scala
le repliche dei pod dell'applicazione. Risolvi i problemi comuni, come
risorse HorizontalPodAutoscaler configurate in modo errato o problemi con la pipeline delle metriche
|
| Scalabilità automatica verticale dei pod |
Risolvi i problemi relativi al gestore della scalabilità automatica pod verticale che non scala
le risorse dei pod dell'applicazione. Risolvi i problemi comuni, come
risorse VerticalPodAutoscaler configurate in modo errato o problemi con la pipeline delle metriche. |
Spazio di archiviazione
| Argomento |
Descrizione |
| Spazio di archiviazione |
Risolvi i problemi di archiviazione, inclusi i problemi relativi ai dischi permanenti regionali,
prestazioni dei dischi e all'espansione dei volumi. |
Sicurezza del cluster
L'autorità di certificazione radice del cluster scadrà a breve
Workload
| Argomento |
Descrizione |
| Workload di cui è stato eseguito il deployment |
Risolvi gli errori relativi ai workload in esecuzione in un cluster GKE
incluso
PodUnschedulable.
Leggi la sezione PodUnschedulable per ricevere consigli su errori come
MatchNodeSelector e
Does not have minimum availability.
|
| Pull delle immagini |
Risolvi i problemi relativi al pull delle immagini. Scopri le cause di stati come
ImagePullBackOff e ErrImagePull
e come risolverli correggendo problemi comuni come
l'autenticazione e la connettività di rete. |
| Eventi CrashLoopBackOff |
Risolvi i problemi relativi agli0/eventi in101GKE.CrashLoopBackOff Diagnostica problemi come l'esaurimento delle risorse, le configurazioni errate delle app
e gli errori del probe di attività. |
| Eventi OOM |
Risolvi i problemi relativi agli eventi Out Of Memory (OOM) di Kubernetes. Identifica le cause,
distingui i tipi di eventi e applica soluzioni efficaci per gli OOM kill a livello di container
e di nodo. |
| Workload Arm |
Risolvi i problemi relativi ai workload Arm, inclusi i pod sui nodi Arm che si arrestano in modo anomalo. |
| TPU |
Risolvi i problemi relativi alle TPU, inclusi i problemi relativi a quota, provisioning automatico dei nodi
, configurazione dei workload e pianificazione. |
| GPU |
Risolvi i problemi relativi alle GPU, inclusi i problemi relativi all'installazione dei driver GPU,
errori dei plug-in dei dispositivi e immagini container. |
Gestione dei cluster
| Argomento |
Descrizione |
| Upgrade dei cluster |
Risolvi i problemi relativi all'upgrade dei cluster e dei nodi GKE
inclusi upgrade lunghi o incompleti, upgrade automatici imprevisti
errori e problemi post-upgrade. |
| Webhook |
Scopri come risolvere i problemi e garantire la stabilità del
control plane del cluster quando utilizzi i webhook di ammissione. |
Lo spazio dei nomi è bloccato nello stato Terminating |
Risolvi i problemi relativi agli spazi dei nomi bloccati nello
Terminating stato identificando e rimuovendo i componenti non integri
che bloccano l'eliminazione. |
| Operazioni simultanee |
Risolvi i problemi relativi alle operazioni simultanee imparando a identificare
questi errori e a risolverli attendendo il completamento delle operazioni. |
Monitoraggio
| Argomento |
Descrizione |
| Metriche di sistema |
Risolvi i problemi relativi alle metriche di sistema che non vengono visualizzate in Cloud Monitoring. |
| Dashboard di monitoraggio |
Risolvi i problemi relativi alle dashboard di monitoraggio, inclusi i problemi relativi all'abilitazione
monitoraggio, alle risorse Kubernetes mancanti e alle autorizzazioni. |
| Risolvi i problemi relativi ai log mancanti |
Risolvi i problemi relativi ai log GKE mancanti. Scopri come controllare lo stato dell'API
lo stato, le impostazioni del cluster, le autorizzazioni, le quote, i filtri e il comportamento dell'applicazione
il comportamento. |
Errori 4xx
Problemi noti
| Argomento |
Descrizione |
| Problemi noti |
Identifica e risolvi i problemi noti che potrebbero influire sul tuo utilizzo di GKE. |
Passaggi successivi