Questo documento elenca i documenti per la risoluzione dei problemi comuni che potresti
riscontrare quando utilizzi Google Kubernetes Engine (GKE). Che tu stia diagnosticando
errori del workload come ImagePullBackOff e CrashLoopBackOff, eseguendo il debug
del comportamento di scalabilità automatica del cluster, risolvendo problemi di PersistentVolume o
risolvendo problemi di registrazione dei nodi, i documenti elencati qui possono aiutarti.
Se non hai mai risolto problemi in GKE, inizia con
Introduzione alla risoluzione dei problemi.
Per diagnosticare e risolvere i problemi riscontrati, consulta i documenti nelle sezioni seguenti:
Per risolvere i problemi di networking di GKE, consulta
Risolvi i problemi di networking di GKE
nella documentazione sul networking di GKE.
Questo documento è destinato ad amministratori e architetti, specialisti della sicurezza, specialisti di Networking o specialisti di archiviazione che risolvono i problemi relativi alle configurazioni GKE. Per scoprire di più sui ruoli GKE,
consulta
Ruoli utente e attività comuni di GKE.
Introduzione alla risoluzione dei problemi
Configurazione del cluster
| Argomento |
Descrizione |
| Creazione del cluster |
Risolvi i problemi relativi alla creazione di cluster. |
| Cluster Autopilot |
Diagnostica e risolvi i problemi dei cluster GKE Autopilot, inclusi la creazione del cluster, l'eliminazione dello spazio dei nomi, lo scaling e i problemi relativi ai workload. |
| Strumento a riga di comando kubectl |
Risolvi i problemi dello strumento a riga di comando kubectl in
GKE, inclusi i problemi di autenticazione e autorizzazione.
Questa pagina include anche consigli su come
risolvere i problemi del proxy Konnectivity
per verificare se è la causa dell'interruzione
della risposta ai comandi kubectl logs, attach,
exec o port-forward. |
| Pool di nodi standard |
Risolvi i problemi relativi ai node pool GKE Standard,
inclusi problemi di creazione pool di nodi, provisioning best-effort,
metadati dell'istanza danneggiati e migrazione dei carichi di lavoro a nuovi node pool. |
Stato del nodo NotReady |
Scopri come diagnosticare e risolvere lo stato NotReady
del nodo in GKE risolvendo le cause comuni, come
carenze di risorse, problemi di rete e guasti dei componenti. |
| Registrazione del nodo |
Risolvi i problemi che si verificano durante l'aggiunta di nodi al cluster GKE Standard, ad esempio errori di registrazione dei nodi e prerequisiti mancanti per la registrazione corretta dei nodi. |
| Runtime container |
Risolvi i problemi relativi ai runtime dei container in GKE, inclusi
i problemi relativi a containerd e dockershim e
i registri privati. |
Scalabilità automatica
| Argomento |
Descrizione |
| Il gestore della scalabilità automatica del cluster non esegue lo scale down |
Diagnostica e risolvi i motivi comuni per cui il cluster non rimuove
i nodi sottoutilizzati. Scopri come verificare la presenza di problemi come PodDisruptionBudgets restrittivi, pod con spazio di archiviazione locale o annotazioni specifiche (ad esempio "cluster-autoscaler.kubernetes.io/safe-to-evict": "false") che impediscono l'espulsione dei nodi. |
| Il gestore della scalabilità automatica del cluster non esegue lo scale up |
Scopri perché il gestore della scalabilità automatica dei cluster non aggiunge nuovi nodi per soddisfare la domanda.
Controlla la presenza di pod non pianificabili, verifica di non aver raggiunto i limiti di dimensioni del cluster o del pool di nodi e identifica potenziali problemi di quota di risorse o di disponibilità delle VM regionali. |
| Scalabilità automatica orizzontale dei pod |
Risolvi i problemi relativi alla mancata scalabilità di Horizontal Pod Autoscaler
delle repliche dei pod della tua applicazione. Risolvi i problemi comuni, ad esempio
oggetti HorizontalPodAutoscaler configurati in modo errato o problemi con la pipeline
delle metriche. |
Archiviazione
| Argomento |
Descrizione |
| Spazio di archiviazione |
Risolvi i problemi di archiviazione, inclusi quelli relativi ai dischi permanenti regionali,
alle prestazioni del disco e all'espansione del volume. |
Sicurezza del cluster
L'autorità di certificazione radice del cluster scadrà a breve
Workload
| Argomento |
Descrizione |
| Workload di cui è stato eseguito il deployment |
Risolvi gli errori per i carichi di lavoro in esecuzione in un cluster GKE, inclusi PodUnschedulable.
Leggi la sezione PodUnschedulable per suggerimenti su errori come
MatchNodeSelector e
Does not have minimum availability.
|
| Estrazioni di immagini |
Risolvi i problemi relativi ai pull delle immagini. Scopri le cause di stati come
ImagePullBackOff e ErrImagePull
e come risolverli correggendo problemi comuni come
l'autenticazione e la connettività di rete. |
| Eventi CrashLoopBackOff |
Risolvi i problemi relativi agli eventi CrashLoopBackOff in
GKE. Diagnostica problemi come esaurimento delle risorse, errori di configurazione
delle app e errori del probe di attività. |
| Eventi OOM |
Risolvi i problemi relativi agli eventi di esaurimento della memoria (OOM) di Kubernetes. Identificare le cause,
distinguere i tipi di eventi e applicare soluzioni efficaci per gli errori OOM a livello di container e nodo. |
| Workload Arm |
Risolvi i problemi relativi ai workload ARM, incluso l'arresto anomalo dei pod sui nodi ARM. |
| TPU |
Risolvi i problemi relativi alle TPU, inclusi quelli relativi a quota, provisioning automatico dei nodi, configurazione e pianificazione dei workload. |
| GPU |
Risolvi i problemi relativi alle GPU, inclusi quelli relativi all'installazione dei driver GPU,
agli errori dei plug-in del dispositivo e alle immagini dei container. |
Gestione dei cluster
| Argomento |
Descrizione |
| Upgrade dei cluster |
Risolvi i problemi di upgrade del cluster e dei nodi GKE, inclusi upgrade lunghi o incompleti, upgrade automatici imprevisti, errori e problemi post-upgrade. |
| Webhook |
Scopri come risolvere i problemi e garantire la stabilità del piano di controllo del cluster quando utilizzi i webhook di ammissione. |
Spazio dei nomi bloccato nello stato Terminating |
Risolvi i problemi relativi agli spazi dei nomi bloccati nello stato
Terminating identificando e rimuovendo i componenti non integri
che bloccano l'eliminazione. |
| Operazioni simultanee |
Risolvi i problemi relativi alle operazioni simultanee imparando a identificare
questi errori e a risolverli aspettando che le operazioni vengano completate. |
Monitoraggio
| Argomento |
Descrizione |
| Metriche di sistema |
Risolvi i problemi relativi alla mancata visualizzazione delle metriche di sistema in Cloud Monitoring. |
| Dashboard di Monitoring |
Risolvi i problemi relativi alle dashboard di monitoraggio, inclusi quelli relativi all'attivazione
del monitoraggio, alle risorse Kubernetes mancanti e alle autorizzazioni. |
| Risolvere i problemi relativi ai log mancanti |
Risolvi i problemi relativi ai log di GKE mancanti. Scopri come controllare lo stato dell'API, le impostazioni del cluster, le autorizzazioni, le quote, i filtri e il comportamento dell'applicazione. |
Errori 4xx
Problemi noti
| Argomento |
Descrizione |
| Problemi noti |
Identifica e risolvi i problemi noti che potrebbero
influire sul tuo utilizzo di GKE. |
Passaggi successivi