En este documento, se enumeran los documentos de solución de problemas para problemas comunes que puedes encontrar cuando usas Google Kubernetes Engine (GKE). Ya sea que estés diagnosticando errores de cargas de trabajo como ImagePullBackOff y CrashLoopBackOff, depurando el comportamiento del ajuste de escala automático del clúster, resolviendo problemas de PersistentVolume o solucionando problemas de registro de nodos, los documentos que se enumeran aquí pueden ayudarte.
Si eres nuevo en la solución de problemas en GKE, comienza con
Introducción a la solución de problemas.
Para diagnosticar y resolver los problemas que encuentres, consulta los documentos en las siguientes secciones:
Para solucionar problemas de redes de GKE, consulta
Soluciona problemas de redes de GKE
en la documentación de redes de GKE.
Este documento está destinado a administradores y arquitectos, especialistas en seguridad, especialistas en redes o especialistas en almacenamiento que solucionan problemas de configuraciones de GKE. Para obtener más información sobre los roles de GKE,
consulta
Roles y tareas comunes del usuario de GKE.
Introducción a la solución de problemas
Configuración del clúster
| Tema |
Descripción |
| Creación del clúster |
Resuelve problemas relacionados con la creación de clústeres. |
| Clústeres de Autopilot |
Diagnostica y soluciona problemas de los clústeres de Autopilot de GKE, incluidos los problemas de creación de clústeres, eliminación de espacios de nombres, ajuste de escala y cargas de trabajo. |
| Herramienta de línea de comandos de Kubectl |
Soluciona problemas de la herramienta de línea de comandos de kubectl en
GKE, incluidos los problemas de autenticación y autorización.
Esta página también incluye sugerencias para solucionar problemas del proxy de Konnectivity y verificar si está causando que los comandos kubectl logs, attach, exec o port-forward dejen de responder. |
| Grupos de nodos estándar |
Soluciona problemas de grupos de nodos de GKE Standard,
incluidos los problemas relacionados con la creación de grupos de nodos, el aprovisionamiento de mejor esfuerzo,
los metadatos de instancias dañados y la migración de cargas de trabajo a grupos de nodos nuevos. |
Estado NotReady del nodo |
Aprende a diagnosticar y resolver el estado NotReady
del nodo en GKE solucionando problemas de causas comunes, como
la escasez de recursos, los problemas de red y las fallas de componentes. |
| Registro de nodos |
Soluciona problemas que ocurren cuando agregas nodos a tu
clúster de GKE Standard, como fallas en el registro de nodos
y la falta de requisitos previos para el registro correcto de nodos. |
| Entorno de ejecución del contenedor |
Soluciona problemas de entornos de ejecución de contenedores en GKE, incluidos
problemas relacionados con containerd y dockershim, y
registros privados. |
| Grupos de nodos de Windows Server |
Soluciona problemas de grupos de nodos de Windows Server en GKE,
incluidas las fallas de inicio de Pods, los errores de extracción de imágenes, los problemas de conectividad de red
y los problemas de estado de los nodos. |
Ajuste de escala automático
| Tema |
Descripción |
| El escalador automático de clústeres no reduce la escala |
Diagnostica y resuelve los motivos comunes por los que tu clúster no quita los nodos subutilizados. Aprende a verificar problemas como
PodDisruptionBudgets restrictivos, Pods con almacenamiento local o anotaciones específicas
(por ejemplo, "cluster-autoscaler.kubernetes.io/safe-to-evict": "false")
que impiden el desalojo de nodos. |
| El escalador automático de clústeres no aumenta la escala |
Descubre por qué el escalador automático de clústeres no agrega nodos nuevos para satisfacer la demanda.
Verifica si hay Pods no programables, verifica que no hayas alcanzado los límites de tamaño del clúster o del grupo de nodos
y, luego, identifica posibles problemas de cuota de recursos o disponibilidad de VM regionales. |
| Escalado automático horizontal de Pods |
Soluciona problemas relacionados con el Horizontal Pod Autoscaler que no ajusta la escala de las réplicas de Pod de tu aplicación. Resuelve problemas comunes, como
recursos HorizontalPodAutoscaler mal configurados o problemas con la canalización de métricas. |
| Ajuste de escala automático vertical de Pods |
Soluciona problemas relacionados con el VerticalPodAutoscaler que no ajusta la escala de los recursos de Pod de tu aplicación. Resuelve problemas comunes, como
recursos VerticalPodAutoscaler mal configurados o problemas con la canalización de métricas. |
Almacenamiento
| Tema |
Descripción |
| Almacenamiento |
Soluciona problemas de almacenamiento, incluidos los problemas relacionados con los discos persistentes regionales,
el rendimiento del disco y la expansión del volumen. |
Seguridad del clúster
La autoridad de certificación raíz del clúster vencerá pronto
Cargas de trabajo
| Tema |
Descripción |
| Cargas de trabajo implementadas |
Soluciona problemas de errores de cargas de trabajo que se ejecutan en un clúster de GKE, incluidos
PodUnschedulable.
Lee la sección PodUnschedulable para obtener sugerencias sobre errores como
MatchNodeSelector y
Does not have minimum availability.
|
| Extracciones de imágenes |
Soluciona problemas de extracción de imágenes. Descubre qué causa estados como
ImagePullBackOff y ErrImagePull
y cómo resolverlos corrigiendo problemas comunes como la
autenticación y la conectividad de red. |
| Eventos de CrashLoopBackOff |
Soluciona problemas relacionados con eventos de CrashLoopBackOff en
GKE. Diagnostica problemas como el agotamiento de recursos, las configuraciones incorrectas de la app
y las fallas de la sonda de actividad. |
| Eventos de OOM |
Soluciona problemas relacionados con eventos de memoria insuficiente (OOM) de Kubernetes. Identifica las causas,
distingue los tipos de eventos y aplica soluciones eficaces para los cierres por OOM a nivel del contenedor
y del nodo. |
| Cargas de trabajo de Arm |
Soluciona problemas de cargas de trabajo de Arm, incluidos los Pods que fallan en los nodos de Arm
fallan. |
| TPUs |
Soluciona problemas de TPUs, incluidos los problemas relacionados con la cuota, el aprovisionamiento automático de nodos
, la configuración de cargas de trabajo y la programación. |
| GPUs |
Soluciona problemas de GPUs, incluidos los problemas relacionados con la instalación de controladores de GPU,
errores de complementos de dispositivos y las imágenes de contenedores. |
Administración de clústeres
| Tema |
Descripción |
| Actualizaciones del clúster |
Soluciona problemas de actualización de clústeres y nodos
de GKE, incluidos los problemas relacionados con actualizaciones largas o incompletas, actualizaciones automáticas inesperadas
, fallas y problemas posteriores a la actualización. |
| Webhooks |
Comprende cómo solucionar problemas y garantizar la estabilidad del
plano de control del clúster cuando usas webhooks de admisión. |
Espacio de nombres atascado en el estado Terminating |
Soluciona problemas relacionados con espacios de nombres atascados en el
Terminating estado identificando y quitando los componentes en mal estado que bloquean la eliminación. |
| Operaciones simultáneas |
Soluciona problemas relacionados con operaciones simultáneas aprendiendo a identificar
estos errores y resolviéndolos esperando que se completen las operaciones. |
Supervisión
| Tema |
Descripción |
| Métricas del sistema |
Soluciona problemas relacionados con las métricas del sistema que no aparecen en Cloud Monitoring. |
| Paneles de Monitoring |
Soluciona problemas relacionados con los paneles de Monitoring, incluidos los problemas relacionados con la habilitación de
la supervisión, la falta de recursos de Kubernetes y los permisos. |
| Soluciona problemas relacionados con la falta de registros |
Soluciona problemas relacionados con la falta de registros de GKE. Aprende a verificar el estado de la API
el estado, la configuración del clúster, los permisos, las cuotas, los filtros y el comportamiento de la aplicación
el comportamiento. |
Errores 4xx
Problemas conocidos
| Tema |
Descripción |
| Problemas conocidos |
Identifica y resuelve problemas conocidos que podrían afectar tu uso de GKE. |
¿Qué sigue?