In diesem Dokument finden Sie Links zu Dokumenten zur Fehlerbehebung für häufige Probleme, die bei der Verwendung von Google Kubernetes Engine (GKE) auftreten können. Ob Sie Arbeitslastfehler wie ImagePullBackOff und CrashLoopBackOff diagnostizieren, das Verhalten des Cluster Autoscalers debuggen, Probleme mit PersistentVolumes beheben oder Probleme mit der Knotenregistrierung beheben möchten – die hier aufgeführten Dokumente können Ihnen helfen.
Wenn Sie noch keine Erfahrung mit der Fehlerbehebung in GKE haben, beginnen Sie mit
der Einführung in die Fehlerbehebung.
Informationen zum Diagnostizieren und Beheben von Problemen finden Sie in den Dokumenten in den folgenden Abschnitten:
Informationen zur Fehlerbehebung bei der GKE-Netzwerkkonfiguration finden Sie unter
Fehlerbehebung bei der GKE-Netzwerkkonfiguration
in der GKE-Netzwerkdokumentation.
Dieses Dokument richtet sich an Administratoren und Architekten, Sicherheitsexperten, Netzwerkspezialisten oder Speicherspezialisten, die Fehler in GKE-Konfigurationen beheben. Weitere Informationen zu GKE-Rollen finden Sie unter Häufig verwendete GKE-Nutzerrollen und -Aufgaben.
Einführung in die Fehlerbehebung
Clustereinrichtung
| Thema |
Beschreibung |
| Clustererstellung |
Probleme beim Erstellen von Clustern beheben. |
| Autopilot-Cluster |
GKE Autopilot-Cluster diagnostizieren und Fehler beheben, einschließlich Clustererstellung, Löschen von Namespaces, Skalierung und Arbeitslastprobleme. |
| Befehlszeilentool `kubectl` |
Fehlerbehebung beim kubectl Befehlszeilentool in
GKE, einschließlich Problemen mit Authentifizierung und Autorisierung.
Diese Seite enthält auch Informationen zur Fehlerbehebung beim Konnectivity-Proxy, um zu prüfen, ob er dazu führt, dass die Befehle kubectl logs, attach, exec oder port-forward nicht mehr reagieren. |
| Standard-Knotenpools |
Fehlerbehebung bei GKE Standard-Knotenpools,
einschließlich Problemen bei der Erstellung von Knotenpools, der Bereitstellung nach bestem Bemühen,
beschädigten Instanzmetadaten und der Migration von Arbeitslasten zu neuen Knotenpools. |
Knotenstatus NotReady |
Informationen zum Diagnostizieren und Beheben des Knotenstatus NotReady
in GKE durch Fehlerbehebung bei häufigen Ursachen wie
Ressourcenmangel, Netzwerkproblemen und Komponentenausfällen. |
| Knotenregistrierung |
Fehlerbehebung bei Problemen, die beim Hinzufügen von Knoten zu einem
GKE Standard-Cluster auftreten, z. B. Fehler bei der Knotenregistrierung
und fehlende Voraussetzungen für eine erfolgreiche Knotenregistrierung. |
| Containerlaufzeit |
Fehlerbehebung bei Containerlaufzeiten in GKE, einschließlich
Problemen mit containerd und dockershim sowie
privaten Registries. |
| Windows Server-Knotenpools |
Fehlerbehebung bei Problemen mit Windows Server-Knotenpools in GKE,
einschließlich Pod-Startfehlern, Fehlern beim Abrufen von Images, Problemen mit der Netzwerkkonnektivität
Problemen und Problemen mit dem Knotenstatus. |
Autoscaling
| Thema |
Beschreibung |
| Cluster Autoscaler skaliert nicht herunter |
Häufige Gründe dafür, dass der Cluster nicht ausgelastete Knoten nicht entfernt, diagnostizieren und beheben. Informationen zum Prüfen auf Probleme wie restriktive
PodDisruptionBudgets, Pods mit lokalem Speicher oder bestimmte Anmerkungen
(z. B. "cluster-autoscaler.kubernetes.io/safe-to-evict": "false")
die das Entfernen von Knoten verhindern. |
| Cluster Autoscaler skaliert nicht hoch |
Informationen dazu, warum der Cluster Autoscaler keine neuen Knoten hinzufügt, um die Nachfrage zu decken.
Prüfen Sie, ob Pods nicht geplant werden können, ob die Größenlimits für Cluster oder Knoten
pools erreicht wurden, und ermitteln Sie potenzielle Probleme mit Ressourcenkontingenten oder der regionalen VM
Verfügbarkeit. |
| Horizontales Pod-Autoscaling |
Fehlerbehebung bei Problemen, bei denen der horizontale Pod-Autoscaler die Pod-Replikate der Anwendung nicht skaliert. Häufige Probleme beheben, z. B.
falsch konfigurierte HorizontalPodAutoscaler-Ressourcen oder Probleme mit der Messwert
pipeline. |
| Vertikales Pod-Autoscaling |
Fehlerbehebung bei Problemen, bei denen der VerticalPodAutoscaler
die Pod-Ressourcen der Anwendung nicht skaliert. Häufige Probleme beheben, z. B.
falsch konfigurierte VerticalPodAutoscaler-Ressourcen oder Probleme mit der Messwert
pipeline. |
Speicher
| Thema |
Beschreibung |
| Speicher |
Fehlerbehebung bei Speicherproblemen, einschließlich Problemen mit regionalen nichtflüchtigen Festplatten,
der Festplattenleistung und der Volume-Erweiterung. |
Clustersicherheit
Ablauf der Stammzertifizierungsstelle des Clusters steht bevor
Arbeitslasten
| Thema |
Beschreibung |
| Bereitgestellte Arbeitslasten |
Fehlerbehebung bei Fehlern für Arbeitslasten, die in einem GKE
Cluster ausgeführt werden, einschließlich
PodUnschedulable.
Im Abschnitt PodUnschedulable finden Sie Informationen zu Fehlern wie
MatchNodeSelector und
Does not have minimum availability.
|
| Image-Abrufe |
Fehlerbehebung bei Image-Abrufen. Informationen zu den Ursachen für Status wie
ImagePullBackOff und ErrImagePull
und wie Sie diese Status beheben können, indem Sie häufige Probleme wie
Authentifizierung und Netzwerkkonnektivität beheben. |
| CrashLoopBackOff-Ereignisse |
Fehlerbehebung bei CrashLoopBackOff Ereignissen in
GKE. Probleme wie Ressourcenmangel, App
Fehlkonfigurationen und Fehler bei Liveness-Tests diagnostizieren. |
| OOM-Ereignisse |
Fehlerbehebung bei Kubernetes-Ereignissen aufgrund von unzureichendem Arbeitsspeicher (Out of Memory, OOM). Ursachen ermitteln,
Ereignistypen unterscheiden und effektive Lösungen für OOM-Kills auf Container-
und Knotenebene anwenden. |
| Arm-Arbeitslasten |
Fehlerbehebung bei Problemen mit Arm-Arbeitslasten, einschließlich Abstürzen von Pods auf Arm-Knoten. |
| TPUs |
Fehlerbehebung bei TPUs, einschließlich Problemen mit Kontingenten, der automatischen Knotenbereitstellung
, der Arbeitslastkonfiguration und der Planung. |
| GPUs |
Fehlerbehebung bei GPUs, einschließlich Problemen mit der Installation von GPU-Treibern,
Geräte-Plug-in-Fehlern und Container-Images. |
Clusterverwaltung
| Thema |
Beschreibung |
| Cluster upgrades |
Fehlerbehebung bei Problemen mit GKE-Cluster- und Knoten
Upgrade, einschließlich langer oder unvollständiger Upgrades, unerwarteter
automatischer Upgrades, Fehlern und Problemen nach dem Upgrade. |
| Webhooks |
Informationen zur Fehlerbehebung und zur Gewährleistung der Stabilität der
Cluster-Steuerungsebene bei Verwendung von Zulassungs-Webhooks. |
Namespace im Status Terminating |
Fehlerbehebung bei Problemen mit Namespaces, die im
Terminating Status festhängen, indem Sie die fehlerhaften
Komponenten, die das Löschen blockieren, identifizieren und entfernen. |
| Gleichzeitige Vorgänge |
Fehlerbehebung bei gleichzeitigen Vorgängen, indem Sie erfahren, wie Sie diese Fehler identifizieren
und beheben, indem Sie warten, bis die Vorgänge abgeschlossen sind. |
Monitoring
| Thema |
Beschreibung |
| Systemmesswerte |
Fehlerbehebung bei Systemmesswerten, die in Cloud Monitoring nicht angezeigt werden. |
| Monitoring-Dashboards |
Fehlerbehebung bei Monitoring-Dashboards, einschließlich Problemen mit der Aktivierung
Monitoring, fehlenden Kubernetes-Ressourcen und Berechtigungen. |
| Fehlerbehebung bei fehlenden Logs |
Fehlerbehebung bei fehlenden GKE-Logs. Informationen zum Prüfen des API
Status, der Clustereinstellungen, Berechtigungen, Kontingente, Filter und des Anwendungs
verhaltens. |
4xx-Fehler
Bekannte Probleme
| Thema |
Beschreibung |
| Bekannte Probleme |
Bekannte Probleme identifizieren und beheben, die sich auf die Verwendung von GKE auswirken können. |
Nächste Schritte