Memecahkan masalah GKE

Dokumen ini mencantumkan dokumen pemecahan masalah untuk masalah umum yang mungkin Anda alami saat menggunakan Google Kubernetes Engine (GKE). Baik Anda mendiagnosis error workload seperti ImagePullBackOff dan CrashLoopBackOff, melakukan debug perilaku penskalaan otomatis cluster, menyelesaikan masalah PersistentVolume, atau memecahkan masalah pendaftaran node, dokumen yang tercantum di sini dapat membantu.

Jika Anda baru menggunakan pemecahan masalah di GKE, mulailah dengan Pengantar pemecahan masalah.

Untuk mendiagnosis dan menyelesaikan masalah yang Anda alami, lihat dokumen di bagian berikut:

Untuk memecahkan masalah jaringan GKE, lihat Memecahkan masalah jaringan GKE di dokumentasi jaringan GKE.

Dokumen ini ditujukan untuk Admin dan arsitek, Spesialis keamanan, Spesialis jaringan, atau Spesialis penyimpanan yang memecahkan masalah konfigurasi GKE. Untuk mempelajari peran GKE lebih lanjut, lihat Peran dan tugas pengguna GKE umum.

Pengantar pemecahan masalah

Topik Deskripsi
Pengantar pemecahan masalah GKE Mulai memecahkan masalah GKE dengan mempelajari proses keseluruhan dan konsep dasar.
Meninjau status dan insiden layanan Pelajari cara memeriksa status GKE dan layanan terkait Google Cloud untuk mengecualikan masalah platform.
Menilai status cluster dan workload di Google Cloud konsol Pelajari cara menggunakan Google Cloud konsol untuk menyelidiki dan menyelesaikan masalah GKE.
Menyelidiki status cluster dengan kubectl Pelajari perintah kubectl dan teknik umum untuk mendiagnosis masalah di cluster dan workload Anda.
Melakukan analisis historis dengan Cloud Logging Pahami cara menggunakan Cloud Logging secara efektif untuk menemukan penyebab utama masalah di GKE.
Melakukan pemantauan proaktif dengan Cloud Monitoring Gunakan dasbor dan metrik Cloud Monitoring untuk mengidentifikasi, mendiagnosis, dan menyelesaikan masalah GKE.
Mempercepat diagnosis dengan Gemini Cloud Assist Temukan cara Gemini dapat membantu mendiagnosis dan menyelesaikan masalah GKE.
Menyatukan semuanya: Contoh skenario pemecahan masalah Ikuti contoh langkah demi langkah untuk memecahkan masalah skenario umum di GKE.

Penyiapan cluster

Topik Deskripsi
Pembuatan cluster Menyelesaikan masalah terkait pembuatan cluster.
Cluster Autopilot Mendiagnosis dan memecahkan masalah cluster GKE Autopilot, termasuk pembuatan cluster, penghapusan namespace, penskalaan, dan masalah workload.
Alat command line Kubectl Memecahkan masalah alat command line kubectl di GKE, termasuk masalah autentikasi dan otorisasi. Halaman ini juga menyertakan saran tentang cara memecahkan masalah proxy Konnectivity untuk memeriksa apakah proxy tersebut menyebabkan perintah kubectl logs, attach, exec, atau port-forward berhenti merespons.
Node pool Standar Memecahkan masalah node pool GKE Standar, termasuk masalah terkait pembuatan node pool, penyediaan terbaik, metadata instance yang rusak, dan migrasi workload ke node pool baru.
Status node NotReady Pelajari cara mendiagnosis dan menyelesaikan status node NotReady di GKE dengan memecahkan masalah penyebab umum seperti kekurangan resource, masalah jaringan, dan kegagalan komponen.
Pendaftaran node Memecahkan masalah yang terjadi saat menambahkan node ke cluster GKE Standar, seperti kegagalan pendaftaran node dan prasyarat yang tidak ada untuk pendaftaran node yang berhasil.
Runtime container Memecahkan masalah runtime container di GKE, termasuk masalah terkait containerd dan dockershim, serta registry pribadi.
Node pool Windows Server Memecahkan masalah node pool Windows Server di GKE, termasuk kegagalan memulai Pod, error saat menarik image, masalah konektivitas jaringan dan masalah status node.

Autoscaling

Topik Deskripsi
Autoscaler cluster tidak menurunkan skala Mendiagnosis dan menyelesaikan alasan umum cluster Anda tidak menghapus node yang kurang dimanfaatkan. Pelajari cara memeriksa masalah seperti restrictive PodDisruptionBudgets, Pod dengan penyimpanan lokal, atau anotasi tertentu (misalnya, "cluster-autoscaler.kubernetes.io/safe-to-evict": "false") yang mencegah penghentian node.
Autoscaler cluster tidak meningkatkan skala Pelajari alasan autoscaler cluster tidak menambahkan node baru untuk memenuhi permintaan. Periksa Pod yang tidak dapat dijadwalkan, pastikan Anda belum mencapai batas ukuran cluster atau node pool, dan identifikasi potensi masalah kuota resource atau ketersediaan VM regional.
Penskalaan otomatis Pod horizontal Memecahkan masalah terkait Penskalaan Otomatis Pod Horizontal yang tidak menskalakan replika Pod aplikasi Anda. Selesaikan masalah umum, seperti resource HorizontalPodAutoscaler yang salah konfigurasi atau masalah dengan pipeline metrik pipeline.
Penskalaan otomatis Pod vertikal Memecahkan masalah terkait VerticalPodAutoscaler yang tidak menskalakan resource Pod aplikasi Anda. Selesaikan masalah umum, seperti resource VerticalPodAutoscaler yang salah konfigurasi atau masalah dengan pipeline metrik pipeline.

Penyimpanan

Topik Deskripsi
Penyimpanan Memecahkan masalah penyimpanan, termasuk masalah terkait persistent disk regional, performa disk, dan perluasan volume.

Keamanan cluster

Topik Deskripsi
Authentication Memecahkan masalah autentikasi di GKE, termasuk masalah terkait RBAC, Workload Identity Federation for GKE, dan server metadata GKE.
Akun layanan Memecahkan masalah akun layanan, termasuk memulihkan akun layanan default akun dan mengaktifkan akun layanan default Compute Engine.
Secret lapisan aplikasi Memecahkan masalah yang dapat terjadi saat mengonfigurasi enkripsi secret lapisan aplikasi, termasuk kegagalan update dan error saat Anda tidak dapat menggunakan kunci Cloud KMS atau saat versi kunci Cloud KMS dihancurkan.

Root Certificate Authority cluster akan segera habis masa berlakunya

Topik Deskripsi
Root Certificate Authority (CA) akan segera habis masa berlakunya Jika Root Certificate Authority (CA) cluster Anda akan segera habis masa berlakunya, pelajari cara melakukan rotasi kredensial untuk mencegah operasi cluster normal terganggu.

Beban kerja

Topik Deskripsi
Workload yang di-deploy Memecahkan masalah error untuk workload yang berjalan di cluster GKE termasuk PodUnschedulable. Baca bagian PodUnschedulable untuk mengetahui saran terkait error seperti MatchNodeSelector dan Does not have minimum availability.
Penarikan image Memecahkan masalah penarikan image. Pelajari penyebab status seperti ImagePullBackOff dan ErrImagePull serta cara menyelesaikan status ini dengan memperbaiki masalah umum seperti autentikasi dan konektivitas jaringan.
Peristiwa CrashLoopBackOff Memecahkan masalah peristiwa CrashLoopBackOff di GKE. Mendiagnosis masalah seperti kehabisan resource, kesalahan konfigurasi aplikasi, dan kegagalan pemeriksaan liveness.
Peristiwa OOM Memecahkan masalah peristiwa kehabisan memori (OOM) Kubernetes. Identifikasi penyebab, bedakan jenis peristiwa, dan terapkan solusi efektif untuk penghentian OOM tingkat container- dan node.
Workload Arm Memecahkan masalah workload Arm, termasuk Pod di node Arm mengalami error.
TPU Memecahkan masalah TPU, termasuk masalah terkait kuota, penyediaan otomatis node workload, dan penjadwalan.
GPU Memecahkan masalah GPU, termasuk masalah terkait penginstalan driver GPU, error plugin perangkat, dan image container.

Pengelolaan cluster

Topik Deskripsi
Upgrade cluster Memecahkan masalah dan menyelesaikan masalah upgrade cluster dan node GKE, termasuk upgrade yang lama atau tidak lengkap, upgrade otomatis yang tidak terduga, kegagalan, dan masalah pasca-upgrade.
Webhook Pahami cara memecahkan masalah dan memastikan stabilitas bidang kontrol cluster Anda saat menggunakan webhook penerimaan.
Namespace yang stuck dalam status Terminating Memecahkan masalah namespace yang stuck dalam status Terminating dengan mengidentifikasi dan menghapus komponen tidak responsif yang memblokir penghapusan.
Operasi serentak Memecahkan masalah operasi serentak dengan mempelajari cara mengidentifikasi error ini dan menyelesaikannya dengan menunggu operasi selesai.

Monitoring

Topik Deskripsi
Metrik sistem Memecahkan masalah metrik sistem yang tidak muncul di Cloud Monitoring.
Dasbor monitoring Memecahkan masalah dasbor monitoring, termasuk masalah terkait pengaktifan monitoring, resource Kubernetes yang tidak ada, dan izin.
Memecahkan masalah log yang tidak ada Memecahkan masalah log GKE yang tidak ada. Pelajari cara memeriksa status API setelan cluster, izin, kuota, filter, dan perilaku aplikasi

Error 4xx

Topik Deskripsi
Error 4xx Memecahkan masalah beberapa error 400, 401, 403, dan 404 yang mungkin Anda alami saat menggunakan GKE. Halaman ini juga menyertakan informasi tentang cara memecahkan masalah izin edit yang tidak ada pada error akun.

Masalah umum

Topik Deskripsi
Masalah umum Mengidentifikasi dan menyelesaikan masalah umum yang mungkin memengaruhi penggunaan GKE Anda.

Langkah berikutnya