במסמך הזה מפורטים מסמכים לפתרון בעיות נפוצות שאתם עשויים להיתקל בהן במהלך השימוש ב-Google Kubernetes Engine (GKE). המסמכים שמופיעים כאן יכולים לעזור לכם לאבחן שגיאות בעומסי עבודה כמו ImagePullBackOff ו-CrashLoopBackOff, לנפות באגים בהתנהגות של מידרוג אוטומטי באשכול, לפתור בעיות ב-PersistentVolume או לפתור בעיות ברישום של צמתים.
אם אתם חדשים בפתרון בעיות ב-GKE, כדאי להתחיל עם מבוא לפתרון בעיות.
כדי לאבחן ולפתור בעיות שנתקלתם בהן, אפשר לעיין במסמכים שבקטעים הבאים:
לפתרון בעיות ברישות ב-GKE, אפשר לעיין במאמר פתרון בעיות ברישות ב-GKE במסמכי התיעוד של GKE בנושא רישות.
המסמך הזה מיועד לאדמינים ולאדריכלים, למומחי אבטחה, למומחי רשת או למומחי אחסון שמבצעים פתרון בעיות בהגדרות של GKE. מידע נוסף על תפקידים ב-GKE זמין במאמר תפקידים נפוצים של משתמשים ומשימות ב-GKE.
מבוא לפתרון בעיות
הגדרת אשכול
| נושא |
תיאור |
| יצירת אשכולות |
פתרון בעיות שקשורות ליצירת אשכולות. |
| אשכולות Autopilot |
אבחון ופתרון בעיות באשכולות GKE Autopilot, כולל בעיות שקשורות ליצירת אשכולות, מחיקת מרחבי שמות, שינוי גודל ובעיות בעומסי עבודה. |
| כלי שורת הפקודה Kubectl |
פתרון בעיות בכלי שורת הפקודה kubectl ב-GKE, כולל בעיות באימות ובמתן הרשאות.
בדף הזה יש גם עצות לפתרון בעיות בשרת ה-proxy של Konnectivity כדי לבדוק אם הוא גורם לכך שהפקודות kubectl logs, attach, exec או port-forward מפסיקות להגיב. |
| מאגרי צמתים רגילים |
פתרון בעיות במאגרי צמתים של GKE Standard,
כולל בעיות ביצירת מאגרי צמתים, הקצאת משאבים על בסיס התוצאה הטובה ביותר,
מטא-נתונים פגומים של מופעים והעברת עומסי עבודה למאגרי צמתים חדשים. |
הסטטוס של צומת NotReady |
במאמר הזה מוסבר איך לאבחן ולפתור בעיות בסטטוס של הצומתNotReady ב-GKE. לשם כך, נבדקות סיבות נפוצות כמו מחסור במשאבים, בעיות ברשת וכשלים ברכיבים. |
| רישום צומת |
פתרון בעיות שמתרחשות כשמוסיפים צמתים לאשכול GKE Standard, כמו כשלים ברישום צמתים ודרישות חסרות לרישום צמתים מוצלח. |
| זמן ריצה של מאגר |
פתרון בעיות בזמני ריצה של קונטיינרים ב-GKE, כולל בעיות ב-containerd וב-dockershim, ורישומים פרטיים. |
| מאגרי צמתים של Windows Server |
פתרון בעיות במאגרי צמתים של Windows Server ב-GKE, כולל כשלים בהפעלת Pod, שגיאות בשליפת תמונות, בעיות בקישוריות לרשת ובעיות בסטטוס הצומת. |
התאמה אוטומטית לעומס (Automatic scaling)
| נושא |
תיאור |
| התאמה אוטומטית של גודל האשכול לא מקטינה את האשכול |
אבחון ופתרון של סיבות נפוצות לכך שלא מתבצעת הסרה של צמתים שלא נעשה בהם שימוש מספיק באשכול. כאן מוסבר איך לבדוק אם יש בעיות כמו PodDisruptionBudgets מגבילות, Pods עם אחסון מקומי או הערות ספציפיות (לדוגמה, "cluster-autoscaler.kubernetes.io/safe-to-evict": "false") שמונעות את פינוי הצומת. |
| התאמה אוטומטית של גודל האשכול לא מגדילה את האשכול |
למה המידרוג האוטומטי של האשכול לא מוסיף צמתים חדשים כדי לעמוד בדרישות.
בודקים אם יש פודים שלא ניתן לתזמן, מוודאים שלא חרגתם ממגבלות הגודל של מאגר הצמתים או האשכול, ומזהים בעיות פוטנציאליות במכסות משאבים או בזמינות של מכונות וירטואליות אזוריות. |
| התאמה אופקית של קבוצות Pod לעומס |
פתרון בעיות שקשורות ל-Horizontal Pod Autoscaler (HPA) שלא מבצע שינוי קנה מידה של רפליקות ה-Pod של האפליקציה. פתרון בעיות נפוצות, כמו
משאבי HorizontalPodAutoscaler שלא הוגדרו כראוי או בעיות בצינור
הנתונים של המדדים. |
| התאמה אנכית של קבוצות Pod לעומס |
פתרון בעיות שקשורות ל-VerticalPodAutoscaler שלא משנה את גודל המשאבים של ה-Pod של האפליקציה. פתרון בעיות נפוצות, כמו
משאבי VerticalPodAutoscaler שהוגדרו בצורה שגויה או בעיות בצינור
הנתונים של המדדים. |
אחסון
| נושא |
תיאור |
| אחסון |
פתרון בעיות באחסון, כולל בעיות בדיסקים לאחסון מתמיד אזורי, בביצועי הדיסק ובהרחבת הנפח. |
אבטחת אשכולות
התוקף של רשות אישורי הבסיס של האשכול יפוג בקרוב
עומסי עבודה
| נושא |
תיאור |
| עומסי עבודה (workloads) שנפרסו |
פתרון בעיות שקשורות לעומסי עבודה שפועלים באשכול GKE, כולל PodUnschedulable.
בקטע PodUnschedulable מופיעות הצעות לפתרון שגיאות כמו
MatchNodeSelector ו-
Does not have minimum availability.
|
| שליפות תמונות |
פתרון בעיות שקשורות לשליפת תמונות. כאן מוסבר מה גורם לסטטוסים כמו
ImagePullBackOff ו-ErrImagePull
ואיך לפתור בעיות נפוצות כמו אימות וקישוריות לרשת כדי לשנות את הסטטוסים האלה. |
| אירועים של CrashLoopBackOff |
פתרון בעיות באירועי CrashLoopBackOff ב-GKE. אבחון בעיות כמו מיצוי משאבים, הגדרות שגויות של אפליקציות וכשלים בבדיקת הפעילות. |
| אירועי OOM |
פתרון בעיות שקשורות לאירועי חוסר זיכרון (OOM) ב-Kubernetes. לזהות את הסיבות, להבחין בין סוגי אירועים ולהחיל פתרונות יעילים לבעיות של OOM ברמת המאגר וברמת הצומת. |
| עומסי עבודה של Arm |
פתרון בעיות שקשורות לעומסי עבודה של Arm, כולל קריסה של Pods בצמתי Arm. |
| TPUs |
פתרון בעיות ב-TPU, כולל בעיות שקשורות למכסת השימוש, להקצאה אוטומטית של צמתים, להגדרת עומס עבודה ולתזמון. |
| GPUs |
פתרון בעיות ב-GPU, כולל בעיות בהתקנת מנהלי התקנים (דרייברים) של GPU,
שגיאות בתוספים של מכשירים ותמונות של קונטיינרים. |
ניהול אשכולות
| נושא |
תיאור |
| שדרוגי אשכולות |
פתרון בעיות בשדרוג של אשכולות וצמתים ב-GKE, כולל שדרוגים ארוכים או לא מלאים, שדרוגים אוטומטיים לא צפויים, כשלים ובעיות אחרי השדרוג. |
| Webhooks |
הסבר על פתרון בעיות ועל שמירה על יציבות של מישור הבקרה של האשכול כשמשתמשים ב-webhooks של בקרת כניסה. |
מרחב שמות תקוע במצב Terminating |
כדי לפתור בעיות שקשורות למרחבי שמות שנתקעו במצב Terminating, צריך לזהות ולהסיר את הרכיבים הבעייתיים שמונעים את המחיקה. |
| פעולות בו-זמניות |
כדי לפתור בעיות שקשורות לפעולות מקבילות, צריך לזהות את השגיאות האלה ולחכות עד שהפעולות יסתיימו. |
מעקב
| נושא |
תיאור |
| מדדי מערכת |
פתרון בעיות שקשורות למדדי מערכת שלא מופיעים ב-Cloud Monitoring. |
| מרכזי בקרה של מעקב |
פתרון בעיות בלוחות בקרה של ניטור, כולל בעיות בהפעלת הניטור, משאבי Kubernetes חסרים והרשאות. |
| פתרון בעיות שקשורות ליומנים חסרים |
פתרון בעיות שקשורות ליומני GKE חסרים. כאן מוסבר איך לבדוק את הסטטוס של API, את הגדרות האשכול, את ההרשאות, את המכסות, את המסננים ואת התנהגות האפליקציה. |
שגיאות 4xx
| נושא |
תיאור |
| שגיאות 4xx |
פתרון בעיות שקשורות לחלק מהשגיאות 400, 401, 403 ו-404 שאתם עשויים להיתקל בהן כשאתם משתמשים ב-GKE. בדף הזה מוסבר גם איך לפתור בעיות שקשורות לשגיאות בחשבון שמונעות עריכה.
|
בעיות מוכרות
| נושא |
תיאור |
| בעיות מוכרות |
לזהות ולפתור בעיות ידועות שעשויות להשפיע על השימוש ב-GKE. |
המאמרים הבאים