בדף הזה מתוארות בעיות ידועות שאתם עלולים להיתקל בהן בזמן הפעלת מכונות וירטואליות או אשכולות שעברו אופטימיזציה באמצעות AI. אם יש בעיות במכונות וירטואליות ב-Compute Engine, אפשר לעיין במאמר בנושא בעיות מוכרות ב-Compute Engine.
בעיות
בקטע הבא מפורטות בעיות ידועות ופתרונות עקיפים ל-AI Hypercomputer.
הפרעות בעומסי עבודה במכונות וירטואליות מסוג A4 בגלל בעיות בתוכנת קושחה (firmware) של מעבדי GPU מסוג NVIDIA B200
חברת NVIDIA זיהתה שתי בעיות בקושחה של יחידות עיבוד גרפיות (GPU) מדגם B200, שמשמשות מכונות וירטואליות מדגם A4. הבעיות האלה עלולות לגרום להפרעות בעומסי העבודה, למשל אם הפקודה nvidia-smi לא מגיבה. אם אתם מבחינים בהפרעות בעומסי עבודה במכונות וירטואליות מסוג A4, אתם צריכים לוודא שאחד מהתנאים הבאים מתקיים:
- זמן הפעולה של ה-VM (
lastStartTimestamp) חורג מ-65 ימים. - בנתוני היומן מוצגת הודעת השגיאה
Xid 149שבה מוזכר0x02a.
אם אחד מהתנאים האלה מתקיים, צריך לאפס את יחידות ה-GPU שמצורפות למכונות הווירטואליות מסוג A4. כדי למנוע שיבושים בעתיד בעומס העבודה בגלל בעיות בתוכנת הקושחה, מומלץ לאפס את ה-GPU לפחות פעם ב-60 יום. מידע נוסף מופיע במאמר בנושא איפוס של יחידות GPU.
יכול להיות ששרת המטא-נתונים יציג מטא-נתונים ישנים של מכונה וירטואלית physicalHost
אחרי שחוויתם שגיאת מארח או השתמשתם באפשרות דיווח על API מארח פגום כדי להעביר מופע של Compute למארח חדש, כשאתם מריצים שאילתה בשרת המטא-נתונים, יכול להיות שיוצגו מטא-נתונים של physicalHost המארח הקודם של מופע ה-Compute.
כדי לעקוף את הבעיה, אפשר לנסות את אחד מהפתרונות הבאים:
- משתמשים בשיטה
instances.getאו בפקודהgcloud compute instances describeכדי לאחזר את פרטיphysicalHostהנכונים. - מפסיקים את המופע ואז מפעילים אותו. במהלך התהליך הזה, המידע
physicalHostמתעדכן בשרת המטא-נתונים. - מחכים 24 שעות עד שהמידע על המופע המושפע
physicalHostיתעדכן.