יכולות ניהול של אשכולות

סדרות המכונות של מעבדי GPU מקובצים, כמו A4X Max,‏ A4X, ‏ A4,‏ A3 Ultra, ‏ A3 Mega ו-A3 High (8 GPUs), מיועדות להפעלה של אשכולות בינה מלאכותית (AI) ולמידת מכונה (ML) בקנה מידה גדול, ומספקות את היכולות הבאות לניהול אשכולות:

סדרות מכונות נתמכות

יכולות ניהול האשכולות שמתוארות בדף הזה זמינות עבור סדרת מכונות GPU באשכול, שעברו אופטימיזציה לעומסי עבודה מרובי-צמתים בקנה מידה גדול.

התכונות האלה לא חלות על סדרת המכונות הכללית של GPU, שמורכבת ממשאבי מחשוב עצמאיים שמשתמשים ברשת VPC רגילה ולא תומכים במצבי הפעלה של תחזוקה או במיקום משותף צפוף.

בטבלה הבאה מפורטות סדרות המכונות שנתמכות ב-AI Hypercomputer:

קטגוריה סדרת מכונות תמיכה בניהול אשכולות
קבוצות של יחידות GPU A4X Max, ‏ A4X, ‏ A4, ‏ A3 Ultra, ‏ A3 Mega, ‏ A3 High כן
יחידות GPU כלליות A3 Edge, ‏ A2, ‏ G2, ‏ G4, ‏ N1 לא

מידע נוסף על כל סדרת מכונות זמין במאמר מידע על מאיצי GPU.

רוב היכולות של ניהול אשכולות נתמכות רק בקיבולת שמוגבלת להזמנה – תשתית שמשתמשת במודל הקצאת משאבים שמוגבל להזמנה, שתומך רק בסוגי מכונות של GPU באשכול. לגבי קיבולת שמשתמשת במודל הקצאת משאבים אחר, זמינות רק היכולות הבאות לניהול אשכולות:

מיקום משותף של תשתית GPU באשכול

כשמשתמשים ב-GPU באשכול, כמו A4X Max,‏ A4X,‏ A4,‏ A3 Ultra,‏ A3 Mega ו-A3 High (8 GPUs), אפשר לבקש מכונות מארחות ש-Compute Engine מקצה כמה שיותר קרוב זו לזו. המכונות האלה מציעות את התכונות הבאות:

הסידור הזה של המשאבים מצמצם את מספר הקפיצות ברשת ומבצע אופטימיזציה כדי להשיג את זמן האחזור הנמוך ביותר ברשת. כדי לפרוס בלוקים של מכונות שעברו אופטימיזציה לשימוש במאיצים ש-Compute Engine מקצה בצפיפות, אפשר להשתמש באפשרויות הבאות:

מיקום שמודע לטופולוגיה של האשכול

אחרי שיוצרים GPU באשכול, אפשר לקבל מידע על הטופולוגיה ברמת הצומת וברמת האשכול. המידע הזה עוזר לכם:

  • כדאי לשנות את העיצוב של האפליקציה או של עומס העבודה כדי לצמצם עוד יותר את זמן האחזור ברשת.

  • הסבר על זמן אחזור ברשת ובעיות בביצועים של מופעים שמתקשרים זה עם זה בתדירות גבוהה, ועל פתרון בעיות כאלה. הבעיות האלה יכולות לקרות אם המיקומים של המופעים רחוקים זה מזה באופן לא צפוי.

באופן ספציפי, התמיכה ביכולות טופולוגיה היא כדלקמן:

מידע נוסף זמין במאמר בנושא הצגת הטופולוגיה של מופעי מחשוב.

מצב הפעולה של האשכול

כשמשריינים קיבולת כדי ליצור מופעי מחשוב או אשכולות באמצעות GPU באשכול, סוג המכונה שאתם משריינים קובע את מצב ההפעלה של האשכול עבור המופעים. במצב הזה מצוין איך המופעים מתנהגים אחרי שגיאות במארח או דוחות שגויים של המארח. מצבי הפעולה הזמינים של מכונה הם מצב מנוהל, שבו Compute Engine מחליף באופן אוטומטי מכונות פגומות, אבל שומר חלק מהקיבולת המוזמנת כדי לספק למכונות את המשאבים הדרושים להפעלה מחדש. או מצב קיבולת מלאה, שבו יש לכם גישה לקיבולת המלאה שהזמנתם אבל אתם אחראים לניהול של כשלים ותחזוקה מתוכננת.

מידע נוסף זמין במאמר בנושא מצב הפעלה של הזמנה.

תזמון תחזוקה של אשכולות ואמצעי בקרה

אתם יכולים לשלוט בתחזוקה של מעבדי GPU מקובצים באמצעות תזמון מודע לטופולוגיה בבלוק של משאבים. היכולת הזו עוזרת לסנכרן שדרוגים כדי שעומסי העבודה יהיו עמידים יותר לאירועים של המארח וכדי לצמצם שיבושים. הגישה הזו עוזרת לשפר את התפוקה האפקטיבית של עומס העבודה.

כדי לשלוט באופן מלא באירועי תחזוקה, אפשר להשתמש בתכונות הבאות:

סוג התזמון של התחזוקה

כשמזמינים קיבולת כדי ליצור מכונות וירטואליות או אשכולות של יחידות GPU, אפשר להגדיר איך Compute Engine ישמור על התשתית שהמכונות פועלות עליה. בהתאם לסוג המכונה שבה רוצים להשתמש עבור המופעים, אפשר לבחור בין תחזוקה מסונכרנת בכל המופעים (grouped) לבין לוחות זמנים שונים לתחזוקה (independent).

מידע נוסף זמין במאמר בנושא סוגים של תזמון תחזוקה.

ניהול אירועים למארחים

אחרי שיוצרים GPU באשכול ומתחילים את עומס העבודה, אפשר להגדיר התראות ולקבל הודעות כשתחזוקה של המופעים או של הבלוקים השמורים מתוזמנת, מתחילה או מסתיימת. אתם יכולים גם לראות את מועד התחזוקה של מכונה או של בלוק שמור, ואם צריך, להתחיל את התחזוקה באופן ידני לפני המועד שנקבע. האפשרויות האלה עוזרות לכם לשלוט באופן יזום בזמני ההשבתה של עומסי העבודה ולצמצם אותם.

למידע נוסף, קראו את המאמרים הבאים:

כלים לניטור ולאבחון של אשכולות

לצורך מעקב ופתרון בעיות, כרטיסי GPU באשכול כוללים את השירותים הבאים:

מה השלב הבא?