במאמר הזה מוסבר איך לזהות את תשתית ההאצה האופטימלית לעומסי העבודה של הבינה המלאכותית (AI) והלמידה החישובית (ML) בהתאם לשלב במחזור החיים, כמו יצירת אב טיפוס בקנה מידה קטן, הסקת מסקנות בזמן אמת והדרכה מסיבית ומבוזרת. AI Hypercomputer מארגן את המאיצים בשתי קטגוריות: מעבדי GPU כלליים ומעבדי GPU מקובצים.
תשתית GPU
AI Hypercomputer מציע שתי קטגוריות שונות של GPU. לכל קטגוריה יש מודל ניהול ייחודי שקובע איך המערכת מטפלת באירועים שקשורים למחזור החיים, מנהלת את התחזוקה ומבצעת אופטימיזציה של הרשת עבור עומס העבודה:
מודל כללי לניהול GPU
מודל ניהול ה-GPU הכללי מיועד לעומסי עבודה שבהם יש עדיפות לעצמאות משאבים ולזמינות גבוהה. המודל הזה משתמש במישור הניהול הרגיל Google Cloud , ומספק חוויה מוכרת לצוותים שכבר משתמשים ב-Compute Engine או ב-GKE.
תחזוקה: אסינכרונית. כל מופע מתעדכן בנפרד. בצי של שרתים מרובי-צמתים, אירוע תחזוקה בצומת אחד לא משפיע על הזמינות של צמתים אחרים, כך שאפשר להפנות את התנועה לצמתים תקינים בלי לעצור את כל העבודה.
תרחישי שימוש עיקריים: מומלץ למשימות נפוצות כמו הסקת מסקנות בזמן אמת, הפעלת מודלים, יצירת אב טיפוס בקנה מידה קטן וסביבות פיתוח שבהן לא נדרש קנה מידה של מחשוב-על.
סדרות כלליות של מכונות GPU
סדרות המכונות הבאות הן GPUs כלליים:
- G2 (L4)
- G4 (RTX PRO 6000)
- A2 (A100)
- N1+T4
- A3 Edge
- A3 High (כרטיס GPU אחד, 2 או 4)
מידע טכני על כל אחת מהמכונות הכלליות של GPU זמין במאמר סוגי מכונות GPU.
מודל ניהול של GPU באשכול
מודל הניהול של GPU באשכולות הוא סביבה ברמת מחשוב-על שמיועדת לאימון מבוזר בהיקף גדול. המשאבים מנוהלים כמערכת יחידה עם צימוד הדוק באמצעות מחסנית GPU מקובצת.
תחזוקה: מתואמת. המודל הזה מתאם בין אירועי תחזוקה כדי לתמוך בעומסי עבודה עם צימוד הדוק. באימון מבוזר, אפשר להשתמש בתחזוקה מסונכרנת, שבה העדכונים מוחלים על כל הצמתים בו-זמנית. הגישה הזו מונעת הפעלה מחדש של צמתים שגורמת לעיכובים בעבודות, וממקסמת את התפוקה. המודל הזה מציע גם התראות תחזוקה כל 90 יום.
תרחישי שימוש עיקריים: מיועד לאימון מודלים בסיסיים בקנה מידה אקססקייל עם טריליוני פרמטרים או להרצת סימולציות מורכבות של מחשוב עתיר ביצועים (HPC), כמו גילוי תרופות וקיפול חלבונים.
סדרות מכונות GPU באשכול
סדרות המכונות הבאות הן GPU מקובץ:
- A4X
- A4 (Blackwell)
- A3 Ultra
- A3 Mega
- A3 High (8 יחידות GPU)
מידע טכני על כל אחת ממכונות ה-GPU המקובצות זמין במאמר סוגי מכונות GPU.
מטריצת יכולות
השוואה בין המאפיינים הטכניים והתפעוליים של מודלים לניהול GPU כללי ו-GPU מקובץ:
| מאפיין | מודל כללי לניהול GPU | מודל ניהול של GPU באשכול |
|---|---|---|
| תרחישים עיקריים לדוגמה | הסקת מסקנות, פרסום המודל, יצירת אבות טיפוס ופיתוח | אימון מבוזר בקנה מידה גדול ו-HPC |
| תחזוקה | אסינכרוני: עדכונים עצמאיים של צמתים מאפשרים להפנות מחדש את התנועה בלי לעצור את העבודות | מתואם: תומך בעדכונים מתואמים (מסונכרנים) בכל האשכול כדי לשמור על סנכרון בין הצמתים ולמקסם את קצב העברת הנתונים |
| חומרה של מכשיר היעד | G2 (L4), G4 (RTX PRO 6000), A2 (A100), N1+T4, A3 Edge ו-A3 High (עם 1, 2 או 4 מעבדי GPU) | A4X, A4 (Blackwell), A3 Ultra, A3 Mega ו-A3 High (8 GPUs) |
| Networking | רישות VPC רגיל דרך ממשקי gVNIC (למעט A3 Edge, שמשתמש ב-GPUDirect-TCPX בכמה רשתות VPC) | בדים מיוחדים עם זמן אחזור נמוך (RDMA, RoCE, TCPX או NVIDIA NVLink) |
| רשימת רשתות בתהליך בחירת הרשת | מישור Google Cloud רגיל (Compute Engine או GKE) | חבילת ניהול ייעודית (לדוגמה, Cluster Director) |
| אמינות | תיקון אוטומטי רגיל של צמתים וזמן פעולה ברמת ה-Pod | חבילה מיוחדת של משאבים ושחזור |
מטריצת החלטות
אפשר להשתמש בטבלה הזו כדי לזהות אילו משפחות של ציוד תואמות לכוונת עומס העבודה הספציפי שלכם:
| אם עומס העבודה כולל... | תשתית GPU מומלצת | סדרות מכונות מומלצות |
|---|---|---|
| יצירת אב טיפוס ופיתוח | יחידות GPU כלליות | G2, G4, A2, N1+T4, A3 Edge |
| הסקת מסקנות בזמן אמת (פחות מ-100 מיליארד פרמטרים) | יחידות GPU כלליות | G2, G4, A2, N1+T4, A3 Edge |
| הסקת מסקנות בכמה מעבדי GPU | קבוצות של יחידות GPU | A3, A4 |
| אימון והסקת מסקנות בקנה מידה גדול | קבוצות של יחידות GPU | A4, A3 series |
| אימון בקנה מידה עצום (מעל 500 מיליארד פרמטרים) והסקת מסקנות מפורקת | קבוצות של יחידות GPU | A4X Max, A4X, A4 |
לעיון במודל מפורט של עץ החלטות למיפוי ארכיטקטורות של מודלים ישירות לחומרה, אפשר לעבור אל בחירת מאיץ.
אחרי שקובעים את הקריטריונים העיקריים האלה, בוחרים פלטפורמת תזמור. הבחירה הזו תלויה בהעדפה של הצוות שלכם לניהול אוטומטי או לשליטה מדויקת במערכת ההפעלה ובדרייברים.
המאמרים הבאים
- כדי לבחור כלי תזמור ואפשרות פריסה, אפשר לעיין במאמר בחירת כלי תזמור ואפשרות פריסה.
- כדי לפרוס עומסי עבודה של הסקת מסקנות או להריץ אימון בקנה מידה גדול, אפשר לעיין במדריכים בנושא AI Hypercomputer.
- כדי לשפר את יעילות המערכת, אפשר לעיין במאמר Goodput optimization recipes.