כדי להריץ ביעילות עומסי עבודה של בינה מלאכותית (AI) או למידת מכונה (ML), צריך לבחור גם כלי לתזמור עומסי עבודה וגם פלטפורמת פריסה. אלה הפונקציות של הרכיבים:
מנהל התזמור מתזמן ומריץ את המשימות.
אפשרות פריסה מנהלת כלי תזמור.
אחרי שמזהים את תשתית ה-GPU שרוצים להשתמש בה להרצת עומסי העבודה (GPU באשכול או GPU כללי), פועלים לפי ההנחיות במסמך הזה כדי לזהות את כלי התזמור והפריסה שהכי מתאימים לעומס העבודה ולרמת הניהול.
כדי לעיין בסוגי מכונות GPU שבהם אפשר להשתמש להרצת עומסי העבודה, אפשר לעיין במאמר בנושא מכונות GPU.
השוואה בין כלי תזמור ואפשרויות פריסה
AI Hypercomputer מציע כמה כלי תזמור ואפשרויות פריסה למכונות הווירטואליות שלכם. האפשרויות האלה כוללות אשכולות מנוהלים באופן מלא שמאפשרים לכם להתמקד בעומסי העבודה, וסביבות בניהול עצמי שמאפשרות לכם שליטה מדויקת באופן שבו אתם מתחזקים ומעדכנים את מופעי המחשוב.
בטבלה הבאה מוצגת השוואה בין כלי התזמור ואפשרויות הפריסה שבהם אפשר להשתמש כשמריצים עומסי עבודה של AI:
| מוצר | Orchestrator | מורכבות טכנית | מומלץ ל | יתרון מרכזי |
|---|---|---|---|---|
| Cluster Director | Slurm | נמוכה | חוקרי AI, מדעני נתונים | מחזור חיים מנוהל לאשכולות Slurm |
| Google Kubernetes Engine (GKE) | Kubernetes | בינונית עד גבוהה | מהנדסי למידת מכונה, מהנדסי פלטפורמה | תזמור קונטיינרים והתאמה לעומס (scaling) |
| Cluster Toolkit | Slurm, Kubernetes | בינוני | מהנדסי למידת מכונה (ML), מהנדסי פלטפורמה | תוכניות מגירה מאומתות של תשתית כקוד |
| Compute Engine | בהתאמה אישית / ללא | גבוהה | אדריכלי תשתית | שליטה פרטנית במערכת ההפעלה וברשת |
בחירת כלי תזמור ואפשרות פריסה
כדי לבחור כלי תזמור ואפשרות פריסה, אפשר להשתמש בתרשים הזרימה הבא:
בתרשים הזרימה שלמעלה מופיעות השאלות הבאות:
האם אתם רוצים תזמור אשכולות עבור עומסי העבודה שלכם?
- כן: עוברים לשאלה 2.
- לא: משתמשים ב-Compute Engine.
רוצה להריץ אפליקציות רגילות בקונטיינרים?
- כן: שימוש ב-GKE.
- לא: עוברים לשאלה 3.
האם אתם רוצים ש-Google תנהל את מחזור החיים של האשכול?
- כן: שימוש ב-Cluster Director.
- לא: משתמשים ב-Cluster Toolkit.
כלי תזמור נתמכים
כלי תזמור מאפשר אוטומציה של ניהול האשכולות, כך שלא צריך לנהל כל מופע חישוב בנפרד. מערכות תזמור כמו Slurm או Kubernetes מטפלות בהוספת משימות לתור, בהקצאת משאבים ובשינוי גודל אוטומטי.
Slurm: כלי תזמור בקוד פתוח שמשמש בדרך כלל לעומסי עבודה של AI, ML ו-HPC. אפשר להשתמש ב-Slurm עם Cluster Toolkit או Cluster Director.
Kubernetes: פלטפורמה לתזמור בין קונטיינרים עם קוד פתוח. אפשר לפרוס את Kubernetes באמצעות GKE ישירות או באמצעות Cluster Toolkit.
מותאם אישית או ללא: אם אתם מעדיפים כלי תזמור שונה או רוצים לנהל את מכונות החישוב שלכם בלי כלי תזמור, אתם יכולים להשתמש ב-Compute Engine. האפשרות הזו מספקת את רמת השליטה הגבוהה ביותר, אבל היא מחייבת להגדיר, לתחזק ולעדכן את מופעי המחשוב באופן ידני.
פלטפורמות פריסה נתמכות
אחרי שתזהו את כלי האורקסטרציה המומלץ ואת אפשרות הפריסה שמתאימים לתרחיש השימוש שלכם, כדאי לעיין בתיאורים שלהם שבהמשך כדי לוודא שרמות הניהול והתכונות שלהם עומדות בדרישות של עומס העבודה.
פלטפורמות מנוהלות ואוטומטיות
אם אתם רוצים להימנע מהתקורה של ניהול אשכול ולהתמקד בהרצת עומסי העבודה, אתם יכולים להשתמש באחת מהפלטפורמות המנוהלות הבאות:
Cluster Director: שירות שמנוהל במלואו שמאפשר אוטומציה של מחזור החיים של אשכולות Slurm. אפשר להשתמש ב-Cluster Director כדי לפשט את ההגדרה והקביעה של אשכולות Slurm. Cluster Director מבצע אוטומציה של מחזור החיים של האשכולות, כדי שתוכלו להתמקד בהרצת עומסי העבודה של AI, ML או HPC. מידע נוסף זמין במאמר סקירה כללית על Cluster Director.
GKE: סביבת Kubernetes מנוהלת שעברה אופטימיזציה לעומסי עבודה של AI ו-ML. שימוש ב-GKE כדי לתזמן עומסי עבודה מבוססי-קונטיינר, לשלב עם חומרה מיוחדת של Compute Engine ולהשתמש בתכונות ספציפיות ל-GKE כמו תזמון מודע-טופולוגיה (TAS). מידע נוסף זמין במאמר סקירה כללית על GKE.
פלטפורמות בניהול חלקי ובניהול עצמי
אם אתם צריכים שליטה מדויקת במערכת ההפעלה, בהגדרות של ליבת המערכת או בגרסאות של מנהלי ההתקנים, כדאי להשתמש בפלטפורמה בניהול חלקי או בניהול עצמי:
Cluster Toolkit: ערכת כלים בקוד פתוח שמספקת תוכניות מגירה מאומתות וניתנות להתאמה אישית לפריסת סביבות AI ו-ML שניתנות לשחזור. הוא מציע גמישות ושליטה גבוהות באמצעות עקרונות של תשתית כקוד (IaC). מידע נוסף זמין במאמר סקירה כללית של Cluster Toolkit.
Compute Engine: שירות מחשוב שניתן להתאמה אישית ומספק שליטה מקסימלית בבניית סביבות בהתאמה אישית מאפס. Compute Engine לא משמש ככלי עצמאי לארגון תהליכים, אבל הוא מהווה בסיס למשתמשים שמעדיפים לבנות ולנהל סטאקים מותאמים אישית משלהם. מידע נוסף זמין במאמר סקירה כללית על Compute Engine.
המאמרים הבאים
- כדי לקבל קיבולת, אפשר לעיין באפשרויות הצריכה.
- למידע על פריסת האשכול, אפשר לעיין במאמר סקירה כללית על יצירת אשכול.