שירותי הרשת שאתם מגדירים תלויים באפשרות הפריסה שבחרתם (מכונות וירטואליות או אשכולות) ובתשתית.
המסמך הזה מיועד לאדריכלים, למהנדסי רשת ולמפתחים שרוצים להבין את שירותי הרשת עבור פריסות של AI Hypercomputer. ההנחה במסמך הזה היא שיש לכם היכרות בסיסית עם מושגים של רישות בענן ומחשוב מבוזר. מידע נוסף על אפשרויות הפריסה זמין במאמר סקירה כללית של אפשרויות הפריסה.
מידע מפורט על ארכיטקטורת רשת, פרוטוקולים וטופולוגיות של חומרה זמין במאמר סקירה כללית על רשתות GPU.
רישות לפריסות של GKE שעברו אופטימיזציה ל-AI באמצעות Cluster Toolkit
כשיוצרים אשכול GKE שעבר אופטימיזציה ל-AI באמצעות Cluster Toolkit, התוכנית מגדירה את הרשת באופן הבא:
- התוכנית משתמשת ברשת VPC שמוגדרת כברירת מחדל עבור אשכול GKE הראשי.
- הוא יוצר שני VPC נוספים: אחד לכרטיס ממשק רשת (NIC) שני של מארח, ואחד לתנועה של גישה ישירה לזיכרון (RDMA) מרחוק מ-GPU ל-GPU.
- תוכנית ה-blueprint מחילה פרופיל רשת מוגדר מראש שמנוהל על ידי Google על ה-VPC שמשמש לתעבורת GPU. הפרופיל הזה מגדיר באופן אוטומטי את הרשת לביצועי RDMA במהירות גבוהה ועם השהיה נמוכה.
- תוכנית האב יוצרת באופן אוטומטי שמונה רשתות משנה ייעודיות ב-RDMA VPC, אחת לכל כרטיס רשת RDMA במכונת מאיץ וירטואלית.
- הוא מגדיר כללים של חומת אש שמאפשרים את כל תעבורת ה-TCP, UDP ו-ICMP בין הצמתים באשכול.
רישות לפריסות GKE
הגדרת הרשת בהגדרות GKE תלויה בסוג עומס העבודה ובסוג התשתית:
- עבור GPU כללי או עומסי עבודה לא מבוזרים, יוצרים אשכול GKE ללא GPUDirect RDMA. בהגדרה הזו נעשה שימוש ברשת VPC אחת לכל התקשורת.
- כדי להשתמש ב-GPU באשכול או בעומסי עבודה מבוזרים, צריך ליצור אשכול GKE עם GPUDirect RDMA מופעל. ההגדרה הזו משתמשת בסביבת VPC מרובה שמפרידה בין תעבורה למטרות כלליות לבין תקשורת ברוחב פס גבוה בין GPU ל-GPU.
רשתות לפריסות של אשכולות Slurm
אפשר להשתמש ב-Cluster Toolkit כדי לפרוס עומסי עבודה של AI ו-ML באמצעות תוכניות מותאמות אישית, למשל עבור סדרות A4 או A3 Ultra.
רכיבי הרשת שמוגדרים על ידי תוכנית ה-blueprint לפריסות של Slurm עם GPU באשכול הם:
- תוכנית ה-blueprint יוצרת שלוש רשתות VPC נפרדות: רשת VPC ראשית למישור הבקרה של Slurm, רשת VPC משנית לתנועה כללית ברמת המארח ורשת VPC ייעודית עם ביצועים גבוהים לתקשורת בין GPU ל-GPU.
- במישור הנתונים של ה-GPU, תוכנית האב-טיפוס מחילה פרופיל רשת מוגדר מראש שמנוהל על ידי Google ואופטימלי ל-RoCE.
- תוכנית האב כוללת טווח כתובות IP ייעודי שנדרש לשירות Filestore, שמספק את ספריית
/homeהמשותפת לאשכול. - הוא יוצר VPC זמני ומבודד לבניית אימג' שמשמש רק במהלך תהליך בניית האימג' של מכונה וירטואלית בהתאמה אישית לצמתי האשכול.
רשתות למכונות Compute Engine
אתם יכולים להשתמש ב-Compute Engine כדי ליצור מכונות וירטואליות עצמאיות, מופעי מחשוב בכמות גדולה וקבוצות של מופעי מכונה מנוהלים (MIG). הדרישות הספציפיות של הרשת תלויות במודל התשתית של סוג המכונה:
- מעבדי GPU באשכולות: סדרות המכונות האלה (A4X Max, A4X, A4, A3 Ultra, A3 Mega ו-A3 High עם 8 מעבדי GPU) דורשות הגדרת רשת מרובת VPC כדי להפריד בין תעבורה כללית ממארח למארח לבין תקשורת ברוחב פס גבוה בין מעבדי GPU.
- מעבדי GPU כלליים: סדרות המכונות האלה (G2, G4, A2 ו-N1 עם T4 או V100) משתמשות בארכיטקטורת VPC יחידה דרך ממשקי gVNIC לכל התקשורת. A3 Edge הוא חריג שדורש ארבעה רשתות VPC של נתונים ו-GPUDirect-TCPX.
מידע מפורט על כרטיסי הרשת והגדרת הרשת של סוג המכונה שלכם זמין במאמר Networking and GPU machines.
המאמרים הבאים
- כדי לקרוא על השיטות המומלצות ליצירת סביבת רשת מאובטחת ועמידה, אפשר לעיין במאמר בנושא שיטות מומלצות לניהול רשתות.
- מידע על אפשרויות האחסון ב-AI Hypercomputer מופיע במאמר מידע על שירותי אחסון לעומסי עבודה של AI ו-ML.
- כדי להצטרף לפריסת אשכולות, אפשר לעיין במאמר בנושא תכנון ויצירה של תשתית AI.