יחידות GPU כלליות מותאמות לעומסי עבודה של בינה מלאכותית (AI) ולמידת מכונה (ML) שבהם יש עדיפות לגמישות תפעולית, לעצמאות משאבים ולחסכוניות.
מעבדים גרפיים כלליים מאפשרים לצוותים להטמיע ולהרחיב מאיצי NVIDIA עם אוטונומיה תפעולית מלאה, בלי להסתבך עם המורכבות הארכיטקטונית של אשכולות מתואמים של מחשבי-על. הם אידיאליים לעומסי עבודה שבהם יש עדיפות לזמינות גבוהה, להקצאת משאבים בשירות עצמי ולהתאמה לעומס (scaling) באופן עצמאי. תרחישים נפוצים לדוגמה: הסקת מסקנות בזמן אמת, RAG, יצירת אב טיפוס ואימון מודלים קטנים עד בינוניים.
מאפיינים מרכזיים של מעבדי GPU כלליים
- גמישות תפעולית: אפשר לנהל משאבים באמצעות ממשקי GKE (Autopilot ו-Standard) ו-Compute Engine רגילים כדי לפשט את הפריסה וההתאמה של קנה המידה.
- זמינות גבוהה: Google Cloud העדכונים מתבצעים בנפרד בכל מופע, כדי להבטיח שהעדכונים בצומת אחד לא ישפיעו על הזמינות של צמתים אחרים. כך מאזן העומסים יכול להפנות מחדש את התנועה בלי להפסיק את הפעלת צי המכונות.
- פשטות של הרשת: עומסי העבודה משתמשים בשירותים סטנדרטיים של ענן וירטואלי פרטי (VPC) וב-TCP/IP סטנדרטי דרך ממשקי Google Virtual NIC (gVNIC) כדי לבטל רשתות מורכבות ברמת החומרה.
- אופטימיזציה של עלויות: אפשר להשתמש במכונות וירטואליות מסוג Spot למחקר עם עמידות בפני תקלות, כדי לחסוך בעלויות עד 90% בהשוואה לתעריפים רגילים על פי דרישה.
- רכישה בשירות עצמי: אתם יכולים לקבל קיבולת ישירות באמצעות הזמנות רגילות ובקשות לפי דרישה, בלי שתצטרכו להשתמש בתהליכי עבודה שמנוהלים על ידי צוות החשבון.
משפחות כלליות של GPU ומפרטים טכניים
כדאי לעיין במפרטי החומרה של עומסי העבודה של סדרת המכונות עם מעבדי GPU לשימוש כללי. כדי להפעיל שרתים עם תפוקה גבוהה, כדאי להשתמש בסדרת A3 Edge.
סדרת A3 (גבוה עם 1, 2 או 4 מעבדי GPU ו-Edge)
A3 High (כרטיס GPU אחד, 2 או 4)
אם אתם מריצים עומסי עבודה של הסקת מסקנות או של אימון רגיל שדורשים ביצועים גבוהים אבל לא צריכים אשכול מסונכרן מלא של 8 יחידות GPU, אתם יכולים להשתמש בסדרת מכונות A3 High עם יחידת GPU אחת, 2 או 4 יחידות GPU שמצורפות.
סוגי המכונות A3 High כוללים מעבדי GPU מסוג NVIDIA H100 SXM ומתאימים היטב הן להסקת מסקנות ממודלים גדולים והן לכוונון עדין של מודלים.
| כרטיסי GPU של NVIDIA H100 מצורפים | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3,000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6,000 | 5 | 1,000 | 8 | 640 |
1 vCPU מיושם כ-hyper-thread יחיד בחומרה באחת מפלטפורמות ה-CPU הזמינות.
2 רוחב הפס המקסימלי של התעבורה היוצאת לא יכול להיות גבוה מהמספר שצוין. רוחב הפס בפועל של התעבורה היוצאת תלוי בכתובת ה-IP של היעד ובגורמים אחרים.
מידע נוסף על רוחב פס ברשת זמין במאמר רוחב פס ברשת.
3זיכרון GPU הוא הזיכרון במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות יותר של עומסי עבודה עתירי גרפיקה.
A3 Edge
אם אתם מריצים עומסי עבודה של הסקת מסקנות מבוזרת עם תפוקה גבוהה במספר רב של מארחים ללא רשת אשכול מתואמת, כדאי להשתמש בסדרת A3 Edge כדי לפשט את הפריסה ברשתות וירטואליות פרטיות רגילות.
סוגי המכונות A3 Edge כוללים מעבדי NVIDIA H100 SXM GPU ומיועדים במיוחד להצגת תוכן. הם זמינים בקבוצה מוגבלת של אזורים.
| כרטיסי GPU של NVIDIA H100 מצורפים | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM3) |
a3-edgegpu-8g |
208 | 1,872 | 6,000 | 5 |
|
8 | 640 |
סדרת A2 (רגיל ואולטרה)
אם אתם צריכים להפעיל מודלים בשרת יחיד עם ביצועים גבוהים או לבצע כוונון עדין של מודלים בקנה מידה קטן, תוכלו להשתמש בסדרת המכונות A2 כדי לגשת למשאבי GPU ייעודיים של NVIDIA A100.
A2 Ultra
| מצורפים מעבדי GPU NVIDIA A100 בנפח 80GB | ||||||
|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי מצורף (GiB) | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM2e) |
a2-ultragpu-1g |
12 | 170 | 375 | 24 | 1 | 80 |
a2-ultragpu-2g |
24 | 340 | 750 | 32 | 2 | 160 |
a2-ultragpu-4g |
48 | 680 | 1,500 | 50 | 4 | 320 |
a2-ultragpu-8g |
96 | 1,360 | 3,000 | 100 | 8 | 640 |
1 vCPU מיושם כ-hyper-thread יחיד בחומרה באחת מפלטפורמות ה-CPU הזמינות.
2 רוחב הפס המקסימלי של התעבורה היוצאת לא יכול להיות גבוה מהמספר שצוין. רוחב הפס בפועל של התעבורה היוצאת תלוי בכתובת ה-IP של היעד ובגורמים אחרים.
מידע נוסף על רוחב פס ברשת זמין במאמר רוחב פס ברשת.
3זיכרון GPU הוא הזיכרון במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות יותר של עומסי עבודה עתירי גרפיקה.
A2 Standard
| מעבדי GPU מסוג NVIDIA A100 40GB מצורפים | ||||||
|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | אחסון SSD מקומי נתמך | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB HBM2) |
a2-highgpu-1g |
12 | 85 | כן | 24 | 1 | 40 |
a2-highgpu-2g |
24 | 170 | כן | 32 | 2 | 80 |
a2-highgpu-4g |
48 | 340 | כן | 50 | 4 | 160 |
a2-highgpu-8g |
96 | 680 | כן | 100 | 8 | 320 |
a2-megagpu-16g |
96 | 1,360 | כן | 100 | 16 | 640 |
1 vCPU מיושם כ-hyper-thread יחיד בחומרה באחת מפלטפורמות ה-CPU הזמינות.
2 רוחב הפס המקסימלי של התעבורה היוצאת לא יכול להיות גבוה מהמספר שצוין. רוחב הפס בפועל של התעבורה היוצאת תלוי בכתובת ה-IP של היעד ובגורמים אחרים.
מידע נוסף על רוחב פס ברשת זמין במאמר רוחב פס ברשת.
3זיכרון GPU הוא הזיכרון במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות יותר של עומסי עבודה עתירי גרפיקה.
G4 series
אם הצוות שלכם צריך הסקה ברמת הכניסה או עומסי עבודה סטנדרטיים של עיבוד גרפי במחיר משתלם, כדאי להשתמש בסדרת המכונות G4 עם יחידות GPU מסוג NVIDIA RTX PRO 6000.
סוגי מכונות G4
משתמשים ב
מעבדי GPU של NVIDIA RTX PRO 6000 Blackwell Server Edition (nvidia-rtx-pro-6000)
ומתאימים
לעומסי עבודה של סימולציה ב-NVIDIA Omniverse, לאפליקציות עתירות גרפיקה, לטרנסקוד של סרטונים ולמחשבים וירטואליים. סוגי המכונות G4 מספקים גם פתרון בעלות נמוכה לביצוע הסקה של מארח יחיד וכוונון מודלים, בהשוואה לסוגי המכונות מסדרת A.
| מעבדי GPU מסוג NVIDIA RTX PRO 6000 שמצורפים | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון המכונה (GB) | נפח ה-Titanium SSD המקסימלי שנתמך (GiB)2 | מספר כרטיסי ה-NIC הפיזיים | רוחב הפס המקסימלי ברשת (Gbps)3 | מספר יחידות ה-GPU | זיכרון GPU4 (GB GDDR7) |
g4-standard-6 |
6 | 22 | 0 | 1 | 20 | 1/8 | 12 |
g4-standard-12 |
12 | 45 | 375 | 1 | 20 | 1/4 | 24 |
g4-standard-24 |
24 | 90 | 750 | 1 | 20 | 1/2 | 48 |
g4-standard-48 |
48 | 180 | 1,500 | 1 | 50 | 1 | 96 |
g4-standard-96 |
96 | 360 | 3,000 | 1 | 100 | 2 | 192 |
g4-standard-192 |
192 | 720 | 6,000 | 1 | 200 | 4 | 384 |
g4-standard-384 |
384 | 1,440 | 12,000 | 2 | 400 | 8 | 768 |
*זיכרון ה-GPU הוא הזיכרון שזמין במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות של עומסי העבודה המואצים, כמו למידת מכונה ועומסי עבודה שדורשים הרבה משאבים גרפיים.
G2 series
אם אתם פורסים אפליקציות של הסקת מסקנות בזמן אמת או צינורות עיבוד נתונים של יצירת תוכן עם שליפה משופרת (RAG), כדאי להשתמש בסדרת המכונות G2 כדי לאזן בין ביצועים לבין יעילות בעלויות באמצעות מעבדי GPU מסוג NVIDIA L4.
| מצורפים מעבדי NVIDIA L4 GPU | |||||||
|---|---|---|---|---|---|---|---|
| סוג המכונה | מספר המעבדים הווירטואליים1 | זיכרון ברירת מחדל של מכונה (GB) | טווח זיכרון מותאם אישית של מכונה (GB) | הנפח המקסימלי של SSD מקומי שנתמך (GiB) | רוחב הפס המקסימלי של הרשת (Gbps)2 | מספר יחידות ה-GPU | זיכרון GPU3 (GB GDDR6) |
g2-standard-4 |
4 | 16 | 16 עד 32 | 375 | 10 | 1 | 24 |
g2-standard-8 |
8 | 32 | 32 עד 54 | 375 | 16 | 1 | 24 |
g2-standard-12 |
12 | 48 | 48 עד 54 | 375 | 16 | 1 | 24 |
g2-standard-16 |
16 | 64 | 54 עד 64 | 375 | 32 | 1 | 24 |
g2-standard-24 |
24 | 96 | 96 עד 108 | 750 | 32 | 2 | 48 |
g2-standard-32 |
32 | 128 | 96 עד 128 | 375 | 32 | 1 | 24 |
g2-standard-48 |
48 | 192 | 192 עד 216 | 1,500 | 50 | 4 | 96 |
g2-standard-96 |
96 | 384 | 384 עד 432 | 3,000 | 100 | 8 | 192 |
1 vCPU מיושם כ-hyper-thread יחיד בחומרה באחת מפלטפורמות ה-CPU הזמינות.
2 רוחב הפס המקסימלי של התעבורה היוצאת לא יכול להיות גבוה מהמספר שצוין. רוחב הפס בפועל של התעבורה היוצאת תלוי בכתובת ה-IP של היעד ובגורמים אחרים.
מידע נוסף על רוחב פס ברשת זמין במאמר רוחב פס ברשת.
3זיכרון GPU הוא הזיכרון במכשיר GPU שאפשר להשתמש בו לאחסון זמני של נתונים. הזיכרון הזה נפרד מהזיכרון של המופע, והוא מיועד במיוחד לטיפול בדרישות רוחב הפס הגבוהות יותר של עומסי עבודה עתירי גרפיקה.
סדרת N1 (NVIDIA T4 או V100)
אם אתם רוצים לבצע ניסויים רגישים לעלויות או להריץ מסקנות ברמת כניסה עם רמת מקביליות נמוכה, אתם יכולים להשתמש בסדרת מכונות N1 כדי לצרף מעבדי GPU מסוג NVIDIA T4 או V100.
NVIDIA T4
| סוג המאיץ | מספר יחידות ה-GPU | זיכרון GPU1 (GB GDDR6) | מספר ה-vCPU | זיכרון המכונה (GB) | אחסון SSD מקומי נתמך |
|---|---|---|---|---|---|
nvidia-tesla-t4 או nvidia-tesla-t4-vws
|
1 | 16 | 1 עד 48 | 1 עד 312 | כן |
| 2 | 32 | 1 עד 48 | 1 עד 312 | כן | |
| 4 | 64 | 1 עד 96 | 1 עד 624 | כן |
NVIDIA V100
| סוג המאיץ | מספר יחידות ה-GPU | זיכרון GPU1 (GB HBM2) | מספר ה-vCPU | זיכרון המכונה (GB) | יש תמיכה ב-SSD מקומי2 |
|---|---|---|---|---|---|
nvidia-tesla-v100 |
1 | 16 | 1 עד 12 | 1 עד 78 | כן |
| 2 | 32 | 1 עד 24 | 1 עד 156 | כן | |
| 4 | 64 | 1 עד 48 | 1 עד 312 | כן | |
| 8 | 128 | 1 עד 96 | 1 עד 624 | כן |
הגדלת הקיבולת
מאיצי GPU כלליים משתמשים בהקצאת משאבים רגילה בשירות עצמי. אפשר לקבל קיבולת באמצעות הזמנות רגילות, בקשות על פי דרישה או מכונות וירטואליות מסוג Spot. יכול להיות שלא יהיה מלאי של קיבולת לפי דרישה, ולכן מומלץ להשתמש במכונות וירטואליות מסוג Spot או ב-Flex-start כשזה אפשרי.
המאמרים הבאים
- במאמר אפשרויות צריכה מוסבר איך לרכוש נפח אחסון.
- כדי להעריך את דרישות התשתית, אפשר לעיין במאמר בחירת תשתית.
- מידע על שירותי הרשת של יחידות ה-GPU זמין במאמר סקירה כללית על רשתות GPU.
- כדי לעיין בתהליך ובאפשרויות שצריך לבחור כשמתחילים ליצור אשכול, אפשר לעיין במאמר תכנון ויצירה של תשתית AI.