בין אם אתם בונים סוכנים, מריצים מודלים של הסקה או משלבים עם שירותי AI שונים, Cloud Run מספק את יכולת ההתאמה, הגמישות וקלות השימוש שנדרשים כדי להגשים את החידושים שלכם בתחום ה-AI.
בדף הזה מודגשים כמה תרחישים לדוגמה ברמה גבוהה לאירוח, ליצירה ולפריסה של עומסי עבודה של AI ב-Cloud Run.
למה כדאי להשתמש ב-Cloud Run לעומסי עבודה של AI?
ל-Cloud Run יש כמה יתרונות שמאפשרים לכם לוודא שאפליקציות ה-AI שלכם ניתנות להרחבה, גמישות וניהול. בין התכונות המרכזיות:
- תמיכה גמישה במאגרי תגים: אפשר לארוז את האפליקציה ואת התלויות שלה במאגר תגים, או להשתמש בכל שפה, ספרייה או מסגרת נתמכת. מידע נוסף על הסכם זמן הריצה של קונטיינרים ב-Cloud Run
- נקודת קצה (endpoint) בפרוטוקול HTTP: אחרי פריסה של שירות או אירוע של Cloud Run, מקבלים נקודת קצה (endpoint) של כתובת URL של Cloud Run שהיא מאובטחת ומוכנה לשימוש. שירות Cloud Run מספק סטרימינג באמצעות תמיכה בקידוד העברה של נתונים בחלקים ב-HTTP, ב-HTTP/2 וב-WebSockets.
- שינוי גודל אוטומטי או ידני: בשירותי Cloud Run, Cloud Run משנה את גודל השירות באופן אוטומטי בהתאם לביקוש. כך משלמים רק על מה שמשתמשים, ולכן זה אידיאלי לעומסי עבודה של AI שקשה לחזות את השימוש בהם. אפשר גם להגדיר את השירות להרחבה ידנית על סמך הצרכים שלכם בנוגע לתנועה ולניצול המעבד. במקרים של מכונות ב-Cloud Run, התאמה אוטומטית לעומס לא רלוונטית. הן פועלות כסינגלטונים שמתחילים ומפסיקים ידנית.
תמיכה ב-GPU: אפשר להגדיר משאבי Cloud Run עם GPU כדי להאיץ את מודלי ה-AI. שירותי Cloud Run עם מעבדי GPU מופעלים יכולים להצטמצם לאפס כדי לחסוך בעלויות כשהם לא בשימוש.
מערכת אקולוגית משולבת: אפשר להתחבר בצורה חלקה לשירותים אחרים Google Cloud , כמו Vertex AI, BigQuery, Cloud SQL, Memorystore, Pub/Sub, AlloyDB ל-PostgreSQL, Cloud CDN, Secret Manager ודומיינים בהתאמה אישית, כדי ליצור צינורות מקיפים של AI מקצה לקצה. בנוסף, Google Cloud Observability מספק כלים מובנים למעקב ולרישום ביומן, כדי להבין את ביצועי האפליקציה ולפתור בעיות בצורה יעילה.
- מוכן לשימוש בארגונים: Cloud Run מציע קישוריות ישירה ל-VPC, אבטחה גרנולרית ואמצעי בקרה ברשת.
תרחישי שימוש עיקריים ב-AI
ריכזנו כאן כמה דרכים להשתמש ב-Cloud Run כדי להפעיל אפליקציות AI:
אירוח של סוכני AI ובוטים
Cloud Run היא פלטפורמה אידיאלית לאירוח של לוגיקת ה-Backend של סוכני AI, צ'אטבוטים ועוזרים וירטואליים. הסוכנים האלה יכולים לתזמן קריאות למודלים של AI כמו Gemini ב-Vertex AI, לנהל את המצב ולהשתלב עם מגוון כלים וממשקי API.
- מיקרו-שירותים לסוכנים: פריסת יכולות סוכנים נפרדות כשירותים או כאינסטנסים נפרדים של Cloud Run. מידע נוסף זמין במאמר בנושא אירוח סוכני AI.
- תקשורת Agent2Agent (A2A): יצירת מערכות סוכנים שיתופיות באמצעות פרוטוקול A2A. מידע נוסף זמין במאמר בנושא אירוח סוכני A2A.
- שרתי Model Context Protocol (MCP): הטמעה של שרתי MCP כדי לספק הקשר סטנדרטי למודלים גדולים של שפה (LLM) מהכלים וממקורות הנתונים שלכם. מידע נוסף זמין במאמר בנושא אירוח שרתי MCP.
אבטחה של סוכני AI
Cloud Run משתלב עם Agent Platform כדי לספק יכולות מובנות לסוכני AI, לשרתי MCP ולכלים.
- זהויות של סוכנים: הקצאת פרטי כניסה של זהות סוכן שמנוהלים על ידי המערכת לעומסי העבודה של Cloud Run כדי לבצע אימות ל-APIs שלGoogle Cloud , לסוכנים אחרים ולשרתי MCP ללא מפתחות סטטיים. איך מאמתים את הסוכנים
- Agent Registry: רישום אוטומטי של הסוכנים והכלים בAgent Registry של הארגון, כדי להתחבר בצורה מאובטחת למפתחים ולסוכנים אחרים. הגדרת תכונות של Agent Platform ל-Cloud Run
- שרתי MCP וכלים: הגנה על שרתי MCP שנפרסו ב-Cloud Run באמצעות אימות שרת proxy לאימות זהויות (IAP) ואמצעי בקרה מפורטים לגישה. אפשר לקרוא על אימות שרתי MCP.
הצגת מודלים של AI/ML להסקת מסקנות
פריסת מודלים מאומנים של למידת מכונה כנקודות קצה (endpoints) של HTTP שניתנות להרחבה.
- הסקת מסקנות בזמן אמת: הצגת תחזיות ממודלים שנבנו באמצעות מסגרות כמו TensorFlow, PyTorch, scikit-learn או באמצעות מודלים פתוחים כמו Gemma. דוגמה מופיעה במאמר הרצת Gemma 3 ב-Cloud Run.
- האצת GPU: שימוש במעבדי GPU של NVIDIA כדי להאיץ את ההסקה עבור מודלים תובעניים יותר. מידע נוסף זמין במאמר הגדרת GPU לשירותים.
- שילוב עם Vertex AI: הצגת מודלים שאומנו או נפרסו ב-Vertex AI באמצעות Cloud Run כחלק מקצה עורפי (frontend) שניתן להרחבה.
- הפרדה של קובצי מודלים גדולים מהקונטיינר: מתאם Cloud Storage FUSE מאפשר לטעון קטגוריה של Cloud Storage ולהפוך אותה לזמינה כספרייה מקומית בתוך קונטיינר Cloud Run.
יצירת מערכות Retrieval-Augmented Generation (יצירה משולבת-אחזור, RAG)
פיתוח אפליקציות RAG על ידי חיבור שירותים או מופעים של Cloud Run למקורות הנתונים.
- מסדי נתונים וקטוריים: אפשר להתחבר למסדי נתונים וקטוריים שמארחים ב-Cloud SQL (עם
pgvector), ב-AlloyDB ל-PostgreSQL, ב-Memorystore for Redis או במאגרי וקטורים מיוחדים אחרים כדי לאחזר הקשר רלוונטי למודלים גדולים של שפה (LLM). בדוגמה הזו של תשתית אפשר לראות איך משתמשים ב-Cloud Run כדי לארח אפליקציית AI גנרטיבית עם יכולות RAG ועיבוד נתונים באמצעות Vertex AI וחיפוש וקטורי. - גישה לנתונים: שליפת נתונים מ-Cloud Storage, מ-BigQuery, מ-Firestore או מממשקי API אחרים כדי להעשיר את ההנחיות.
אירוח של ממשקי API ושרתי קצה עורפיים מבוססי-AI
פיתוח ממשקי API ומיקרו-שירותים שמשולבות בהם יכולות AI.
- Smart APIs: פיתוח ממשקי API שמשתמשים ב-LLM להבנת שפה טבעית, ניתוח סנטימנט, תרגום, סיכום וכו'.
- תהליכי עבודה אוטומטיים: יצירת שירותים שמפעילים פעולות מבוססות-AI על סמך אירועים או בקשות.
יצירת אב-טיפוס וניסוי רעיונות
חזרה מהירה על רעיונות מבוססי-AI.
- פריסה מהירה: מעבירים במהירות אבות טיפוס מסביבות כמו Vertex AI Studio, Google AI Studio או מחברות Jupyter לפריסות ניתנות להרחבה ב-Cloud Run עם מינימום הגדרות.
- פיצול תנועה: אפשר להשתמש בתכונה של פיצול תנועה ב-Cloud Run כדי לבצע בדיקות A/B של מודלים, הנחיות או הגדרות שונים, וב-Google Cloud Observability כדי לעקוב אחרי מדדים (זמן אחזור, שיעור שגיאות, עלות) ולמדוד את ההצלחה של בדיקות A/B.
המאמרים הבאים
בהתאם לרמת ההיכרות שלכם עם מושגי AI ולתרחיש השימוש שלכם ב-AI, תוכלו לעיין במשאבי ה-AI של Cloud Run.