Knowledge Catalog הוא קטלוג נתונים המופעל על ידי Gemini המספק הקשר עסקי וממשל אוניברסליים לכלל נכס הנתונים שלך. על ידי חילוץ אוטומטי של סמנטיקה מנתונים מובנים ולא מובנים, היא בונה גרף הקשר דינמי שמבסס סוכני בינה מלאכותית ב-Enterprise Truth ומפחית הזיות. צוותי נתונים ומפתחי AI משתמשים ב-Knowledge Catalog כדי לגלות נתונים, לאכוף מדיניות ולאחזר הקשר עשיר גם לניתוח וגם לאפליקציות אוטונומיות. לצפייה בהסבר מפורט על Knowledge Catalog, אפשר לראות את הסרטון שמוטמע כאן.
Dataplex Universal Catalog נקרא עכשיו Knowledge Catalog
כדי לשקף טוב יותר את החזון של איחוד ניהול הנתונים עם יכולות של AI גנרטיבי, Dataplex Universal Catalog נקרא עכשיו Knowledge Catalog. השינוי הזה בשם המוצר מייצג מעבר ממאגר רגיל ופסיבי של מטא-נתונים לגרף הקשר פעיל שמבוסס על AI.
למה Dataplex הפך ל-Knowledge Catalog
ככל שהארגונים מאיצים את האימוץ של AI גנרטיבי, סוכני AI צריכים הקשר עסקי מעמיק כדי לספק תשובות מדויקות ומבוססות. Knowledge Catalog מגשר על הפער בין משילות מידע (data governance) ארגונית לבין תהליכי עבודה של סוכני AI.
מה ההבדל בין Dataplex לבין Knowledge Catalog
העדכונים ב-Knowledge Catalog משקפים יכולות חדשות שמבוססות על AI. בניגוד לקטלוגים פסיביים רגילים, Knowledge Catalog אוסף באופן אוטומטי מטא-נתונים, לוגיקה עסקית ויחסי נתונים לגרף הקשר מאוחד. הגרף הזה מספק את ה-Enterprise Truth המהימן שהסוכני AI צריכים כדי להריץ משימות מורכבות בצורה מדויקת. הוא ממנף תכונות כמו אוצרות הקשר אוטומטית, שאילתות לדוגמה מאומתות ואינטגרציות של Model Context Protocol (MCP) מקומיות ומרוחקות.
מה לא ישתנה
הפריסות, ממשקי ה-API וההגדרות הקיימים של Dataplex ימשיכו לפעול. תכונות ליבה כמו גילוי נתונים, שושלת נתונים, איכות נתונים ומילוני מונחים עסקיים נותרו ללא שינוי ונתמכות. המעבר לחוויית השימוש החדשה בקטלוג הידע מתבצע באופן אוטומטי, בלי שתידרש העברה ידנית, העברת נתונים או השבתה. המטא-נתונים, ההיבטים וההגדרות הקיימים שלכם יועברו לחוויית השימוש החדשה.
ממשקי API וספריות לקוח
המיתוג מחדש ל-Knowledge Catalog אינו משנה נקודות קצה קיימות של ה-API, פקודות gcloud dataplex או ספריות לקוח. באפשרותך להמשיך להשתמש בממשקי ה-API של Knowledge Catalog ובספריות הלקוחות כדי לקיים אינטראקציה עם Knowledge Catalog:
API בארכיטקטורת REST. עיין בתיעוד של Knowledge Catalog API בארכיטקטורת REST.
API ל-RPC. מידע נוסף על Knowledge Catalog RPC API
ספריות לקוח. מתחילים להשתמש ב-Knowledge Catalog בשפה הרצויה באמצעות ספריות הלקוח של Knowledge Catalog.
פקודות gcloud. ניהול משאבי Knowledge Catalog באמצעות קבוצת הפקודות
gcloud dataplex. אפשר לעיין במדריך העזר לפקודות gcloud Dataplex.
איך Knowledge Catalog עובד
Knowledge Catalog מאחד את הממשל וההקשר באמצעות שלושה עמודי תווך:
בסיס לממשל. Knowledge Catalog אוסף באופן אוטומטי מטא-נתונים טכניים משירותים Google Cloud כמו BigQuery, AlloyDB ל-PostgreSQL ו-Spanner, וגם ממערכות של צד שלישי. הוא יוצר בסיס נתונים מהימן באמצעות מילון המונחים הארגוני מרכזי, בדיקות איכות נתונים, זיהוי אנומליות ומשילות מבוססת-מדיניות.
התאמה להקשר השירות משתמש ב-Gemini כדי להסיק כוונות עסקיות על ידי ניתוח סכימות, יומני שאילתות ומודלים סמנטיים בנתונים שלכם. הוא יוצר תיאורים בשפה טבעית, מגלה קשרים ומציע תבניות SQL מאומתות בצורה של שאילתות לדוגמה שמציגות לוגיקה עסקית מורכבת.
אחזור הקשר. סוכני AI ואפליקציות יכולים לגלות נכסים באופן מיידי ולאחזר הקשר מועשר באמצעות חיפוש סמנטי וכלים שתומכים ב-Model Context Protocol (MCP). כך סוכנים יכולים לגשת לנתונים הארגוניים כדי לקבל החלטות מהימנות.
הדיאגרמה הבאה ממחישה את הארכיטקטורה של Knowledge Catalog ואיך הוא מאחד בין משילות מידע (data governance) לבין תהליכי עבודה של בינה מלאכותית גנרטיבית:
תרחישים נפוצים לדוגמה
Knowledge Catalog עוזר למהנדסי נתונים, למדעני נתונים ולמפתחי AI לפתור אתגרים שקשורים לניהול נתונים ולפיתוח AI:
העשרת נתונים ל-AI. אפשר להשתמש בתובנות לגבי נתונים לא מובְנים כדי לחלץ באופן אוטומטי מטא-נתונים וישויות מקבצים לא מובְנים כמו קובצי PDF ב-Cloud Storage. זה הופך נתונים אפלים וידע ארגוני לנגישים למודלים של בינה מלאכותית.
הפחתת הזיות של AI. מספקים לסוכני AI שאילתות לדוגמה שעברו אימות מראש ומגבלות סמנטיות, כדי לאפשר להם לבצע שליפות מורכבות של נתונים ברמת דיוק גבוהה יותר.
האצת גילוי הנתונים. שימוש בחיפוש סמנטי ובגרף הקשר המרכזי כדי לאתר נכסי נתונים רלוונטיים במקורות שונים לצורך ניתוח ותהליכי עבודה של מדעי הנתונים.
יצירה אוטומטית של מוצרי נתונים. הסקת קשרים בין הנתונים בנכסי הנתונים שלכם כדי לארוז נכסים במוצרי נתונים עצמאיים עם הסכמי רמת שירות (SLA) מובנים ומגבלות ניהול.
דוגמאות לתהליכי עבודה ב-Knowledge Catalog
כדי לראות איך אפשר ליצור את תרשים ההקשר ולנהל את נכסי הנתונים, כדאי לראות איך חברת קמעונאות אונליין יכולה להשתמש בתכונות הבאות של Knowledge Catalog:
גילוי וקטלוג של נתונים. הקמעונאי קולט באופן אוטומטי נתוני עסקאות ואוסף מטא-נתונים מהם Google Cloud שירותים כמו BigQuery, Pub/Sub ואחסון בענן. השירות גם מייבא מטא-דאטה ממאגרי מידע מותאמים אישית של מלאי כדי לבנות תצוגה מאוחדת של כל נכס הנתונים הקמעונאי. מידע נוסף מופיע במאמר בנושא גילוי נתונים.
חיפוש נכסי נתונים מדען הנתונים מוצא את נכסי נתוני הלקוחות המדויקים שהוא זקוק להם באמצעות מנוע החיפוש של Knowledge Catalog עם סינון היבטי, חיפוש סמנטי בשפה טבעית ואופרטורים לוגיים. מידע נוסף מופיע במאמר חיפוש נכסי נתונים.
העשרת הנתונים בהקשר עסקי. צוות משילות הנתונים מגדיר מונחים מעולם הקמעונאות (כמו 'ערך חיי המשתמש' או 'מק"ט') באמצעות מילוני מונחים עסקיים, ומשתמש בתובנות מבוססות-AI כדי ליצור באופן אוטומטי תיאורים לטבלאות מוצרים חדשות. הם גם מוסיפים באופן ידני מטא-נתונים ותגים מובְנים בהתאמה אישית (היבטים) באופן אחיד לכל הנכסים שלהם. מידע נוסף זמין במאמרים ניהול היבטים והוספת מטא-נתונים וניהול מילון המונחים הארגוני.
הסבר על הקשרים בין נתונים באמצעות שושלת נתונים צוות ההנדסה עוקב באופן אוטומטי אחר שושלת הנתונים כדי לראות כיצד נתוני הזמנות נעים, עוברים טרנספורמציה ונצרכים במערכות שלהם. הם משתמשים בגרפים של שושלת נתונים כדי לפתור בעיות בפייפליינים של דיווח, לבצע ניתוח של שורש הבעיה בשגיאות בתהליך התשלום ולוודא שהם עומדים בדרישות התאימות. מידע נוסף זמין במאמר סקירה כללית על שרשרת מקורות הנתונים.
נתוני הפרופיל ואיכות המדידה הקמעונאי משתמש בפרופיל נתונים אוטומטי כדי לזהות דפוסים וחריגות בטבלאות התמחור שלו ב-BigQuery. הם מגדירים ומריצים בדיקות של איכות הנתונים כדי לוודא שהכתובות למשלוח של הלקוחות מדויקות, מלאות ומהימנות עבור עומסי עבודה של AI ושל מילוי הזמנות בהמשך. מידע נוסף זמין במאמרים סקירה כללית על פרופיל נתונים וסקירה כללית על איכות נתונים אוטומטית.
אצירת מוצרי נתונים ושיתוף שלהם. הצוות של פלטפורמת הנתונים אורז נכסי מכירות אזוריים ואת המטא-נתונים, ציוני האיכות והשיוך שלהם למוצרים מנוהלים של נתוני 'תצוגה של 360 מעלות על הלקוח', שהצוותים של השיווק והמלאי מגלים ומשתמשים בהם. מידע נוסף זמין במאמר סקירה כללית על מוצרי נתונים.
Knowledge Catalog בסביבת Google Cloud העבודה
כשמקימים בסיס נתונים, חשוב להבין איך Knowledge Catalog משתלב עםGoogle Cloud שירותים קשורים:
| שירות | תפקיד ראשי | מתי משתמשים |
|---|---|---|
| Knowledge Catalog | הקשר של סוכנים ומשילות מידע (data governance) | השירות משמש לקטלוג מטא-נתונים, לניהול איכות הנתונים ולספק בסיס סמנטי לסוכני AI. |
| BigQuery | מחסן נתונים ארגוני | השימוש ב-BigQuery מאפשר לאחסן, להריץ שאילתות ולנתח מערכי נתונים גדולים. ב-Knowledge Catalog אפשר להוסיף הקשר עסקי לנתונים ב-BigQuery. |
| Vertex AI | פלטפורמה ל-AI ולמידת מכונה | השתמשו בו כדי לבנות ולפרוס מודלים של למידה מוקדמת וסוכני בינה מלאכותית. סוכנים משתמשים בממשקי Knowledge Catalog API כדי לאחזר הקשר מדויק של הארגון. |
| Cloud Storage | אחסון של נתונים לא מובנים | משמש לאחסון קבצים גולמיים. Knowledge Catalog סורק קטגוריות של Cloud Storage כדי לחלץ מטא-נתונים וישויות שאפשר לחפש. |
מושגי ליבה
כדי להשתמש ב-Knowledge Catalog ביעילות, יש להבין את המושגים המרכזיים הבאים:
תרשים הקשרים. מפה דינמית ומאוחדת שמציגה את הקשר בין הנתונים לעסק שלכם. הוא מקשר בין סכימות טכניות לבין ישויות עסקיות וידע לא מובנה.
שאילתות לדוגמה תבניות SQL מאומתות שנוצרו מראש וכוללות לוגיקה עסקית מורכבת. השאילתות האלה מאפשרות גם לבני אדם וגם לסוכני AI לשאול שאילתות על נתונים בצורה מדויקת בלי ליצור מחדש איחודים מורכבים של טבלאות.
Model Context Protocol (MCP). תקן פתוח שמאפשר לסוכני AI לגלות כלים זמינים ולהשתמש בהם באופן מותאם. קטלוג הידע משתמש בכלי MCP כדי לספק אמת ארגונית מוסמכת ישירות לסוכנים, ומציע שרתי MCP מרוחקים ומקומיים כאחד כדי להתאים לדרישות נגישות ואבטחה.
-- Example: An example query retrieved by an AI agent to ensure accurate revenue calculation
SELECT customer_id, SUM(transaction_amount) AS total_revenue
FROM `sales.processed_transactions`
WHERE transaction_status = 'COMPLETED'
GROUP BY customer_id;
הטמעות נתונים
Knowledge Catalog בולע אוטומטית מטא-נתונים מהבאיםGoogle Cloud מקורות. בשירותים מסוימים, כמו AlloyDB ל-PostgreSQL ו-Cloud SQL, צריך קודם להפעיל את השילוב עם Knowledge Catalog כדי שאפשר יהיה להטמיע מטא-נתונים:
אנליטיקס ולייקהאוס
- מערכי נתונים, טבלאות, תצוגות, מודלים, שגרות, חיבורים ומערכי נתונים מקושרים ב-BigQuery
- בורסות ורישומים של BigQuery sharing (לשעבר Analytics Hub)
- מאגרי Dataform ונכסי קוד
- שירותים, מסדי נתונים וטבלאות של Dataproc Metastore
טבלאות בקטלוג REST של Iceberg (כולל Google Cloud קטלוג זמן הריצה של Lakehouse IRC, קטלוג Databricks Unity IRC, קטלוג AWS Glue Data Catalog IRC וקטלוג Snowflake Horizon IRC)
AI ולמידת מכונה
- מודלים של בינה מלאכותית של Vertex, מערכי נתונים, קבוצות תכונות, תצוגות תכונות ומופעים של חנויות אונליין
בינה עסקית
- מכונות, מרכזי בקרה, רכיבים של מרכזי בקרה, תצוגות, פרויקטים של LookML, מודלים, ניתוחים ותצוגות ב-Looker (Google Cloud Core) (תצוגה מקדימה)
מסדי נתונים
- מופעים, אשכולות וטבלאות של Bigtable (כולל פרטים על משפחות עמודות)
- מופעים, מסדי נתונים, טבלאות ותצוגות של Spanner
סטרימינג והעברת הודעות
- נושאים ב-Pub/Sub
נתונים לא מובנים
מאגרי מידע תפעוליים
- אשכולות, מכונות, מסדי נתונים, סכימות, טבלאות ותצוגות (תצוגה מקדימה) של AlloyDB ל-PostgreSQL. קטלוג הידע מאחזר מטא-נתונים רק מ-AlloyDB עבור מופעים ראשיים של PostgreSQL ולא מרפליקות קריאה. מידע נוסף זמין במאמר בנושא ניהול משאבי AlloyDB ל-PostgreSQL באמצעות Knowledge Catalog.
- מופעי Cloud SQL, מסדי נתונים, סכמות, טבלאות ותצוגות. Knowledge Catalog מאחזר מטא-נתונים רק ממופעים ראשיים של Cloud SQL ולא ממופעים משוכפלים לקריאה. מידע נוסף מופיע במאמר ניהול משאבי Cloud SQL באמצעות Knowledge Catalog.
כדי לייבא מטא-נתונים ממקור של צד שלישי אל Knowledge Catalog, אפשר להשתמש במחברים של Knowledge Catalog או בצינור קישוריות מנוהל. למידע נוסף, ראו אודות מחברי Knowledge Catalog וסקירה כללית של קישוריות מנוהלת.
מגבלות
כשמתכננים את הפריסה, חשוב לקחת בחשבון את המגבלות הבאות:
אינטגרציות נתמכות. אמנם Knowledge Catalog תומך במערכות עיקריות של צד שלישי, אבל יכול להיות שחלק מהחילוצים הסמנטיים האוטומטיים יוגבלו לשירותים מובנים Google Cloud .
מגבלות מכסה. תֶקֶן Google Cloud מכסות API חלות על פעולות אחזור הקשר וחילוץ מטא-נתונים.
המאמרים הבאים
מושגים:
מדריכים: