מעקב אחרי מדדים של Knowledge Catalog

במאמר הזה מוסבר איך להשתמש ב-Cloud Monitoring כדי לעקוב אחרי תקינות השירות של Knowledge Catalog (לשעבר Dataplex Universal Catalog), לשפר את הביצועים ולקבל תובנות לגבי פלטפורמת הנתונים. ניטור פרואקטיבי עוזר לוודא את המהימנות של אפליקציות נתונים ולקבל החלטות מושכלות לגבי הקצאת משאבים וניהול עלויות.

מידע על העלויות מופיע במאמר תמחור של Monitoring.

מידע נוסף על שמירת נתוני מדדים זמין במאמר מכסות ומגבלות ב-Monitoring.

תרחישים לדוגמה

אתם יכולים להשתמש במדדים של Knowledge Catalog ב-Cloud Monitoring כדי לתמוך בתרחישים הבאים:

  • הבטחת האמינות של צינורות עיבוד הנתונים: מעקב אחרי שיעורי ההצלחה והכישלון של משימות ב-Knowledge Catalog, כמו הטמעת נתונים או משימות שקשורות לאיכות הנתונים. כדי למזער את זמן ההשבתה של עומסי עבודה קריטיים, מומלץ להגדיר התראות לגבי כשלים או משכי זמן חריגים.
  • אופטימיזציה של הביצועים: אפשר לעקוב אחרי משך העבודות ומדדי השימוש במשאבים כדי לזהות צווארי בקבוק בביצועים של עומסי העבודה של עיבוד הנתונים, איכות הנתונים וגילוי הנתונים, ולפתור אותם.
  • ניהול עלויות: אפשר לעקוב אחרי צריכת המשאבים של Knowledge Catalog (למשל אגמים, אזורים ונכסים) ב-Monitoring, ולהשתמש בייצוא של נתוני החיוב ב-Cloud ל-BigQuery כדי לשייך את עלויות השימוש בשרתים וירטואליים (DCU) לעומסי עבודה של איכות נתונים, פרופיל נתונים ו-Data Lineage.
  • שמירה על משילות מידע: עוקבים אחרי מדדים שקשורים לגילוי מטא-נתונים ולהעשרת הקטלוג כדי לוודא שנכסי הנתונים נסרקים ומתויגים בהתאם למדיניות המשילות.

איך זה עובד

‫Knowledge Catalog משולב עם Cloud Monitoring, שאוסף מדדים, אירועים ומטא-נתונים משירותי Knowledge Catalog. המדדים האלה מספקים תובנות לגבי תחומים כמו סטטוס ההרצה של העבודות, השימוש ב-API ומצב המשאבים. אפשר לנתח את המדדים האלה באמצעות כלים ב-Cloud Monitoring, כמו Metrics Explorer, לוחות בקרה מותאמים אישית והתראות. הכלים האלה מאפשרים לכם לראות את ההתנהגות של השירות, לזהות מגמות בביצועים וליצור מדיניות התראות שתשלח לכם התראות כשהביצועים חורגים מספים מוגדרים או כשמתרחשים כשלים.

גישה למדדי שירות בניטור

מדדי משאבי השירות של Knowledge Catalog מופעלים באופן אוטומטי בשירותי Knowledge Catalog. כדי לראות את המדדים האלה, משתמשים ב-Monitoring.

אפשר לגשת אל Monitoring דרך מסוףGoogle Cloud או באמצעות Monitoring API.

אם אין לכם אפשרות לראות את הגרפים של המעקב או ליצור התראות, יכול להיות שאתם צריכים הרשאות נוספות למעקב.

המסוף

  1. נכנסים לדף Metrics explorer במסוף Google Cloud .

    כניסה לדף Metrics Explorer

  2. בתפריט Select a metric בוחרים משאב Cloud Dataplex.

  3. בוחרים קטגוריית מדדים ואז בוחרים מדד מהרשימה.

    כדי להציג מידע על מדד, מעבירים את הסמן מעל שם המדד.

  4. לוחצים על אישור.

  5. אופציונלי: בוחרים מסננים, מקבצים לפי תוויות מדדים, מבצעים צבירות ובוחרים אפשרויות לתצוגת התרשים.

REST

כדי לתעד ולרשום מדדים שמוגדרים על ידי ביטוי filter, צריך להשתמש בשיטה timeSeries.list של Monitoring.

כדי לשלוח בקשת API ולהציג את התגובה, משתמשים בתבנית Try this API בדף ה-API.

מדדי שירות של Knowledge Catalog ב-Monitoring

המדדים של שירות Knowledge Catalog מאפשרים לעקוב אחרי תקינות השירות.

מעקב אחר עלויות של יחידות DCU ב-Dataplex ושיוך שלהן באמצעות ייצוא של נתוני חיוב ב-Cloud

מכיוון שסריקות של נתונים ב-Knowledge Catalog (כולל איכות נתונים אוטומטית ופרופיל נתונים) ונתוני שושלת לא מפרסמים מדדים של סדרות זמן ב-Cloud Monitoring, אתם יכולים להשתמש בייצוא של חיוב ב-Cloud ל-BigQuery כדי לעקוב אחרי השימוש ביחידות עיבוד נתונים (DCU) והעלויות שלהן בפרויקטים, בסריקות ובמשאבי נתונים, ולנטר אותם ולשייך אותם.

תוויות לחיוב ב-Dataplex

‫Knowledge Catalog מצרף באופן אוטומטי תוויות מערכת לרשומות חיוב שנוצרות לסריקות נתונים ולשיוך נתונים למקורות. אפשר לשלוח שאילתות לגבי התוויות האלה במערך labels בטבלת הייצוא של נתוני החיוב ב-Cloud:

מפתח התווית עומס עבודה תיאור
goog-dataplex-datascan-id איכות הנתונים, פרופיל הנתונים המזהה או השם של סריקת הנתונים.
goog-dataplex-datascan-job-id איכות הנתונים, פרופיל הנתונים מזהה הביצוע הספציפי של משימת סריקת הנתונים.
goog-dataplex-datascan-data-source-project איכות הנתונים, פרופיל הנתונים הפרויקט ב- Google Cloud שמכיל את מקור הנתונים שנסרק.
goog-dataplex-datascan-data-source-region איכות הנתונים, פרופיל הנתונים האזור Google Cloud של מקור הנתונים שנסרק.
goog-dataplex-datascan-data-source-bigquery-dataset איכות הנתונים, פרופיל הנתונים מזהה מערך הנתונים ב-BigQuery של הטבלה שנסרקה.
goog-dataplex-datascan-data-source-bigquery-table איכות הנתונים, פרופיל הנתונים מזהה הטבלה ב-BigQuery שנסרקה.
goog-dataplex-datascan-data-source-dataplex-lake איכות הנתונים, פרופיל הנתונים מזהה האגם ב-Dataplex (אם רלוונטי).
goog-dataplex-datascan-data-source-dataplex-zone איכות הנתונים, פרופיל הנתונים מזהה אזור הנתונים ב-Dataplex (אם רלוונטי).
goog-dataplex-datascan-data-source-dataplex-entity איכות הנתונים, פרופיל הנתונים מזהה הישות ב-Dataplex (אם רלוונטי).
goog-dataplex-datascan-data-source-biglake-catalog איכות הנתונים, פרופיל הנתונים מזהה הקטלוג של BigLake (אם רלוונטי).
goog-dataplex-datascan-data-source-biglake-namespace איכות הנתונים, פרופיל הנתונים מרחב השמות של BigLake (אם רלוונטי).
goog-dataplex-datascan-data-source-biglake-table איכות הנתונים, פרופיל הנתונים מזהה הטבלה ב-BigLake (אם רלוונטי).
goog-dataplex-workload-type שושלת נתונים מזהה את עומס העבודה. הערך שמוגדר הוא LINEAGE לחיובים על עיבוד של שרשרת מקורות הנתונים.

שאילתות לדוגמה

לפני שמריצים את השאילתות האלה, צריך לוודא שהפעלתם את הייצוא של נתוני החיוב ב-Cloud ל-BigQuery. בשאלתות לדוגמה, מחליפים את הפלייסולדרים הבאים:

  • PROJECT_ID: מזהה הפרויקט Google Cloud שמארח את מערך הנתונים של ייצוא החיוב ב-BigQuery.
  • DATASET_NAME: השם של מערך הנתונים ב-BigQuery שמכיל את טבלת ייצוא החיוב.
  • BILLING_ACCOUNT_ID: מספר החשבון לחיוב ב-Cloud (בפורמט עם קווים תחתונים, לדוגמה, 012345_567890_ABCDEF).

שאילתה 1: עלויות שימוש ומאפיינים של DCU לפי DataScan וטבלת יעד

השאילתה הזו צוברת את העלויות של Dataplex Processing ו-Premium Processing לפי מזהה DataScan וטבלת היעד ב-BigQuery ב-30 הימים האחרונים:

SELECT
  project.id AS project_id,
  (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id') AS datascan_id,
  (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-data-source-project') AS data_source_project,
  (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-data-source-bigquery-dataset') AS data_source_dataset,
  (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-data-source-bigquery-table') AS data_source_table,
  sku.description AS sku_description,
  SUM(usage.amount) AS total_usage,
  usage.unit AS usage_unit,
  SUM(cost) AS total_cost,
  currency
FROM
  `PROJECT_ID.DATASET_NAME.gcp_billing_export_v1_BILLING_ACCOUNT_ID`
WHERE
  service.description = 'Dataplex'
  AND EXISTS (SELECT 1 FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id')
  AND _PARTITIONDATE >= DATE_SUB(CURRENT_DATE(), INTERVAL 30 DAY)
GROUP BY
  project_id,
  datascan_id,
  data_source_project,
  data_source_dataset,
  data_source_table,
  sku_description,
  usage_unit,
  currency
ORDER BY
  total_cost DESC;

שאילתה 2: שיוך עלויות Dataplex לפי סוג עומס העבודה (Lineage לעומת DataScan)

השאילתה הזו מפרטת את העלויות של מק"טים של Dataplex לפי קטגוריית עומס עבודה (למשל, Data Lineage לעומת DataScan) בכל הפרויקטים:

SELECT
  project.id AS project_id,
  sku.description AS sku_description,
  COALESCE(
    (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-workload-type'),
    IF(EXISTS(SELECT 1 FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id'), 'DATASCAN', 'OTHER')
  ) AS workload_type,
  SUM(usage.amount) AS total_usage,
  usage.unit AS usage_unit,
  SUM(cost) AS total_cost,
  currency
FROM
  `PROJECT_ID.DATASET_NAME.gcp_billing_export_v1_BILLING_ACCOUNT_ID`
WHERE
  service.description = 'Dataplex'
  AND _PARTITIONDATE >= DATE_SUB(CURRENT_DATE(), INTERVAL 30 DAY)
GROUP BY
  project_id,
  sku_description,
  workload_type,
  usage_unit,
  currency
ORDER BY
  total_cost DESC;

שאילתה 3: מגמת השימוש והעלות היומית ב-DCU לכל הרצה של עבודת DataScan

השאילתה הזו עוקבת אחרי העלויות והשימוש היומי ביחידות DCU של הרצות נפרדות של משימות DataScan ב-7 הימים האחרונים:

SELECT
  DATE(usage_start_time) AS usage_date,
  project.id AS project_id,
  (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id') AS datascan_id,
  (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-job-id') AS job_id,
  SUM(usage.amount) AS total_usage,
  usage.unit AS usage_unit,
  SUM(cost) AS total_cost,
  currency
FROM
  `PROJECT_ID.DATASET_NAME.gcp_billing_export_v1_BILLING_ACCOUNT_ID`
WHERE
  service.description = 'Dataplex'
  AND EXISTS (SELECT 1 FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id')
  AND _PARTITIONDATE >= DATE_SUB(CURRENT_DATE(), INTERVAL 7 DAY)
GROUP BY
  usage_date,
  project_id,
  datascan_id,
  job_id,
  usage_unit,
  currency
ORDER BY
  usage_date DESC,
  total_cost DESC;

יצירת לוח בקרה של Monitoring בהתאמה אישית

אתם יכולים ליצור לוח בקרה מותאם אישית של Monitoring שבו מוצגים תרשימים של מדדי שירות נבחרים מתוך Knowledge Catalog. מידע נוסף על יצירת מרכז שליטה זמין במאמר יצירה וניהול של מרכזי בקרה בהתאמה אישית. כשבוחרים מדד לווידג'ט בלוח הבקרה, בוחרים משאב Cloud Dataplex ואז בוחרים מדד של Knowledge Catalog.

שימוש בהתראות של Monitoring

אתם יכולים ליצור התראה ב-Monitoring שתשלח לכם הודעה כשמדד של שירות או של משימה ב-Knowledge Catalog חוצה סף מסוים.

יצירת התראה

כדי ליצור התראה, פועלים לפי ההוראות במאמר יצירת כללי מדיניות התראות על סמך סף מדד. כשבוחרים סדרת זמן למעקב, בוחרים Cloud Dataplexמשאב ואז בוחרים מדד של Knowledge Catalog.

הצגת ההתראות

כשמתקבלת התראה בעקבות תנאי של סף מדד, המערכת של Monitoring יוצרת אירוע ואירוע תואם.

כדי לראות אירוע:

אם הגדרתם מנגנון התראה במדיניות ההתראות, כמו התראה באימייל או ב-SMS, מערכת Monitoring תשלח גם התראה על האירוע.

מידע נוסף על התראות זמין במאמר אירועים של התראות שמבוססות על מדדים.

המאמרים הבאים