סקירה כללית על משימות שקשורות לאיכות הנתונים

.

משימות של איכות נתונים ב-Knowledge Catalog מאפשרות להגדיר ולהריץ בדיקות של איכות נתונים בטבלאות ב-BigQuery וב-Cloud Storage. משימות של איכות נתונים ב-Knowledge Catalog מאפשרות גם להחיל אמצעי בקרה רגילים על נתונים בסביבות BigQuery.

מתי כדאי ליצור משימות של איכות נתונים ב-Knowledge Catalog

משימות של איכות נתונים ב-Knowledge Catalog יכולות לעזור לכם:

  • אימות נתונים כחלק מצינור לייצור נתונים.
  • חשוב לעקוב באופן שוטף אחרי איכות מערכי הנתונים בהשוואה לציפיות שלכם.
  • יצירת דוחות על איכות הנתונים לצורך עמידה בדרישות רגולטוריות.

יתרונות

  • מפרטים שאפשר להתאים אישית. אתם יכולים להשתמש בתחביר YAML הגמיש מאוד כדי להגדיר את הכללים לאיכות הנתונים.
  • הטמעה ללא שרת. לא צריך להגדיר תשתית כדי להשתמש ב-Knowledge Catalog.
  • העתקה אפסית והעברה אוטומטית. בדיקות YAML מומרות ל-SQL ומועברות ל-BigQuery, כך שלא מתבצעת העתקה של נתונים.
  • בדיקות איכות נתונים שאפשר לתזמן. אפשר לתזמן בדיקות של איכות הנתונים באמצעות מתזמן ללא שרתים ב-Knowledge Catalog, או להשתמש ב-Dataplex API באמצעות מתזמנים חיצוניים כמו Managed Airflow לשילוב צינורות.
  • חוויה מנוהלת. ב-Knowledge Catalog נעשה שימוש במנוע קוד פתוח לבדיקת איכות הנתונים, CloudDQ, כדי להריץ בדיקות של איכות הנתונים. עם זאת, Knowledge Catalog מספק חוויה מנוהלת חלקה לביצוע בדיקות איכות הנתונים.

איך עובדים עם משימות לשיפור איכות הנתונים

הדיאגרמה הבאה מציגה איך פועלות משימות של איכות נתונים ב-Knowledge Catalog:

תמונה

  • קלט מהמשתמשים
    • מפרט YAML: קבוצה של קובץ YAML אחד או יותר שמגדירים כללים לאיכות הנתונים על סמך תחביר המפרט. אתם מאחסנים את קובצי ה-YAML בקטגוריה של Cloud Storage בפרויקט. המשתמשים יכולים להריץ כמה כללים בו-זמנית, והכללים האלה יכולים לחול על טבלאות שונות ב-BigQuery, כולל טבלאות במערכי נתונים שונים או בפרויקטים שונים של Google Cloud. התקן תומך בהרצות מצטברות רק לצורך אימות נתונים חדשים. כדי ליצור מפרט YAML, אפשר לעיין במאמר בנושא יצירת קובץ מפרט.
    • טבלת תוצאות ב-BigQuery: טבלה שהמשתמש מציין לאחסון התוצאות של אימות איכות הנתונים. Google Cloud הפרויקט שבו הטבלה הזו נמצאת יכול להיות פרויקט שונה מהפרויקט שבו נעשה שימוש במשימת איכות הנתונים של Knowledge Catalog.
  • טבלאות לאימות
    • במפרט YAML, צריך לציין אילו טבלאות רוצים לאמת לפי אילו כללים, שנקרא גם קשירת כללים. הטבלאות יכולות להיות טבלאות מקוריות של BigQuery או טבלאות חיצוניות של BigQuery ב-Cloud Storage. במפרט YAML אפשר לציין טבלאות בתוך אזור של Knowledge Catalog או מחוצה לו.
    • טבלאות ב-BigQuery וב-Cloud Storage שעוברות אימות בהרצה אחת יכולות להיות שייכות לפרויקטים שונים.
  • משימת איכות נתונים ב-Knowledge Catalog: משימת איכות נתונים ב-Knowledge Catalog מוגדרת באמצעות קובץ בינארי מוכן מראש של CloudDQ PySpark שמתוחזק, והיא מקבלת כקלט את מפרט ה-YAML ואת טבלת התוצאות ב-BigQuery. בדומה למשימות אחרות ב-Knowledge Catalog, משימת איכות הנתונים ב-Knowledge Catalog פועלת בסביבת Spark ללא שרת, ממירה את מפרט ה-YAML לשאילתות BigQuery ואז מריצה את השאילתות האלה בטבלאות שמוגדרות בקובץ המפרט.

תמחור

כשמריצים משימות של איכות נתונים ב-Knowledge Catalog, מחויבים על השימוש ב-BigQuery וב-Managed Service for Apache Spark (Batches).

  • המשימה של איכות הנתונים ב-Knowledge Catalog ממירה את קובץ המפרט לשאילתות BigQuery ומריצה אותן בפרויקט של המשתמש. מחירון BigQuery

  • ב-Knowledge Catalog נעשה שימוש ב-Spark כדי להריץ את תוכנת מנהל ההתקן CloudDQ בקוד פתוח, שנוצרה על ידי Google, כדי להמיר את המפרט של המשתמש לשאילתות ב-BigQuery. ראו מחירים של Managed Service for Apache Spark.

אין חיובים על שימוש ב-Knowledge Catalog לארגון נתונים או על שימוש בכלי לתזמון ללא שרתים ב-Knowledge Catalog לתזמון בדיקות של איכות הנתונים. מחירון Knowledge Catalog

המאמרים הבאים