שושלת הנתונים עוזרת לכם להבין איך הנתונים עוברים במערכות שלכם. היא עושה זאת על ידי מעקב אחרי הקשרים בין נכסי הנתונים לבין התהליכים שמשנים אותם. אפשר לראות את פרטי שושלת הנתונים האלה כתרשימים וכרשימות במסוף Google Cloud .
במסמך הזה מוסבר על רמת הפירוט של שושלת הנתונים ברמת הטבלה וברמת העמודה, ומופיעות בו הוראות לשימוש בתצוגות גרף ורשימה כדי לבדוק את שושלת הנתונים במסוף Google Cloud .
פרטים על מודל נתוני הבסיס מופיעים במאמר בנושא מודל מידע על שושלת הנתונים.
ההבדלים בין שושלת נתונים ברמת הטבלה לבין שושלת נתונים ברמת העמודה
השגת שקיפות לגבי מקורות הנתונים מאפשרת לכם לעקוב אחרי המקור של הנתונים ואחרי מסלול השינוי שלהם, גם ברמת הטבלה וגם ברמת העמודה.
מתי כדאי להשתמש בתיעוד מקורות נתונים ברמת הטבלה
השורה של הטבלה מספקת סקירה כללית ברמה גבוהה של צינורות הנתונים, ומציגה את הקשרים בין טבלאות שלמות. אפשר להשתמש בנתוני השושלת ברמת הטבלה למשימות ברמת המאקרו, כמו:
גילוי נתונים. אנליסט שיוצר לוח בקרה חדש יכול להשתמש בתיעוד המקורות ברמת הטבלה כדי לעקוב אחרי טבלת סיכום עד למקורות שלה, ולוודא שהנתונים מגיעים ממסד נתונים מהימן.
תכנון ההעברה אדמין של מסד נתונים שמתכנן להעביר מסד נתונים מרכזי יכול להשתמש בתיעוד המקור ברמת הטבלה כדי לזהות כל דוח ומרכז בקרה שמוגדרים בהמשך השרשרת ותלויים בו.
ביקורת וניהול. אחראי על ניהול הנתונים יכול להשתמש בתיעוד המקור והיעד ברמת הטבלה וברמת העמודה כדי לבדוק איך נתונים מטבלה שמכילה פרטים אישיים מזהים (PII) זורמים דרך צינור.
מתי כדאי להשתמש בנתוני שושלת ברמת העמודה
השילוב של נתוני שושלת ברמת העמודה מאפשר לכם לקבל תצוגה מפורטת יותר, כי הוא עוקב אחרי זרימת הנתונים בין עמודות נפרדות. בתצוגה הזו, הקישורים באירוע של שושלת הנתונים מייצגים את הקשר בין עמודת מקור לעמודת יעד. לכל אחד מהקישורים ברמת העמודה יש סוג תלות שמתאר את השינוי:
Exact copy: הערכים מועתקים בין העמודות.
Other: סוגים אחרים של תלות בין עמודות.
אפשר להשתמש בתיעוד המקור ברמת העמודה למשימות כמו:
ניתוח שורש הבעיה. אם אנליסט נתונים מוצא ערך שגוי בעמודה, הוא יכול להשתמש בשושלת הנתונים של העמודה כדי לאתר את עמודות המקור ולמצוא את שורש הבעיה.
ניתוח השפעות. לפני שמהנדס נתונים מוציא משימוש עמודה, הוא יכול להשתמש בשושלת נתונים ברמת העמודה כדי למצוא כל עמודה במורד הזרם שתלויה בה.
אימות של מקורות נתונים למדדים. אנליסט נתונים יכול להשתמש בשושלת נתונים ברמת העמודה כדי לזהות אילו עמודות מקור משמשות לחישוב מדד, בלי לפענח שאילתת SQL מורכבת.
שושלת נתונים ברמת העמודה נאספת באופן אוטומטי עבור סוגי המשימות הבאים ב-BigQuery:
במקרה של משימות Managed Service for Apache Spark, התמיכה תלויה בסוג ובגרסה של התלות ב-Open Lineage שבה נעשה שימוש ב-Managed Service for Apache Spark. הגרסה המינימלית הנתמכת היא 1.34. אלה הגרסאות המינימליות הנתמכות של תמונות אשכולות של Managed Service for Apache Spark:
- 3.0.3
- 2.3.22
- 2.2.75
- 2.1.107
אלה גרסאות המינימום של זמן הריצה של Managed Service for Apache Spark שנתמכות:
- 3.0.3
- 2.3.20
תצוגות של שושלת הנתונים במסוף Google Cloud
במסוף Google Cloud אפשר לקיים אינטראקציה עם מידע על שרשרת מקורות הנתונים בשתי דרכים: אפשר לעיין בתרשים של שרשרת מקורות הנתונים בכמה אזורים זמינים, או להשתמש בחלונית Lineage explorer כדי לקבל תצוגה ממוקדת יותר באזור ספציפי. אפשר גם לעבור בין תצוגת הגרף לתצוגת הרשימה כדי לנתח את זרימת הנתונים ברמות פירוט שונות.
תצוגות של שושלת הנתונים זמינות רק לרשומות ב-Knowledge Catalog (לשעבר Dataplex Universal Catalog), לנכסי BigQuery ולמשאבי Vertex AI (מודלים, מערכי נתונים, תצוגות של מאגר תכונות וקבוצות תכונות).
כדי לראות את התצוגות השונות שמוזכרות במאמר הזה, אפשר לעיין במאמר בנושא שימוש ב-Data Lineage עם Google Cloud מערכות.
תצוגת תרשים של שרשרת היוחסין
בתצוגת הגרף מוצגים באופן חזותי הזרימה והקשרים של נכסי הנתונים במערכות ובאזורים שונים. כך אפשר להבין את ארכיטקטורת הנתונים, לעקוב אחרי המקורות והיעדים ולזהות דפוסים. בתרשימי שרשרת היוחסין האלה, שנוצרים על ידי שירות Data Lineage API עבור רשומה ספציפית ב-Knowledge Catalog, מוצגת הטרנספורמציה של הנתונים לאורך זמן. אפשר לראות בהם את הזרימה במעלה הזרם, במורד הזרם או בשני הכיוונים מרשומת הבסיס שנבחרה.
Data Lineage API מקבל באופן אוטומטי מידע על נכסים ממערכות נתמכות וממקורות מותאמים אישית באמצעות קריאות ל-API.
הרכיבים העיקריים בתרשים הם:
צמתים. הצמתים מייצגים את ישויות הנתונים. בתצוגה ברמת הטבלה, הצומת מציג את שם הטבלה והעמודות שלה. בתצוגה ברמת העמודה, כל צומת מייצג טבלה ועמודה ספציפיות.
צלעות. הקצוות הם הקווים שמחברים בין הצמתים ומייצגים את התהליכים שמתרחשים ביניהם. המראה של קצה תלוי בתצוגת שושלת הנתונים:
- בתצוגה ברמת הטבלה, לקצוות יש סמלים שמציינים טרנספורמציות של נתונים.
- בתצוגה ברמת העמודה, לקצוות יש תוויות שמציינות את השינויים בנתונים. לדוגמה, תווית של קצה יכולה להיות
Exact copyכדי לתאר איך עמודת מקור הועתקה לעמודת יעד.
עיבוד סמלים ותוויות. סמלים ותוויות של תהליכים מופיעים בקצוות כדי לספק מידע נוסף על הטרנספורמציה.
- סמלים. הסמלים מייצגים את תהליך השינוי. כשבודקים את הגרף באופן ידני, הסמלים בקצוות מייצגים את מערכת המקור של התהליך (לדוגמה, BigQuery או Vertex AI). אם יש כמה תהליכים, מוצג סמל של 'תהליכים מרובים'. אם המערכת לא יודעת מהו מקור התהליך, יופיע סמל של גלגל שיניים. כשמחילים מסננים, סמל גלגל השיניים מופיע בכל התהליכים.
- תוויות. בתצוגת שושלת הנתונים ברמת העמודה, התווית מתארת את סוג התלות בין העמודות:
Exact copyאוOther.
עיון בתרשים של שושלת נתונים
כשפותחים את הכרטיסייה Lineage, רואים את תצוגת הגרף שמוגדרת כברירת מחדל. תצוגת ברירת המחדל מספקת סקירה כללית ברמה גבוהה של המערכות והאזורים, עם הרחבה ידנית מצטברת של הגרף, שמאפשרת לטעון חמישה צמתים בכל פעם. סמלי תהליך בקצוות מייצגים את מערכת המקור או מציינים כמה תהליכים.
סינון והדגשה של תצוגות שושלת נתונים
בגרפים גדולים ומורכבים של שושלת הנתונים, אפשר להחיל מסננים או הדגשה כדי לצמצם את הרעש החזותי ולהתמקד בבדיקת שושלת הנתונים באזור ספציפי. משתמשים בחלונית Lineage explorer כדי להגדיר את הקריטריונים. כשמחילים מסננים, סרגל סינון מופיע בחלק העליון של התצוגות תרשים ורשימה, והמסננים הפעילים מוצגים כצ'יפים.
כדי לשפר את התצוגה החזותית של שושלת הנתונים, אפשר לבחור באחד מהמצבים הבאים:
הדגשה: הצמתים התואמים מודגשים בצבעים ובגבולות, והגרף המלא נשאר גלוי. כך אפשר לאתר נכסים ספציפיים בלי לאבד את ההקשר הכולל של גרף השושלת.
מסנן: הצמתים שלא תואמים מוסתרים, והגרף מפשט את עצמו כדי להציג רק את הצמתים התואמים ואת הנתיבים ביניהם. נכסים שלא תואמים, שהם חלק מנתיב בין צמתים תואמים, מקובצים לצמתים מכווצים. המצב הזה שימושי לצמצום המורכבות ולהתמקדות רק בנכסים רלוונטיים וביחסים הישירים ביניהם.
כדי לסנן או להדגיש את שרשרת המקור, משתמשים בקריטריונים הבאים:
- פרויקט: סינון לפי Google Cloud מזהה פרויקט.
- מערכת: סינון לפי המערכת שבה נמצא נכס הנתונים (לדוגמה, BigQuery או Cloud Storage).
- שם הישות: סינון לפי שם הנכס. אפשר להשתמש בתו
*לחיפושים עם תו כללי (רק בקידומת ובסיומת – לדוגמה,*tableאוtest*). - סוג משנה: סינון לפי סוג משנה של נכס (לדוגמה,
dashboardאוmodel). - שם העמודה: סינון שושלת נתונים לפי שם העמודה כדי לראות פרטים ברמת העמודה.
- כיוון: הצגת שושלת במעלה הזרם או במורד הזרם, או שניהם.
- טווח זמן: סינון של היסטוריית השינויים לפי שעת התחלה או שעת סיום ספציפיות.
- סוג התלות: סינון של שושלת הנתונים ברמת העמודה לפי סוג התלות.
דוגמאות לאפשרויות זמינות:
AllאוExact copy.
כדי לצמצם עוד יותר את העומס, אפשר לבחור באפשרות הסתרת טבלאות זמניות ב-BigQuery כדי להסתיר נכסים זמניים שנוצרו על ידי BigQuery, כמו טבלאות במערכי נתונים שהשמות שלהם מתחילים ב-_script.
בתצוגה הממוקדת בכרטיסיית התצוגה Graph (גרף), הגרף מתרחב אוטומטית עד שלוש רמות, ונטען כל הקשר שמתאים לקריטריוני הסינון. כלי לבדיקת מקורות נתונים מאחזר עד 10 רמות של גרף מקורות הנתונים, אבל רק שלוש הרמות הראשונות מוצגות בתצוגה מורחבת כברירת מחדל. כדי להרחיב את התרשים ולראות את הרמות שנותרו, לוחצים על החיצים.
התצוגה הממוקדת תומכת בתיעוד מקורות נתונים ברמת הטבלה וברמת העמודה, כולל תצוגה חזותית של הנתיב מכל צומת שנבחר בחזרה לצומת הבסיס. בתצוגה הממוקדת הזו, סמל גלגל שיניים כללי משמש לכל התהליכים.
כדי לראות את שושלת הנתונים ברמת העמודה, משתמשים באחת מהשיטות הבאות:
בתצוגת תרשים ממוקדת, לוחצים על סמל העמודה בטבלה כדי לעבור לנתוני מקור ברמת העמודה.
סמל העמודה בתצוגת הגרף שמוגדרת כברירת מחדל או בתצוגת הגרף הממוקדת, מחילים שם של עמודה בחלונית Lineage explorer.
כדי להסיר את כל המסננים ולחזור לתצוגת ברירת המחדל, לוחצים על איפוס.
כדי לעבור בין מצב הדגשה למצב סינון, אפשר לעיין במאמר שיפור הוויזואליזציה של שרשרת המקור.
צפייה בפרטים של צומת בשרשרת היוחסין
כדי לראות את הפרטים של צומת, לוחצים על הצומת. מופיעה חלונית צדדית עם מידע מפורט על נכס הנתונים שנבחר. לדוגמה, בתצוגת שושלת נתונים ברמת הטבלה, כשלוחצים על צומת מוצג מידע כמו השם מוגדר במלואו של הנכס, הסוג שלו ומאפיינים רלוונטיים אחרים.
צפייה בהיסטוריית ההרצות של שרשרת היוחסין
גרף שושלת נתונים מלא הוא תוצאה של הרצות של הרבה משימות שונות. כל משימה יוצרת קישור ספציפי בתרשים. רישום של כמה הפעלות מתבצע כריצות חדשות, אבל לא משנה את המראה הסטטי של הגרף.
כדי לראות את הפרטים של כל הרצה, לוחצים על קצה עם תהליך בגרף. בחלונית שאילתה שמופיעה, לוחצים על הכרטיסייה הפעלות.
בדיקה של הלוגיקה של טרנספורמציית הנתונים
כדי להבין את הלוגיקה העסקית של טרנספורמציה בלי לחפש את הקוד, אפשר לראות את שאילתת ה-SQL המדויקת שהופעלה. כדי לראות את קוד ה-SQL, לוחצים על קצה עם תהליך בגרף. בחלונית הצדדית שמופיעה, לוחצים על הכרטיסייה פרטים.
המחשה ויזואלית של נתיב מקור נתונים
המחשה של נתיב השושלת עוזרת לכם לעקוב אחרי הנתיב מכל צומת שנבחר בתרשים בחזרה אל רשומת הבסיס. כשבוחרים צומת ולוחצים על Visualize path, התרשים מדגיש רק את הצמתים והתהליכים שיוצרים את נתיב השושלת הישיר אל רשומת הבסיס.
כדי לראות את הוויזואליזציה של נתיב השושלת, בחלונית Lineage explorer, מחילים מסנן כדי ליצור תצוגת Graph ממוקדת. לאחר מכן, בתצוגה הממוקדת תרשים, בוחרים צומת. בחלונית הפרטים של הצומת שנבחר, לוחצים על הצגת הנתיב.
המחשה של נתיב השושלת זמינה לשושלת ברמת הטבלה ולשושלת ברמת העמודה. אפשר גם להשתמש בהדמיה של נתיב שרשרת היוחסין בתצוגת רשימה.
תצוגת רשימה של נתוני השושלת
בתצוגה List מוצגת טבלה עם ייצוג מובנה של שושלת נתונים, שמתעדכנת בהתאם לתצוגה Graph. הוא מאפשר למיין, לסנן ולהוריד נכסי נתונים. התצוגה הזו אידיאלית לניתוח הקשרים בין מקור ליעד, לפרט את הנכסים הרלוונטיים ולייצא נתוני שושלת.
התצוגה רשימה זמינה גם לשושלת נתונים ברמת הטבלה וגם לשושלת נתונים ברמת העמודה. אפשר לעבור בין התצוגות המפורטות והפשוטות הבאות של רשימת המשימות:
תצוגת רשימה פשוטה: התצוגה הזו שימושית לקבלת רשימה ייחודית ומצומצמת של כל הנכסים שקשורים לשושלת הנתונים. העמודות כמו System, Project, Entity, FQN (שם מוגדר במלואו), Direction ו-Depth עוזרות לכם לראות את כל נכסי הנתונים ב-שושלת נתונים, איפה הם נמצאים, מה המקור המקורי שלהם והמרחק שלהם מהנכס המרכזי שמנותח. הוא אידיאלי לקבלת סקירה כללית ברמה גבוהה של כל הישויות שמשתתפות בהעברת הנתונים. זו תצוגת ברירת המחדל.
תצוגת רשימה מפורטת: התצוגה הזו מיועדת לניתוח של קשרי גומלין בין מקור ליעד. העמודות הנפרדות מקור ויעד מאפשרות לכם לראות כל קישור ספציפי להמרת נתונים. התצוגה הזו מתאימה למשימות שדורשות הבנה מעמיקה של תנועת הנתונים בין זוגות ספציפיים של נכסים, כמו ביקורת של זרימות נתונים פרטניות, הבנת התלות בין טבלאות או ייצוא של רשומות מפורטות של שרשרת מקורות לכל חיבור.
תצוגת רשימת שושלת נתונים ברמת הטבלה
בתצוגה הזו מוצגים הקשרים בין הטבלאות בכללותן. משתמשים במסננים שמופיעים כדי לבחור את העמודות שרוצים.
כדי לראות את העמודות שזמינות בתצוגות הרשימה ברמת הטבלה, מרחיבים את הקטעים הבאים.
עמודות שזמינות בתצוגת רשימה פשוטה ברמת הטבלה
- מערכת: המערכת שבה נמצא נכס הנתונים. דוגמאות: [BigQuery](/bigquery/docs).
- Project: מזהה הפרויקט ב- Google Cloud שמכיל את נכס הנתונים.
- Entity: השם של נכס הנתונים. לדוגמה, שם של טבלה.
- FQN: השם המלא (FQN) של ישות או עמודה במקור המקורי.
- כיוון: מציין אם הנכס שמופיע ברשימה הוא במעלה הזרם (מקור) או במורד הזרם (יעד) בתהליך של שרשרת הדורות.
- עומק: מספר השלבים בשרשרת היוחסין מהנכס המרכזי שמנותח.
העמודות שזמינות בתצוגת רשימה מפורטת ברמת הטבלה
- מערכת המקור: המערכת שבה נמצא נכס נתוני המקור. לדוגמה, BigQuery.
- פרויקט המקור: מזהה הפרויקט ב- Google Cloud שמכיל את נכס נתוני המקור.
- מקור: השם של נכס נתוני המקור. לדוגמה, שם של טבלה.
- Source FQN: ה-FQN של ישות המקור.
- מערכת היעד: המערכת שבה נמצא נכס נתוני היעד. לדוגמה, BigQuery.
- Target project (פרויקט היעד): מזהה הפרויקט ב- Google Cloud שמכיל את נכס נתוני היעד.
- יעד: השם של נכס נתוני היעד. לדוגמה, שם של טבלה.
- Target FQN: ה-FQN של ישות היעד.
- כיוון: מציין אם הנכס שמופיע ברשימה הוא במעלה הזרם (מקור) או במורד הזרם (יעד) בתהליך של שרשרת הדורות.
- עומק: מספר השלבים בשרשרת היוחסין מהנכס המרכזי שמנותח.
תצוגת רשימת קשרי התלות ברמת העמודה
בתצוגה הזו מוצגים הקשרים בין העמודות השונות בטבלאות המקור והיעד. משתמשים במסננים שמופיעים כדי לבחור את העמודות שרוצים.
כדי לראות את העמודות שזמינות בתצוגות הרשימה ברמת העמודה, מרחיבים את הקטעים הבאים.
העמודות שזמינות בתצוגת רשימה פשוטה ברמת העמודה
- מערכת: המערכת שבה נמצא נכס הנתונים. דוגמאות: BigQuery.
- Project: מזהה הפרויקט ב- Google Cloud שמכיל את נכס הנתונים.
- Entity: השם של נכס הנתונים. לדוגמה, שם של טבלה.
- עמודה: העמודה הספציפית שנבחרה בחלונית Lineage Explorer בתוך הישות.
- FQN: השם המלא (FQN) של ישות המקור או העמודה המקורית.
- כיוון: מציין אם הנכס שמופיע ברשימה הוא במעלה הזרם (מקור) או במורד הזרם (יעד) בתהליך של שרשרת המקורות.
- עומק: מספר השלבים בשרשרת היוחסין מהנכס המרכזי שמנותח.
העמודות שזמינות בתצוגת רשימה מפורטת ברמת העמודה
- מערכת המקור: המערכת שבה נמצא נכס נתוני המקור.
- פרויקט המקור: מזהה הפרויקט ב- Google Cloud שמכיל את נכס נתוני המקור.
- FQN של המקור: ה-FQN של עמודת המקור.
- מערכת היעד: המערכת שבה נמצא נכס נתוני היעד.
- Target project (פרויקט היעד): מזהה הפרויקט ב- Google Cloud שמכיל את נכס נתוני היעד.
- Target FQN: ה-FQN של עמודת היעד.
- כיוון: מציין אם זרימת הנתונים היא במעלה הזרם או במורד הזרם.
- סוגי תלות: תיאור של אופי הקשר בין העמודות.
- עומק: מספר השלבים בשרשרת היוחסין מהנכס המרכזי שמנותח.