מבוא למסגרת לזיהוי ישויות ב-BigQuery
התכונה 'זיהוי ישויות' ב-BigQuery מאפשרת לכם להתאים רשומות במערכי נתונים משותפים שאין להם מזהה משותף. אפשר גם להשתמש בספק זהויות משותף Google Cloud כדי להוסיף מאפיינים לנתונים המשותפים. לדוגמה, אפשר לקשר רשומות של לקוחות בין מערכי נתונים כדי ליצור פרופילים מאוחדים של לקוחות, לזהות הונאות פיננסיות או לנתח שרשרות אספקה.
לפני שמוסיפים נתונים לחדר נקי לנתונים, אפשר להשתמש בפתרון ישויות כדי להכין את הרשומות ולהתאים אותן. התכונה 'זיהוי ישויות' זמינה במודלים של תמחור על פי דרישה ועל פי קיבולת בכל מהדורות BigQuery. מידע נוסף על ההטמעה זמין במאמר הגדרה ושימוש בפתרון ישויות ב-BigQuery.
היתרונות של זיהוי ישויות
פתרון ישויות מספק יתרונות תפעוליים ושיתוף נתונים למשתמשי קצה ולספקי זהויות.
הטבות למשתמשי קצה
כשמבצעים זיהוי ישויות ב-BigQuery, נהנים מהיתרונות הבאים למשתמשי הקצה:
- פתרון במקום: אתם יכולים לפתור ישויות במקום בלי לשלם עמלות על העברת נתונים. ספק זהויות משווה את הנתונים שלכם לגרף הזהויות שלו וכותב את תוצאות זיהוי הישויות למערך נתונים ב Google Cloud פרויקט שלכם.
- פעולות פשוטות יותר: לא צריך לנהל צינורות ETL (חילוץ, טרנספורמציה וטעינה) או זרימות עבודה מותאמות אישית של שכפול נתונים.
היתרונות של ספק זהויות
כשמציעים שירותי זהויות ב-BigQuery, מקבלים את היתרונות הבאים של ספקי זהויות:
- שילוב עם Marketplace: אתם יכולים להציע את הפתרון לזיהוי ישויות כתוכנה כשירות (SaaS) מנוהלת ב-Google Cloud Marketplace.
- הגנה על קניין רוחני: אתם משתמשים בתרשימי הזהויות הקנייניים ובלוגיקת ההתאמה שלכם בלי לחשוף אותם למשתמשי הקצה. הארכיטקטורה הזו עוזרת להגן על הקניין הרוחני שלכם.
ארכיטקטורה של זיהוי ישויות
ב-BigQuery, מתבצעת רזולוציה של ישויות באמצעות קריאה לפונקציות מרוחקות שמריצות תהליכי התאמה בסביבה של ספק זהויות. במהלך התהליך הזה, BigQuery לא מעתיק או מעביר את הנתונים.
בתרשים הבא מוצג תהליך העבודה של זיהוי ישויות בין פרויקט של משתמש קצה Google Cloud לבין פרויקט של ספק זהויות Google Cloud :
תהליך העבודה של זיהוי ישויות כולל את השלבים הבאים:
- אתם מעניקים לחשבון השירות של ספק הזהויות הרשאת קריאה למערך נתוני הקלט והרשאת כתיבה למערך נתוני הפלט.
- אתם קוראים לפונקציה המרוחקת כדי להתאים את נתוני הקלט לנתוני גרף הזהויות של ספק הזהויות. הפונקציה המרוחקת מעבירה את פרמטרי ההתאמה לספק הזהויות.
- חשבון השירות של ספק הזהויות קורא ומעבד את מערך הנתונים שלכם.
- חשבון השירות של ספק הזהויות כותב את תוצאות זיהוי הישויות למערך נתוני הפלט.
כדי להריץ את תהליך העבודה הזה, רזולוציית הישויות מסתמכת על רכיבים בסביבה שלכם ובסביבה של ספק הזהויות.
רכיבים של משתמשי קצה
הפרויקט שלך Google Cloud כולל את רכיבי משתמש הקצה הבאים:
- קריאה לפונקציה מרוחקת: קריאה שמפעילה הליך שספק הזהויות מגדיר ומיישם. השיחה הזו מתחילה את תהליך זיהוי הישות.
- מערך נתוני קלט: מערך נתוני המקור שמכיל את הנתונים שרוצים להתאים. אם רוצים, מערך הנתונים של הקלט יכול להכיל טבלת מטא-נתונים עם פרמטרים נוספים. ספקי הזהויות מציינים את דרישות הסכימה של קבוצות הנתונים של הקלט.
- מערך נתונים של פלט: מערך הנתונים של היעד שבו ספק הזהויות כותב את התוצאות התואמות כטבלת פלט. אפשר גם שהספק של הזהויות יכתוב טבלה של סטטוס המשימה עם פרטי המשימה למערך הנתונים הזה. מערך הנתונים של הפלט יכול להיות אותו מערך נתונים כמו מערך הנתונים של הקלט.
רכיבים של ספק זהויות
הסביבה של ספק הזהויות מכילה את הרכיבים הבאים:
- מישור הבקרה: מכיל פונקציה מרוחקת של BigQuery שמנהלת את תהליך ההתאמה. ספק הזהויות יכול להטמיע את הפונקציה הזו כמשימת Cloud Run או כפונקציית Cloud Run. מישור הבקרה יכול להכיל גם שירותי אימות והרשאה.
- מישור הנתונים: מכיל את מערך הנתונים של גרף הזהויות ואת הפרוצדורה המאוחסנת שמפעילה את לוגיקת ההתאמה. גרף זהויות הוא מסד נתונים של הפניות למזהים ולמאפיינים של ישויות מוכרות. ספק הזהויות יכול להטמיע את התהליך המאוחסן כתהליך מאוחסן של SQL או כתהליך מאוחסן של Apache Spark. מערך הנתונים של גרף הזהויות מכיל את הטבלאות שספק הזהויות משווה לנתונים שלכם.
לתשומת ליבכם
כשמתכננים את הפריסה של פתרון לזיהוי ישויות, כדאי לקחת בחשבון את הגורמים הבאים:
- תיאום עם ספק הזהויות: לפני שמריצים משימות התאמה, צריך לתאם עם ספק זהויות נתמך כדי לקבל את פרטי הכניסה לחשבון השירות שלו ואת החתימה של הפונקציה המרוחקת.
- מסדי נתונים חיצוניים: ספקי זהויות בדרך כלל מארחים גרפים של זהויות ב-BigQuery, אבל הם יכולים גם לאחסן גרפים של זהויות במסדי נתונים חיצוניים.