יצירת פרופיל של איכות הנתונים ואימות שלהם

במדריך הזה נסביר איך להשתמש ב-Knowledge Catalog (לשעבר Dataplex Universal Catalog) כדי ליצור פרופיל של טבלה ב-BigQuery, להגדיר כללים לאיכות הנתונים על סמך תובנות מהפרופיל ולהריץ סריקה של איכות הנתונים.

מבצעים את השלבים הבאים:

  1. יוצרים מערך נתונים וטבלה ב-BigQuery עם נתונים לדוגמה של שיתוף אופניים, שכוללים אנומליות מכוונות כמו כפילויות וערכים ריקים, כדי לבדוק את יכולות הסריקה.
  2. יוצרים ומריצים סריקה של פרופיל נתונים בטבלה. במסגרת פרופיל הנתונים מחושבים נתונים סטטיסטיים ברמת העמודה, כמו אחוזים של ערכי null, ספירות של ערכים ייחודיים והתפלגויות של ערכים. מידע נוסף מופיע במאמר מידע על פרופיל נתונים.
  3. בודקים את תוצאות הסריקה של פרופיל הנתונים כדי למצוא דפוסים ואנומליות פוטנציאליות.
  4. מגדירים כללים לאיכות הנתונים על סמך הממצאים בפרופיל ומריצים סריקה של איכות הנתונים. בסריקות של איכות הנתונים, המערכת מאמתת את הנתונים בהתאם לכללים מוגדרים כדי לזהות אנומליות. מידע נוסף זמין במאמר בנושא איכות נתונים אוטומטית.
  5. בודקים את תוצאות ההערכה כדי לראות אילו כללי איכות עברו את הבדיקה ואילו לא.

לפני שמתחילים

מגדירים את הפרויקט:

  1. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  2. If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.

  3. Verify that billing is enabled for your Google Cloud project.

  4. Enable the Knowledge Catalog and BigQuery APIs.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the APIs

התפקידים הנדרשים

כדי לקבל את ההרשאות שדרושות ליצירה ולהרצה של סריקות פרופיל נתונים ואיכות נתונים, ולניהול משאבי BigQuery, צריך לבקש מהאדמין את התפקידים הבאים ב-IAM בפרויקט:

להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.

יכול להיות שאפשר לקבל את ההרשאות הנדרשות גם באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש.

אם יש לכם את ההרשאות הנדרשות לניהול גישת IAM בפרויקט, אתם יכולים להקצות את התפקידים האלה לחשבון המשתמש שלכם על ידי הפעלת הפקודות הבאות של gcloud:

gcloud projects add-iam-policy-binding PROJECT_ID \
    --member="user:USER_EMAIL" \
    --role="roles/dataplex.dataScanEditor"

gcloud projects add-iam-policy-binding PROJECT_ID \
    --member="user:USER_EMAIL" \
    --role="roles/bigquery.dataOwner"

gcloud projects add-iam-policy-binding PROJECT_ID \
    --member="user:USER_EMAIL" \
    --role="roles/bigquery.jobUser"

מחליפים את מה שכתוב בשדות הבאים:

  • PROJECT_ID: מזהה הפרויקט ב- Google Cloud .
  • USER_EMAIL: כתובת האימייל בחשבון המשתמש (לדוגמה, name@example.com).

מתן הרשאות לסוכן השירות של Knowledge Catalog

סוכן שירות הוא חשבון שירות בניהול Google שמשמש את Knowledge Catalog להפעלת שאילתות סריקה ב-BigQuery בשמכם.

  1. במסוף Google Cloud , לוחצים על Activate Cloud Shell בסרגל הכלים. יחלפו כמה רגעים עד שההקצאה והחיבור לסביבת העבודה יושלמו.

  2. יצירת סוכן השירות של Knowledge Catalog:

    gcloud beta services identity create --service=dataplex.googleapis.com
    

    הפקודה הזו יוצרת את סוכן השירות אם הוא עדיין לא הוקצה, ומציגה את כתובת האימייל שלו. אם בפרויקט כבר יש סוכן שירות של Knowledge Catalog, הפקודה מחזירה את הזהות הקיימת בלי לבצע שינויים.

    הפלט אמור להיראות כך:

    serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex.
    

    שימו לב לPROJECT_NUMBER בפלט כדי לדעת מה השלבים הבאים.

  3. נותנים את התפקיד BigQuery Job User (roles/bigquery.jobUser) כדי ש-Knowledge Catalog יוכל להריץ משימות של שאילתות בפרויקט:

    gcloud projects add-iam-policy-binding PROJECT_ID \
       --member="serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex." \
       --role="roles/bigquery.jobUser"
    

    מחליפים את מה שכתוב בשדות הבאים:

    • PROJECT_ID: מזהה הפרויקט ב- Google Cloud .
    • PROJECT_NUMBER: מספר הפרויקט ב- Google Cloud .
  4. צריך להעניק את התפקיד BigQuery Data Viewer ‏ (roles/bigquery.dataViewer) כדי שסוכן השירות יוכל לקרוא את נתוני הטבלה והסכימה:

    gcloud projects add-iam-policy-binding PROJECT_ID \
       --member="serviceAccount:service-PROJECT_NUMBER@gcp-sa-dataplex." \
       --role="roles/bigquery.dataViewer"
    

    מחליפים את מה שכתוב בשדות הבאים:

    • PROJECT_ID: מזהה הפרויקט ב- Google Cloud .
    • PROJECT_NUMBER: מספר הפרויקט ב- Google Cloud .

יצירת טבלה ומערך נתונים לדוגמה

כדי לנסות את הפרופילים ואת הסריקות של איכות הנתונים בצורה בטוחה בלי לגעת בנתוני הייצור, מגדירים מערך נתונים ייעודי ב-BigQuery ויוצרים טבלה שמכילה נתונים לדוגמה ישירות בפרויקט.

המסוף

  1. במסוף Google Cloud , עוברים לדף BigQuery.

    כניסה לדף BigQuery

  2. בחלונית Explorer, לוחצים על View actions לצד מזהה הפרויקט ואז על Create dataset.

  3. בשדה Dataset ID (מזהה מערך הנתונים), מזינים את הערך quickstart_data_profile.

  4. ברשימה Data location, בוחרים באפשרות us-central1 (Iowa).

  5. לוחצים על יצירת מערך נתונים.

  6. בעורך השאילתות, מזינים את שאילתת ה-SQL הבאה כדי ליצור נתונים לדוגמה של שיתוף אופניים בטבלה bikeshare_trips:

    CREATE OR REPLACE TABLE `PROJECT_ID.quickstart_data_profile.bikeshare_trips` AS
    SELECT
    -- Duplicate and null IDs
    IF(MOD(x, 100) = 0, NULL, IF(x > 9900, 1000 + (x - 9900), 1000 + x)) AS trip_id,
    -- Nulls and unrecognized category values
    CASE
      WHEN MOD(x, 50) = 0 THEN 'INVALID_TIER'
      WHEN MOD(x, 25) = 0 THEN NULL
      WHEN MOD(x, 4) = 0 THEN 'Local Rider'
      WHEN MOD(x, 4) = 1 THEN 'Walk Up'
      WHEN MOD(x, 4) = 2 THEN 'Student Membership'
      ELSE 'Weekender'
    END AS subscriber_type,
    -- Nulls and malformed bike IDs
    CASE
      WHEN MOD(x, 60) = 0 THEN 'UNKNOWN'
      WHEN MOD(x, 30) = 0 THEN NULL
      ELSE CAST(2000 + x AS STRING)
    END AS bike_id,
    -- Null dates and future timestamps
    CASE
      WHEN MOD(x, 70) = 0 THEN NULL
      WHEN MOD(x, 40) = 0 THEN TIMESTAMP_ADD(CURRENT_TIMESTAMP(), INTERVAL x MINUTE)
      ELSE TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL x MINUTE)
    END AS start_time,
    -- Nulls and placeholder station values
    CASE
      WHEN MOD(x, 20) = 0 THEN 'STATION_UNKNOWN'
      WHEN MOD(x, 10) = 0 THEN NULL
      ELSE CAST(100 + MOD(x, 50) AS STRING)
    END AS start_station_id,
    -- Negative durations, zeros, and extreme outliers
    CASE
      WHEN MOD(x, 15) = 0 THEN -10.0
      WHEN MOD(x, 35) = 0 THEN 0.0
      WHEN MOD(x, 200) = 0 THEN 99999.0
      ELSE CAST(MOD(x, 120) + 1.5 AS FLOAT64)
    END AS duration_minutes
    FROM UNNEST(GENERATE_ARRAY(1, 10000)) AS x;

    מחליפים את PROJECT_ID במזהה הפרויקט ב- Google Cloud .

  7. לוחצים על הפעלה.

gcloud

  1. ב-Cloud Shell, יוצרים את מערך הנתונים quickstart_data_profile באזור us-central1:

    bq --location=us-central1 mk --dataset PROJECT_ID:quickstart_data_profile
    

    מחליפים את PROJECT_ID במזהה הפרויקט ב-Google Cloud .

  2. יוצרים את טבלת הדוגמה bikeshare_trips ומאכלסים אותה:

    bq query \
    --use_legacy_sql=false \
    "CREATE OR REPLACE TABLE \`PROJECT_ID.quickstart_data_profile.bikeshare_trips\` AS
    SELECT
      IF(MOD(x, 100) = 0, NULL, IF(x > 9900, 1000 + (x - 9900), 1000 + x)) AS trip_id,
      CASE
        WHEN MOD(x, 50) = 0 THEN 'INVALID_TIER'
        WHEN MOD(x, 25) = 0 THEN NULL
        WHEN MOD(x, 4) = 0 THEN 'Local Rider'
        WHEN MOD(x, 4) = 1 THEN 'Walk Up'
        WHEN MOD(x, 4) = 2 THEN 'Student Membership'
        ELSE 'Weekender'
      END AS subscriber_type,
      CASE
        WHEN MOD(x, 60) = 0 THEN 'UNKNOWN'
        WHEN MOD(x, 30) = 0 THEN NULL
        ELSE CAST(2000 + x AS STRING)
      END AS bike_id,
      CASE
        WHEN MOD(x, 70) = 0 THEN NULL
        WHEN MOD(x, 40) = 0 THEN TIMESTAMP_ADD(CURRENT_TIMESTAMP(), INTERVAL x MINUTE)
        ELSE TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL x MINUTE)
      END AS start_time,
      CASE
        WHEN MOD(x, 20) = 0 THEN 'STATION_UNKNOWN'
        WHEN MOD(x, 10) = 0 THEN NULL
        ELSE CAST(100 + MOD(x, 50) AS STRING)
      END AS start_station_id,
      CASE
        WHEN MOD(x, 15) = 0 THEN -10.0
        WHEN MOD(x, 35) = 0 THEN 0.0
        WHEN MOD(x, 200) = 0 THEN 99999.0
        ELSE CAST(MOD(x, 120) + 1.5 AS FLOAT64)
      END AS duration_minutes
    FROM UNNEST(GENERATE_ARRAY(1, 10000)) AS x;"
    

יצירה והפעלה של סריקת פרופיל נתונים

בסריקה של פרופיל נתונים נבדקות השורות בטבלה כדי לחשב תובנות סטטיסטיות, כולל ספירת ערכים ייחודיים, יחסי null וטווחים של חלוקת נתונים.

המסוף

  1. במסוף Google Cloud , עוברים לדף Data profiling & quality.

    מעבר לפרופיל נתונים ולאיכות נתונים

  2. לוחצים על יצירת סריקה של פרופיל נתונים.

  3. בקטע Choose type (בחירת סוג), משאירים את האפשרות Data profile scan (סריקת פרופיל נתונים) מסומנת.

  4. בקטע כללי, בשדה שם לתצוגה, מזינים bikeshare-trips-profile.

  5. בקטע Table to scan (טבלה לסריקה), בשדה Table (טבלה), לוחצים על Browse (עיון), בוחרים את הטבלה quickstart_data_profile.bikeshare_trips בפרויקט ואז לוחצים על Select (בחירה).

  6. בשדה Mode (מצב), בוחרים באפשרות Standard (רגיל).

  7. בקטע היקף, בוחרים באפשרות כל הנתונים.

  8. בקטע תזמון, בוחרים באפשרות על פי דרישה.

  9. משאירים את שאר ההגדרות כברירת המחדל.

  10. לוחצים על הפעלת הסריקה.

    עבודת הסריקה מתחילה. בדרך כלל נדרשות 3 עד 5 דקות עד ש-Knowledge Catalog מריץ את הסריקה ומחשב את הנתונים הסטטיסטיים של הטבלה.

gcloud

  1. ב-Cloud Shell, יוצרים את סריקת פרופיל הנתונים:

    gcloud dataplex datascans create data-profile bikeshare-trips-profile \
     --location=us-central1 \
     --data-source-resource="//bigquery.googleapis.com/projects/PROJECT_ID/datasets/quickstart_data_profile/tables/bikeshare_trips" \
     --description="Data profile scan for sample bikeshare dataset"
    

    מחליפים את PROJECT_ID במזהה הפרויקט ב-Google Cloud .

  2. מריצים את סריקת פרופיל הנתונים:

    gcloud dataplex datascans run bikeshare-trips-profile \
     --location=us-central1
    

    משימת הסריקה מתחילה ברקע. בדרך כלל הסריקה מסתיימת תוך 3 עד 5 דקות.

בדיקת התוצאות של סריקת פרופיל נתונים

אחרי שהסריקה מסתיימת, בודקים את הנתונים הסטטיסטיים של העמודות כדי להבין את המאפיינים של הנתונים.

  1. במסוף Google Cloud , עוברים לדף Data profiling & quality.

    מעבר לפרופיל נתונים ולאיכות נתונים

  2. ברשימת הסריקות, לוחצים על bikeshare-trips-profile.

  3. אם הסריקה עוד לא הופעלה, לוחצים על הפעלה מיידית.

  4. בקטע סקירה כללית, מחכים עד שיוצג הצלחה בסריקה האחרונה.

    בתמונה הבאה מוצג סריקת העבודה בקטע סקירה כללית עם הסטטוס הושלם:

    קטע הסקירה הכללית של סריקת פרופיל הנסיעות בשירות השכרת אופניים, שבו מוצג סטטוס המשימה כהצלחה והקישור 'הצגת התוצאות'.

  5. בודקים את תוצאות הסריקה כדי להבין את פיזור הנתונים בטבלה ולזהות יעדים פוטנציאליים לאימות איכות הנתונים. בכרטיסייה תוצאות העבודה האחרונה, Knowledge Catalog מציג מדדים ברמת העמודה, כולל אחוז הערכים הריקים, ספירה ואחוז של ערכים ייחודיים, הערכים המובילים וסיכום נתונים סטטיסטיים.

    בטבלה הבאה מפורט איזה מדד פרופיל צריך לבדוק בכל עמודה בטבלה, איך לפרש את התוצאות ואיזה כלל איכות נתונים צריך להגדיר:

    עמודה בטבלה מדד תוצאות הפרופיל מה לחפש ואיך לפרש יעד לאימות איכות הנתונים
    duration_minutes נתונים סטטיסטיים של סיכום זוהו ערכים שליליים: ערך המינימום הוא -10.0 דקות. משך הנסיעה שחלף לא יכול להיות שלילי, מה שמצביע על הקלטות לא תקינות של החיישן או הנסיעה. טירגוט באמצעות כלל תוקף (טווח) (כמו duration_minutes ≥ 1.0) כדי לדרוש זמני נסיעה חיוביים.
    start_station_id Null %‎ כ-5% ערכי null: אחוז ה-null גדול מ-0%, מה שמראה שבחלק מהרשומות חסרים מזהים של תחנות (למשל, נסיעות ללא תחנות עגינה או ללא עמדות השכרה). מטרגטים באמצעות כלל Completeness (Non-null) כדי לזהות ולסמן רשומות שחסרים בהן מזהי תחנות.
    subscriber_type הערכים המובילים קטגוריות לא צפויות: רשימת הערכים הנפוצים כוללת קטגוריות לא סטנדרטיות (כמו INVALID_TIER) לצד רמות חברות תקינות, מה שמצביע על קלט של משתמשים לא מאומת או על בעיות בהטמעת נתונים. כדי לוודא שכל הערכים הנכנסים שייכים לרשימת סוגי החברות המותרים, מטמיעים כלל תוקף (הגדרה) לטירגוט.
    trip_id ספירה ייחודית ואחוז זוהו מזהים כפולים: הייחודיות נמוכה מ-100% (בערך 98%), מה שמצביע על רשומות חוזרות של מזהים. מפתחות ראשיים ומזהי נסיעות צריכים להיות ייחודיים לחלוטין. מטרגטים באמצעות כלל ייחודיות כדי לסמן ולמנוע רשומות כפולות של נסיעות.

הממצאים בפרופיל מספקים לכם בסיס מבוסס-ראיות ליצירת כללים ממוקדים לאיכות הנתונים.

יצירה והפעלה של סריקה לבדיקת איכות הנתונים

אחרי שראיתם איך הנתונים נראים, הגיע הזמן להגדיר כללים אוטומטיים לאיכות הנתונים כדי לזהות אנומליות. בשלב הזה מגדירים ארבעה סוגים נפוצים של כללים על סמך הממצאים בפרופיל.

המסוף

  1. במסוף Google Cloud , עוברים לדף Data profiling & quality.

    מעבר לפרופיל נתונים ולאיכות נתונים

  2. לוחצים על יצירת סריקה של איכות הנתונים.

  3. בקטע כללי, בשדה שם לתצוגה, מזינים bikeshare-trips-quality.

  4. בקטע טבלה לסריקה, בשדה טבלה, לוחצים על עיון, בוחרים בטבלה quickstart_data_profile.bikeshare_trips ואז לוחצים על בחירה.

  5. בקטע היקף, בוחרים באפשרות כל הנתונים.

  6. בקטע תזמון, בוחרים באפשרות על פי דרישה.

  7. משאירים את שאר ההגדרות כברירות המחדל ולוחצים על המשך.

  8. בקטע כללים לאיכות נתונים, לוחצים על הוספת כללים ובוחרים באפשרות סוגי כללים מובנים.

  9. בחלונית הוספת כללים, בוחרים את העמודות ואת סוגי הכללים:

    • בשדה בחירת עמודות, לוחצים על עיון ובוחרים באפשרויות duration_minutes, start_station_id, subscriber_type ו-trip_id.
    • לוחצים על בחירה.
    • ברשימה Choose rule types (בחירת סוגי כללים), בוחרים באפשרויות Range check (בדיקת טווח), NULL check (בדיקת ערך NULL), Value-set check (בדיקת קבוצת ערכים) ו-Uniqueness check (בדיקת ייחודיות), ואז לוחצים על OK (אישור).
    • ברשימת הכללים שנוצרו, מסמנים את התיבה לצד כל אחד מהכללים הבאים:

      • duration_minutes: בדיקת טווח
      • start_station_id: בדיקת ערך NULL
      • subscriber_type: בדיקת קבוצת ערכים
      • trip_id: בדיקת ייחודיות
    • לוחצים על בחירה.

  10. בטבלה כללים לאיכות נתונים, מגדירים פרמטרים לכללים שדורשים ערכים:

    • בשורה duration_minutes (בדיקת טווח), לוחצים על עריכה, מזינים את הערך 1.0 בשדה ערך מינימלי ולוחצים על שמירה.
    • בשביל subscriber_type (בדיקת קבוצת ערכים), לוחצים על עריכה, לוחצים על הוספת ערך כדי להוסיף כל אחד מהערכים המותרים (Local Rider, Walk Up, Student Membership ו-Weekender), ואז לוחצים על שמירה.
  11. לוחצים על המשך ואז על הפעלת הסריקה.

gcloud

  1. ב-Cloud Shell, יוצרים קובץ בשם dq_bikeshare.yaml עם מפרטי כללים שמטרתם לטפל באנומליות שנמצאו בפרופיל:

    cat << 'EOF' > dq_bikeshare.yaml
    rules:
      - column: trip_id
        dimension: UNIQUENESS
        uniquenessExpectation: {}
      - column: start_station_id
        dimension: COMPLETENESS
        nonNullExpectation: {}
      - column: duration_minutes
        dimension: VALIDITY
        rangeExpectation:
          minValue: "1.0"
      - column: subscriber_type
        dimension: VALIDITY
        setExpectation:
          values:
            - "Local Rider"
            - "Walk Up"
            - "Student Membership"
            - "Weekender"
    EOF
    
  2. יוצרים סריקה של איכות הנתונים:

    gcloud dataplex datascans create data-quality bikeshare-trips-quality \
     --location=us-central1 \
     --data-source-resource="//bigquery.googleapis.com/projects/PROJECT_ID/datasets/quickstart_data_profile/tables/bikeshare_trips" \
     --data-quality-spec-file="dq_bikeshare.yaml" \
     --description="Data quality scan for sample bikeshare dataset"
    

    מחליפים את PROJECT_ID במזהה הפרויקט ב-Google Cloud .

  3. מריצים את הסריקה של איכות הנתונים:

    gcloud dataplex datascans run bikeshare-trips-quality \
     --location=us-central1
    

בדיקת ההערכות של כללי איכות הנתונים

בודקים את התוצאות של איכות הנתונים כדי לראות איך הכללים העריכו את נתוני המדגם וזיהו אנומליות.

  1. במסוף Google Cloud , עוברים לדף Data profiling & quality.

    מעבר לפרופיל נתונים ולאיכות נתונים

  2. בטבלה Scans (סריקות), לוחצים על הסריקה bikeshare-trips-quality.

  3. בקטע סקירה כללית, לוחצים על הצגת התוצאות כדי לפתוח את פרטי המשרה.

  4. בחלונית פרטי המשרה, בודקים את תוצאות ההערכה:

    • סטטוס איכות הנתונים: כמו שציפינו, הסטטוס של כל 3 המאפיינים שנבדקו הוא נכשל.

      • תוקף: נכשל. העמודה duration_minutes מכילה ערכים שליליים, והעמודה subscriber_type מכילה ערכים לא תקינים של חברות (INVALID_TIER).
      • השלמות: נכשל. העמודה start_station_id מכילה ערכי null.
      • ייחודיות: נכשל. העמודה trip_id מכילה רשומות כפולות.
    • כללים: בטבלה כללים, כל 4 הכללים שנבדקו מציגים סטטוס של נכשל.

      • duration_minutes: בדיקת טווח (נכשלה)
      • start_station_id: בדיקת ערך NULL‏ (Failed)
      • subscriber_type: בדיקת ערכים (נכשלה)
      • trip_id: בדיקת ייחודיות (נכשלה)

      לכל כלל שנכשל, אפשר להעתיק את שאילתת ה-SQL בעמודה Query to get failed records ולהריץ אותה ב-BigQuery כדי לבודד את השורות הלא תקינות ולבדוק אותן.

יצרתם פרופיל של טבלה ב-BigQuery כדי לגלות נתונים סטטיסטיים של עמודות, והשתמשתם בתובנות האלה כדי להגדיר ולאמת כללים אוטומטיים לאיכות הנתונים.

הסרת המשאבים

כדי לא לצבור חיובים לחשבון Google Cloud על המשאבים שבהם השתמשתם בדף הזה, פועלים לפי השלבים הבאים:

המסוף

  1. במסוף Google Cloud , עוברים לדף Data profiling & quality.

    מעבר לפרופיל נתונים ולאיכות נתונים

  2. בטבלה Scans, בוחרים באפשרויות bikeshare-trips-quality ו-bikeshare-trips-profile.

  3. לוחצים על מחיקה ומאשרים.

  4. עוברים לדף BigQuery.

    כניסה לדף BigQuery

  5. בחלונית Explorer, לוחצים על Datasets.

  6. בוחרים את מערך הנתונים quickstart_data_profile ולוחצים על מחיקה.

gcloud

ב-Cloud Shell, מוחקים את סריקת איכות הנתונים, את סריקת פרופיל הנתונים ואת מערך הנתונים לדוגמה:

gcloud dataplex datascans delete bikeshare-trips-quality --location=us-central1 --quiet
gcloud dataplex datascans delete bikeshare-trips-profile --location=us-central1 --quiet
bq rm -r -f -d PROJECT_ID:quickstart_data_profile

מחליפים את PROJECT_ID במזהה הפרויקט ב-Google Cloud .

המאמרים הבאים