Informazioni sui metadati in Knowledge Catalog

Knowledge Catalog (in precedenza Catalogo universale Dataplex) fornisce una piattaforma unificata e strutturata di gestione dei metadati per il tuo patrimonio di dati distribuiti. Rileva, indicizza e organizza automaticamente le strutture tecniche, il contesto aziendale, le metriche sulla qualità dei dati e le relazioni operative.

Organizzando i metadati in un metamodello flessibile ed estensibile, Knowledge Catalog stabilisce la base strutturale del grafico di contesto attivo all'interno di Google's Agentic Data Cloud. Questo grafico di contesto consente ai team di dati di scoprire e gestire gli asset, consentendo al contempo agli agenti di AI generativa di recuperare un contesto aziendale attendibile e basato su dati reali.

Metamodello di Knowledge Catalog

Knowledge Catalog organizza i metadati tramite una gerarchia modulare di container, asset, schemi e relazioni:

  • Container e asset: i gruppi di voci organizzano le voci, che rappresentano i singoli asset di dati e le relative colonne dello schema.
  • Arricchimento strutturato: i tipi di aspetto definiscono gli schemi per gli aspetti, che collegano i metadati strutturati a voci, colonne o relazioni.
  • Standard e governance: i tipi di voci definiscono i modelli che applicano gli aspetti obbligatori alle voci.
  • Relazioni: i tipi di link di voci definiscono le relazioni (link di voci) che collegano le voci e i termini aziendali correlati.

La tabella seguente riassume la distinzione tra le risorse gestite dal sistema (fornite automaticamente da Google Cloud) e le risorse personalizzate definite dall'utente:

Elemento del metamodello Gestito dal sistema (integrato) Definito dall'utente (personalizzato)
Gruppi di voci Predefiniti per progetto per i Google Cloud servizi (ad esempio, @bigquery, @spanner, @pubsub). Creati dagli utenti per raggruppare e gestire asset di dati e autorizzazioni personalizzati.
Voci Popolate automaticamente dalle Google Cloud origini (ad esempio tabelle, viste, set di dati e modelli BigQuery). Create dagli utenti per rappresentare origini dati, file o database di terze parti personalizzati.
Tipi di aspetto Modelli di sistema predefiniti (ad esempio Schema, Overview, Contacts, DataQuality, Lineage). Creati dagli utenti per definire schemi di metadati specifici del dominio (ad esempio classificazione PII o livelli SLA).
Aspetti Popolati automaticamente dai sistemi di origine, dai log delle query o dalle scansioni automatiche. Creati da utenti, pipeline o agenti e collegati a voci, colonne o link di voci.
Tipi di voci Modelli predefiniti che rappresentano i tipi di risorse Google Cloud . Definiti dagli utenti per specificare gli aspetti obbligatori e facoltativi per gli asset di dati personalizzati.
Link di voci Tipi di relazioni integrati (ad esempio synonym, definition, schema-join, related). Istanze create tra voci o colonne specifiche per modellare connessioni tra sistemi.

Le sezioni seguenti descrivono i componenti principali che compongono il metamodello di Knowledge Catalog.

Gruppi di voci

Un gruppo di voci (EntryGroup) è un container regionale per voci e link di voci che funge da limite amministrativo e di sicurezza per la gestione di queste risorse.

Utilizza i gruppi di voci per configurare quanto segue:

  • Controllo dell'accesso di Identity and Access Management: concedi le autorizzazioni di visualizzazione o modifica a team specifici su un gruppo di voci senza modificare le autorizzazioni delle singole voci.
  • Attribuzione di progetto e località: raggruppa gli asset in base alla regione geografica e alla proprietà del progetto.

Per le Google Cloud origini, Knowledge Catalog crea automaticamente gruppi di voci di sistema per progetto (ad esempio @bigquery o @spanner). Per le origini dati personalizzate, devi creare gruppi di voci personalizzati.

Ad esempio, un team di finanza può creare un gruppo di voci personalizzato denominato production_finance_data per gestire le autorizzazioni di accesso per tutte le voci personalizzate relative alla finanza in un'unica località.

Gruppi di voci contenenti voci e link alle voci che le collegano. Gruppi di voci contenenti voci e link alle voci che le collegano.
Figura 1. Gruppi di voci, voci e link di voci (fai clic per ingrandire).

Per ulteriori informazioni, vedi Gruppi di voci.

Voci e percorsi dello schema

Una voce (Entry) rappresenta un singolo asset di dati. Una voce può rappresentare una tabella di database strutturata, un modello analitico, una tabella di oggetti non strutturata o un set di dati esterni personalizzato.

I componenti chiave di una voce includono quanto segue:

  • Identificatore della voce: un nome della risorsa univoco all'interno del gruppo di voci principale.
  • Tipo di voce: il modello che definisce la struttura della voce e gli aspetti obbligatori.
  • Aspetti: attributi di metadati strutturati collegati alla voce.
  • Percorsi dello schema (colonne): sottosezioni o campi specifici all'interno dell'asset di dati, ad esempio una colonna in una tabella BigQuery o un campo in uno schema JSON.

Le colonne consentono di collegare i metadati ai singoli campi all'interno di un asset. Non definisci le colonne manualmente; vengono popolate quando colleghi un aspetto di tipo schema a una voce. Puoi fare riferimento ai campi nidificati utilizzando i percorsi di notazione con punti (ad esempio customer.address.postal_code).

Ad esempio, una tabella BigQuery denominata orders_project.sales.customer_orders è rappresentata come una voce. Per descrivere il campo email_address all'interno di questa tabella come contenente informazioni sensibili, collega un aspetto di classificazione direttamente al percorso della colonna email_address.

Per ulteriori informazioni, vedi Voci.

Tipi di aspetto

Un tipo di aspetto (AspectType) è un modello di schema riutilizzabile che definisce i campi, i tipi di dati e le regole di convalida per un aspetto. Ogni aspetto è un'istanza di un tipo di aspetto.

I tipi di aspetto possono essere definiti dal sistema (forniti da Google Cloud) o personalizzati (creati dalla tua organizzazione).

Quando definisci metadata_template per un tipo di aspetto personalizzato, puoi utilizzare i seguenti tipi di dati supportati:

Tipo di dati del campo Descrizione Caso d'uso di esempio
string Valore di testo (UTF-8). Email del proprietario, etichetta di classificazione dei dati, nome del reparto.
integer / number Valori numerici (numeri interi o in rappresentazione in virgola mobile). Giorni di conservazione dei dati, percentuale target SLA, rango di priorità.
boolean Flag vero o falso. contains_pii: true, is_certified: false.
enum Un elenco predefinito di valori stringa consentiti. Ambiente: ["DEV", "STAGING", "PROD"].
datetime / timestamp Data e ora nel formato ISO 8601. Ultima data di certificazione, scadenza della revisione di conformità.
record Un oggetto strutturato nidificato contenente campi secondari. ContactInfo { name: string, email: string, phone: string }.
array Un elenco di valori ripetuti di qualsiasi tipo primitivo o di record. Elenco dei proprietari secondari dei dati: ["user1@example.com", "user2@example.com"].
map Coppie chiave-valore stringa per attributi estensibili. Tag di deployment personalizzati: {"cost_center": "1042", "tier": "gold"}.

Ad esempio, per definire un modello riutilizzabile per le informazioni di contatto, puoi creare un tipo di aspetto denominato ContactInfo con i campi owner_name (string), email (string) e support_channel (string).

Tipi di aspetto che definiscono gli aspetti collegati alle voci e tipi di voce che richiedono tipi di aspetto. Tipi di aspetto che definiscono gli aspetti collegati alle voci e tipi di voce che richiedono tipi di aspetto.
Figura 2. Tipi di aspetto, aspetti e tipi di voci (fai clic per ingrandire).

Per ulteriori informazioni, vedi Tipi di aspetto.

Aspetti

Un aspetto (Aspect) è un insieme di campi di metadati correlati conformi a un tipo di aspetto. Gli aspetti sono collegati a una voce, a un percorso di voce (colonna) o a un link di voce per descrivere la risorsa.

A differenza dei sistemi di tagging legacy, gli aspetti in Knowledge Catalog sono incapsulati direttamente all'interno delle voci o dei link di voci principali, il che consente di eseguire operazioni di lettura e scrittura atomiche.

Gli aspetti vengono utilizzati in più funzioni:

  • Struttura tecnica: l'aspetto Schema descrive le colonne della tabella, i tipi di dati e le descrizioni.
  • Contesto aziendale: gli aspetti personalizzati descrivono la proprietà, la conformità e lo stato del ciclo di vita.
  • Affidabilità operativa: gli aspetti della qualità dei dati registrano i risultati delle scansioni delle regole automatiche e i punteggi di convalida.
  • Grafici di entità non strutturati: l'GraphProfile aspetto acquisisce le entità e i bordi delle relazioni estratti dall'AI dai file non elaborati.

Ad esempio, puoi creare un'istanza del tipo di aspetto ContactInfo con i valori {"owner_name": "Alex", "email": "alex@example.com"} e collegarla alla customer_orders voce.

Per ulteriori informazioni, vedi Aspetti.

Tipi di voci

Un tipo di voce (EntryType) è un modello di governance per la creazione di voci personalizzate. Applica gli standard di qualità dei metadati stabilendo i tipi di aspetto obbligatori che devono essere collegati a una voce di quel tipo.

Quando crei una voce di un tipo di voce specifico, Knowledge Catalog verifica che tutti i tipi di aspetto contrassegnati come required nel tipo di voce siano presenti e validi.

Ad esempio, puoi creare un tipo di voce denominato CertifiedDataProduct che specifica i tipi di aspetto OwnerInfo e DataRetentionPolicy come obbligatori. Qualsiasi nuova voce creata con questo tipo di voce deve includere questi aspetti prima di poterla salvare.

Per ulteriori informazioni, vedi Tipi di voci.

Link di voci e tipi di link di voci

Un link di voci (EntryLink) stabilisce una relazione semantica tra due voci di dati o tra colonne specifiche all'interno delle voci. Ogni link di voci è un'istanza di un tipo di link di voci (EntryLinkType).

I link di voci possono essere direzionali o non direzionali:

  • Simmetrici (non direzionali): relazioni in cui entrambi i lati sono peer (ad esempio synonym, related, o schema-join).
  • Asimmetrici (direzionali): relazioni con un'origine e una destinazione esplicite (ad esempio definition, che collega un termine del glossario aziendale a una colonna della tabella).

Puoi anche collegare gli aspetti direttamente ai link di voci (ad eccezione dei link schema-join). In questo modo puoi descrivere la relazione stessa, ad esempio registrando i punteggi di affidabilità dei join, le regole di trasformazione o le note di mapping.

Knowledge Catalog supporta i seguenti tipi di link di voci integrati:

  • synonym: collega concetti aziendali equivalenti o termini alternativi.
  • related: collega asset a basso accoppiamento tra i sistemi.
  • definition: collega le definizioni del glossario aziendale a colonne o voci fisiche.
  • schema-join: collega le tabelle che possono essere unite lungo percorsi di chiave esterna o schemi corrispondenti.
Collegamento di voce con voci, aspetti e relativi tipi collegati. Collegamento di voce con voci, aspetti e relativi tipi collegati.
Figura 3. Link di voci con voci collegate, aspetti e relativi tipi (fai clic per ingrandire).

Per ulteriori informazioni, vedi EntryLinks riferimento REST.

Glossari e termini aziendali

Un glossario aziendale consente di stabilire una tassonomia aziendale formale definendo glossari, categorie e termini aziendali.

Utilizzando i link di voci di tipo definition o synonym, puoi mappare i termini aziendali direttamente a voci fisiche e percorsi di colonne. Quando gli utenti o gli agenti di AI cercano nel catalogo utilizzando il linguaggio naturale, il motore di ricerca risolve questi termini aziendali per individuare gli asset di dati fisici corretti.

Per ulteriori informazioni, vedi Gestire i glossari aziendali.

Origini supportate Google Cloud

Knowledge Catalog importa automaticamente i metadati dalle seguenti Google Cloud origini. Per alcuni servizi, come AlloyDB per PostgreSQL e Cloud SQL, devi prima abilitare l'integrazione di Knowledge Catalog prima che i metadati possano essere importati:

  • Analisi e lakehouse

    • Set di dati, tabelle, viste, modelli, routine, connessioni e set di dati collegati BigQuery
    • Scambi e schede di BigQuery sharing (in precedenza Analytics Hub)
    • Repository Dataform e asset di codice
    • Servizi, database e tabelle di Dataproc Metastore
    • Tabelle del catalogo REST Iceberg (incluso Google Cloud il catalogo IRC del runtime Lakehouse , Databricks Unity IRC, AWS Glue Data Catalog IRC e Snowflake Horizon IRC)

  • AI e machine learning

    • Modelli, set di dati, gruppi di funzionalità, viste di funzionalità e istanze di negozio online di Vertex AI
  • Business intelligence

    • Istanze, dashboard, elementi della dashboard, Look, progetti LookML, modelli, Esplora e viste di Looker (Google Cloud core) (anteprima)
  • Database

    • Istanze, cluster e tabelle Bigtable (inclusi i dettagli delle famiglie di colonne)
    • Istanze, database, tabelle e viste Spanner
  • Streaming e messaggistica

    • Argomenti Pub/Sub
  • Dati non strutturati

  • Database operativi

Per importare i metadati da un'origine di terze parti in Knowledge Catalog, puoi utilizzare i connettori di Knowledge Catalog o una pipeline di connettività gestita. Per ulteriori informazioni, vedi Informazioni su Knowledge Catalog Connettori e Panoramica della connettività gestita.

Vincoli di progetto e località

Le risorse del catalogo in Knowledge Catalog sono ospitate all'interno di progetti e località geografiche specifici. Google Cloud Si applicano i seguenti vincoli di ambito:

Risorsa Regola per le località Regola per i progetti
Voci La località della voce deve corrispondere alla località del relativo EntryType, oppure EntryType deve essere global. Può fare riferimento a tipi di voci globali o dello stesso progetto.
Aspetti delle voci AspectType dell'aspetto deve essere archiviato nella stessa località della voce oppure AspectType deve essere global. Può fare riferimento a tipi di aspetto globali o dello stesso progetto.
Link di voci La località del link di voci deve corrispondere al relativo EntryLinkType, oppure EntryLinkType deve essere global. Può collegare voci che risiedono in progetti diversi all'interno della stessa organizzazione.
Tipi di voci Composto da tipi di aspetto archiviati nella stessa località del tipo di voce, o da tipi di aspetto global. Se un tipo di voce fa riferimento a tipi di aspetto personalizzati, questi devono trovarsi nello stesso progetto e nella stessa località.

Feed di modifica dei metadati

Knowledge Catalog può trasmettere in streaming gli eventi di modifica dei metadati in tempo quasi reale utilizzando i feed di modifica dei metadati.

Un feed di modifica dei metadati pubblica le notifiche relative alla creazione, all'aggiornamento o all'eliminazione delle voci in un argomento Pub/Sub che configuri. I client abbonati possono utilizzare questi eventi per automatizzare i workflow operativi, ad esempio attivando le valutazioni della qualità dei dati quando uno schema cambia o aggiornando le dashboard di governance downstream.

Per ulteriori informazioni, vedi Informazioni sui feed di modifica dei metadati.

Prezzi

Knowledge Catalog utilizza lo SKU di archiviazione dei metadati per addebitare il volume dei metadati archiviati. Per ulteriori informazioni, vedi Prezzi di Knowledge Catalog.

Non sono previsti addebiti per quanto segue:

  • Creazione e gestione delle risorse del metamodello del catalogo (tipi di voci, tipi di aspetto, gruppi di voci, voci e link di voci).
  • Chiamate API di ricerca e query di ricerca eseguite nella Google Cloud console.

Passaggi successivi

Guida rapida

Scopri gli asset e collega i metadati degli aspetti personalizzati a una tabella BigQuery.

Importazione

Definisci i tipi di voci e importa i metadati personalizzati da database e pipeline esterni.

Governance

Crea una tassonomia aziendale e mappa i termini direttamente a tabelle e colonne fisiche.

Individuazione

Scopri le risorse in Google Cloud e le origini personalizzate utilizzando i predicati di ricerca.

Contesto AI

Recupera i metadati pronti per l'LLM e il contesto attivo per basare gli agenti di AI generativa.

Migrazione

Esegui la migrazione dei modelli di tag, delle voci personalizzate e dei workflow a Knowledge Catalog.