Knowledge Catalog (anciennement Dataplex Universal Catalog) fournit une plate-forme unifiée et structurée de gestion des métadonnées dans votre environnement de données distribué. Il découvre, indexe et organise automatiquement les structures techniques, le contexte métier, les métriques de qualité des données et les relations opérationnelles.
En organisant les métadonnées dans un métamodèle flexible et extensible, Knowledge Catalog établit la base structurelle du graphe de contexte actif dans le cloud de données agentique de Google. Ce graphique de contexte permet aux équipes de données de découvrir et de gérer les éléments, tout en permettant aux agents d'IA générative de récupérer un contexte métier fiable et fondé sur des données.
Métamodèle Knowledge Catalog
Knowledge Catalog organise les métadonnées via une hiérarchie modulaire de conteneurs, d'éléments, de schémas et de relations :
- Conteneurs et éléments : les groupes d'entrées organisent les entrées, qui représentent des éléments de données individuels et leurs colonnes de schéma.
- Enrichissement structuré : les types d'aspects définissent des schémas pour les aspects, qui associent des métadonnées structurées à des entrées, des colonnes ou des relations.
- Normes et gouvernance : les types d'entrées définissent des modèles qui appliquent les aspects requis aux entrées.
- Relations : les types de liens d'entrée définissent des relations (liens d'entrée) qui connectent des entrées et des termes commerciaux associés.
Le tableau suivant récapitule la distinction entre les ressources gérées par le système (fournies automatiquement par Google Cloud) et les ressources personnalisées définies par l'utilisateur :
| Élément de métamodèle | Géré par le système (intégré) | Défini par l'utilisateur (personnalisé) |
|---|---|---|
| Groupes d'entrées | Prédéfinis par projet pour les Google Cloud services (par exemple,
@bigquery, @spanner, @pubsub). |
Créés par les utilisateurs pour regrouper et gérer les éléments de données et les autorisations personnalisés. |
| Entrées | Remplies automatiquement à partir de Google Cloud sources (telles que les tables, les vues, les ensembles de données et les modèles BigQuery). | Créées par les utilisateurs pour représenter des sources de données, des fichiers ou des bases de données tierces sur mesure. |
| Types d'aspects | Modèles système prédéfinis (par exemple, Schema,
Overview, Contacts, DataQuality,
Lineage). |
Créés par les utilisateurs pour définir des schémas de métadonnées spécifiques à un domaine (tels que la classification des informations permettant d'identifier personnellement l'utilisateur ou les niveaux de SLA). |
| Aspects | Remplis automatiquement à partir de systèmes sources, de journaux de requêtes ou d'analyses automatisées. | Créés par les utilisateurs, les pipelines ou les agents, et associés à des entrées, colonnes ou des liens d'entrée. |
| Types d'entrées | Modèles prédéfinis représentant des types de ressources Google Cloud . | Définis par les utilisateurs pour spécifier les aspects obligatoires et facultatifs des éléments de données personnalisés |
| Liens d'entrée | Types de relations intégrés (tels que synonym,
definition, schema-join,
related). |
Instances créées entre des entrées ou des colonnes spécifiques pour modéliser les connexions entre systèmes. |
Les sections suivantes décrivent les principaux composants du métamodèle Knowledge Catalog.
Groupes d'entrées
Un groupe d'entrées (EntryGroup) est un conteneur régional d'entrées et de liens d'entrée qui sert de limite administrative et de sécurité pour la gestion de ces ressources.
Utilisez des groupes d'entrées pour configurer les éléments suivants :
- Contrôle des accès Identity and Access Management : accordez des autorisations d'affichage ou de modification à des équipes spécifiques sur un groupe d'entrées sans modifier les autorisations d'entrée individuelles.
- Attribution de l'emplacement et du projet : regroupez les éléments par région géographique et par propriétaire du projet.
Pour les Google Cloud sources, Knowledge Catalog crée
automatiquement des groupes d'entrées système par projet (tels que @bigquery ou
@spanner). Pour les sources de données personnalisées, vous créez des groupes d'entrées personnalisés.
Par exemple, une équipe financière peut créer un groupe d'entrées personnalisé nommé production_finance_data pour gérer les autorisations d'accès à toutes les entrées personnalisées liées aux finances dans un seul emplacement.
Pour en savoir plus, consultez Groupes d'entrées.
Entrées et chemins de schéma
Une entrée (Entry) représente un seul élément de données. Une entrée peut représenter une table de base de données structurée, un modèle analytique, une table d'objets non structurée ou un ensemble de données externe personnalisé.
Les principaux composants d'une entrée sont les suivants :
- Identifiant d'entrée : nom de ressource unique dans son groupe d'entrées parent.
- Type d'entrée : modèle qui définit la structure de l'entrée et les aspects requis.
- Aspects : attributs de métadonnées structurées associés à l'entrée.
- Chemins de schéma (colonnes) : sous-sections ou champs spécifiques de l'élément de données, tels qu'une colonne dans une table BigQuery ou un champ dans un schéma JSON.
Les colonnes vous permettent d'associer des métadonnées à des champs individuels d'un élément. Vous ne définissez pas les colonnes manuellement. Elles sont remplies lorsque vous associez un aspect de type schema à une entrée. Vous pouvez référencer des champs imbriqués à l'aide de chemins de notation par points (par exemple, customer.address.postal_code).
Par exemple, une table BigQuery nommée orders_project.sales.customer_orders est représentée sous forme d'entrée. Pour décrire le champ email_address de cette table comme contenant des informations sensibles, vous associez un aspect de classification directement au chemin de colonne email_address.
Pour en savoir plus, consultez Entrées.
Types d'aspects
Un type d'aspect (AspectType) est un modèle de schéma réutilisable qui définit les champs, les types de données et les règles de validation d'un aspect. Chaque aspect est une instance d'un type d'aspect.
Les types d'aspects peuvent être définis par le système (fournis par Google Cloud) ou personnalisés (créés par votre organisation).
Lorsque vous définissez le metadata_template pour un type d'aspect personnalisé, vous pouvez utiliser les types de données compatibles suivants :
| Type de données du champ | Description | Exemple d'utilisation |
|---|---|---|
string |
Valeur de texte (UTF-8). | Adresse e-mail du propriétaire, libellé de classification des données, nom du service. |
integer / number |
Valeurs numériques (entiers ou nombres à virgule flottante). | Jours de conservation des données, pourcentage cible du SLA, rang de priorité. |
boolean |
Indicateur vrai ou faux. | contains_pii: true, is_certified: false. |
enum |
Liste prédéfinie de valeurs de chaîne autorisées. | Environnement : ["DEV", "STAGING", "PROD"]. |
datetime / timestamp |
Date et heure au format ISO 8601. | Dernière date de certification, date limite de l'examen de conformité. |
record |
Objet structuré imbriqué contenant des champs enfants. | ContactInfo { name: string, email: string, phone: string }. |
array |
Liste de valeurs répétées de n'importe quel type primitif ou d'enregistrement. | Liste des propriétaires de données secondaires : ["user1@example.com", "user2@example.com"]. |
map |
Paires clé/valeur de chaîne pour les attributs extensibles. | Tags de déploiement personnalisés : {"cost_center": "1042", "tier": "gold"}. |
Par exemple, pour définir un modèle réutilisable pour les informations de contact, vous pouvez créer un type d'aspect nommé ContactInfo avec des champs pour owner_name (string), email (string) et support_channel (string).
Pour en savoir plus, consultez Types d'aspects.
Aspects
Un aspect (Aspect) est un ensemble de champs de métadonnées associés qui sont conformes à un type d'aspect. Les aspects sont associés à une entrée, à un chemin d'entrée (colonne) ou à un lien d'entrée pour décrire cette ressource.
Contrairement aux anciens systèmes de tagging, les aspects de Knowledge Catalog sont encapsulés directement dans leurs entrées ou liens d'entrée parents, ce qui vous permet d'effectuer des opérations de lecture et d'écriture atomiques.
Les aspects sont utilisés dans plusieurs fonctions :
- Structure technique : l'
Schemaaspect décrit les colonnes de table, les types de données et les descriptions. - Contexte métier : les aspects personnalisés décrivent la propriété, la conformité et l' état du cycle de vie.
- Confiance opérationnelle : les aspects de qualité des données enregistrent les résultats d'analyse des règles automatisées et les scores de validation.
- Graphiques d'entités non structurées : l'aspect
GraphProfilecapture les entités extraites par l'IA et les arêtes de relation à partir de fichiers bruts.
Par exemple, vous pouvez créer une instance du type d'aspect ContactInfo avec
les valeurs {"owner_name": "Alex", "email": "alex@example.com"} et l'associer à l'entrée
customer_orders.
Pour en savoir plus, consultez Aspects.
Types d'entrées
Un type d'entrée (EntryType) est un modèle de gouvernance permettant de créer des entrées personnalisées. Il applique des normes de qualité des métadonnées en établissant les types d'aspects requis qui doivent être associés à une entrée de ce type.
Lorsque vous créez une entrée d'un type d'entrée spécifique, Knowledge Catalog vérifie que tous les types d'aspects marqués comme required dans le type d'entrée sont présents et valides.
Par exemple, vous pouvez créer un type d'entrée nommé CertifiedDataProduct qui spécifie les types d'aspects OwnerInfo et DataRetentionPolicy comme obligatoires. Toute nouvelle entrée créée avec ce type d'entrée doit inclure ces aspects avant de pouvoir l'enregistrer.
Pour en savoir plus, consultez Types d'entrées.
Liens d'entrée et types de liens d'entrée
Un lien d'entrée (EntryLink) établit une relation sémantique entre deux entrées de données ou entre des colonnes spécifiques dans les entrées. Chaque lien d'entrée est une instance d'un type de lien d'entrée (EntryLinkType).
Les liens d'entrée peuvent être directionnels ou non directionnels :
- Symétriques (non directionnels) : relations où les deux côtés sont des pairs
(par exemple,
synonym,related, ouschema-join). - Asymétriques (directionnels) : relations avec une source et
une cible explicites (par exemple,
definition, qui associe un terme de glossaire d'entreprise à une colonne de table).
Vous pouvez également associer des aspects directement aux liens d'entrée (à l'exception des liens schema-join). Cela vous permet de décrire la relation elle-même, par exemple en enregistrant des scores de confiance de jointure, des règles de transformation ou des notes de mappage.
Knowledge Catalog est compatible avec les types de liens d'entrée intégrés suivants :
synonym: connecte des concepts commerciaux équivalents ou des termes alternatifs.related: connecte des éléments faiblement couplés entre les systèmes.definition: connecte les définitions du glossaire d'entreprise à des colonnes ou des entrées physiques.schema-join: connecte des tables qui peuvent être jointes le long d'une clé étrangère ou de chemins de schéma correspondants.
Pour en savoir plus, consultez la documentation de référence REST
EntryLinks.
Glossaires et termes commerciaux
Un glossaire d'entreprise vous permet d'établir une taxonomie commerciale formelle en définissant des glossaires, des catégories et des termes commerciaux.
À l'aide de liens d'entrée de type definition ou synonym, vous pouvez mapper directement des termes commerciaux à des entrées physiques et à des chemins de colonnes. Lorsque des utilisateurs ou des agents d'IA effectuent une recherche dans le catalogue en langage naturel, le moteur de recherche résout ces termes commerciaux pour localiser les éléments de données physiques appropriés.
Pour en savoir plus, consultez Gérer les glossaires d'entreprise.
Sourcesacceptées Google Cloud
Knowledge Catalog ingère automatiquement les métadonnées des sources suivantes Google Cloud . Pour certains services, tels qu'AlloyDB pour PostgreSQL et Cloud SQL, vous devez d'abord activer l'intégration de Knowledge Catalog pour que les métadonnées puissent être ingérées :
Analyse et lakehouse
- Ensembles de données, tables, vues, modèles, routines, connexions et ensembles de données associés BigQuery
- Échanges et fiches BigQuery Sharing (anciennement Analytics Hub)
- Dépôts Dataform et éléments de code
- Services, bases de données et tables Dataproc Metastore
Tables du catalogue REST Iceberg (y compris le catalogue IRC du runtime Google Cloud Lakehouse, le catalogue IRC Databricks Unity, le catalogue IRC AWS Glue Data Catalog et le catalogue IRC Snowflake Horizon)
IA et machine learning
- Modèles, ensembles de données, groupes de caractéristiques, vues de caractéristiques et instances de boutique en ligne Vertex AI
Informatique décisionnelle
- Instances, tableaux de bord, éléments de tableau de bord, Looks, projets LookML, modèles, Explorations et vues Looker (Google Cloud Core) (preview)
Bases de données
- Instances, clusters et tables Bigtable (y compris les détails des familles de colonnes)
- Instances, bases de données, tables et vues Spanner
Streaming et messagerie
- Sujets Pub/Sub
Données non structurées
Bases de données opérationnelles
- Clusters, instances, bases de données, schémas, tables et vues AlloyDB pour PostgreSQL (preview). Knowledge Catalog récupère les métadonnées uniquement à partir des instances AlloyDB principales, et non des instances répliquées avec accès en lecture. Pour en savoir plus, consultez Gérer vos ressources AlloyDB pour PostgreSQL à l'aide de Knowledge Catalog.
- Instances, bases de données, schémas, tables et vues Cloud SQL. Knowledge Catalog récupère les métadonnées uniquement à partir des instances Cloud SQL principales, et non des instances répliquées avec accès en lecture. Pour en savoir plus, consultez Gérer vos ressources Cloud SQL à l'aide de Knowledge Catalog.
Pour importer des métadonnées depuis une source tierce dans Knowledge Catalog, vous pouvez utiliser des connecteurs Knowledge Catalog ou un pipeline de connectivité gérée. Pour en savoir plus, consultez À propos des connecteurs Knowledge Catalog et Présentation de la connectivité gérée.
Contraintes liées au projet et à l'emplacement
Les ressources de catalogue dans Knowledge Catalog sont hébergées dans des projets et des emplacements géographiques spécifiques. Google Cloud Les contraintes de champ d'application suivantes s'appliquent :
| Ressource | Règle d'emplacement | Règle de projet |
|---|---|---|
| Entrées | L'emplacement de l'entrée doit correspondre à celui de son EntryType,
ou le EntryType doit être global. |
Peut référencer des types d'entrées globaux ou du même projet. |
| Aspects des entrées | Le AspectType de l'aspect doit être stocké au même emplacement
que l'entrée, ou le AspectType doit être global. |
Peut référencer des types d'aspects globaux ou du même projet. |
| Liens d'entrée | L'emplacement du lien d'entrée doit correspondre à son EntryLinkType, ou
le EntryLinkType doit être global. |
Peut associer des entrées résidant dans différents projets au sein de la même organisation. |
| Types d'entrées | Composés de types d'aspects stockés au même emplacement que le type d'entrée,
ou de types d'aspects global. |
Si un type d'entrée fait référence à des types d'aspects personnalisés, ces types d'aspects doivent se trouver dans le même projet et au même emplacement. |
Flux de modifications des métadonnées
Knowledge Catalog peut diffuser des événements de modification des métadonnées en temps quasi réel à l'aide de flux de modifications des métadonnées.
Un flux de modifications des métadonnées publie des notifications concernant la création, la mise à jour ou la suppression d'entrées dans un sujet Pub/Sub que vous configurez. Les clients abonnés peuvent consommer ces événements pour automatiser les workflows opérationnels, par exemple en déclenchant des évaluations de la qualité des données lorsqu'un schéma change ou en mettant à jour les tableaux de bord de gouvernance en aval.
Pour en savoir plus, consultez À propos des flux de modifications des métadonnées.
Tarifs
Knowledge Catalog utilise le SKU de stockage de métadonnées pour facturer le volume de métadonnées stockées. Pour en savoir plus, consultez Tarifs de Knowledge Catalog.
Les éléments suivants sont sans frais :
- Création et gestion des ressources de métamodèle de catalogue (types d'entrées, types d'aspects, groupes d'entrées, entrées et liens d'entrée).
- Appels d'API de recherche et requêtes de recherche effectuées dans la Google Cloud console.
Étape suivante
Ajouter des métadonnées à une table
Découvrez des éléments et associez des métadonnées d'aspect personnalisées à une table BigQuery.
Ingérer des sources de données personnalisées
Définissez des types d'entrées et ingérez des métadonnées personnalisées à partir de bases de données et de pipelines externes.
Gérer les glossaires d'entreprise
Créez une taxonomie commerciale et mappez directement les termes à des tables et des colonnes physiques.
Rechercher et découvrir des éléments
Découvrez des ressources dans Google Cloud et des sources personnalisées à l'aide de prédicats de recherche.
Récupérer le contexte des agents d'IA
Récupérez des métadonnées prêtes pour les LLM et un contexte actif pour fonder les agents d'IA générative.
Passer de Data Catalog
Migrez les modèles de tags, les entrées personnalisées et les workflows vers Knowledge Catalog.