Knowledge Catalog est une couche de contexte optimisée par Gemini qui fournit un contexte métier universel et des capacités d'ancrage actif dans l'ensemble de votre parc de données. En créant un graphique de contexte dynamique à partir de données structurées et non structurées, il aide les équipes de données et les développeurs à découvrir des composants, à vérifier la qualité des données et à ancrer de manière sécurisée les applications d'IA générative pour réduire les hallucinations.
Pour obtenir une présentation détaillée de Knowledge Catalog, regardez la vidéo suivante :
Audience et prérequis
Cette présentation est destinée aux ingénieurs de données et de contexte, aux data scientists, aux responsables des données et aux développeurs d'IA. Avant d'utiliser Knowledge Catalog, vous devez disposer des éléments suivants :
Connaissance des systèmes de base de données et de stockage, tels que BigQuery ou Cloud Storage.
Connaissances de base des concepts d'IA générative, comme la génération augmentée par récupération (RAG) ou le Model Context Protocol (MCP).
Gérer la complexité des données spécifiques à votre secteur
Dans les entreprises modernes, les données sont complexes, très distribuées et existent dans des formats structurés et non structurés. Les demandes d'entreprise sont rarement mappées à un seul schéma de base de données ou à un seul magasin de documents. L'alignement sécurisé de ces silos tout en fournissant des réponses immédiates et fiables aux questions interdomaines constitue un défi opérationnel majeur.
Knowledge Catalog sert de base sémantique pour combler cette lacune, en permettant aux agents d'IA et aux outils d'analyse de récupérer un contexte ancré et pertinent.
Rôles utilisateur clés
Ingénieurs de contexte (ingénieurs de données) Automatisez l'agrégation des métadonnées dans les bases de données et Cloud Storage, tracez les transformations avec la traçabilité et créez des workflows d'enrichissement et d'évaluation.
Responsables des données (équipes de gouvernance) Supervisez la qualité des métadonnées en fournissant des révisions human-in-the-loop (avec intervention humaine) des descriptions générées par l'IA, en standardisant les vocabulaires métier avec des glossaires et en définissant des aspects personnalisés pour associer un contexte spécifique à un domaine aux entrées du catalogue.
Développeurs d'IA. Ancrez les LLM et les applications d'IA avec des schémas de données d'entreprise fiables à l'aide de serveurs MCP ou d'API de récupération de contexte.
Cas d'utilisation dans différents secteurs
Le tableau suivant illustre les questions complexes qui se posent en pratique, la façon dont elles franchissent les limites techniques et comment Knowledge Catalog aide les organisations à y répondre :
| Secteur | Défis liés aux données et aux opérations | Problème commercial à résoudre | Comment Knowledge Catalog y remédie |
|---|---|---|---|
| E-commerce |
|
"Trouve les produits électroniques avec des taux de retour élevés et des photos de clients montrant des signes de dommages à l'arrivée." | Ancrage sémantique pour différents formats de données : découvre automatiquement les métadonnées des bases de données transactionnelles et les associe aux images non structurées dans les buckets de stockage Cloud Storage, ce qui permet aux outils d'IA de résoudre la requête dans différents systèmes de stockage. |
| Industrie |
|
"Génère des résumés pour tous les rapports d'inspection liés aux machines de la région Ouest qui n'ont pas passé les contrôles de sécurité au cours du dernier trimestre." | Exploration régionale et non structurée : explore et catalogue les rapports d'inspection PDF non structurés ainsi que les métadonnées des éléments, ce qui permet aux agents IA génératifs de localiser, compiler et résumer les rapports par région. |
| Santé |
|
"Quels sont les patients les plus à risque d'être réadmis dans les 30 jours, en tenant compte des signes vitaux et de la fréquence des rendez-vous récents ?" | Qualité et traçabilité des données : calcule le profilage de la qualité des données au niveau des lignes et les cartes de traçabilité dans les flux de dossiers médicaux électroniques. Cela permet de s'assurer que les modèles prédictifs cliniques ne s'appuient que sur des constantes vitales de patients vérifiées et de haute qualité. |
| Services financiers |
|
"Quels sont les 10 clients les plus importants en termes de revenus qui se sont plaints de "problèmes de performances" et comment cela affecte-t-il les prévisions pour le troisième trimestre ?" | Graphique de contexte unifié : unifie les fiches client, les commentaires sur l'assistance et les tableaux financiers. Il permet aux requêtes en langage naturel de joindre les statistiques sur les revenus des clients à des fichiers de commentaires non structurés pour prévoir l'impact financier. |
Pour relever ces défis opérationnels, Knowledge Catalog fournit des fonctionnalités clés qui aident les ingénieurs de données, les data scientists et les développeurs d'IA à créer des systèmes de données régis :
Ancrez les agents d'IA avec le protocole MCP (Model Context Protocol). Exposez les métadonnées, les schémas, la traçabilité et les règles métier directement aux agents IA à l'aide de serveurs MCP locaux ou distants. Ces serveurs permettent aux modèles de vérifier les attentes opérationnelles avant de proposer des actions.
Accélérez la découverte pour l'IA et l'analyse. Trouvez des composants de données pertinents à l'aide de la recherche sémantique en langage naturel. Les résumés et recommandations génératifs aident les utilisateurs à localiser les données sans avoir à attendre l'examen manuel de la documentation.
Extrayez le contexte des données non structurées. Analysez automatiquement les fichiers non structurés, tels que les PDF dans Cloud Storage, pour extraire les entités et les relations, et les convertir en composants interrogeables dans BigQuery afin de prendre en charge les agents conversationnels.
Gouverner les produits de données à grande échelle Regroupez des collections de composants avec des contrats de niveau de service, des contrats, des informations sur la propriété et des notes d'utilisation dans des unités uniques et régies pour la recherche et l'abonnement.
Fonctionnement de Knowledge Catalog
Knowledge Catalog unifie la gestion des données et le contexte grâce à un cycle de vie à trois piliers. Le schéma suivant illustre la façon dont le service mappe les éléments de données physiques à la sémantique métier pour l'ancrage des agents d'IA :
Pour en savoir plus sur ces concepts de métadonnées, consultez À propos des métadonnées.
Les sections suivantes décrivent les trois piliers du cycle de vie des métadonnées et illustrent la manière dont une entreprise de vente au détail les applique aux tables de base de données, aux fichiers et aux entrées de catalogue externes :
Agrégation (découverte et ingestion) : Knowledge Catalog explore et indexe automatiquement les métadonnées techniques de votre patrimoine de données sans déplacer les données sous-jacentes :
- Bases de données intégrées Le catalogage automatisé capture les schémas et les attributs sur des plates-formes telles que BigQuery, AlloyDB pour PostgreSQL et Spanner.
- Connectivité gérée : Ingérez des définitions à partir de systèmes externes, tels qu'Oracle ou PostgreSQL, ou de registres de partenaires, tels que Collibra, sans écrire de pipelines personnalisés.
- Traçabilité des données. Suivez les transformations au niveau des colonnes dans les pipelines pour savoir d'où proviennent vos données et comment elles ont changé.
- Exemple : Une entreprise de vente au détail ingère automatiquement les métadonnées de la base de données transactionnelle, telles que les tables
ordersetorder_items, et indexe les fichiers produit non structurés stockés dans les buckets Cloud Storage. Ils associent des bases de données externes pour établir un index de métadonnées unifié dans un répertoire consultable.
Pour en savoir plus sur l'agrégation des métadonnées et l'ingestion des données (cliquez pour développer)
- Sources de données acceptées : liste toutes les sources Google Cloud et externes acceptées pour l'ingestion automatique.
- Présentation de la connectivité gérée : explique comment ingérer des schémas techniques à partir de systèmes externes.
- Suivre la traçabilité des données : décrit comment visualiser les transformations de pipeline et le flux de données au niveau des colonnes.
Enrichissement (organiser le contexte et vérifier la fiabilité) : Knowledge Catalog associe une signification métier aux structures techniques et établit des signaux de confiance :
- Insights générés par IA : Gemini analyse les journaux de requêtes pour générer des descriptions de colonnes, des résumés de tables et des jointures recommandées.
- Indexation non structurée : Explorez les répertoires de fichiers pour extraire les entités et les connexions à partir d'assets non structurés tels que des PDF ou des images.
- Glossaires et aspects Mappez les noms de métriques internes à un vocabulaire partagé à l'aide de termes commerciaux et de modèles logiques.
- Qualité des données et détection des anomalies : Appliquez des consignes de nettoyage et exécutez des analyses de machine learning pour détecter les valeurs aberrantes statistiques ou les problèmes de fraîcheur des données, ce qui génère des signaux de confiance clés.
- Examens de gouvernance. Gérez les risques en utilisant des processus d'examen des workflows pour vérifier les mises à jour des métadonnées avant publication.
- Exemple : L'équipe Retail enrichit les composants en déclenchant des insights sur les données pour recommander des descriptions de colonnes et exécuter des règles de qualité des données. Ils associent les définitions métier aux commandes actives en créant des glossaires et des aspects.
Pour en savoir plus sur l'enrichissement des métadonnées et la validation de la fiabilité (cliquez pour développer)
- Configurer les insights sur les données : explique comment générer des descriptions et des résumés d'ensembles de données de manière automatique.
- Gérer les glossaires d'entreprise : explique comment personnaliser les termes standards et les vocabulaires d'entreprise.
- Enrichir les métadonnées avec des aspects : explique comment associer des propriétés de métadonnées structurées à des composants logiques.
- Réutiliser des règles de qualité des données : explique comment établir et réutiliser des règles de validation de base de données.
- Présentation du profilage des données : explique comment configurer des analyses pour détecter les anomalies de schéma et la dérive statistique.
Recherche et récupération (accès et ancrage) : Les applications d'IA et les utilisateurs professionnels interrogent le graphique contextuel unifié pour accéder aux données de manière sécurisée :
- Agents d'ancrage Connectez vos applications et agents basés sur des LLM au catalogue.
- API Context : Effectuez des requêtes de charge utile d'ancrage à faible latence.
- Recherche sémantique : Trouvez les bons composants à l'aide de requêtes en langage naturel.
- Packaging des données. Regroupez des collections de tables, des informations sur les licences et des SLA dans des packages de données sécurisés en libre-service.
- Exemple : Les analystes effectuent des recherches sémantiques en langage naturel pour localiser des composants. Les applications d'IA consomment cet index de manière sécurisée à l'aide de serveurs MCP ou de l'API de récupération du contexte, et les composants de haute qualité sont regroupés dans une vue sécurisée.
Pour en savoir plus sur la récupération du contexte et l'ancrage de l'agent (cliquez pour développer)
- Présentation du protocole MCP (Model Context Protocol) : explique comment faire le lien entre les agents d'IA générative et les couches d'application vers le contexte du Knowledge Catalog.
- Récupérer le contexte à l'aide de LookupContext : montre comment extraire les charges utiles opérationnelles clés pour l'incitation de l'agent.
- Rechercher des composants : décrit les fonctionnalités de recherche de composants à l'aide de la syntaxe de requête sémantique en langage naturel.
Knowledge Catalog dans l'écosystème Google Cloud et d'IA
Il est essentiel de comprendre comment Knowledge Catalog s'intègre aux services associés lorsque vous créez une base de données.
Google Cloud bases de données et modèles
- BigQuery. Knowledge Catalog explore et indexe automatiquement les ensembles de données, les tables et les vues BigQuery. Il déclenche des insights sur les données optimisés par Gemini pour analyser les historiques de requêtes, publier des descriptions et suggérer des exemples de requêtes validés.
- Looker (Google Cloud Core) Knowledge Catalog ingère les tableaux de bord, les Looks et les structures LookML Looker, telles que les vues, les explorations, les dimensions et les mesures. Cette ingestion crée des mappages de traçabilité pour suivre la façon dont les valeurs opérationnelles sont mappées aux sémantiques métier.
- Catalogue d'environnements d'exécution Lighthouse. Knowledge Catalog s'intègre à Lighthouse, le metastore d'exécution pour les charges de travail Iceberg Open Source. Il indexe automatiquement les métadonnées techniques en plus des charges de travail Lighthouse pour fournir un contexte actif unifié.
Plates-formes et assistants d'agents d'IA
- Conversational Analytics : Les interfaces d'analyse utilisent des termes de catalogue et des outils de recherche pour permettre aux utilisateurs d'interroger les métriques métier en langage naturel avec un ancrage validé.
- Gemini pour les agents IA Les agents assistants de haute précision utilisent les métadonnées du catalogue pour effectuer des recherches dans la base de données, ce qui réduit les hallucinations.
- Gemini Enterprise Agent Platform Knowledge Catalog sert de norme centrale de gouvernance des données dans les environnements de plate-forme cible. Il établit des liens croisés avec Gemini Enterprise Agent Platform pour fournir des outils et du contexte à l'Agent Registry de la plate-forme.
Google Cloud Intégration des services de base de données et d'IA
Knowledge Catalog fonctionne avec d'autres produitsGoogle Cloud pour former la base de vos données. Le tableau suivant montre comment Knowledge Catalog s'intègre aux services associés et les complète :
| Service | Rôle principal | Intégration à Knowledge Catalog |
|---|---|---|
| Knowledge Catalog | Gouvernance et contexte agentique | Il sert de graphique de contexte sémantique unifié, exécute des analyses de contrôle de la qualité des données et expose des schémas ancrés aux modèles et applications d'IA. |
| BigQuery | Entreposage de données d'entreprise | Stocke, interroge et traite les ensembles de données ; explore, indexe et enrichit automatiquement ces tables avec des aspects de classification des entreprises. |
| Vertex AI | Développement de modèles d'IA | Crée, déploie et héberge des modèles de fondation. Les agents personnalisés récupèrent le contexte des métadonnées pour ancrer le raisonnement logique. |
| Cloud Storage | Stockage de fichiers non structurés | Stocke les fichiers bruts et non structurés. Exécute automatiquement des analyses de découverte non structurées pour analyser les PDF et les images afin de créer des cartes de relations. |
Sémantique et formats de données
Pour instruire et ancrer efficacement les systèmes agentiques, vous devez faire la distinction entre la structure physique des données et leur signification sémantique :
- Sémantique La signification métier, l'intention et les relations associées à vos données. Bien que les schémas techniques définissent des spécifications de stockage structurel, telles qu'un type de base de données, une longueur de caractère ou une contrainte d'entier, la sémantique décrit ce que l'ensemble de données représente réellement. Par exemple, vous pouvez mapper une colonne nommée
txn_qtyà la définition métier de "quantité achetée". - Données structurées : Informations stockées dans des schémas et des formats relationnels définis. Il peut s'agir, par exemple, de tables BigQuery, de bases de données Spanner et de tables Postgres opérationnelles. Knowledge Catalog explore automatiquement ces métadonnées et enregistre les colonnes et les contraintes.
- Données non structurées Informations non formatées contenant du texte brut ou des fichiers multimédias dépourvus de schéma structurel. Il peut s'agir, par exemple, de fiches techniques au format PDF, d'e-mails du service client ou d'images stockées dans Cloud Storage. Knowledge Catalog exécute des analyses de découverte à l'aide d'insights sur les données non structurées pour extraire les relations entre les entités sous-jacentes et les enregistrer dans un profil de graphe, qui est un aspect spécialisé contenant des nœuds et des arêtes de relations entre entités extraits par l'IA.
Orchestration du contexte du cloud de données agentique
Dans le framework cloud de données agentique de Google, Knowledge Catalog sert de plan d'orchestration sémantique. Au lieu d'obliger les développeurs à coder en dur manuellement les schémas et les règles de base de données dans les requêtes, le moteur de contexte fournit de manière dynamique le contexte sémantique précis dont un agent a besoin pour prendre des décisions intelligentes.
La figure suivante montre comment Knowledge Catalog orchestre et fournit le contexte des données :
Le workflow d'orchestration du contexte se compose des phases suivantes :
- Ingestion et découverte : Les bases de données opérationnelles, les entrepôts tels que Spanner et BigQuery, les magasins d'objets non structurés tels que Cloud Storage et les metastores d'exécution tels que Lighthouse alimentent directement Knowledge Catalog avec des schémas techniques, des cartes de traçabilité et des définitions de métadonnées.
- Cartographie du contexte : Dans Knowledge Catalog, ces propriétés de métadonnées sont liées à des éléments sémantiques, y compris des aspects techniques, des glossaires d'entreprise et des requêtes validées, pour assembler le graphe de contexte actif.
- Interfaces de diffusion. Les applications et les orchestrateurs d'IA récupèrent ce graphique de contexte consolidé de manière programmatique à l'aide de connecteurs standards, tels que MCP ou des points de terminaison d'API
LookupContextdirects. - Ancrage de l'agent Les frameworks d'orchestration, tels que l'Agent Development Kit (ADK) ou LangChain, injectent ce contexte de métadonnées directement dans les requêtes LLM. Cette injection ancre le raisonnement de l'agent dans des règles organisationnelles vérifiées, ce qui lui permet d'interroger des bases de données ou d'exécuter des actions automatisées sans hallucinations.
Profils d'agents IA
En fonction des workflows que vous souhaitez automatiser, vous pouvez créer différentes classes d'agents optimisés par Knowledge Catalog :
- Agents de découverte de données. Ces assistants aident les utilisateurs à rechercher et à parcourir le patrimoine de données. Au lieu d'utiliser la correspondance de mots clés, ils analysent l'intention et les contraintes de longue durée en langage naturel pour récupérer les actifs physiques les plus pertinents.
- Agents d'enrichissement des métadonnées : Ces agents en arrière-plan ingèrent du texte non structuré provenant de wikis, de fichiers README ou de journaux de chat, analysent le texte pour en extraire des métadonnées formelles et écrivent les métadonnées sous forme d'aspects dans Knowledge Catalog pour les maintenir à jour.
- Qualité des données et agents de pipeline : Ces agents autonomes évaluent les règles de qualité, détectent la dérive de schéma et créent ou réparent des pipelines de transformation de données en interrogeant la provenance des données et les statistiques de profil.
Outils d'orchestration
Pour créer et intégrer ces agents, vous pouvez utiliser les outils suivants :
- Protocole MCP (Model Context Protocol) : Protocole ouvert et standardisé permettant d'associer des agents à des ressources externes. Vous pouvez configurer les agents pour qu'ils se connectent au catalogue à l'aide du serveur MCP distant ou de la boîte à outils MCP locale. Pour en savoir plus, consultez À propos du protocole MCP (Model Context Protocol) dans Knowledge Catalog.
- Agent Development Kit (ADK) : Framework de Google qui simplifie la création, l'exécution et le test d'agents d'IA générative, et qui offre des liaisons intégrées à l'API Catalog Service. Pour en savoir plus, consultez la page d'accueil de l'ADK.
- API LookupContext Un point de terminaison de l'API REST et gRPC qui extrait une charge utile de contexte YAML ou JSON unifiée pour les assets de données, prête à être injectée directement dans les prompts LLM. Pour en savoir plus, consultez Récupérer le contexte à l'aide de l'API LookupContext.
Contexte d'accès avec MCP
Le protocole MCP (Model Context Protocol) est un pont standardisé qui permet aux agents et outils d'IA de se connecter de manière fluide à des sources de données telles que Knowledge Catalog. Utilisez le tableau comparatif suivant pour déterminer la meilleure option pour votre intégration :
| Implémentation | Application idéale | Informations essentielles | Point de terminaison ou configuration |
|---|---|---|---|
| Serveur MCP à distance | Déploiements axés sur le cloud, environnements sans serveur tels que Cloud Run et services externes gérés. | Point de terminaison hébergé par Google qui ne nécessite aucune gestion de serveur local. | Point de terminaison : https://dataplex.googleapis.com/mcpPour configurer, consultez Utiliser un serveur MCP distant. |
| Boîte à outils MCP locale | Développement d'agents locaux, prototypage rapide et intégrations d'IDE de bureau comme VS Code ou Cursor. | Outil de ligne de commande agissant comme un proxy local entre votre environnement de travail et Knowledge Catalog. | Nécessite l'installation du binaire et les paramètres .mcp.json.Pour configurer, consultez Utiliser un serveur MCP local. |
Bonnes pratiques pour le contexte de données agentiques
Pour créer des expériences agentiques fiables, gardez à l'esprit les bonnes pratiques suivantes lorsque vous organisez et interrogez des métadonnées dans Knowledge Catalog :
- Ajoutez des aspects. Les agents d'IA ne peuvent pas faire la différence entre les tables de production officielles et les maquettes temporaires du bac à sable en se basant uniquement sur leur nom. Définissez et appliquez un aspect de signal de confiance personnalisé pour certifier les produits de données faisant autorité. Cela permet de s'assurer que les agents donnent la priorité aux requêtes concernant ces ressources ou les limitent.
- Optimisez les recherches à l'aide des budgets de contexte. Lorsque vous appelez l'API
LookupContext, spécifiez le paramètrecontext_budget. L'API optimise et ajuste d'abord les métadonnées les plus importantes, telles que la traçabilité et les descriptions principales, en respectant les contraintes de jetons que vous avez spécifiées. - Fournissez des ressources associées pour exposer les chemins de jointure. Dans vos demandes de contexte, listez jusqu'à 10 tables ou composants associés. En fournissant un groupe d'assets, vous permettez au moteur de contexte de remplir automatiquement les chemins de jointure et les relations, ce qui aide l'agent à comprendre comment les tables interagissent.
- Structurez les glossaires sémantiques. Normalisez les termes et les abréviations dans les glossaires d'entreprise. Cette standardisation aide les outils conversationnels à résoudre avec précision les synonymes et les métriques spécifiques à l'entreprise.
- Publiez les requêtes de référence. Joignez des requêtes en langage naturel validées et leurs équivalents SQL corrects directement aux entrées du Knowledge Catalog. En ancrant le raisonnement dans ces modèles validés, vous évitez les erreurs de conversion SQL dans les agents text-to-SQL.
Passer de Dataplex Universal Catalog à Knowledge Catalog
Dataplex Universal Catalog est devenu Knowledge Catalog. Pour en savoir plus sur cette transition, consultez Passer de Dataplex Universal Catalog à Knowledge Catalog.
Limites
Lorsque vous planifiez votre déploiement, tenez compte des limites suivantes :
Intégrations compatibles : Bien que Knowledge Catalog soit compatible avec les principaux systèmes tiers, certaines extractions sémantiques automatisées peuvent être limitées aux services intégrés Google Cloud .
Limites de quota : Les quotas d'API Google Cloud standards s'appliquent aux opérations de récupération du contexte et d'extraction des métadonnées.
Étapes suivantes
À propos du contexte des données
Découvrez comment le contexte actif transforme les métadonnées passives pour ancrer les agents d'IA et éviter les hallucinations.
Établir un contexte de données de base
Créez un glossaire d'entreprise, définissez des types d'aspect personnalisés et enrichissez les assets dans BigQuery.
Ancrer les agents avec MCP
Connectez les agents IA et les outils pour les développeurs à Knowledge Catalog à l'aide du protocole MCP (Model Context Protocol).
Rechercher des ressources
Recherchez et explorez les ressources du catalogue dans Google Cloud et les systèmes tiers en utilisant le langage naturel.
Automatiser les analyses de la qualité des données
Définissez des règles de validation et surveillez la propreté des données dans les tables grâce à des analyses de qualité automatisées.
Découvrir des cas d'utilisation interactifs
Découvrez des solutions concrètes pour l'enrichissement du contexte, la traçabilité des données et les workflows agentiques.