Ce document explique comment utiliser Cloud Monitoring pour suivre l'état du service Knowledge Catalog (anciennement Dataplex Universal Catalog), optimiser les performances et obtenir de la visibilité sur votre plate-forme de données. La surveillance proactive vous aide à assurer la fiabilité des applications de données et à prendre des décisions éclairées concernant l'allocation des ressources et la gestion des coûts.
Pour comprendre les coûts, consultez la page Tarifs de Monitoring.
Pour en savoir plus sur la conservation des données métriques, consultez Quotas et limites de Monitoring.
Cas d'utilisation
Vous pouvez utiliser les métriques Knowledge Catalog dans Cloud Monitoring pour prendre en charge les cas d'utilisation suivants :
- Assurer la fiabilité du pipeline de données : surveillez les taux de réussite et d'échec des tâches Knowledge Catalog, telles que les tâches d'ingestion ou de qualité des données. Configurez des alertes pour les échecs ou les durées inhabituelles afin de minimiser les temps d'arrêt pour les charges de travail critiques.
- Optimiser les performances : suivez les métriques de durée des jobs et d'utilisation des ressources pour identifier et résoudre les goulots d'étranglement au niveau des performances dans vos charges de travail de traitement des données, de qualité des données et de découverte des données.
- Gérer les coûts : surveillez la consommation des ressources du Knowledge Catalog (telles que les lacs, les zones et les assets) dans la section "Surveillance", et utilisez l'exportation Cloud Billing vers BigQuery pour attribuer les coûts de calcul sans serveur (DCU) aux charges de travail de qualité des données, de profilage des données et de traçabilité des données.
- Maintenir la gouvernance des données : suivez les métriques liées à la découverte des métadonnées et à l'enrichissement du catalogue pour vous assurer que les éléments de données sont analysés et tagués conformément à vos règles de gouvernance.
Fonctionnement
Knowledge Catalog est intégré à Cloud Monitoring, qui collecte des métriques, des événements et des métadonnées à partir des services Knowledge Catalog. Ces métriques fournissent des insights sur des domaines tels que l'état d'exécution des jobs, l'utilisation des API et l'état des ressources. Vous pouvez analyser ces métriques à l'aide des outils de Cloud Monitoring, tels que l'explorateur de métriques, les tableaux de bord personnalisés et les alertes. Ces outils vous permettent de visualiser le comportement de votre service, d'identifier les tendances de performances et de créer des règles d'alerte qui vous avertissent lorsque les performances s'écartent des seuils définis ou lorsque des échecs se produisent.
Accéder aux métriques du service dans Monitoring
Les métriques des ressources de service Knowledge Catalog sont automatiquement activées sur les services Knowledge Catalog. Pour afficher ces métriques, utilisez Monitoring.
Vous pouvez accéder à Monitoring depuis la consoleGoogle Cloud ou en utilisant l'API Monitoring.
Si vous ne parvenez pas à afficher les graphiques de surveillance ou à créer des alertes, vous avez peut-être besoin d'autorisations Monitoring supplémentaires.
Console
Dans la console Google Cloud , accédez à la page Explorateur de métriques.
Dans le menu Sélectionner une métrique, sélectionnez une ressource
Cloud Dataplex.Sélectionnez une catégorie de métrique, puis une métrique dans la liste.
Pour afficher des informations sur une métrique, pointez sur son nom.
Cliquez sur Appliquer.
Facultatif : Sélectionnez des filtres, regroupez par étiquettes de métriques, effectuez des agrégations et sélectionnez les options d'affichage des graphiques.
REST
Pour enregistrer et lister les métriques définies par une expression filter, utilisez la méthode Monitoring timeSeries.list.
Pour envoyer une requête API et afficher la réponse, utilisez le modèle Essayer cette API sur la page de l'API.
Métriques du service Knowledge Catalog dans Monitoring
Les métriques du service Knowledge Catalog facilitent la surveillance de l'état du service.
Surveiller et attribuer les coûts en unités de calcul de données Dataplex avec l'exportation Cloud Billing
Étant donné que les analyses des données du Knowledge Catalog (y compris la qualité des données et le profilage des données automatiques) et la traçabilité des données ne publient pas de métriques de série temporelle dans Cloud Monitoring, vous pouvez utiliser l'exportation Cloud Billing vers BigQuery pour suivre, surveiller et attribuer l'utilisation et les coûts des unités de calcul de données (DCU) dans les projets, les analyses et les ressources de données.
Libellés de facturation Dataplex
Knowledge Catalog associe automatiquement des libellés système aux enregistrements de facturation émis pour les analyses de données et la traçabilité des données. Vous pouvez interroger ces libellés dans le tableau d'exportation Cloud Billing, dans le tableau labels :
| Clé de l'étiquette | Charge de travail | Description |
|---|---|---|
goog-dataplex-datascan-id |
Qualité des données, profilage des données | ID ou nom de l'analyse des données. |
goog-dataplex-datascan-job-id |
Qualité des données, profilage des données | ID d'exécution spécifique du job d'analyse des données. |
goog-dataplex-datascan-data-source-project |
Qualité des données, profilage des données | Le projet Google Cloud contenant la source de données analysée. |
goog-dataplex-datascan-data-source-region |
Qualité des données, profilage des données | Région Google Cloud de la source de données analysée. |
goog-dataplex-datascan-data-source-bigquery-dataset |
Qualité des données, profilage des données | ID de l'ensemble de données BigQuery de la table analysée. |
goog-dataplex-datascan-data-source-bigquery-table |
Qualité des données, profilage des données | ID de la table BigQuery analysée. |
goog-dataplex-datascan-data-source-dataplex-lake |
Qualité des données, profilage des données | ID du lac Dataplex (le cas échéant). |
goog-dataplex-datascan-data-source-dataplex-zone |
Qualité des données, profilage des données | ID de la zone de données Dataplex (le cas échéant). |
goog-dataplex-datascan-data-source-dataplex-entity |
Qualité des données, profilage des données | ID de l'entité Dataplex (le cas échéant). |
goog-dataplex-datascan-data-source-biglake-catalog |
Qualité des données, profilage des données | ID du catalogue BigLake (le cas échéant). |
goog-dataplex-datascan-data-source-biglake-namespace |
Qualité des données, profilage des données | Espace de noms BigLake (le cas échéant). |
goog-dataplex-datascan-data-source-biglake-table |
Qualité des données, profilage des données | ID de la table BigLake (le cas échéant). |
goog-dataplex-workload-type |
Traçabilité des données | Identifie la charge de travail. Définissez la valeur sur LINEAGE pour les frais de traitement de la traçabilité des données. |
Exemples de requêtes
Avant d'exécuter ces requêtes, assurez-vous d'avoir activé l'exportation Cloud Billing vers BigQuery. Dans les exemples de requêtes, remplacez les espaces réservés suivants :
PROJECT_ID: ID du projet Google Cloud qui héberge votre ensemble de données d'exportation des données de facturation BigQuery.DATASET_NAME: nom de l'ensemble de données BigQuery contenant votre table d'exportation des données de facturation.BILLING_ACCOUNT_ID: ID de votre compte de facturation Cloud (au format avec des traits de soulignement, par exemple012345_567890_ABCDEF).
Requête 1 : Attribuer les coûts et l'utilisation des UDC par DataScan et table cible
Cette requête agrège les coûts de traitement Dataplex et de traitement Premium par ID DataScan et table BigQuery cible au cours des 30 derniers jours :
SELECT project.id AS project_id, (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id') AS datascan_id, (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-data-source-project') AS data_source_project, (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-data-source-bigquery-dataset') AS data_source_dataset, (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-data-source-bigquery-table') AS data_source_table, sku.description AS sku_description, SUM(usage.amount) AS total_usage, usage.unit AS usage_unit, SUM(cost) AS total_cost, currency FROM `PROJECT_ID.DATASET_NAME.gcp_billing_export_v1_BILLING_ACCOUNT_ID` WHERE service.description = 'Dataplex' AND EXISTS (SELECT 1 FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id') AND _PARTITIONDATE >= DATE_SUB(CURRENT_DATE(), INTERVAL 30 DAY) GROUP BY project_id, datascan_id, data_source_project, data_source_dataset, data_source_table, sku_description, usage_unit, currency ORDER BY total_cost DESC;
Requête 2 : attribuer les coûts Dataplex par type de charge de travail (traçabilité ou DataScan)
Cette requête répartit les coûts des SKU Dataplex par catégorie de charge de travail (comme la traçabilité des données par rapport à DataScan) dans tous les projets :
SELECT project.id AS project_id, sku.description AS sku_description, COALESCE( (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-workload-type'), IF(EXISTS(SELECT 1 FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id'), 'DATASCAN', 'OTHER') ) AS workload_type, SUM(usage.amount) AS total_usage, usage.unit AS usage_unit, SUM(cost) AS total_cost, currency FROM `PROJECT_ID.DATASET_NAME.gcp_billing_export_v1_BILLING_ACCOUNT_ID` WHERE service.description = 'Dataplex' AND _PARTITIONDATE >= DATE_SUB(CURRENT_DATE(), INTERVAL 30 DAY) GROUP BY project_id, sku_description, workload_type, usage_unit, currency ORDER BY total_cost DESC;
Requête 3 : Tendance quotidienne de l'utilisation et du coût des DCU par exécution de tâche DataScan
Cette requête suit la consommation et les coûts quotidiens d'unités de capacité de données pour les exécutions individuelles de tâches DataScan au cours des sept derniers jours :
SELECT DATE(usage_start_time) AS usage_date, project.id AS project_id, (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id') AS datascan_id, (SELECT value FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-job-id') AS job_id, SUM(usage.amount) AS total_usage, usage.unit AS usage_unit, SUM(cost) AS total_cost, currency FROM `PROJECT_ID.DATASET_NAME.gcp_billing_export_v1_BILLING_ACCOUNT_ID` WHERE service.description = 'Dataplex' AND EXISTS (SELECT 1 FROM UNNEST(labels) WHERE key = 'goog-dataplex-datascan-id') AND _PARTITIONDATE >= DATE_SUB(CURRENT_DATE(), INTERVAL 7 DAY) GROUP BY usage_date, project_id, datascan_id, job_id, usage_unit, currency ORDER BY usage_date DESC, total_cost DESC;
Créer un tableau de bord Monitoring personnalisé
Vous pouvez créer un tableau de bord Monitoring personnalisé pour afficher les graphiques des métriques de service Knowledge Catalog sélectionnées. Pour savoir comment créer un tableau de bord, consultez Créer et gérer des tableaux de bord personnalisés. Lorsque vous sélectionnez une métrique pour un widget de votre tableau de bord, sélectionnez une ressource Cloud Dataplex, puis choisissez une métrique Knowledge Catalog.
Utiliser les alertes Monitoring
Vous pouvez créer une alerte Monitoring qui vous avertit lorsqu'une métrique de service ou de job Knowledge Catalog dépasse un seuil spécifié.
Créer une alerte
Pour créer une alerte, suivez les instructions de la section Créer des règles d'alerte basées sur un seuil de métrique.
Lorsque vous sélectionnez une série temporelle à surveiller, sélectionnez une ressource Cloud Dataplex, puis choisissez une métrique Knowledge Catalog.
Afficher les alertes
Lorsqu'une condition de seuil de métrique déclenche une alerte, Monitoring crée un incident et un événement correspondant.
Pour afficher un incident, procédez comme suit :
Dans la console Google Cloud , accédez à la page Alertes :
Si vous avez spécifié un mécanisme de notification dans la règle d'alerte, telle qu'une notification par e-mail ou SMS, Monitoring se charge également d'envoyer une notification de l'incident.
Pour en savoir plus sur les alertes, consultez Incidents pour les alertes basées sur des métriques.
Étapes suivantes
- Obtenez davantage d'informations sur Cloud Monitoring.
- En savoir plus sur l'exportation des données Cloud Billing vers BigQuery
- Découvrez comment utiliser la qualité automatique des données.
- Découvrez comment utiliser le profilage des données.
- Découvrez comment utiliser la traçabilité des données.