数据分析简介

Knowledge Catalog(以前称为 Dataplex Universal Catalog)可自动分析 BigQuery、Google Cloud Lakehouse Iceberg REST Catalog、SAP Business Data Cloud (BDC) Delta Lake 和 Hive 表,从而更轻松地了解和分析数据。

分析就像是获取数据的详细健康报告。它会提供关键统计信息,例如常见值、数据分布情况以及缺失条目的数量(null 值计数)。这些信息有助于加快分析速度。

数据分析可推荐数据质量检查规则,确保数据始终可靠。

概念模型

借助 Knowledge Catalog,您可以创建数据分析扫描,从而更好地了解数据分析。数据分析扫描是一种Knowledge Catalog 数据扫描,用于分析 BigQuery、 Google Cloud Lakehouse Iceberg REST Catalog、SAP BDC Delta Lake 或 Hive 表,以生成统计数据洞见。

下图展示了 Knowledge Catalog 如何扫描数据以报告统计特征。

数据分析扫描会分析表格数据,以报告统计特征。

数据分析扫描与一个 BigQuery、 Google CloudLakehouse Iceberg REST Catalog、SAP BDC Delta Lake 或 Hive 表关联,并扫描该表以生成数据分析结果。数据分析扫描支持多种配置选项

配置选项

本部分介绍了可用于运数据分析扫描的配置选项。

分析模式

您可以从以下分析模式中进行选择:

  • 标准:这是默认模式。它会根据您指定的抽样和过滤条件扫描数据,从而提供全面且可自定义的剖析文件。标准模式适合对数据特征进行详细分析和长期监控。

  • 轻量级(预览版:此模式提供低延迟的分析扫描,可在几秒内返回结果。它经过优化,可提供出色的速度和成本效益,以支持以下使用场景:

    • 根据即时数据特征为 AI 智能体回答提供依据
    • 以经济高效的方式大规模预生成配置文件,以便在全球范围内发现数据
    • 在交互式数据探索期间提供快速健康报告

    轻量级模式具有以下限制:

    • 与标准分析模式不同,您无法在轻量级扫描中修改范围、过滤条件或采样大小。
    • 它不支持 BigQuery 视图和外部表。
  • 非结构化(预览版:此模式使用由 Vertex AI Gemini 模型提供支持的独立非结构化数据 (UnstructuredDataProfileSpec) 配置文件扫描,通过使用现有的 BigQuery 对象表来分析非结构化文件(例如 Cloud Storage 中的 PDF)的实际定性内容。与计算统计指标(例如 null 计数和值分布)的结构化分析模式(标准和轻量级)不同,非结构化数据的数据分析扫描会执行语义推理,以提取业务实体 (NodeType) 和关系 (EdgeType),将 Graph Profile 方面 (dataplex-types.global.graph-profile) 附加到目录条目,并支持以编程方式将数据具体化为物理 BigQuery 表或视图。

    注意:非结构化数据的数据分析扫描目前处于公开预览版阶段,仅可通过 Dataplex REST API 使用。不支持 Google Cloud 控制台和 Google Cloud CLI 工作流。

    如需了解详情,请参阅非结构化数据分析简介使用非结构化数据发现扫描(适用于 Cloud Storage 发现扫描)和使用非结构化数据的数据分析(适用于独立对象表分析)。

时间安排选项

您可以按定义的频率安排数据分析扫描,也可以按需运行扫描。如果扫描作业的运行时间超出预期,您可以取消该作业

执行身份

默认情况下,Knowledge Catalog 使用集中式服务代理 (service-PROJECT_NUMBER@gcp-sa-dataplex.) 运行数据分析扫描。

您还可以通过指定自定义服务账号(自带服务账号)或使用自己的最终用户凭据 (EUC) 来替换此默认执行身份。这有以下几点好处:

  • 最小权限原则:仅向专用服务账号授予特定数据分析任务所需的精确 Identity and Access Management (IAM) 权限,从而最大限度地减少过度预配的访问权限。
  • 精细的访问权限控制:将权限限定到特定资源,从而与 BigQuery 中的行级和列级访问权限政策集成。
  • 提高了可审核性:为特定扫描分配自定义服务账号或用户凭据,从而在审核日志中更清晰地跟踪和记录活动。
  • 结算统一:使用自定义执行身份时,处理和存储费用会直接集中在 BigQuery 下(绕过 Knowledge Catalog Premium SKU)。这样,您就可以享受 BigQuery 企业折扣和槽用量承诺。

如需了解如何配置自定义执行身份,请参阅配置执行身份

网络要求

如需运行扫描,您必须在用于扫描的 VPC 子网上启用专用 Google 访问通道。如果您未指定子网,请确保您的默认子网已启用专用 Google 访问通道。

范围

对于标准分析扫描,您可以指定要扫描的数据范围:

  • 完整表:在数据分析扫描中,系统会扫描整个表。在计算数据分析统计信息之前,系统会对整个表应用采样、行过滤条件和列过滤条件。

  • 增量:在数据分析扫描中,系统会扫描您指定的增量数据。指定表中要用作增量的 DateTimestamp 列。通常,这是用于对表进行分区的列。在计算数据分析统计信息之前,系统会对增量数据应用采样、行过滤条件和列过滤条件。

过滤数据

对于标准数据分析扫描,您可以使用行过滤条件和列过滤条件来过滤要扫描的数据,以进行数据分析。使用过滤条件有助于缩短运行时间并降低费用,还可以排除敏感数据和不必要的数据。 轻量级分析扫描不支持列过滤条件和行过滤条件。

  • 行过滤条件:借助行过滤条件,您可以重点关注特定时间段内或特定细分(例如区域)的数据。例如,您可以过滤掉时间戳早于特定日期的数据。

  • 列过滤条件:借助列过滤条件,您可以指定在运行数据分析扫描时包含和排除表中的特定列。

样本数据

对于标准分析扫描,您可以指定要采样的数据中记录所占的百分比,以便运行数据分析扫描。对较小的数据示例创建数据分析扫描可以缩短查询整个数据集的运行时间并降低成本。

多次数据分析扫描

您可以使用 Google Cloud 控制台一次创建多个数据分析扫描。您最多可以从一个数据集中选择 100 个表,并为每个数据集创建数据分析扫描。如需了解详情,请参阅创建多个数据分析扫描

将扫描结果导出到 BigQuery 表

您可以将数据分析扫描结果导出到 BigQuery 表中,以供进一步分析。如需自定义报告,您可以将 BigQuery 表数据连接到 Looker 信息中心。您可以通过在多次扫描中使用同一结果表来构建汇总的报告。

数据分析结果

数据分析结果包含以下值:

列类型 数据分析结果
数值列
  • null 值的百分比。
  • 近似唯一(不同)值的百分比。
  • 列中前 10 个最常见的值。如果列中的唯一值数量小于 10(不包括 null 值),则该值可能小于 10。对于每个最常见的值,系统会显示其在当前扫描中扫描的数据中出现所占的百分比。
  • 平均值、标准差、最小值、近似下四分位数、近似中位数、近似上四分位数和最大值。
字符串列
  • null 值的百分比。
  • 近似唯一(不同)值的百分比。
  • 列中前 10 个最常见的值,如果列中的唯一值数量少于 10,则该值可能小于 10。
  • 字符串的平均长度、最短长度和最长长度。
其他非嵌套列(日期、时间、时间戳、二进制等)
  • null 值的百分比。
  • 近似唯一(不同)值的百分比。
  • 列中前 10 个最常见的值,如果列中的唯一值数量少于 10,则该值可能小于 10。
所有其他嵌套或复杂数据类型列(例如 Record、Array、JSON)或任何具有重复模式的列。
  • null 值的百分比。

结果包括每个作业中扫描的记录数。

报告和监视

您可以使用以下报告和方法来监控和分析数据分析结果:

  • 在 BigQuery 和 Knowledge Catalog 页面中与源表一起发布的报告

    如果您将数据分析扫描配置为将结果发布到 BigQuery 和 Knowledge Catalog,则可以在 BigQuery 和 Knowledge Catalog 中源表的数据分析标签页上查看最新的数据分析扫描结果。这些结果可从任何项目中访问。

    已发布的报告。

  • 每个作业的历史报告

    在 Knowledge Catalog 和 BigQuery 的数据分析和质量评估 > 数据分析扫描页面上,您可以查看最新作业和历史作业的详细报告。其中包括列级数据分析信息和所用的配置。

    每个作业的历史报告。

  • “分析”标签页

    在 Knowledge Catalog 和 BigQuery 的数据分析和质量评估 > 数据分析扫描页面上,您可以使用分析标签页查看列的给定统计信息在多个数据分析作业中的趋势。例如,如果您有增量扫描,则可以查看某个值的平均值随时间变化的趋势。

    “分析”标签页。

  • 构建您自己的信息中心或分析

    如果您已将数据分析扫描配置为将结果导出到 BigQuery 表,则可以使用数据洞察等工具构建自己的信息中心。

  • 在 Cloud Billing 中监控 DCU 计算费用

    数据分析扫描计算在无服务器基础架构上运行,不会向 Cloud Monitoring 发出时序指标。如需按项目、扫描 ID 或表跟踪和归因数据分析 DCU 费用,请使用 goog-dataplex-datascan-* 系统标签在 BigQuery 中查询 Cloud Billing 导出数据。如需了解详情,请参阅通过 Cloud Billing 导出监控和归因 Dataplex DCU 费用

限制

  • 您只能对 BigQuery、 Google CloudLakehouse Iceberg REST Catalog、SAP BDC Delta Lake 和 Hive 表运行数据分析扫描。
  • 具有所有列类型(BIGNUMERIC 除外)的 BigQuery 表支持数据分析。为具有 BIGNUMERIC 列的表创建的扫描会导致验证错误,无法成功创建。
  • Lakehouse 表不支持多次数据分析扫描。

价格

后续步骤