针对分布式数据实现智能体分析工作流

Last reviewed 2026-06-09 UTC

本文档提供了一个高级别架构,用于实现使用 AI 代理的跨云分析工作流。本文档适用于希望在多云数据湖、结构化数据仓库和非结构化数据存储区中使用智能体 AI 进行分析工作流的云架构师、数据工程师和数据科学家。本文档假定您对智能体 AI 概念、数据分析和云架构有基础的了解。

本文档的部署部分提供了一个 Codelab,您可以通过该 Codelab 了解如何构建智能体分析解决方案。

架构

下图展示了代理分析解决方案的架构,该解决方案可从分布在多个数据存储区和云服务提供商中的结构化和非结构化数据中获取业务洞见。

一种架构,使用代理开发环境和 AI 模型来分析分布在 Google Cloud 和其他云服务提供商中的数据。

此架构中的组件分为以下层:

  • 用户操作和代理操作

    • 智能体开发环境:数据从业者(例如数据工程师和数据科学家)可以使用以下方法之一提交自然语言请求:
    • Google Cloud Data Agent Kit 扩展程序:该扩展程序使代理能够通过加载适当的技能并连接到远程 MCP 服务器来访问Google Cloud 中的可信数据,从而提供 Google Cloud 服务。
    • 基础模型:为了从可信的上下文和数据中生成业务洞见,代理开发环境使用基础模型,例如 Gemini 系列中的模型。该模型使用 Data Agent Kit 扩展程序中的相应技能,并使用所需的 MCP 服务器工具来实现复杂的分析工作流。
  • 分析工作流

    • 无边界湖仓一体:湖仓一体提供高性能的统一元数据目录,可将 Apache Iceberg 开放表格式与 Google Cloud中的企业级存储空间集成。
    • Managed Service for Apache Spark:这是架构中的核心数据处理组件。Managed Service for Apache Spark 的 Lightning Engine 功能支持以批量模式和互动模式进行高性能无服务器数据处理。Spark 数据处理作业使用 Lakehouse 中 Iceberg 目录的元数据,从 BigQuery 读取结构化数据,并从 Amazon S3 等外部来源执行零复制读取。
    • Knowledge Catalog:智能体使用 Knowledge Catalog 对 Cloud Storage 中的非结构化数据执行智能扫描,提取语义元数据,并构建上下文图。
  • 可信数据存储区

    • Google Cloud 中的数据:BigQuery 是结构化数据的中央仓库,包括从 Cloud Storage 中的非结构化数据提取的结构化数据。
    • 来自外部来源的数据:此架构显示了外部数据源,例如 Amazon S3 存储分区中的数据和 Databricks Unity Catalog 中的元数据。Cross-Cloud Interconnect 可在 Google Cloud与其他云服务提供商之间建立高带宽专用连接。

使用的产品

该架构使用以下 Google Cloud 产品和工具:

  • Google Cloud Data Agent Kit:智能体扩展程序,可让数据科学家、数据工程师和数据应用开发者在其偏好的智能体开发环境中管理整个数据生命周期。
  • BigQuery:一种企业数据仓库,可帮助您使用机器学习、地理空间分析和商业智能等内置功能管理和分析数据。
  • Managed Service for Apache Spark:一项代管式服务,可在托管计算基础设施上运行 Apache Spark 批量工作负载。
  • Lakehouse:一种高性能存储引擎,可让您构建开放式数据湖仓一体架构,并为高级分析和 AI 提供统一的接口。
  • Knowledge Catalog:一项 AI 赋能的服务,可提供统一的数据资产目录,其中包含智能元数据和治理功能。
  • Gemini:Google 开发的一系列多模态 AI 模型。
  • Cloud Storage:适用于各种数据类型的费用低廉且不受限制的对象存储区。数据可从 Google Cloud内部和外部访问,并且跨位置进行复制以实现冗余。
  • Cross-Cloud Interconnect:一种服务,可在 Google Cloud 与其他云服务提供商之间提供高带宽、低延迟的专用连接。
  • Google Cloud MCP 服务器:由 Google 管理的远程服务,用于实现 Model Context Protocol (MCP),以便为 AI 应用提供对 Google 和 Google Cloud 产品和服务的访问权限。

使用场景

本文档中介绍的架构适用于以下应用场景:

  • 多云数据分析:高效查询和分析分布在 Google Cloud 和其他云服务提供商中的数据,无需移动文件或构建复杂的提取、转换、加载 (ETL) 流水线。例如,一家全球零售商的营销经理可以将 Amazon S3 中的客户忠诚度数据与 BigQuery 中的营销运营数据联接起来,从而分析营销活动的成效。
  • 智能数据发现:使用自然语言提示和 AI 代理在多个环境中发现、查询和处理联邦数据集。 例如,采购专家可以根据供应链管理 (SCM) 系统中的结构化数据,结合非结构化电子邮件通信和损坏评估报告中的分析洞见,确定供应链中断的常见原因。
  • 从非结构化来源提取结构化数据:扫描大量非结构化数据,派生语义元数据,并将提取的结构化数据存储在 BigQuery 中以供下游分析。例如,运营控制器可以从数千份以非结构化格式(例如 PDF 文件)存储的账单中提取结构化数据,从而高效地分析费用。

部署

如需了解如何使用 Data Agent Kit 扩展程序构建智能体分析解决方案,请参阅 Codelab:借助 AI 智能体,数秒内将原始数据转化为预测洞察。此 Codelab 展示了如何使用 Data Agent Kit 扩展程序在您偏好的智能体开发环境中高效分析数据。代码实验室使用的所有示例数据都存储在Google Cloud中。

后续步骤

贡献者

作者: Kumar Dhanagopal | 跨产品解决方案开发者

其他贡献者: