针对分布式数据实现智能体分析工作流

Last reviewed 2026-06-09 UTC

本文档提供了使用 AI 智能体实现跨云分析工作流的概要架构。本文档适用于希望在多云数据湖、结构化数据仓库和非结构化数据存储区中使用智能体 AI 进行分析工作流的云架构师、数据工程师和数据科学家。本文档假定您对智能体 AI 概念、数据分析和云架构有基本的了解。

本文档的 部署 部分提供了一个 Codelab,您可以使用该 Codelab 了解如何构建智能体分析解决方案。

架构

下图展示了智能体分析解决方案的架构,该解决方案可从分布在多个数据存储区和云服务提供商中的结构化和非结构化数据中获取业务洞见。

一种架构,使用代理式开发环境和 AI 模型来分析分布在 Google Cloud 和其他云服务提供商中的数据。

此架构中的组件按以下层级组织:

使用的产品

该架构使用以下 Google Cloud 产品和工具:

  • Google Cloud Data Agent Kit:智能体扩展程序,可让数据 科学家、数据工程师和数据应用开发者在其首选的智能体开发环境中管理整个数据生命周期。
  • BigQuery:一种企业数据仓库,可帮助您使用机器学习、地理空间分析和商业智能等内置功能管理和 分析数据。
  • Managed Service for Apache Spark:一项代管式服务,可在托管式计算基础架构上运行 Apache Spark 批处理 工作负载。
  • Lakehouse for Apache Iceberg:一种高性能存储引擎,可让您构建开放式数据湖仓 并为高级分析和 AI 提供统一的界面。
  • Knowledge Catalog:一项由 AI 提供支持的服务 ,可提供统一的数据资产目录,并具有智能元数据和治理 功能。
  • Gemini:Google 开发的多模态 AI 模型系列。
  • Cloud Storage:适用于各种数据类型的费用低廉且不受限制的对象存储区。数据可从 内部和外部访问 Google Cloud,并且 跨位置进行复制以实现冗余。
  • Cross-Cloud Interconnect:一项服务,可在 与其他云服务提供商之间提供高带宽、低延迟的 专用连接。 Google Cloud
  • Google Cloud MCP 服务器:Google 管理的远程服务,用于实现 Model Context Protocol (MCP),以便为 AI 应用提供对 Google 和 Google Cloud 产品和服务的访问权限。

使用场景

本文档介绍的架构适用于以下使用场景:

  • 多云数据分析:高效查询和分析 分布在 Google Cloud 与其他云服务提供商之间的数据, 而无需移动文件或构建复杂的 提取、转换、加载 (ETL) 流水线。例如,全球零售商的营销经理可以将 Amazon S3 中的客户忠诚度数据与 BigQuery 中的营销运营数据联接,以分析营销活动的效果。
  • 智能数据发现:使用自然语言提示和 AI 智能体 在多个环境中发现、查询和处理联合数据集。 例如,采购专家可以根据供应链管理 (SCM) 系统中的结构化数据,结合来自非结构化电子邮件通信和损坏评估报告的洞见,确定供应链中断的常见原因。
  • 从非结构化来源提取结构化数据:扫描大量 非结构化数据,获取语义元数据,并将结构化数据 提取内容存储在 BigQuery 中以进行下游分析。例如,运营控制员可以通过从数千份以非结构化格式(例如 PDF 文件)存储的发票中提取结构化数据,高效地分析费用。

部署

如需了解如何使用 Data Agent Kit 扩展程序构建智能体分析解决方案,请参阅 Codelab: 使用 AI 智能体在几秒钟内将原始数据转换为预测。 该 Codelab 展示了如何使用 Data Agent Kit 扩展程序在首选的智能体开发环境中高效分析数据。该 Codelab 使用的所有示例数据都存储在 Google Cloud中。

后续步骤

贡献者

作者: Kumar Dhanagopal | 跨产品解决方案开发者

其他贡献者: