Last reviewed 2026-06-09 UTC
本文档提供了使用 AI 智能体实现跨云分析工作流的概要架构。本文档适用于希望在多云数据湖、结构化数据仓库和非结构化数据存储区中使用智能体 AI 进行分析工作流的云架构师、数据工程师和数据科学家。本文档假定您对智能体 AI 概念、数据分析和云架构有基本的了解。
本文档的 部署 部分提供了一个 Codelab,您可以使用该 Codelab 了解如何构建智能体分析解决方案。
架构
下图展示了智能体分析解决方案的架构,该解决方案可从分布在多个数据存储区和云服务提供商中的结构化和非结构化数据中获取业务洞见。
此架构中的组件按以下层级组织:
用户和智能体操作
- 智能体开发环境:数据从业者(例如数据工程师
和数据科学家)使用以下方法之一提交自然语言请求:
- 智能体开发环境,例如 Google Antigravity IDE 或 Microsoft Visual Studio Code。
- CLI 智能体,例如 Gemini CLI、Claude Code 或 Codex。
- Google Cloud Data Agent Kit 扩展程序:该 扩展程序使智能体能够通过加载适当的技能并连接到 远程 MCP 服务器来访问 中的可信数据,以获取Google Cloud Google Cloud 服务。
- 基础模型:为了从可信的上下文和 数据中生成业务洞见,智能体开发环境使用基础模型,例如 Gemini 系列中的模型。 该模型使用 Data Agent Kit 扩展程序中的适当技能,并使用所需的 MCP 服务器工具来实现复杂的分析工作流。
- 智能体开发环境:数据从业者(例如数据工程师
和数据科学家)使用以下方法之一提交自然语言请求:
分析工作流
- Lakehouse for Apache Iceberg: Lakehouse 提供了一个高性能的统一元数据 目录,该目录将 Apache Iceberg 开放表格式与 中的企业级存储集成在一起 Google Cloud。
- Managed Service for Apache Spark: 这是架构中的核心数据处理组件。Managed Service for Apache Spark 的 Lightning Engine 功能支持以批处理和交互模式进行高性能 无服务器数据处理。Spark 数据处理作业使用 Lakehouse 中 Iceberg 目录中的元数据,从 BigQuery读取结构化数据,并从 Amazon S3 等外部来源执行 零复制读取。
- Knowledge Catalog: 智能体使用 Knowledge Catalog 对 Cloud Storage中的非结构化数据执行智能扫描,提取语义元数据, 并构建上下文图。
可信数据存储区
- Google Cloud 中的数据:BigQuery 用作结构化数据的中央 仓库,包括从 Cloud Storage 中的 非结构化数据中提取的结构化数据。
- 来自外部来源的数据:该架构显示了外部数据 源,例如 Amazon S3 存储分区中的数据和 Databricks Unity Catalog 中的元数据。 Cross-Cloud Interconnect 在与其他云服务提供商之间提供高带宽专用连接。 Google Cloud
使用的产品
该架构使用以下 Google Cloud 产品和工具:
- Google Cloud Data Agent Kit:智能体扩展程序,可让数据 科学家、数据工程师和数据应用开发者在其首选的智能体开发环境中管理整个数据生命周期。
- BigQuery:一种企业数据仓库,可帮助您使用机器学习、地理空间分析和商业智能等内置功能管理和 分析数据。
- Managed Service for Apache Spark:一项代管式服务,可在托管式计算基础架构上运行 Apache Spark 批处理 工作负载。
- Lakehouse for Apache Iceberg:一种高性能存储引擎,可让您构建开放式数据湖仓 并为高级分析和 AI 提供统一的界面。
- Knowledge Catalog:一项由 AI 提供支持的服务 ,可提供统一的数据资产目录,并具有智能元数据和治理 功能。
- Gemini:Google 开发的多模态 AI 模型系列。
- Cloud Storage:适用于各种数据类型的费用低廉且不受限制的对象存储区。数据可从 内部和外部访问 Google Cloud,并且 跨位置进行复制以实现冗余。
- Cross-Cloud Interconnect:一项服务,可在 与其他云服务提供商之间提供高带宽、低延迟的 专用连接。 Google Cloud
- Google Cloud MCP 服务器:Google 管理的远程服务,用于实现 Model Context Protocol (MCP),以便为 AI 应用提供对 Google 和 Google Cloud 产品和服务的访问权限。
使用场景
本文档介绍的架构适用于以下使用场景:
- 多云数据分析:高效查询和分析 分布在 Google Cloud 与其他云服务提供商之间的数据, 而无需移动文件或构建复杂的 提取、转换、加载 (ETL) 流水线。例如,全球零售商的营销经理可以将 Amazon S3 中的客户忠诚度数据与 BigQuery 中的营销运营数据联接,以分析营销活动的效果。
- 智能数据发现:使用自然语言提示和 AI 智能体 在多个环境中发现、查询和处理联合数据集。 例如,采购专家可以根据供应链管理 (SCM) 系统中的结构化数据,结合来自非结构化电子邮件通信和损坏评估报告的洞见,确定供应链中断的常见原因。
- 从非结构化来源提取结构化数据:扫描大量 非结构化数据,获取语义元数据,并将结构化数据 提取内容存储在 BigQuery 中以进行下游分析。例如,运营控制员可以通过从数千份以非结构化格式(例如 PDF 文件)存储的发票中提取结构化数据,高效地分析费用。
部署
如需了解如何使用 Data Agent Kit 扩展程序构建智能体分析解决方案,请参阅 Codelab: 使用 AI 智能体在几秒钟内将原始数据转换为预测。 该 Codelab 展示了如何使用 Data Agent Kit 扩展程序在首选的智能体开发环境中高效分析数据。该 Codelab 使用的所有示例数据都存储在 Google Cloud中。
后续步骤
- 了解如何使用 Data Agent Kit 扩展程序将笔记本用于数据转换和分析。
- 探索 Knowledge Catalog 的使用场景。
- 详细了解 无边界 Lakehouse。
- 了解如何使用 Lightning Engine加速 Apache Spark 工作负载。
- 了解如何将 Knowledge Catalog 用作 BigQuery 的治理层和智能体层。
- 如需查看更多参考架构、图表和最佳实践,请浏览 Cloud 架构中心。
贡献者
作者: Kumar Dhanagopal | 跨产品解决方案开发者
其他贡献者:
- Abirami Sukumaran | 资深开发者技术推广工程师
- Arti Prasad | 技术文档撰写人
- Brad Miro | 高级开发者技术推广工程师
- Matthew Rahmann | 高级产品经理
- Ranadip Chatterjee | 解决方案工程师
- Remigiusz Samborski | 首席开发者关系工程师