Managed Airflow(第 3 代) | Managed Airflow(第 2 代) | Managed Airflow(旧版第 1 代)
本页面介绍了 Orchestration Pipelines 与 Managed Airflow 之间的关系。
Orchestration Pipelines 简介
Orchestration Pipelines是一个统一的声明式编排和自动化部署框架,经过优化,可在 Google Cloud上无缝管理数据和 AI 流水线。
借助 Orchestration Pipelines,您可以使用基于声明式 YAML 的网域特定语言 (DSL) 来定义流水线及其部署配置。此框架可抽象化底层基础架构,让您专注于数据和 AI 工作流的逻辑,而 Orchestration Pipelines 则负责处理部署、版本控制和编排。
Orchestration Pipelines 中的 Managed Airflow 环境简介
Managed Airflow 是在流水线部署后运行流水线的编排引擎。您可以将 Managed Airflow 环境分配为流水线定义的一部分。在 Orchestration Pipelines 中,此环境称为运行器环境。
Orchestration Pipelines 的优势:
您可以让组织中不是 Airflow 专家的团队能够创建和运行工作流,而无需编写 DAG 或配置 Airflow。例如,您可以在临时 Managed Service for Apache Spark 集群中运行笔记本,并在 YAML 中指定其执行的所有时间表、资源和配置参数,而无需编写任何 DAG 代码。
Orchestration Pipelines 中的所有配置和部署均基于 YAML 和 gcloud CLI 命令。所有 Airflow DAG 都是自动生成的,无需与 Airflow、Managed Airflow 环境或环境存储分区进行互动。您可以在资源文件所在的常规 Git 代码库中开发和部署工作流。
您的 YAML 定义适用于所有版本的 Airflow。您无需针对 Airflow 版本之间的更改或已安装软件包的差异调整代码。例如,如果您从 Airflow 2 迁移到 Airflow 3,则无需迁移流水线。
Orchestration Pipelines 与 Google Cloud Data Agent Kit 集成,因此您可以使用智能体式编写和问题排查功能。您可以使用该代理编写流水线、简化部署,并使用首选 IDE 或 CLI 观察流水线状态。
Orchestration Pipelines 的工作原理
Orchestration Pipelines 支持各种操作和Google Cloud 服务,例如:
- 在 Managed Service for Apache Spark 中运行 PySpark 脚本。
- 在 Managed Service for Apache Spark 中运行笔记本文件。
- 在 BigQuery 或 Managed Service for Apache Spark 中执行 SQL 查询。
- 在 Dataform 或 dbt 框架中执行数据处理流水线。
- 运行 Python 脚本。
Orchestration Pipelines 的典型工作流程如下:
- 您需要将流水线定义为一系列必须使用某个 Google Cloud 服务执行的操作。
- 您可以为流水线操作定义资源配置。例如,您可以指定必须在具有特定配置的临时 Managed Service for Apache Spark 集群上执行特定操作。
- (可选)您可以定义必须通过已配置的资源机制自动配置的资源(如果这些资源尚不存在)。例如,您可以指定必须创建采用特定配置的静态 Managed Service for Apache Spark 集群。
- 您需要将包含要执行的操作的流水线定义文件添加到 Git 代码库。
- 您可以将各个流水线操作(例如脚本或笔记本文件)的资源添加到 Git 代码库。
您可以使用 gcloud CLI 命令将流水线部署到 Managed Airflow 环境。Orchestration Pipelines 会自动创建一些用于运行流水线的 DAG 文件。
与独立 Airflow DAG 相比,这些 DAG 是自动生成的,您无需以任何方式管理它们。您可以使用 gcloud CLI 命令查看流水线执行状态并管理流水线。
您的环境会按计划执行流水线。
监控流水线状态
您可以在 Google Cloud 控制台和 Google Cloud CLI 中查看环境中运行的所有流水线的状态以及流水线运行历史记录。如需了解详情,请参阅管理编排流水线。