Managed Service for Apache Spark 无服务器概览

借助 Managed Service for Apache Spark 无服务器模式,您无需预配和管理自己的集群即可运行 Spark 工作负载。 您可以通过以下两种方式运行 Managed Service for Apache Spark 工作负载:批量工作负载和互动式会话。

批处理工作负载

使用Google Cloud 控制台、Google Cloud CLI 或 REST API 提交批处理工作负载。Managed Service for Apache Spark 在托管式计算基础架构上运行工作负载,并根据需要自动扩缩资源。费用仅在执行工作负载时产生。

批处理工作负载功能

您可以运行以下类型的批处理工作负载:

  • PySpark
  • Spark SQL
  • Spark R
  • Spark(Java 或 Scala)

您可以在提交批处理工作负载时指定 Spark 属性。

安排批处理工作负载

您可以在 Airflow 或 Managed Service for Apache Airflow 工作流中使用 Airflow 批处理运算符来安排 Spark 批处理工作负载。如需了解详情,请参阅使用 Managed Airflow 运行 Managed Service for Apache Spark 无服务器工作负载。

开始使用

如需开始使用,请参阅运行 Apache Spark 批量工作负载。

交互式会话

在交互式会话期间,在 Jupyter 笔记本中编写和运行代码。您可以通过以下方式创建笔记本会话:

  • 在 BigQuery Studio 笔记本中运行 PySpark 代码。 打开 BigQuery Python 笔记本,以创建基于 Spark Connect 的交互式会话。每个 BigQuery 笔记本只能有一个与之关联的活跃会话。

  • 使用 JupyterLab 插件,根据您创建和管理的模板创建多个 Jupyter 笔记本会话。在本地机器或 Compute Engine 虚拟机上安装插件时,JupyterLab 启动器页面上会显示与不同 Spark 内核配置对应的不同卡片。点击相应卡片以创建 Managed Service for Apache Spark 笔记本会话,然后开始在笔记本中编写和测试代码。

    借助 JupyterLab 插件,您还可以使用 JupyterLab 启动器页面执行以下操作:

    • 创建 Managed Service for Apache Spark 集群。
    • 向集群提交作业。
    • 查看 Google Cloud 和 Spark 日志。
  • 使用 Google Cloud Data Agent Kit 在 IDE 中管理整个数据工作负载生命周期。Data Agent Kit 支持 Managed Service for Apache Spark,让您可以直接从 VS Code 或使用受支持的 agentic CLI 开发代码、创建互动式会话和构建流水线。

安全合规性

Managed Service for Apache Spark 遵循所有数据驻留、CMEK、VPC-SC 以及 Managed Service for Apache Spark 必须遵守的其他安全要求。