3.0.x 发布版映像版本

组件 3.0.0-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/07/15
3.0.0-RC2-debian13/
-ubuntu24/
-ml-ubuntu24/
-rocky9
2026/05/03
3.0.0-RC1-debian12/
-ubuntu24/
-rocky9
2025/09/08


Apache Flink
可选组件
2.2.0 2.2.0
**Apache Hadoop**
已安装
3.5.0 3.5.0 3.4.1
**Apache Hive**
已安装
4.2.0 4.2.0 4.1.0
Apache Hive WebHCat
可选组件
4.2.0 4.2.0
**Apache Iceberg**
可选组件
1.11.0
**Apache Kafka**
初始化操作
3.9.2 3.9.2
Apache Pig
可选组件
0.18.0 0.18.0-SNAPSHOT
Apache Ranger
可选组件
2.8.0
**Apache Spark**
已安装
4.1.2 4.1.1 4.0.0
Apache Solr
可选组件
9.10.1 9.10.1 9.7.0
Apache Tez
已安装
0.10.5 0.10.5 0.10.5
**Apache Zeppelin 笔记本**
可选组件
0.12.0 0.12.0
**Apache Zookeeper**
可选组件
3.9.5 3.9.5 3.9.3
BigQuery 连接器
已安装
0.44.1-Preview 0.44.1-Preview
**Cloud Storage 连接器**
已安装
3.1.13 3.1.13 3.1.6
Conscrypt
已安装
2.6 2.6 2.6
**Delta Lake**
可选组件
4.2.0
**Docker**
可选组件
28.1 28.1
Java
已安装
21 21 17
**JupyterLab 笔记本**
可选组件
4.5.7 4.5.7
**Python**
已安装
Pixi 0.67.1 with Python 3.12 Pixi 0.67.1 with Python 3.11 micromamba 2.0.5 with Python 3.11
R
已安装
R 4.5 R 4.5 R 4.3
Scala
已安装
2.13.17 2.13.17 2.13.14
Trino
可选组件
480 480

限制

  • Lightning Engine: 映像版本 3.0 不支持 Lightning Engine。

  • 使用 Hive 4.2 的元存储区: 映像版本 3.0 不支持 BigQuery Metastore、BigLake Metastore 或使用 Hive 4.2 的 Dataproc Metastore(不支持使用这些元存储区直接进行 Hive 查询)。

  • 使用 Hive 的 Delta Lake: Managed Service for Apache Spark 映像版本 3.0 中包含的 Delta Lake 4.x 不支持 Hive(无法在 Hive 上执行对 Delta Lake 4.2 表的查询)。

  • 使用 Hive 的 Iceberg: Managed Service for Apache Spark 映像版本 3.0 包含 Hive 4.2,后者通过 Iceberg REST 目录支持 Iceberg。

  • GPU 集群: 除了 3.0-ml-ubuntu 之外的所有 3.0 映像版本都启用了 cgroups V2。由于 YARN 在启用 cgroups V2 时不支持 GPU 发现,因此您必须在使用 GPU 创建集群时使用 3.0-ml-ubuntu 映像。

  • Hudi: 映像版本 3.0 不支持 Apache Hudi。

注意:

  • 3.0 版本是一种仅包含核心组件的轻量级映像,可减少常见漏洞和披露 (CVE) 的风险。如果安全合规性要求较高,请在创建 Managed Service for Apache Spark 集群时使用映像版本 2.3 或更高版本。

  • 如果您选择安装 可选组件,在使用 3.0 映像创建 Managed Service for Apache Spark 集群时,这些组件将在集群创建期间下载并安装。这可能会增加集群启动时间。为避免此延迟,您可以创建预安装了可选组件的自定义映像。这是通过运行带有 --optional-components 标志的 generate_custom_image.py 来实现的。

  • 3.0 映像支持以下可选组件:

    • Apache Flink
    • Apache Hive WebHCat
    • Apache Iceberg
    • Apache Pig
    • Apache Ranger
    • Apache Solr
    • Apache Zeppelin 笔记本
    • Apache Zookeeper
    • Delta Lake
    • Docker
    • JupyterLab 笔记本
    • Trino
  • yarn.nodemanager.recovery.enabled 和 HDFS 审核日志记录在 3.0 版映像中默认处于启用状态。

  • Pixi 作为 Python 安装的一部分进行安装,用于安装 Python 软件包,而不是 Conda。

  • YARN 的默认资源计算器已从 DefaultResourceCalculator 更改为 DominantResourceCalculator, 后者使用主要资源概念来确定资源分配, 例如内存和 CPU 分配。此更改会影响 自动扩缩器, 该扩缩器会根据集群的主要资源使用情况进行扩缩。

  • 从映像版本 3.0 开始,如果您在创建集群时未为集群节点指定机器类型,Managed Service for Apache Spark 会使用灵活虚拟机机器类型的排名列表(例如 N4、N2 和 E2 系列机器类型的排名列表,该列表针对资源可用性进行了优化)指定节点。