为了补充启动磁盘,您可以将本地固态硬盘(本地 SSD)挂接到集群中的主节点、主要工作器节点和辅助工作器节点。 为集群提供本地 SSD 后,HDFS 和暂存数据(例如 shuffle 输出)会使用本地 SSD 而不是启动永久性磁盘。
- 与永久性磁盘相比,本地 SSD 的读写速度更快(请参阅本地 SSD 性能)。
- 每个本地 SSD 的大小 375 GB 是固定的,但您可以挂接多个本地 SSD 以 增加 SSD 存储空间(请参阅 添加本地 SSD)。
- 每个本地 SSD 都会装载到 Managed Service for Apache Spark 集群节点中的
/mnt/<id>。 - 本地 SSD 使用
ext4作为默认文件系统。
使用本地 SSD
Google Cloud 控制台
创建集群并将本地 SSD 挂接到节点:
- 打开 Managed Service for Apache Spark 创建集群页面。
- 点击其他配置 以展开该部分。
- 修改主要工作器 和辅助工作器 以配置本地 SSD 设置。
- 默认情况下,驱动器(主)节点设置与主要工作器设置相同。 在其他配置 下,您可以点击驱动器节点 以取消选中将默认驱动节点设为与主要工作器相同 复选框,然后指定驱动器节点设置。
gcloud CLI 命令
将
gcloud dataproc clusters create
命令与 --num-master-local-ssds、
--num-workers-local-ssds 和
--num-secondary-worker-local-ssds 标志结合使用,可将本地
SSD 挂接到集群的主节点、主工作器节点和辅助工作器
节点。
可以使用 SCSI
(小型计算机系统接口)或 NVME(非易失性快速内存)接口将本地 SSD 挂接到 Managed Service for Apache Spark 虚拟机(请参阅
本地 SSD 性能)。
默认的 Managed Service for Apache Spark 集群虚拟机本地 SSD
接口是 SCSI 接口。将
gcloud dataproc clusters create
命令与 --master-local-ssd-interface、
--worker-local-ssd-interface 和
--secondary-worker-local-ssd-interface 标志
结合使用,可以为主节点、主要工作器节点和辅助工作器节点指定本地 SSD
接口。
示例:
gcloud dataproc clusters create cluster-name \ --region=region \ --num-master-local-ssds=1 \ --num-worker-local-ssds=1 \ --num-secondary-worker-local-ssds=1 \ --master-local-ssd-interface=NVME \ --worker-local-ssd-interface=NVME \ --secondary-worker-local-ssd-interface=NVME \ ... other args ...
REST API
在 cluster.create API 请求的 masterConfig、workerConfig 和 secondaryWorkerConfig
InstanceGroupConfig 中设置 numLocalSsds 字段,可以将本地 SSD 挂接到集群的主实例、主要工作器和辅助工作器节点。
可以使用 SCSI
(小型计算机系统接口)或 NVME(非易失性快速内存)接口将本地 SSD 挂接到 Managed Service for Apache Spark 虚拟机(请参阅
本地 SSD 性能)。
默认的 Managed Service for Apache Spark 集群虚拟机本地 SSD
接口是 SCSI 接口。在 cluster.create API 请求的 masterConfig、workerConfig 和 secondaryWorkerConfig
InstanceGroupConfig 中设置 localSsdInterface 字段可以指定“SCSI”或“NVME”接口,以将本地 SSD 挂接到集群的主节点、主要工作器节点和辅助工作器节点。