本教程介绍如何使用 MaxText 和 Cluster Toolkit 在张量处理单元 (TPU) v6e-64 集群上运行多主机强化学习 (RL) 训练。您可以使用
Cluster Toolkit 执行
多主机训练工作负载,并将结果导出回 Hugging Face 格式
以进行服务。
目标
- 安装 Cluster Toolkit 及其依赖项。
- 部署 Cluster Toolkit 集群。
- 将 Hugging Face 模型转换为 MaxText 格式。
- 在 TPU v6e 集群上运行 RL 训练工作负载。
- 将经过微调的模型转换回 Hugging Face 格式以进行服务。
费用
在本文档中,您将使用的以下收费组件: Google Cloud
您可使用 价格计算器 根据您的预计使用情况来估算费用。
完成本文档中描述的任务后,您可以通过删除所创建的资源来避免继续计费。如需了解详情,请参阅 清理。
准备工作
您需要拥有 Hugging Face 访问令牌才能使用本教程。您可以在 Hugging Face 上注册 免费账号。拥有账号后,请生成访问令牌:
- 在欢迎使用 Hugging Face页面上, 点击您的账号头像,然后选择访问令牌。
- 在访问令牌 页面上,点击创建新令牌 。
- 选择读取 令牌类型,然后输入令牌的名称。
- 系统会显示您的访问令牌。请将令牌保存在安全的位置。
- 在 Hugging Face 网站上,接受您计划训练的模型的许可
协议。本教程使用模型
gemma4-26b。
如需获得完成本教程所需的权限,请让您的管理员为您授予项目的以下 IAM 角色:
-
如需完成本教程:
- TPU 管理员 (
roles/tpu.admin) - 服务账号用户 (
roles/iam.serviceAccountUser) - Compute 编辑者 (
roles/compute.editor) - 存储管理员 (
roles/storage.admin)
- TPU 管理员 (
如需详细了解如何授予角色,请参阅管理对项目、文件夹和组织的访问权限。
设置环境变量
设置环境变量:
替换以下内容:
- YOUR_PROJECT_ID:您的 Google Cloud 项目的 ID。
- YOUR_REGION:您要在其中部署 集群的区域。
- YOUR_ZONE:您要在其中部署 集群的可用区。
- YOUR_CLUSTER_NAME:您的 Google Kubernetes Engine 集群的名称。
- YOUR_BUCKET_NAME:Cloud Storage 存储桶的全局唯一名称。
- YOUR_RESERVATION_NAME:预留的名称。
- YOUR_HF_TOKEN:您的 Hugging Face 访问令牌。
安装 Cluster Toolkit 依赖项
如需从 Linux 或 macOS 客户端或工作站完成本教程,请按照 Cluster Toolkit 文档中 安装依赖项中的相关步骤操作。
如果您使用的是 Cloud Shell,则可以跳过此部分。
安装 Cluster Toolkit
按照 安装 Cluster Toolkit中的说明安装 Cluster Toolkit 的预构建软件包。
创建 Cluster Toolkit 集群
如需创建和部署包含 64 个 v6e TPU 芯片的 Cluster Toolkit 集群,请完成以下步骤:
创建 Cloud Storage 存储桶:
默认情况下,集群节点池服务帐号没有写入 Cloud Storage 存储桶所需的权限。如需允许节点池服务帐号写入 Cloud Storage 存储桶,您必须为其授予
Storage Admin角色。如需授予此角色,请通过更新名为node_pool_service_account的service-account模块 来修改文件gke-tpu-v6e-advanced.yaml:使用蓝图
gke-tpu-v6e-advanced.yaml并使用--vars标志传递所需变量来部署 Cluster Toolkit 集群:
将模型转换为 MaxText 格式
如需以 MaxText 格式训练模型,您必须将其从 Hugging Face 格式转换为 MaxText 格式。
如需简化后续命令,请配置默认项目、集群和位置:
将模型从 Hugging Face 格式转换为 MaxText 格式,并将其存储在 Cloud Storage 存储桶中:
检查转换作业的状态:
启动训练工作负载
转换过程完成后,启动 RL 训练工作负载:
检查训练作业的状态:
将经过训练的模型转换回 Hugging Face 格式
训练工作负载完成后,将模型转换回 Hugging Face 格式:
检查转换作业的状态:
清理
为避免产生额外费用,请删除在本教程中创建的资源:
后续步骤
- 如需详细了解 Cloud TPU,请参阅 Cloud TPU 简介。
- 如需了解
v6e-64TPU 的架构和配置详情,请参阅 TPU v6e。 - 如需详细了解 Cluster Toolkit,请参阅 Cluster Toolkit 概览。