快速入门:使用 Google Cloud 控制台进行强化学习微调

本页面将引导您完成在 Google Cloud 控制台中对 Gemini 模型进行强化学习微调的端到端工作流:创建调优作业、检查其状态、检索调优后的模型端点,以及针对该端点运行推理。 如需使用 Agent Platform API 完成这些任务,请参阅 API 快速入门

开始之前,请参阅强化学习微调简介,了解此功能、支持的模型和支持的区域。

创建强化学习微调作业

如需使用 Google Cloud 控制台创建强化学习微调作业,请执行以下步骤:

  1. 在 Google Cloud 控制台中,前往模型 > 调优页面。

    前往调优

  2. 点击创建经调整的模型

  3. 模型详情部分,配置以下内容:

    1. 调优方法下,选择强化学习微调
    2. 已调优模型的名称字段中,输入调优后模型的名称(例如 my-rl-tuned-model)。
    3. 基础模型下,选择对基础模型进行调优
    4. 基础模型下拉列表中,选择要调优的模型(例如 gemini-3.5-flash)。
    5. 区域下拉列表中,选择运行调优作业的区域(例如 us-central1 (Iowa))。调优后得到的模型将通过 us 多区域端点提供服务。如需查看支持的调优和服务提供区域的完整列表,请参阅支持的模型和区域部分。
    6. 可选:展开高级选项以自定义超参数:
      • 周期数:训练周期数(例如,15)。
      • 学习速率调节系数:用于缩放学习速率的调节系数(例如 1.0)。
      • 适配器大小:用于参数高效调优的适配器大小(例如 16)。
      • 每个提示的样本数:模型在训练期间针对每个提示生成的候选回答数量(例如 16)。
      • 思考等级:推理模型的思考等级(例如 HIGH)。
      • 批次大小:每个批次的训练示例数量(例如 32)。
      • 检查点间隔:保存中间检查点的步数频率(例如 5)。
      • 输出 token 数上限:每个样本生成的输出 token 数上限(例如 32768)。
      • 评估间隔:针对验证数据集运行评估的频率(以步数为单位,例如 5)。
    7. 点击继续
  4. 奖励配置部分中,配置一个或多个奖励函数,以便在训练期间对模型响应进行评分:

    1. 奖励名称字段中,输入奖励函数的唯一名称(例如 my_reward_function_name)。监控视图中发出的指标会以该名称为前缀。
    2. 奖励类型下拉列表中,选择得分手类型:
      • 字符串匹配奖励:使用完全匹配或正则表达式将生成的文本与参考文本进行比较。
      • 基于 LLM 的奖励:使用 Gemini 模型作为自动评分器,根据评估提示对回答进行评分。
      • 基于 Python 函数的奖励:在安全沙盒中执行自定义 Python 代码来评估回答。
      • 通过 Cloud Run 实现完全自定义的奖励:调用 Cloud Run 上托管的外部 HTTP 端点来评估回答。
    3. 为所选奖励类型配置设置。例如,对于 Cloud Run 奖励:

      • Cloud Run URI 字段中,输入已部署服务的 HTTPS URI(例如 https://my.cloud.run.uri)。
      • 解析类型字段中,选择 IDENTITY

      或者,对于字符串匹配奖励:

      • 解析类型字段中,选择 REGEX_EXTRACTIDENTITY。 如果您选择 REGEX_EXTRACT,请在正则表达式提取表达式中输入正则表达式(例如 \text{(.*)})。
      • 错误回答奖励字段中,输入错误回答的惩罚(例如 -1)。
      • 正确答案奖励字段中,输入正确回答的分数(例如 1)。
      • 字符串匹配表达式类型下,选择字符串匹配JSON 匹配
      • 匹配操作下拉列表中,选择匹配逻辑(例如,完全匹配)。
      • 表达式字段中,输入参考表达式(例如 references.reference)。
    4. 奖励权重字段中,输入相应奖励函数的相对权重(例如 1)。

    5. 点击完成

    6. 可选:如需定义复合奖励,请点击 + 添加其他奖励,然后配置其他奖励函数。您最多可以添加 16 个奖励函数,并为每个函数分配相对权重。

    7. 点击继续

  5. 测试奖励(可选)部分中,在开始调整作业之前验证奖励配置:

    1. 训练示例字段中,输入包含 contentsreferences 的 JSON 对象示例。
    2. 模型回答示例字段中,输入候选回答,或点击根据训练示例生成,以使用基础模型生成回答示例。
    3. 点击测试
    4. 验证评估是否成功,并检查计算出的得分。如果使用复合奖励,请点击查看单项奖励信息,以检查每项奖励的得分细分情况。
    5. 点击继续
  6. 调整数据集下,指定存储在 Cloud Storage 中的数据集文件:

    1. 训练数据集字段中,输入训练数据集 JSONL 文件的 Cloud Storage URI(例如 gs://path/to/my/training_dataset.jsonl)。
    2. 验证数据集字段中,输入验证数据集 JSONL 文件的 Cloud Storage URI(例如 gs://path/to/my/eval_dataset.jsonl)。
    3. 点击开始调整

检查强化学习微调作业的状态

点击开始调优后,控制台会重定向到模型 > 调优页面。在“调节作业”表格中,您新创建的作业会显示在列表顶部附近,并包含以下详细信息:

  • 模型名称:您为调优后模型指定的显示名称。
  • 状态:调优作业的当前状态(例如待处理正在运行成功)。
  • 方法Reinforcement Learning
  • 基本模型:基础模型或预调优模型。
  • 区域:运行调优作业的位置。

点击模型名称以打开调优作业详情页面。该页面包含以下标签页:

  • Monitor:显示调优进度和交互式指标图表:
    • 调参进度:显示作业是正在运行还是已完成。
    • 组合图表:如果提供了验证数据集,系统会将训练曲线和验证曲线(例如 /train_mean_reward/eval_mean_reward)一起绘制在同一图表上。
    • 可收起的图表组:指标图表分为多个组,包括一般调优指标(平均奖励、生成令牌长度、思考 Token 长度、抽样延迟时间和奖励延迟时间)和以 ${reward_name} 为前缀的每个奖励的指标。
    • 检查点注释:在调优期间保存的中间检查点会直接在图表中沿训练时间轴进行注释。
    • 过滤条件栏:使用过滤条件栏按名称搜索指标或按类别 (Show Category) 过滤。过滤后,过滤条件栏会固定在视图顶部。
    • 检查点表格:列出了已保存的中间检查点,其中包含步数和指标值。使用列选择器选择要显示的列。
  • 数据集:显示数据集详细信息、对话示例和参考值。
  • 详细信息:总结作业配置,包括基础模型、调优方法、超参数和奖励配置。点击奖励配置卡片上的查看详情,即可查看非默认参数值。

如需查看已发出指标的完整列表以及如何解读这些指标,请参阅指标和监控页面。

训练时间

训练时间受以下因素影响:

根据您的设置,Gemini 强化学习微调作业可以运行数小时到数天。

获取经过调整的模型端点

调优作业达到成功状态后,模型检查点会部署到端点。您可以直接在Google Cloud 控制台中查看和管理已部署的调优模型:

  1. 在调优作业详情页面的标题中,点击查看模型详情。 系统会打开Model Registry页面,其中包含已调优模型的详细信息。
  2. 在模型详情页面上,找到部署和测试标签页,查看已部署的端点资源路径(格式为 projects/{PROJECT_ID}/locations/{LOCATION}/endpoints/{ENDPOINT_ID})。
  3. 或者,在调优作业详情页面的监控标签页中,找到检查点表格,以检查中间检查点。 您可以单独部署和评估各个检查点。

如果调优作业在 us-central1 中运行,则调优后的模型会通过 us 多区域端点提供服务。

对调优后的模型运行推理

您可以在Google Cloud 控制台中直接测试并对调优后的模型运行推理,具体操作如下:

  1. 在调优作业详情页面的标题中,点击测试

    Agent Studio 随即打开,并预先选择您的调优模型。

  2. 在提示字段中,输入输入提示(例如 "Why is the sky blue?" 或目标网域中的问题)。

  3. 点击运行(或发送)以生成回答。

  4. 查看生成的输出,评估模型在多大程度上遵循了您所需的推理风格、格式和奖励目标。

后续步骤