针对强化学习微调的持续调优

通过持续调优,您可以添加更多周期或训练示例,继续调优已调优的模型或模型检查点。使用已调优的模型或检查点作为基础模型,可以更高效地进行调优实验。

您可以出于以下目的使用持续调优:

  • 如果现有调优模型出现欠拟合,则使用更多数据进行调优。
  • 为了提升性能或使模型能够根据新数据及时更新。
  • 进一步自定义现有的调优模型。

支持的持续调优模式

支持以下持续调优模式:

  • 监督式微调 → 强化学习微调
  • 强化学习微调 → 强化学习微调

配置持续调优

如需配置持续调优作业,请在请求正文中添加 preTunedModel 块,该块指向之前调优的模型(以及可选的特定检查点)。请求的其余部分遵循与新的强化学习微调作业相同的架构。

{
  "description": string,
  "tunedModelDisplayName": string,
  "reinforcementTuningSpec": {
    "trainingDatasetUri": "TRAINING_DATASET",
    "validationDatasetUri": "VALIDATION_DATASET",
    "hyperParameters": "HYPER_PARAMETERS",
    "singleRewardConfig": "REWARD_CONFIG"
  },
  "preTunedModel": {
    "tunedModelName": "projects/PROJECT_ID/locations/LOCATION_ID/models/PRETUNED_MODEL_ID",
    "checkpointId": "CHECKPOINT_ID"
  }
}

正文中的占位符如下:

  • TRAINING_DATASET:训练数据集 JSONL 文件的 Cloud Storage URI。
  • VALIDATION_DATASET:验证数据集 JSONL 文件的 Cloud Storage URI。可选。
  • HYPER_PARAMETERS: 持续调优作业的超参数配置。如需了解详情,请参阅 超参数 页面。
  • REWARD_CONFIG:奖励配置。如需了解详情,请参阅 奖励函数 页面。
  • PROJECT_ID:您的 Google Cloud 项目 ID。
  • LOCATION_ID:位置 ID。
  • PRETUNED_MODEL_ID:之前调优的模型(将从该模型继续调优)的模型 ID 。
  • CHECKPOINT_ID:之前调优的模型的特定检查点的 ID。可选 - 如果省略,则使用预调优模型的最新检查点。

后续步骤