通过持续调优,您可以添加更多周期或训练示例,继续调优已调优的模型或模型检查点。使用已调优的模型或检查点作为基础模型,可以更高效地进行调优实验。
您可以出于以下目的使用持续调优:
- 如果现有调优模型出现欠拟合,则使用更多数据进行调优。
- 为了提升性能或使模型能够根据新数据及时更新。
- 进一步自定义现有的调优模型。
支持的持续调优模式
支持以下持续调优模式:
- 监督式微调 → 强化学习微调
- 强化学习微调 → 强化学习微调
配置持续调优
如需配置持续调优作业,请在请求正文中添加 preTunedModel 块,该块指向之前调优的模型(以及可选的特定检查点)。请求的其余部分遵循与新的强化学习微调作业相同的架构。
{
"description": string,
"tunedModelDisplayName": string,
"reinforcementTuningSpec": {
"trainingDatasetUri": "TRAINING_DATASET",
"validationDatasetUri": "VALIDATION_DATASET",
"hyperParameters": "HYPER_PARAMETERS",
"singleRewardConfig": "REWARD_CONFIG"
},
"preTunedModel": {
"tunedModelName": "projects/PROJECT_ID/locations/LOCATION_ID/models/PRETUNED_MODEL_ID",
"checkpointId": "CHECKPOINT_ID"
}
}
正文中的占位符如下:
- TRAINING_DATASET:训练数据集 JSONL 文件的 Cloud Storage URI。
- VALIDATION_DATASET:验证数据集 JSONL 文件的 Cloud Storage URI。可选。
- HYPER_PARAMETERS: 持续调优作业的超参数配置。如需了解详情,请参阅 超参数 页面。
- REWARD_CONFIG:奖励配置。如需了解详情,请参阅 奖励函数 页面。
- PROJECT_ID:您的 Google Cloud 项目 ID。
- LOCATION_ID:位置 ID。
- PRETUNED_MODEL_ID:之前调优的模型(将从该模型继续调优)的模型 ID 。
- CHECKPOINT_ID:之前调优的模型的特定检查点的 ID。可选 - 如果省略,则使用预调优模型的最新检查点。
后续步骤
- 准备调优数据集 为持续调优作业。
- 为持续调优作业配置超参数 和 奖励函数。
- 在持续调优运行时, 监控作业状态和指标。