强化学习是一种强大的技术,可用于调整大语言模型 (LLM),以最大限度地提高用户定义的奖励函数提供的反馈奖励。模型会探索许多可能的答案,观察每个答案的数值奖励,并逐渐调整其行为,以便更有可能生成高奖励答案,而不太可能生成低奖励答案。这种方法非常适合需要多步推理、复杂决策或理解提示中细微差别的场景。
通过对 Gemini 进行强化学习微调,您可以使用自己的提示和自行定义的奖励函数来微调 Gemini。 您可以使用它来提升 Gemini 模型在您自己的应用场景和智能体工作流中的推理能力和输出质量。
工作原理
强化学习微调通过迭代方式来优化 LLM 的行为。在每次迭代期间,模型都会针对一组提示生成回答。然后,系统会通过用户定义的奖励函数来评估这些回答,该函数会根据您所需的标准来量化生成输出的质量。该服务会使用此奖励信号,通过强化学习算法更新模型的参数,以鼓励带来更高奖励的行为。通过这种生成、评估和更新的迭代过程,模型可以学习并适应您的特定应用场景。
下图显示了强化学习微调的总体工作流程:
主要特性
可自定义的奖励函数:定义您自己的奖励函数,以便针对各种自定义使用情形进行精确优化,并使模型的行为与特定目标保持一致。如需详细了解支持的奖励类型,请参阅奖励函数页面。
用于高效调优的适配器:强化学习微调使用适配器,可在重用现有服务基础架构的同时实现有效适应。
多种思考水平:该服务支持在两种思考水平(
MINIMAL和HIGH[动态思考])下进行调优,因此您可以选择最适合模型学习目标和所需回答生成模式的方法。如需了解详情,请参阅超参数页面。持续调优:通过纳入更多训练示例或周期,进一步优化之前已调优的模型。使用已调优的模型或检查点作为基础,可以更高效地进行调优实验。如需了解详情,请参阅持续调优页面。
多模态数据集:支持文本、图片、视频和音频数据模态。
何时使用强化学习微调
在无法通过监督学习明确最佳策略的情况下,最好使用强化学习微调来微调 LLM。这包括以下任务:目标是优化特定指标,但没有现成的标准答案标签;与人类偏好保持一致至关重要(并且存在判断方法);以及受益于迭代改进和探索的推理密集型任务。
在以下场景中,最好使用强化学习微调:
复杂指令遵循:当模型需要遵循复杂的指令时,“正确”的输出不是单个答案,而是需要进行一系列检查。强化学习可以帮助模型学习如何处理这些复杂的指令集。
创意内容生成:对于生成创意写作、诗歌或高度专业化的代码等任务,很难定义客观指标。通过精心设计的奖励函数(可能涉及人类反馈或专家评估)进行强化学习,可以引导模型生成更理想、更具创新性的输出。
推理任务:对于需要大量推理的任务(例如解决字谜或数学问题),强化学习可以激励模型探索不同的“思维”序列,从而了解哪种推理模式最能有效地解决问题。
支持的型号和区域
以下 Gemini 模型支持强化学习微调:
Gemini 3.5 Flash
| 规范 | 值 |
|---|---|
| 支持模型调优的端点 |
|
| 支持的端点(用于提供经过调整的模型) |
|
| API 版本 | 仅使用 v1beta1 |
支持的调优模态
强化学习微调支持在微调数据集中使用以下数据模态:
- 文本
- 音频
- 图片
- 视频
如需了解每种模态的数据集限制(例如每个提示的文件数量上限、文件大小上限和总长度上限),请参阅调整数据集页面。
持续调优
您可以将之前调优作业的输出用作新的强化学习微调作业的基础。支持以下持续调优模式:
- 监督式微调 → 强化学习微调
- 强化学习微调 → 强化学习微调
如需了解配置详情,请参阅持续调优页面。
应用调优后的模型
在基础 Gemini 模型上成功完成强化学习微调作业后,系统会将基于最后一个检查点的调优模型部署到您项目中的端点。调优后的模型使用与基础模型相同的服务端点策略。例如,如果您在 us-central1 中运行调优作业,调优后的模型会部署到 us 多区域端点 (mREP)。
如需检索已部署的调优后模型端点并针对该端点运行推理,请参阅快速入门页面。
价格
调优价格
Gemini 的强化学习微调分两个阶段生成令牌:抽样阶段和训练阶段。训练阶段生成的令牌会根据 Gemini Enterprise Agent Platform 价格页面中的“模型调优”部分收费。
推理价格
调优完毕后,调优后模型的推理(预测请求)仍然会产生费用。对于从 Gemini 3 开始的模型推理,调优后模型端点的预测价格是基本模型价格的 1.5 倍。如需了解详情,请参阅可用的 Gemini 稳定模型版本。
如果您将 Gen AI Evaluation Service 配置为在调优期间自动运行,则评估会按批量预测作业收费。如需了解详情,请参阅 Gemini Enterprise Agent Platform 价格页面中的“模型调优”部分。
后续步骤
- 按照快速入门中的步骤创建您的第一个强化学习微调作业。
- 了解如何准备调优数据集并配置奖励函数。
- 了解如何部署调优后的 Gemini 模型。