Gemini 模型的强化学习微调简介

强化学习是一种强大的技术,可用于调整大语言模型 (LLM),以最大限度地提高用户定义的奖励函数提供的反馈奖励。模型会探索许多可能的答案,观察每个答案的数值奖励,并逐渐调整其行为,以便更有可能生成高奖励答案,而不太可能生成低奖励答案。这种方法非常适合需要多步推理、复杂决策或理解提示中细微差别的场景。

通过对 Gemini 进行强化学习微调,您可以使用自己的提示和自行定义的奖励函数来微调 Gemini。 您可以使用它来提升 Gemini 模型在您自己的应用场景和智能体工作流中的推理能力和输出质量。

工作原理

强化学习微调通过迭代方式来优化 LLM 的行为。在每次迭代期间,模型都会针对一组提示生成回答。然后,系统会通过用户定义的奖励函数来评估这些回答,该函数会根据您所需的标准来量化生成输出的质量。该服务会使用此奖励信号,通过强化学习算法更新模型的参数,以鼓励带来更高奖励的行为。通过这种生成、评估和更新的迭代过程,模型可以学习并适应您的特定应用场景。

下图显示了强化学习微调的总体工作流程:

强化学习微调反馈环:模型从未加标签的输入中抽样输出,奖励函数(基于函数、基于大语言模型或自定义)对每个输出进行评分,RL 微调步骤通过策略梯度下降法更新模型权重。该循环会生成微调后的 LLM 检查点。
Gemini 模型的强化学习微调反馈环。

主要特性

  • 可自定义的奖励函数:定义您自己的奖励函数,以便针对各种自定义使用情形进行精确优化,并使模型的行为与特定目标保持一致。如需详细了解支持的奖励类型,请参阅奖励函数页面。

  • 用于高效调优的适配器:强化学习微调使用适配器,可在重用现有服务基础架构的同时实现有效适应。

  • 多种思考水平:该服务支持在两种思考水平(MINIMALHIGH [动态思考])下进行调优,因此您可以选择最适合模型学习目标和所需回答生成模式的方法。如需了解详情,请参阅超参数页面。

  • 持续调优:通过纳入更多训练示例或周期,进一步优化之前已调优的模型。使用已调优的模型或检查点作为基础,可以更高效地进行调优实验。如需了解详情,请参阅持续调优页面。

  • 多模态数据集:支持文本、图片、视频和音频数据模态。

何时使用强化学习微调

在无法通过监督学习明确最佳策略的情况下,最好使用强化学习微调来微调 LLM。这包括以下任务:目标是优化特定指标,但没有现成的标准答案标签;与人类偏好保持一致至关重要(并且存在判断方法);以及受益于迭代改进和探索的推理密集型任务。

在以下场景中,最好使用强化学习微调:

  • 复杂指令遵循:当模型需要遵循复杂的指令时,“正确”的输出不是单个答案,而是需要进行一系列检查。强化学习可以帮助模型学习如何处理这些复杂的指令集。

  • 创意内容生成:对于生成创意写作、诗歌或高度专业化的代码等任务,很难定义客观指标。通过精心设计的奖励函数(可能涉及人类反馈或专家评估)进行强化学习,可以引导模型生成更理想、更具创新性的输出。

  • 推理任务:对于需要大量推理的任务(例如解决字谜或数学问题),强化学习可以激励模型探索不同的“思维”序列,从而了解哪种推理模式最能有效地解决问题。

支持的型号和区域

以下 Gemini 模型支持强化学习微调:

Gemini 3.5 Flash

规范
支持模型调优的端点
  • us-central1us-central1-aiplatform.googleapis.com
  • europe-west4europe-west4-aiplatform.googleapis.com
支持的端点(用于提供经过调整的模型)
  • us-central1 中进行调整时,us 多区域端点 (aiplatform.us.rep.googleapis.com)
  • europe-west4 中进行调整时,eu 多区域端点 (aiplatform.eu.rep.googleapis.com)
API 版本 仅使用 v1beta1

支持的调优模态

强化学习微调支持在微调数据集中使用以下数据模态:

  • 文本
  • 音频
  • 图片
  • 视频

如需了解每种模态的数据集限制(例如每个提示的文件数量上限、文件大小上限和总长度上限),请参阅调整数据集页面。

持续调优

您可以将之前调优作业的输出用作新的强化学习微调作业的基础。支持以下持续调优模式:

  • 监督式微调 → 强化学习微调
  • 强化学习微调 → 强化学习微调

如需了解配置详情,请参阅持续调优页面。

应用调优后的模型

在基础 Gemini 模型上成功完成强化学习微调作业后,系统会将基于最后一个检查点的调优模型部署到您项目中的端点。调优后的模型使用与基础模型相同的服务端点策略。例如,如果您在 us-central1 中运行调优作业,调优后的模型会部署到 us 多区域端点 (mREP)。

如需检索已部署的调优后模型端点并针对该端点运行推理,请参阅快速入门页面。

价格

调优价格

Gemini 的强化学习微调分两个阶段生成令牌:抽样阶段和训练阶段。训练阶段生成的令牌会根据 Gemini Enterprise Agent Platform 价格页面中的“模型调优”部分收费。

推理价格

调优完毕后,调优后模型的推理(预测请求)仍然会产生费用。对于从 Gemini 3 开始的模型推理,调优后模型端点的预测价格是基本模型价格的 1.5 倍。如需了解详情,请参阅可用的 Gemini 稳定模型版本

如果您将 Gen AI Evaluation Service 配置为在调优期间自动运行,则评估会按批量预测作业收费。如需了解详情,请参阅 Gemini Enterprise Agent Platform 价格页面中的“模型调优”部分。

后续步骤