Gemini 模型的偏好调优简介

借助 Gemini Enterprise Agent Platform 偏好调优,您可以使用人类反馈数据来调优 Gemini 模型。

偏好调优使模型能够从主观用户偏好中学习,而这些偏好很难通过使用特定标签或仅通过监督式微调来定义。

偏好调优输入数据集包含由提示和一对响应组成的示例,这些示例指明了哪个响应是首选响应,哪个响应是不首选响应。模型会学习以更高的概率生成首选响应,并以更低的概率生成不首选响应。

如需了解如何准备数据集,请参阅 为 Gemini 模型准备偏好调优数据

支持的模型

以下 Gemini 模型支持偏好调优:

点击即可展开支持的模型

限制

规范
模态 文本
训练数据集的文件大小 1GB
每个训练示例的输入和输出 token 数上限 131,072
输入和输出传送 token 数上限 与基础 Gemini 模型相同
训练数据集中的训练示例数上限 1,000 万个纯文本训练样本
验证数据集大小上限 5000 个样本;如果验证样本超过 1000 个,则为训练样本数量的 30%
适配器大小 支持的值包括 1、2、4、8 和 16

最佳做法

在将偏好优化算法应用于模型之前,我们强烈建议您执行以下操作:

  1. 使用 监督式微调 对首选响应数据进行模型调优。这会训练模型在推理期间生成首选响应。
  2. 继续调优 使用偏好调优从第 1 步生成的检查点。这会训练模型增加首选响应和不首选响应之间的可能性差距。

如需创建监督式微调数据集,请使用偏好数据集中的提示和接受的响应对作为监督式微调数据集的提示和目标。通常,一个或两个监督式微调周期就足够了,但具体情况可能会因数据集大小以及训练数据集与 Gemini 模型最初的对齐程度而异。

如需使用监督式微调来调优模型,请按照 使用监督式微调来调优 Gemini 模型中的步骤操作。

Quota

系统对并发调优作业的数量实施配额。每个项目都配有运行至少一个调优作业的默认配额。这是一个全球配额,所有可用区域和支持的模型共用这一配额。如果要同时运行更多作业,则需要为 Global concurrent tuning jobs 申请更多配额

价格

您可以在此处查看 Gemini 偏好调优的价格 :Gemini Enterprise Agent Platform 价格

为了便于计费,每个调优示例的 token 数按以下方式计算:将提示中的 token 数乘以 2,然后加上补全 token 数。

后续步骤