Gemini 提炼服务 (提炼)允许用户训练一个较小但更高效的“学生”模型,该模型使用较大且功能更强大的“教师”模型的输出和推理模式。虽然前沿模型定义了 AI 的最前沿,但对于特定的企业使用场景,它们可能会过度配置。提炼弥合了这一差距,实现了生产级效率(更低的延迟时间和费用),同时让较小的模型能够实现更深层次的推理。
与仅使用最终文本输出的标准监督式微调 (SFT) 不同,提炼利用了以下内容:
- 教师回答:最终文本输出。
- 原始想法:教师 模型生成的内部推理路径。
支持的模型
在优享先机期间,提炼支持以下模型:
- 教师模型:
gemini-3.1-pro - 学生模型:
gemini-2.5-flash

图 1. Gemini 提炼服务的工作方式系统图示。
适用的使用场景
在以下情况下,建议使用提炼而不是标准提示或监督式微调 (SFT):
- 高容量、对延迟时间敏感的应用:当您的应用 需要 Pro 级模型的推理能力,但必须满足严格的 延迟时间 SLA 或预算限制,因此需要 Flash 级模型时。
- 缺少标准答案数据(SFT 不可行):当您拥有大量 用户提示或查询数据集,但缺乏资源来手动标记 或生成标准 SFT 所需的高质量标准答案时。
- 复杂的推理任务:涉及多步逻辑、摘要 高度技术性文档或复杂的编码任务,其中基本 Flash 模型难以胜任,但 Pro 模型可以成功完成。
- 显著的性能差距:当教师模型在您的特定任务上显著 优于基本学生模型时,为提炼期间的知识转移提供了明确的 优势。
前提条件和项目设置
在开始提炼作业之前,请确保您的 Google Cloud 环境已 正确配置:
- 请求访问许可名单:确保您的 Google Cloud 项目 ID 已 添加到 Gemini 提炼服务优享先机的许可名单中。 请与您的 Google 销售代表联系,将您的项目添加到许可名单。
- 启用 API:在您的 Google Cloud 项目中启用 Agent Platform API。
- 设置 IAM 角色权限:您必须拥有
Agent Platform Administrator (
roles/aiplatform.admin) IAM 角色。 - 设置区域:提炼作业必须在
us-central1区域中运行。
数据集准备
此服务的一项关键功能是使用仅包含提示的数据集 。由于教师模型在提炼过程中生成目标输出,因此您无需提供预期答案。
数据集要求
数据集必须采用 JSON 行 (JSONL) 格式,并存储在 Cloud Storage 存储桶中。除了以下内容之外,每个条目都必须遵循 Gemini 调优数据集格式, 此外:
- 系统指令:您可以添加可选的
systemInstruction字段(具有“系统”角色)来定义系统提示。 - 输入:主要输入需要内容字段(具有“用户”角色)。
多轮提示:您可以在“用户”和“模型”角色之间交替, 前提是序列中的最后一个条目是“用户”。
以下是两个 dataset.jsonl 文件示例:
{
"contents": [
{
"role": "user",
"parts": [
{
"text": "You're the artist here. Choose as many strands of thread as you like, as long as you're using three or more. Go for color combinations that you think would make a pretty pattern. Get creative! If you only use one color of thread, you won't be able to create a pattern.\n\nProvide a summary of the article in two or three sentences:\n\n"
}
]
}
]
},
{
"contents": [
{
"role": "user",
"parts": [
{
"text": "You're the artist here. Choose as many strands of thread as you like, as long as you're using three or more. Go for color combinations that you think would make a pretty pattern. Get creative! If you only use one color of thread, you won't be able to create a pattern.\n\nProvide a summary of the article in two or three sentences:\n\n"
}
]
},
{
"role": "model",
"parts": [
{
"text": "Choose several strands of embroidery thread in a variety of colors."
}
]
},
{
"role": "user",
"parts": [
{
"text": "You will need one egg (raw or hard boiled but hard boiled is best) and one spoon for each person participating in the race. You might even like to use dyed Easter eggs as something special for Easter. It's best to have this race on grass or some other soft surface, to give dropped eggs a chance!"
}
]
}
]
}
最佳做法
创建数据集时,请遵循以下准则:
- 大小:建议至少使用 1,000 个示例,以显著提高质量 。
- 多样性:确保您的提示涵盖生产流量中预期的极端情况和不同长度 。
配置提炼请求
提炼作业需要配置教师的生成行为和学生的训练超参数。
配置教师模型的生成行为
您必须定义教师模型如何响应您的数据集。学生模型的质量直接取决于教师输出的质量。如需配置教师模型的生成行为,请设置 candidateCount:
candidateCount:要生成的回答变体的数量。(示例:4。范围[1, 5])。如果未在请求中指定,则将使用默认值4。
设置提炼超参数
提炼超参数控制学生模型的训练过程。如需详细了解 Gemini Enterprise Agent Platform 中的超参数,请参阅 监督式微调指南的“创建调优作业”部分。
创建提炼作业时,必须设置以下超参数:
epochCount:学生模型将迭代数据集的次数。(示例:20。范围[1, 100])。如果未指定,则使用默认值4。learningRateMultiplier:修改学生模型的基本学习速率。(示例:2.0。范围[0.25, 4])。如果未指定,则使用默认值1。
启动提炼作业
在优享先机期间,您可以使用 Agent Platform API 的 REST 版本提交和监控提炼作业。您可以启动新的提炼作业,也可以对已提炼的模型检查点执行持续调优。
创建新的提炼作业
创建一个名为 request.json 的 JSON 文件,其中包含您的作业配置。在以下示例中,教师的生成配置嵌套在 hyperParameters 字段中:
{
"description": "Distillation testing job.",
"baseModel": "gemini-2.5-flash",
"tunedModelDisplayName": "flash-distillation-run-1",
"distillationSpec": {
"promptDatasetUri": "gs://your-bucket/path/to/prompt_dataset.jsonl",
"validationDatasetUri": "",
"base_teacher_model": "gemini-3.1-pro-preview",
"hyperParameters": {
"epochCount": "20",
"learningRateMultiplier": 2.0,
"generation_config": {
"candidateCount": 5
}
}
}
}
使用 curl 提交作业:
curl -X POST \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs \
-d @request.json
执行持续调优
如果您想从之前提炼的模型检查点恢复调优,请在 request.json 文件中添加 preTunedModel 代码块。持续调优仅支持之前提炼的模型检查点,且具有相同的基本学生模型。不支持之前监督式微调的模型检查点(即使具有相同的基本学生模型)。
以下是为之前提炼的模型检查点设置持续调优的示例:
{
"description": "Continuous distillation testing job.",
"preTunedModel": {
"tunedModelName": "projects/YOUR_PROJECT_ID/locations/us-central1/models/PRETUNED_MODEL_ID@1",
"checkpointId": "1",
"baseModel": "gemini-2.5-flash"
},
"tunedModelDisplayName": "flash-distillation-continuous",
"distillationSpec": {
"promptDatasetUri": "gs://your-bucket/path/to/prompt_dataset.jsonl",
"validationDatasetUri": "",
"base_teacher_model": "gemini-3.1-pro-preview",
"hyperParameters": {
"epochCount": "20",
"learningRateMultiplier": 2.0,
"generation_config": {
"candidateCount": 5,
}
}
}
}
使用 curl 提交载荷:
curl -X POST \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs \
-d @request.json
监控提炼作业
提交响应将返回一个包含您的
JOB_ID的作业名称。您可以通过发送 GET 请求来检查作业的状态(state、错误和最终超参数):
curl -X GET \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
https://us-central1-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/us-central1/tuningJobs/JOB_ID
您还可以在 Google Cloud 控制台中直观地监控进度,方法是
依次前往 Agent Platform > 调优 ,然后选择
us-central1 区域。
对于此优享先机版本,Agent Platform 控制台界面存在以下已知限制:
- 教师抽样进度:教师 模型抽样过程没有进度小部件。虽然状态可能会显示“正在运行准备调优”,但作业在后台正常进行。
- 学生调优图表:在学生模型调优阶段,界面 会提供损失曲线和总训练文本词元数的图表。
- 检查点表:界面会显示中间检查点的表格 并提供指向生成的 Agent Platform 预测端点的链接以进行 评估。由于已知问题,此表中的“周期”列显示为“0”。
取消提炼作业
如需取消正在进行的提炼作业,请执行以下任一操作:
使用 Google Cloud 控制台,更改以下网址:
https://console.cloud.google.com/agent-platform/tuning/managed?project=YOUR_PROJECT_ID&vertex_ai_region=us-central1将 YOUR_PROJECT_ID 替换为您的项目 ID。
使用
curl发送 POST 请求以取消作业:curl -X POST \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json; charset=utf-8" \ https://us-central1-aiplatform.googleapis.com/v1beta1/projects/YOUR_PROJECT_ID/locations/us-central1/tuningJobs/YOUR_JOB_ID:cancel替换以下内容:
- 将
YOUR_PROJECT_ID替换为您的项目 ID。 - 将
YOUR_JOB_ID替换为您的作业 ID。
- 将
评估结果
提炼作业成功完成后,新的学生模型会自动注册到 Gemini Enterprise Agent Platform Model Registry 中,并创建一个或多个专用端点来提供预测。如需评估结果,请找到端点,发送预测请求,然后进行评估。
如需评估结果,请执行以下操作:
发送以下 GET 请求以查看调优作业的状态。
curl -X GET \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json; charset=utf-8" \ https://us-central1-aiplatform.googleapis.com/v1beta1/projects/YOUR_PROJECT_ID/locations/us-central1/tuningJobs/YOUR_JOB_ID替换以下内容:
- 将
YOUR_PROJECT_ID替换为您的项目 ID。 - 将
YOUR_JOB_ID替换为您的作业 ID。
- 将
已完成的作业会在
tunedModel对象内显示嵌套的endpoint字段。从返回的 路径字符串末尾提取ENDPOINT_ID(例如,projects/.../endpoints/YOUR_ENDPOINT_ID)。记下端点 ID。确保调优作业已成功完成,因为在调优作业仍在运行或失败时,端点不可用。如果缺少
endpoint字段,请通过查看作业的state或error键来调试调优作业。创建一个名为
generate_content_request.json的 JSON 载荷请求,其中包含您的提示:{ "contents": { "role": "user", "parts": [ { "text": "hi, say something" } ] } }使用以下 POST 示例发送预测请求:
curl -X POST \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ https://us-central1-aiplatform.googleapis.com/v1beta1/projects/YOUR_PROJECT_ID/locations/us-central1/endpoints/YOUR_ENDPOINT_ID:generateContent \ -d @generate_content_request.json替换以下内容:
YOUR_PROJECT_ID:您的项目 ID。YOUR_JOB_ID:您的作业 ID。ENDPOINT_ID:您的端点 ID。
执行以下操作来评估结果:
针对新提炼的模型运行留出测试集,使用训练数据中未包含的提示。
将输出与基本
gemini-2.5-flash模型进行比较,以衡量质量改进情况。将输出与
gemini-3.1-pro模型进行比较,以确定学生模型与教师模型的推理有多接近。
限制
下表介绍了提炼的限制:
提炼受以下限制:
- 模型限制:
- 请参阅支持的模型
- 数据集限制:
- 容量限制:
- 训练集的最大容量为 50,000 个示例。
- 源 JSONL 文件大小不得超过 1 GB。
- 上下文窗口规范:
- 该服务每个条目最多可容纳 8,000 个输入词元。 如果提供的 条目中有超过 10% 超出此既定阈值,提炼作业将终止。
- 教师模型抽样限制为最多输出 24,000 个词元。如果教师模型生成的词元超过 24,000 个,内容将在此限制处截断,这可能会 影响学生模型的性能。
- 模态:仅限于基于文本的数据。不支持多模态输入,包括视频、图片或函数调用。
- 容量限制:
- 配置和超参数限制
- 定义 distillationSpec 及其关联的超参数时,请遵循以下边界:
- 加密:对于涉及 Google 第一方模型的提炼任务,CMEK 不可用。
epochCount:限制为介于 1 到 100 之间的整数值。learningRateMultiplier:值必须在0.25-4.0的浮点范围内。
- 定义 distillationSpec 及其关联的超参数时,请遵循以下边界:
- 一步提炼:教师模型抽样和学生模型 调优在单个 API 调用中运行。如果您有大量数据要抽样,则必须在后续调优中再次抽样相同的数据。
获取访问权限
如果您有兴趣试用 Gemini 提炼服务,请通过 cloud-ai-tuning-service-support@google.com 与我们的 调优服务团队联系,请求访问权限并将项目添加到许可名单。
为确保最佳性能和资源管理,我们建议您为提炼任务创建一个 专用 Google Cloud 项目。与我们的团队联系时,请提供您的项目 ID 或项目编号,以加快许可名单添加过程。
配额和访问权限政策
以下配额和访问权限政策有效:
容量:最近添加到许可名单的项目将预配默认并发配额 4。为防止资源争用,我们建议您使用单独的项目,而不是已在运行其他 Gemini 调优作业的项目。
访问期限:首次访问权限的期限为 30 天。