思考模型经过训练后,会在生成回答之前生成内部“思考过程”。因此,思考模型在推理、多步规划、数学问题解决和代码生成方面的能力比没有思考能力的模型更强。
默认情况下,所有 Gemini 模型都启用了思考过程。当您在 Gemini Enterprise Agent Platform 上使用 Agent Studio 时,可以查看完整的思考过程以及模型生成的回答。
支持的模型
以下模型支持思考功能:
点击即可展开支持的模型
- Gemini Omni Flash
- Gemini Omni 1.1 Flash
- Gemini 3.8 Flash
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash
- Gemini 3.1 Pro
- Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite)
- Gemini 3.1 Flash-Lite
- Gemini 3.1 Flash Image
- Gemini 3 Pro Image
- Gemini 3 Flash
- Gemini 2.5 Pro
- Gemini 2.5 Flash-Lite
- Gemini 2.5 Flash
控制模型思考
您可以控制模型在返回回答之前执行的思考量。控制思考的方法因模型版本而异。
Gemini 3 及更高版本的模型
Gemini 3 模型引入了 thinking_level 参数,该参数将思考预算配置简化为离散级别。如果不需要复杂的推理,您可以限制模型的
thinking_level,以获得更快、延迟更低的回答。
下表总结了每种模型支持的 thinking_level 值,以及每种模型的默认 thinking_level:
| 模型 | 支持的 thinking_level 值 |
默认 |
|---|---|---|
| Gemini 3.8 Flash | LOW、MEDIUM、HIGH |
MEDIUM |
| Gemini 3.7 Flash | LOW、MEDIUM、HIGH |
MEDIUM |
| Gemini 3.6 Flash | MINIMAL、LOW、MEDIUM、HIGH |
MEDIUM |
| Gemini 3.5 Flash-Lite | MINIMAL、LOW、MEDIUM、HIGH |
MINIMAL |
| Gemini 3.5 Flash | MINIMAL、LOW、MEDIUM、HIGH |
MEDIUM |
| Gemini 3.1 Pro | LOW、MEDIUM、HIGH |
HIGH |
| Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) | MINIMAL、HIGH |
MINIMAL |
| Gemini 3.1 Flash-Lite | MINIMAL、LOW、MEDIUM、HIGH |
MINIMAL |
| Gemini 3.1 Flash Image | MINIMAL、HIGH |
MINIMAL |
| Gemini 3 Pro Image | HIGH |
HIGH |
| Gemini 3 Flash | MINIMAL、LOW、MEDIUM、HIGH |
HIGH |
MINIMAL:限制模型最大限度地少用 token 进行思考,最适合不会受益于大量推理的低复杂程度任务。这是 Gemini 3.1 Flash-Lite 使用的默认级别。MINIMAL的思考预算尽可能接近于零 ,但仍需要 思考 签名。如果您在请求中未提供思考签名,模型会返回400错误。如需了解详情,请参阅思考 签名。from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MINIMAL ) ), ) print(response.text)LOW:限制模型使用较少的 token 进行思考,适合不需要进行大量推理的简单任务。LOW非常适合需要快速处理的高吞吐量任务:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.LOW ) ), ) print(response.text)MEDIUM:提供了一种均衡方法,适合中等复杂程度的任务,这些任务可以从推理中受益,但不需要进行深入的多步规划。该级别提供的推理能力比LOW强,而延迟时间比HIGH低:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MEDIUM ) ), ) print(response.text)HIGH:允许模型使用更多的 token 进行思考,适合需要深度推理的复杂提示,例如多步规划、经过验证的代码生成或高级函数调用场景。这是 Gemini 3 Pro 模型和 Gemini 3 Flash 使用的默认级别。 当处理您之前可能依赖专用推理模型来完成的任务时,请使用此配置:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="Find the race condition in this multi-threaded C++ snippet: [code here]", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.HIGH ) ), ) print(response.text)
对于 Gemini 3 Pro 和 Gemini 3.1 Pro,无法关闭思考功能。
如果您在针对 Gemini 3 模型的同一个请求中同时指定 thinking_level 和 thinking_budget,模型会返回错误。
Gemini 2.5 及更早版本的模型
对于 Gemini 3 之前的模型,您可以使用 thinking_budget 参数来控制思考,该参数设置模型可用于其思考过程的 token 数量上限。默认情况下,如果未设置 thinking_budget,模型会自动控制其思考量,最多为 8,192 个 token。如需通过 API 使用动态预算,请将
thinking_budget 设置为 -1。
如果您需要比默认思考预算更多或更少的 token,则可以手动设置 thinking_budget,以对 token 数量施加软上限。您可以为不太复杂的任务设置较低的
token 限额,为较复杂的任务设置较高的限额。请注意,这是一个软限制,因此总思考 token 数可能会有所不同。如果降低延迟更为重要,请使用较低的预算,或者将预算设置为
0,以防止思考内容随回答一起返回。
下表显示了您可以为每个受支持的模型设置的 thinking_budget 的最小量和最大量,以及每种模型的默认思考预算:
| 模型 | 最低 token 数额 | 最高 token 数额 | 默认 |
|---|---|---|---|
| Gemini 2.5 Flash | 1 | 24,576 | 自动(最多 8,192 个 token) |
| Gemini 2.5 Pro | 128 | 32,768 | 自动(最多 8,192 个 token) |
| Gemini 2.5 Flash-Lite | 512 | 24,576 | 自动(最多 8,192 个 token) |
如果在使用 Gemini 2.5 Flash 和 Gemini 2.5 Flash-Lite 时将 thinking_budget 设置为
0,则回答中不会返回任何思考内容。不过,模型的输出中可能仍会显示推理风格的文本。对于 Gemini 2.5
Pro,无法关闭思考功能。
如果您将 thinking_level 参数与早于 Gemini 3 的模型搭配使用,模型会返回错误。
控制台
- 依次打开 Agent Studio > 创建提示。
- 在模型 面板中,点击切换模型 ,然后从菜单中选择一个受支持的模型。
- 从思考预算下拉选择器中选择手动,然后使用滑块调整思考预算限额。
Python
安装
pip install --upgrade google-genai
如需了解详情,请参阅 SDK 参考文档。
设置环境变量以将 Google Gen AI SDK 与 Vertex AI 搭配使用:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
安装
npm install @google/genai
如需了解详情,请参阅 SDK 参考文档。
设置环境变量以将 Google Gen AI SDK 与 Vertex AI 搭配使用:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
了解如何安装或更新 Go。
如需了解详情,请参阅 SDK 参考文档。
设置环境变量以将 Google Gen AI SDK 与 Vertex AI 搭配使用:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
了解如何安装或更新 Java。
如需了解详情,请参阅 SDK 参考文档。
设置环境变量以将 Google Gen AI SDK 与 Vertex AI 搭配使用:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
查看思考总结
通过思考总结,您可以了解模型在生成回答时执行的中间推理步骤。 您可以在 Gemini 2.5 及更新版本的模型中查看思考总结。
在 Agent Studio 中,思考总结默认处于启用状态,您可以通过展开思考 面板来查看。
使用 API 时,您可以通过在 ThinkingConfig 中设置 include_thoughts=True 来启用思考总结:
控制台
Agent Studio 中默认启用思考总结。 您可以展开 思考 面板,查看模型的总结性思考过程。
Python
安装
pip install --upgrade google-genai
如需了解详情,请参阅 SDK 参考文档。
设置环境变量以将 Google Gen AI SDK 与 Vertex AI 搭配使用:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
安装
npm install @google/genai
如需了解详情,请参阅 SDK 参考文档。
设置环境变量以将 Google Gen AI SDK 与 Vertex AI 搭配使用:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
了解如何安装或更新 Go。
如需了解详情,请参阅 SDK 参考文档。
设置环境变量以将 Google Gen AI SDK 与 Vertex AI 搭配使用:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
了解如何安装或更新 Java。
如需了解详情,请参阅 SDK 参考文档。
设置环境变量以将 Google Gen AI SDK 与 Vertex AI 搭配使用:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
在以下情况下,回答可能包含思考签名,但没有思考总结文本:
- 低复杂程度的请求:模型只需执行最少的推理步骤即可 生成回答。
- 已停用总结:未请求思考总结或已 明确关闭思考总结。
- 非文本推理模态:某些模态(例如图片 处理)可能不会生成文本总结。
您的应用应始终妥善处理缺少或为空的思考总结内容,同时保留关联的思考签名。
思维签名
思考签名是模型内部思考 过程的加密表示形式,用于在多轮 对话期间(特别是在使用 函数 调用时)保留 Gemini 推理状态。
为了确保模型在多轮对话中保持完整上下文,您必须在后续请求中返回来自先前回答的思考签名,无论使用哪种思考级别。如果您使用的是官方 Google Gen AI SDK(Python、Node.js、Go 或 Java),并且使用的是标准聊天记录功能或将完整模型回答附加到历史记录中,则思考签名会被自动处理。
如需了解详细规则、示例和多轮工作流模式,请参阅 思考签名。
提示技巧
通过有效提示设计,您可以引导模型推理、预留 token 预算,并使用思考模型实现最佳输出质量。
如需了解全面的策略、多示例模式、验证提示和 调试技巧,请参阅 思考提示指南。
价格
您需要为模型在思考过程中生成的 token 付费。对于某些模型(例如 Gemini 3 Pro 和 Gemini 2.5 Pro),思考功能默认处于启用状态,并且系统会针对这些 token 向您收费。
如需了解详情,请参阅 Agent Platform 价格。 如需了解如何管理费用,请参阅控制模型思考。