Gemini Enterprise Agent Platform 开放模型(适用于 MaaS)

Gemini Enterprise Agent Platform 支持一组精选的开放模型作为托管式模型。这些 开放模型可与 Gemini Enterprise Agent Platform搭配,作为模型即服务 (MaaS) 使用,并作为托管式 API 提供。使用托管式开放模型时,您可以继续向 Gemini Enterprise Agent Platform 端点发送请求。托管式开放模型是无服务器服务,因此您无需预配或管理基础设施。

您可以使用 Model Garden 发现托管式开放模型,还可以使用 Model Garden 部署模型。如需了解详情,请参阅在 Model Garden 中探索 AI 模型

您需要先授予用户开放模型访问权限,然后才能使用开放模型。

开放模型

以下开放模型在 Gemini Enterprise Agent Platform Model Garden 上以托管式 API 的形式 (MaaS) 提供:

模型名称 模态 说明 快速入门
DeepSeek-OCR 语言、视觉 一种全面的光学字符识别 (OCR) 模型,可分析并理解复杂文档。在处理具有挑战性的 OCR 任务方面表现出色。 模型卡片
DeepSeek R1 (0528) 语言 DeepSeek 的 DeepSeek R1 模型的一个版本。 模型卡片
DeepSeek-V3.1 语言 DeepSeek 的混合模型,可同时支持思考模式和非思考模式。 模型卡片
DeepSeek-V3.2 语言 DeepSeek 的模型,兼具高计算效率和出色的推理及代理性能。 模型卡片
Gemma 4 26B A4B IT 语言 Google 的开放模型系列,由 Google DeepMind 构建。 模型卡片
GLM 4.7 语言、代码 GLM 的模型,专为核心编码、氛围编程、工具使用和复杂推理而设计。 模型卡片
GLM 5 语言、代码 GLM 的模型,适用于复杂的系统工程和长期代理任务。 模型卡片
gpt-oss 120B 语言 一个 120B 模型,在推理任务方面表现出色。 模型卡片
gpt-oss 20B 语言 一个 20B 模型,经过优化,可在消费类硬件和边缘硬件上高效部署。 模型卡片
Kimi K2 思考 语言 一个开源的思维智能体模型,可逐步推理并使用工具解决复杂问题。 模型卡片
Llama 3.3 语言 Llama 3.3 是纯文本 70B 指令调优模型,用于纯文本应用时,相对于 Llama 3.1 70B 和 Llama 3.2 90B,可提供增强的性能。此外,对于某些应用,Llama 3.3 70B 的性能接近 Llama 3.1 405B。 模型卡片
Llama 4 Maverick 17B-128E 语言、视觉 最大、最强大的 Llama 4 模型,具有编码、推理和图像功能。Llama 4 Maverick 17B-128E 是一种使用混合专家 (MoE) 架构和早期融合技术的多模态模型。 模型卡片
Llama 4 Scout 17B-16E 语言、视觉 Llama 4 Scout 17B-16E 在同类模型中取得了出色的结果,在多项基准测试中超越了其他开放模型和专有模型。Llama 4 Scout 17B-16E 是一种使用混合专家 (MoE) 架构和早期融合技术的多模态模型。 模型卡片
MiniMax M2 语言、代码 专为智能体和代码相关任务而设计,具有规划和执行复杂工具调用任务的强大能力。 模型卡片
Qwen3 235B 语言 一款开放权重模型,具有“混合思维”能力,可在有条理的推理和快速对话之间切换。 模型卡片
Qwen3 Coder 语言、代码 一款专为高级软件开发任务而开发的开放权重模型。 模型卡片
Qwen3-Next-80B Instruct 语言、代码 Qwen3-Next 系列模型中的一种,专门用于遵循特定命令。 模型卡片
Qwen3-Next-80B Thinking 语言、代码 Qwen3-Next 系列模型中的一种,专门用于解决复杂问题和进行深度推理。 模型卡片

以下开放嵌入模型在 Gemini Enterprise Agent Platform Model Garden 上以托管式 API 的形式 (MaaS) 提供:

模型名称 说明 输出维度 最大序列长度 支持的文本语言 快速入门
multilingual-e5-small E5 系列文本嵌入模型的一部分。小型变体包含 12 层。 最高 384 512 个词元 支持的语言 模型卡片
multilingual-e5-large E5 系列文本嵌入模型的一部分。大型变体包含 24 层。 高达 1024 512 个词元 支持的语言 模型卡片

开放模型监管合规性

当使用 Gemini Enterprise Agent Platform 将开放模型用作托管式 API 时,Gemini Enterprise Agent Platform 上生成式 AI 的认证仍然 适用。如果您需要了解模型本身的详细信息,可以在相应的模型卡片中找到更多信息,也可以联系相应的模型发布方。

您的数据在 Gemini Enterprise Agent Platform 上开放模型的所选区域或多区域内静态存储,但数据处理的区域化可能会有所不同。如需查看开放模型的数据处理 承诺的详细列表,请参阅开放模型的数据驻留

使用 Gemini Enterprise API(包括开放模型)时,客户提示和模型响应不会与第三方共享。Google 仅会按照客户的指示处理 客户数据,详见我们的 《云端数据处理附录》

上下文缓存

上下文缓存有助于降低包含重复内容的开放模型请求的费用并缩短延迟时间。此功能仅在使用随用随付流量时启用,不支持其他流量类型,例如预配吞吐量和批量。

支持的缓存类型是隐式缓存,这是一种自动缓存 默认在所有 Google Cloud 项目中启用,在发生缓存命中时,与标准输入 token 相比,可为缓存的 token 提供 90% 的折扣。使用这种类型的缓存时,您无需显式定义和调用缓存。相反,我们的后端会在检测到重复上下文后从这些缓存中提取数据。

支持的模型

  • qwen3-coder-480b-a35b-instruct-maas
  • kimi-k2-thinking-maas
  • minimax-m2-maas
  • gpt-oss-20b-maas
  • deepseek-v3.1-maas
  • deepseek-v3.2-maas
  • gemma-4-26b-a4b-it-maas

回答的元数据中的 cachedContentTokenCount 字段表示输入中已缓存 部分的 token 数。缓存请求必须包含至少 4096 个 token(此最低要求在预览期间可能会发生变化)。

启用后,系统会自动将隐式缓存命中节省的费用返还给您。缓存命中无法保证,取决于发送的请求和其他因素。如要提高隐式缓存命中的几率,可以尝试以下操作:

  • 将较大且常见的内容放置在提示的开头。
  • 在短时间内发送具有相似前缀的请求。

后续步骤