开放模型概览

Gemini Enterprise Agent Platform 提供多种方式来提供开放式大型语言模型, 包括 Llama、DeepSeek、Mistral 和 Qwen Google Cloud。本文档概述了 Gemini Enterprise Agent Platform 提供的开放模型部署,并帮助您为自己的应用场景选择合适的选项。

服务选项

Gemini Enterprise Agent Platform 提供以下选项来提供开放模型。这些选项均提供高可用性,并且默认包含 包含 Google Cloud 安全 最佳实践:

何时使用 MaaS

在以下场景中,您可以考虑使用 MaaS:

  • 快速开发和原型设计:MaaS 可帮助您快速将 LLM 功能集成到应用中。这对于初始探索、快速原型设计以及快速上市是关键目标的情况尤其有用。
  • 最大限度地减少运营开销:如果您的团队希望 专注于应用逻辑,而不是基础设施管理,请选择 MaaS。Google 会处理所有 GPU/TPU 预配、伸缩和维护工作,这对于专注于应用开发而不是 MLOps 或 DevOps 的团队来说非常有利。
  • 流量可变:随用随付模式支持实验性工作负载或流量模式不可预测且突发性强的应用。
  • 开箱即用:对于需要 一致性能但不需要对底层模型或服务堆栈进行深度自定义的应用,请使用托管式 API。
  • 安全性和合规性:MaaS 让企业能够使用 Google Cloud's 内置的企业级安全和合规性功能。
  • 标准模型使用:如果标准、非自定义的 基础模型能够满足您的需求,请使用 MaaS。

何时使用 Model Garden 中的自行部署模型

自行部署选项包括使用预构建或自定义容器从 Model Garden 进行部署。在以下关键场景中,您可以考虑自行部署:

  • 自定义权重和微调模型:如果您的应用需要使用自定义权重或模型的微调版本,自行部署是最佳选择, 因为它可以提供更高的灵活性,让您能够部署根据您的特定需求量身定制的模型。您还可以构建和部署自己的自定义服务容器。例如,如果模型需要独特的预处理或后处理逻辑,请使用此选项。
  • 可预测的大批量工作负载:对于流量可预测且流量大的生产应用,自行部署是一种战略性且 经济高效的选择。虽然它需要更多的前期工程投资,但由于大规模优化了每个令牌的费用,因此在应用的整个生命周期内,它可能会降低总拥有成本 (TCO)。
  • 对基础设施进行精细控制:如果您需要 通过选择特定的硬件 配置来微调性能和预算,请使用自行部署。这包括选择确切的机器类型、GPU(例如 NVIDIA L4 或 H100)或 TPU,以及优化的服务框架。
  • 严格的安全性和合规性:此方法支持必须遵守特定数据驻留政策或禁止使用多租户代管式服务的严格法规的应用。它让您能够在自己的 项目和虚拟私有云 Google Cloud 网络中安全地部署模型,从而完全控制数据路径。
  • 对位置进行精细控制:借助专用端点,您可以在 所有区域的任何 Compute Engine 加速器上进行部署。 Google Cloud

何时使用预构建容器

在以下场景中,您可以考虑使用 Gemini Enterprise Agent Platform 预构建容器:

  • 优化性能:Gemini Enterprise Agent Platform 会针对 vLLM 等框架优化和自定义 预构建容器,以增强性能、 可靠性和中的无缝集成 Google Cloud。
  • 易于使用:使用 vLLM、Hex-LLM、SGLang、TGI 或 TensorRT-LLM 等常用服务 框架来提供模型,而无需 构建和维护自己的容器映像。

何时使用自定义 vLLM 容器

在以下场景中,您可以考虑构建和使用自己的自定义容器:

  • 灵活性最高:当现有服务选项和预构建容器无法满足您的需求,并且您需要完全控制容器映像(包括依赖项和配置)时,请选择此选项。
  • 自定义服务逻辑:当您的模型需要预构建容器不支持的独特预处理或 后处理步骤时。

后续步骤