模型路由概览
API Gateway 的模型路由是一个受管理的流量管理层,可接受与 OpenAI 兼容的提示请求,在传输过程中对这些请求进行转码,并将其路由到特定的 Gemini Enterprise Agent Platform 模型。模型路由可作为 LiteLLM 等客户端代理的受管理替代方案,提供集中式基础架构来管理 AI 代理的生命周期。
模型路由将路由逻辑移至网络边缘,并与 Agent Platform Model Garden 集成,以实现同主机优化。此架构无需托管、扩缩和维护非受管代理服务器,从而降低运营开销和基础设施成本。
范围和用户体验历程
模型路由支持以下核心用户体验历程:
- 模型选择:AI 开发者在 Agent Platform Model Garden 中使用以模型即服务 (MaaS) 形式提供的开放模型。这些模型包括 Gemini、Anthropic Claude 或 OpenAI GPT 系列模型。
- 规范撰写:AI 开发者在 OpenAPI 3.x 规范中创建或更新模型路由器配置,以引用已部署的模型。
- 网关部署:AI 开发者使用编写的 OpenAPI 规范部署 API 配置和 API Gateway 实例。
- 提示路由:客户端应用向网关发送与 OpenAI 兼容的提示请求,网关会根据 JSON 载荷中指定的模型名称来路由请求和转换载荷。
我们计划在未来的 API 网关版本中支持更多用户体验历程。
模型路由的优势
在 API Gateway 中实现模型路由具有以下优势:
- 集中化管理:在一个受管理的网关内整合 AI 流量管理,取代分散的客户端路由配置。
- 减少了运营开销:消除了与部署独立代理服务器相关的基础设施成本和维护负担。
- 经过边缘优化的性能:检查提示并在网络边缘路由流量,利用与 Agent Platform Model Garden 端点的直接集成。
- 标准化客户端接口:使客户端应用能够与统一的 OpenAI 兼容 REST 接口进行交互,同时将请求动态调度到不同的底层基础模型。
用户角色和用例
模型路由可满足以下角色的需求:
- 平台工程师:提供托管式基础设施解决方案,以替换企业 AI 部署中的客户端路由逻辑。
- AI 开发者:公开一个标准化 API 端点,该端点可根据请求载荷参数在不同的基础模型(例如 Gemini Pro、Gemini Flash 或 Anthropic Claude)之间动态路由请求。
- 治理管理员:强制执行集中式访问权限政策(例如身份验证和配额),并监控整个组织的总体 AI 流量。
支持的使用场景
在公开预览期间,模型路由支持仅基于 OpenAI 兼容客户端请求的 JSON 载荷中指定的模型标记或名称(例如 "model": "gemini-3.5-flash-lite")进行路由。
架构和请求流程
模型路由作为 API 网关数据平面中的受管理路由层运行。当客户端应用向网关发送 OpenAI 兼容的提示请求时,系统会按以下顺序执行操作:
- 请求拦截:网关拦截传入的
POST请求(例如POST /chat/completions)。 - 载荷检查:模型路由器会检查传入 JSON 载荷中的
model属性(例如{"model": "claude-opus-4-7", "messages": [...]})。 - 规则评估:路由器将
model字符串与 OpenAPI 规范中定义的路由规则进行匹配。如果没有规则匹配,路由器会选择配置的默认模型。 - 实时转码:网关将 OpenAI 兼容的请求转码为目标 Agent Platform 预测架构。
- 后端调度:网关将转码后的请求调度到指定的 Agent Platform Model Garden 端点,并将模型响应返回给客户端。
性能和限制
在实现模型路由之前,请查看以下技术限制:
- 主机限制:模型路由仅支持路由到托管在 Agent Platform Model Garden 中的预部署 MaaS 模型,其中单个路由器引用的所有模型共享相同的主机名(例如,全局端点
aiplatform.googleapis.com或单个区域端点,如us-central1-aiplatform.googleapis.com)。 - 规范要求:模型路由需要 OpenAPI 3.x 规范和相应的 API Gateway OpenAPI 3.x 扩展程序。不支持 OpenAPI 2.0 (Swagger) 规范。
- 网关更新:您无法更新已部署的现有网关(未启用模型路由),以启用模型路由;也无法更新已部署的网关(已启用模型路由),以停用或移除模型路由。如需切换路由模式,您必须创建并部署新的 API 配置和网关实例。
- 混合配置:OpenAPI 规范不能同时包含模型路由操作和非模型路由操作。规范中的所有操作都必须使用模型路由或标准网关路由。
- VPC Service Controls:模型路由网关不支持 VPC Service Controls。您无法将 VPC Service Controls 边界与启用模型路由的 API Gateway 实例搭配使用。
- 流式传输和不受支持的协议:模型路由支持响应流式传输(服务器发送的事件),但不支持请求端流式传输、gRPC、WebSocket 或 Gemini Live。
- 支持的模态:在公开预览期间,模型路由会假设基于文本的提示请求采用与 OpenAI 兼容的 JSON 载荷格式,并仅根据载荷中的
model标记或名称进行路由。 - 必需的载荷字段:传入的 JSON 请求载荷必须包含
model属性。在公开预览期间,如果客户端请求载荷中缺少model字段,网关会错误地处理请求,而不是拒绝请求并返回错误。请务必确保客户端请求在 JSON 载荷中指定model字段。 - 运行时限制:标准网关托管基础设施服务限制和行为适用于模型路由端点:
- 最长超时时间:网关强制执行最长请求超时时间 3,600 秒(1 小时),适用于长时间运行的流式传输请求。
- 冷启动延迟时间:如果网关实例在非活动期间缩放到零,则初始请求可能会遇到冷启动延迟时间,这可能会影响对延迟时间较为敏感的 AI 推理路径。
- 预留的网址路径:您不能使用预留的网址路径,例如
/eventlog、以/_ah/开头的路径或以z结尾的某些路径(为避免冲突,请避免使用以z结尾的路径名称)。 - 网址字符解码:网关会在处理请求之前自动解码请求网址中的某些编码字符(例如,
%41会解码为A)。