本文档列出了适用于 Gemini Enterprise Agent Platform 的配额和系统限制。
- 配额具有默认值,但您通常可以申请 调整。
- 系统限制是无法更改的固定值。
Google Cloud 使用配额来帮助确保公平性并减少资源使用和可用性的激增。配额用于限制您的 Google Cloud 项目可使用多少Google Cloud 资源。配额适用于一系列资源类型,包括硬件、软件和网络组件。例如,配额可以限制对某项服务的 API 调用次数、您的项目并发使用的负载均衡器数量或者您可以创建的项目数量。配额可以防止服务过载,从而保护Google Cloud 用户社区。配额还可以帮助您管理自己的 Google Cloud 资源。
Cloud 配额系统执行以下操作:
在大多数情况下,当您尝试消耗的资源超出其配额允许的范围时,系统会阻止对资源的访问,并且您尝试执行的任务会失败。
配额通常在 Google Cloud 项目级别应用。您在一个项目中使用资源不会影响您在另一个项目中的可用配额。在 Google Cloud 项目中,配额在所有应用和 IP 地址间共享。
如需了解详情,请参阅 Cloud 配额概览。
配额
以下配额适用于每个区域中给定项目的 Agent Platform 上部署的智能体:
| 说明 | Quota | 指标 |
|---|---|---|
| 每分钟创建、删除或更新的 Agent Platform 资源数 | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| 每分钟创建、删除或更新的 Agent Platform 会话数 | 100 | aiplatform.googleapis.com/session_write_requests |
每分钟的 Agent Platform Query 或 StreamQuery 数 |
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| 每分钟向 Agent Platform 会话附加的事件数 | 300 | aiplatform.googleapis.com/session_event_append_requests |
| 每分钟创建、删除或更新的 Agent Platform 非区域(全局或多区域)会话数 | 100 | aiplatform.googleapis.com/non_regional_session_write_requests |
| 每分钟向 Agent Platform 非区域(全局或多区域)会话附加的事件数 | 300 | aiplatform.googleapis.com/non_regional_session_event_append_requests |
| Agent Platform 资源数上限 | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| 每分钟创建、删除或更新的 Agent Platform 内存资源数 | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| 每分钟从 Agent Platform 记忆库中获取、列出或检索的次数 | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| 每分钟创建、删除或更新的 Agent Platform 非区域(全局或多区域)内存资源数 | 100 | aiplatform.googleapis.com/non_regional_memory_bank_write_requests |
| 每分钟从非区域(全局或多区域)Agent Platform 记忆库中获取、列出或检索的次数 | 300 | aiplatform.googleapis.com/non_regional_memory_bank_read_requests |
| 每分钟的沙盒环境(代码执行)执行请求数 | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| 每个区域的沙盒环境(代码执行)实体数 | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| 每分钟的沙盒环境(代码执行)写入请求数 | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
每分钟的 A2A 智能体 POST 请求数(例如 sendMessage 和 cancelTask) |
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
每分钟的 A2A 智能体 GET 请求数(例如 getTask 和 getCard) |
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
每分钟使用 BidiStreamQuery API 的并发实时双向连接数 |
10 | aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests |
生产负载的配额管理
随着流量的增加,您可能需要申请增加特定的 Agent Platform API 配额,以避免 429 Resource Exhausted
错误。您可以
主动配置运行时
并增加配额,以确保
Agent Runtime 实例在
生产负载下保持响应性、可伸缩性和可靠性。
如需了解如何优化和扩缩 Agent Runtime 性能, 请参阅优化和扩缩 Agent Runtime 性能。
请按照以下步骤估算峰值配额要求:
定义变量:
U:并发用户峰值(例如 250)。X:每位用户每分钟的平均请求数(例如 2)。Y:每个请求生成的平均会话事件数(例如,对于涉及多个工具调用的复杂链,为 12)。
计算峰值负载:
计算每分钟的峰值查询数 (QPM):U * X
计算每分钟的峰值会话事件数:峰值 QPM * Y
申请带缓冲区的配额:申请增加配额时,在计算出的峰值基础上添加缓冲区(例如 50%),以应对意外的峰值。
下表显示了
Agent Platform 的关键性能相关配额的计算,其中使用了示例变量 peak concurrent users=250、
average requests per user per minute=2 和 average session events generated
per request=12:
| 配额名称 | 配额说明 | 基本计算(峰值) | 建议值(带 50% 缓冲区) |
|---|---|---|---|
每分钟的查询 Agent Engine 数 (aiplatform.googleapis.com/reasoning_engine_service_query_requests) |
您的智能体每分钟可以接收的 query 或 stream_query 调用总数。 |
250 users * 2 req/min = 500 QPM |
500 * 1.5 = 750 |
每分钟附加的会话事件数 (aiplatform.googleapis.com/session_event_append_requests) |
所有正在进行的会话中的轮次或事件数。 单个查询可以在链中生成多个会话事件, 例如:
|
500 QPM * 12 events/req = 6,000 |
6,000 * 1.5 = 9,000 |
每分钟的会话写入数 (aiplatform.googleapis.com/session_write_requests) |
创建或更新会话资源的速率。此值通常小于或等于查询速率。 | 通常 <= 峰值 QPM (500) |
通常 <= 查询配额 (750) |
申请配额调整
如需调整大多数配额,请使用 Google Cloud 控制台。如需了解详情,请参阅 申请配额调整。
Agent Platform 快速模式配额
Agent Platform 免费层级快速模式用户可以免费使用以下 Agent Platform 服务配额。如需详细了解免费层级和快速模式,请参阅 Agent Platform 快速模式概览。
以下配额适用于每个区域中给定快速模式项目的 Agent Platform 上部署的智能体:
| 说明 | Quota | 指标 |
|---|---|---|
| Agent Platform 资源数上限 | 10 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| 每分钟创建、删除或更新的 Agent Platform 资源数 | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
每分钟的 Agent Platform Query 或 StreamQuery 数 |
10 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
每分钟使用 BidiStreamQuery API 的并发实时双向连接数 |
1 | aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests |
| 每分钟创建、删除或更新的 Agent Platform 会话数 | 10 | aiplatform.googleapis.com/session_write_requests |
| 每分钟向 Agent Platform 会话附加的事件数 | 30 | aiplatform.googleapis.com/session_event_append_requests |
| 每分钟创建、删除或更新的 Agent Platform 内存资源数 | 10 | aiplatform.googleapis.com/memory_bank_write_requests |
| 每分钟从记忆库中获取、列出或检索的次数 | 10 | aiplatform.googleapis.com/memory_bank_read_requests |