Agent Platform 中代理的配额和系统限制

本文档列出了适用于 Gemini Enterprise Agent Platform 的配额和系统限制。

  • 配额具有默认值,但您通常可以申请 调整。
  • 系统限制是无法更改的固定值。

Google Cloud 使用配额来帮助确保公平性并减少资源使用和可用性的激增。配额用于限制您的 Google Cloud 项目可使用多少Google Cloud 资源。配额适用于一系列资源类型,包括硬件、软件和网络组件。例如,配额可以限制对某项服务的 API 调用次数、您的项目并发使用的负载均衡器数量或者您可以创建的项目数量。配额可以防止服务过载,从而保护Google Cloud 用户社区。配额还可以帮助您管理自己的 Google Cloud 资源。

Cloud 配额系统执行以下操作:

在大多数情况下,当您尝试消耗的资源超出其配额允许的范围时,系统会阻止对资源的访问,并且您尝试执行的任务会失败。

配额通常在 Google Cloud 项目级别应用。您在一个项目中使用资源不会影响您在另一个项目中的可用配额。在 Google Cloud 项目中,配额在所有应用和 IP 地址间共享。

如需了解详情,请参阅 Cloud 配额概览

配额

以下配额适用于每个区域中给定项目的 Agent Platform 上部署的智能体:

说明 Quota 指标
每分钟创建、删除或更新的 Agent Platform 资源数 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
每分钟创建、删除或更新的 Agent Platform 会话数 100 aiplatform.googleapis.com/session_write_requests
每分钟的 Agent Platform QueryStreamQuery 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
每分钟向 Agent Platform 会话附加的事件数 300 aiplatform.googleapis.com/session_event_append_requests
每分钟创建、删除或更新的 Agent Platform 非区域(全局或多区域)会话数 100 aiplatform.googleapis.com/non_regional_session_write_requests
每分钟向 Agent Platform 非区域(全局或多区域)会话附加的事件数 300 aiplatform.googleapis.com/non_regional_session_event_append_requests
Agent Platform 资源数上限 100 aiplatform.googleapis.com/reasoning_engine_service_entities
每分钟创建、删除或更新的 Agent Platform 内存资源数 100 aiplatform.googleapis.com/memory_bank_write_requests
每分钟从 Agent Platform 记忆库中获取、列出或检索的次数 300 aiplatform.googleapis.com/memory_bank_read_requests
每分钟创建、删除或更新的 Agent Platform 非区域(全局或多区域)内存资源数 100 aiplatform.googleapis.com/non_regional_memory_bank_write_requests
每分钟从非区域(全局或多区域)Agent Platform 记忆库中获取、列出或检索的次数 300 aiplatform.googleapis.com/non_regional_memory_bank_read_requests
每分钟的沙盒环境(代码执行)执行请求数 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
每个区域的沙盒环境(代码执行)实体数 1000 aiplatform.googleapis.com/sandbox_environment_entities
每分钟的沙盒环境(代码执行)写入请求数 500 aiplatform.googleapis.com/sandbox_environment_write_requests
每分钟的 A2A 智能体 POST 请求数(例如 sendMessagecancelTask 60 aiplatform.googleapis.com/a2a_agent_post_requests
每分钟的 A2A 智能体 GET 请求数(例如 getTaskgetCard 600 aiplatform.googleapis.com/a2a_agent_get_requests
每分钟使用 BidiStreamQuery API 的并发实时双向连接数 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests

生产负载的配额管理

随着流量的增加,您可能需要申请增加特定的 Agent Platform API 配额,以避免 429 Resource Exhausted 错误。您可以 主动配置运行时增加配额,以确保 Agent Runtime 实例在 生产负载下保持响应性、可伸缩性和可靠性。

如需了解如何优化和扩缩 Agent Runtime 性能, 请参阅优化和扩缩 Agent Runtime 性能

请按照以下步骤估算峰值配额要求:

  1. 定义变量:

    • U:并发用户峰值(例如 250)。

    • X:每位用户每分钟的平均请求数(例如 2)。

    • Y:每个请求生成的平均会话事件数(例如,对于涉及多个工具调用的复杂链,为 12)。

  2. 计算峰值负载:

    • 计算每分钟的峰值查询数 (QPM):U * X

    • 计算每分钟的峰值会话事件数:峰值 QPM * Y

  3. 申请带缓冲区的配额:申请增加配额时,在计算出的峰值基础上添加缓冲区(例如 50%),以应对意外的峰值。

下表显示了 Agent Platform 的关键性能相关配额的计算,其中使用了示例变量 peak concurrent users=250average requests per user per minute=2average session events generated per request=12

配额名称 配额说明 基本计算(峰值) 建议值(带 50% 缓冲区)
每分钟的查询 Agent Engine 数 (aiplatform.googleapis.com/reasoning_engine_service_query_requests) 您的智能体每分钟可以接收的 querystream_query 调用总数。 250 users * 2 req/min = 500 QPM 500 * 1.5 = 750
每分钟附加的会话事件数 (aiplatform.googleapis.com/session_event_append_requests)

所有正在进行的会话中的轮次或事件数。 单个查询可以在链中生成多个会话事件, 例如:

  1. 调用 LLM。
  2. LLM 回答:使用工具。
  3. 执行工具。
  4. 使用工具回答调用 LLM。
  5. LLM 给出最终回答。
500 QPM * 12 events/req = 6,000 6,000 * 1.5 = 9,000
每分钟的会话写入数 (aiplatform.googleapis.com/session_write_requests) 创建或更新会话资源的速率。此值通常小于或等于查询速率。 通常 <= 峰值 QPM (500) 通常 <= 查询配额 (750)

申请配额调整

如需调整大多数配额,请使用 Google Cloud 控制台。如需了解详情,请参阅 申请配额调整

Agent Platform 快速模式配额

Agent Platform 免费层级快速模式用户可以免费使用以下 Agent Platform 服务配额。如需详细了解免费层级和快速模式,请参阅 Agent Platform 快速模式概览

以下配额适用于每个区域中给定快速模式项目的 Agent Platform 上部署的智能体:

说明 Quota 指标
Agent Platform 资源数上限 10 aiplatform.googleapis.com/reasoning_engine_service_entities
每分钟创建、删除或更新的 Agent Platform 资源数 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
每分钟的 Agent Platform QueryStreamQuery 10 aiplatform.googleapis.com/reasoning_engine_service_query_requests
每分钟使用 BidiStreamQuery API 的并发实时双向连接数 1 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
每分钟创建、删除或更新的 Agent Platform 会话数 10 aiplatform.googleapis.com/session_write_requests
每分钟向 Agent Platform 会话附加的事件数 30 aiplatform.googleapis.com/session_event_append_requests
每分钟创建、删除或更新的 Agent Platform 内存资源数 10 aiplatform.googleapis.com/memory_bank_write_requests
每分钟从记忆库中获取、列出或检索的次数 10 aiplatform.googleapis.com/memory_bank_read_requests