Gemini Enterprise Agent Platform 上的生成式 AI 的配额和系统限制

本页面提供了按区域和模型列出的配额列表,并展示了如何在 控制台中查看和修改配额。 Google Cloud

已调优的模型配额

已调优的模型推理与基本模型共享同一配额。 已调优的模型推理没有单独的配额。

嵌入限制

gemini-embedding-001 的请求受区域配额限制,而对 gemini-embedding-2 的请求受全局配额限制。
基本模型 Quota 指标
base_model: gemini-embedding 1 亿次 aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 2 亿次 aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 60000 aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model

使用 predict API 对 gemini-embedding-001 的请求也受以下配额限制:

基本模型 Quota 指标
base_model: gemini-embedding 10 万次 aiplatform.googleapis.com/online_prediction_requests_per_base_model
base_model: N/A 30000 aiplatform.googleapis.com/online_prediction_requests

Agent Runtime 配额

以下配额适用于 Agent Runtime,适用于每个区域中给定 项目:
说明 Quota 指标
每分钟创建、删除或更新的 Agent Runtime 资源数 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
每分钟创建、删除或更新的 Agent Runtime 会话数 100 aiplatform.googleapis.com/session_write_requests
每分钟获取、列出或检索的 Agent Runtime 会话数 10000 aiplatform.googleapis.com/session_read_requests
每分钟的 QueryStreamQuery Agent Runtime 数 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
每分钟向 Agent Runtime 会话附加的事件数 300 aiplatform.googleapis.com/session_event_append_requests
Agent Runtime 资源数上限 100 aiplatform.googleapis.com/reasoning_engine_service_entities
每分钟创建、删除或更新的 Agent Runtime 内存资源数 100 aiplatform.googleapis.com/memory_bank_write_requests
每分钟从 Agent Runtime 记忆库中获取、列出或检索的次数 300 aiplatform.googleapis.com/memory_bank_read_requests
每分钟的沙盒环境(代码执行)执行请求数 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
每个区域的沙盒环境(代码执行)实体数 1000 aiplatform.googleapis.com/sandbox_environment_entities
每分钟的沙盒环境(代码执行)写入请求数 500 aiplatform.googleapis.com/sandbox_environment_write_requests
每分钟的 A2A 智能体 POST 请求数(例如 sendMessagecancelTask 60 aiplatform.googleapis.com/a2a_agent_post_requests
每分钟的 A2A 智能体 GET 请求数(例如 getTaskgetCard 600 aiplatform.googleapis.com/a2a_agent_get_requests
每分钟使用 BidiStreamQuery API 的并发实时双向连接数 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests

多模态输入配额

以下配额适用于每个区域中给定项目的 generateContentstreamGenerateContent 请求的多模态输入。每个配额都按基本模型和分辨率强制执行。相同的限制适用于使用相应 ..._global 指标通过全局端点处理的请求。
说明 Quota 指标
每个基本模型和分辨率每分钟的图片输入内容生成请求数 3400 万次 aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution
每个基本模型和分辨率每分钟的视频输入内容生成请求数 1.92 亿次 aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution
每个基本模型和分辨率每分钟的音频输入内容生成请求数 1100 万次 aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution
每个基本模型和分辨率每分钟的文档输入内容生成请求数 120 万次 aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution

如需申请提高这些配额的限制,请与您的 Google Cloud 客户支持 团队联系;无法通过 Google Cloud 控制台提高这些配额。

批量推理

批量推理作业的配额和限制在所有区域中都是相同的。

Gemini 模型的并发批量推理作业限制

Gemini 模型的批量推理没有预定义的配额限制。相反,批量服务提供对大型共享资源池的访问权限,并根据模型在所有客户中的实时可用性和需求动态分配资源。 当更多客户处于活跃状态并使模型容量达到饱和时,您的批量请求可能会因容量不足而排队。

非 Gemini 模型的并发批量推理作业配额

下表列出了并发批量推理作业数的配额,这些配额不适用于 Gemini 模型:
配额
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs 4
如果提交的任务数量超过分配的配额,则会将任务放入队列中,并在配额容量可用时进行处理。

在 Google Cloud 控制台中查看和修改配额

如需在 控制台中查看和修改配额,请执行以下操作:
    Google Cloud
  1. 前往配额和系统限制 页面。
  2. 前往“配额和系统限制”

  3. 如需调整配额,请在过滤条件中复制和粘贴属性 aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs。按 Enter 键。
  4. 点击行末的三个点,然后选择修改配额
  5. 在窗格中输入新的配额值,然后点击提交请求

语义治理政策配额

以下配额适用于每个区域中给定项目的语义治理政策
说明 Quota 指标
每分钟获取或列出的语义治理政策资源数 600 aiplatform.googleapis.com/semantic_governance/policy_read_requests
每分钟创建、更新或删除的语义治理政策资源数 60 aiplatform.googleapis.com/semantic_governance/policy_write_requests
每分钟获取的语义治理政策引擎资源数 600 aiplatform.googleapis.com/semantic_governance/engine_read_requests
每分钟更新或取消预配的语义治理政策引擎资源数 60 aiplatform.googleapis.com/semantic_governance/engine_write_requests
每个项目每个位置的语义治理政策资源数。 1000 aiplatform.googleapis.com/semantic_governance/policy_count

在 Google Cloud 控制台中查看和修改配额

如需在 控制台中查看和修改配额,请执行以下操作:
    Google Cloud
  1. 前往配额和系统限制 页面。
  2. 前往“配额和系统限制”

  3. 如需调整配额,请在过滤条件中复制和粘贴属性 aiplatform.googleapis.com/semantic_governance/policy_write_requests。按 Enter 键。
  4. 点击行末的三个点,然后选择修改配额
  5. 在窗格中输入新的配额值,然后点击提交请求

Gemini Enterprise Agent Platform 上的 RAG 引擎

对于使用 RAG 引擎执行检索增强生成 (RAG) 的每项服务,以下配额适用,配额以每分钟请求数 (RPM) 为单位进行计量。
服务 配额 指标
RAG 引擎数据管理 API 60 RPM VertexRagDataService requests per minute per region
RetrievalContexts API 600 RPM VertexRagService retrieve requests per minute per region
base_model: textembedding-gecko 1,500 RPM Online prediction requests per base model per minute per region per base_model

您可以指定其他过滤条件,即 base_model: textembedding-gecko
适用的限制如下:
服务 限制 指标
并发 ImportRagFiles 请求数 3 RPM VertexRagService concurrent import requests per region
每个 ImportRagFiles 请求的文件数上限 10,000 VertexRagService import rag files requests per region

Gen AI Evaluation Service

Gen AI Evaluation Service 使用 Gemini 2.5 Flash 作为基于模型的指标的默认评判模型。 对基于模型的指标的单个评估请求可能会导致对 Gen AI Evaluation Service 发出多个底层请求。每个模型的消耗量都是在组织级计算的,这意味着定向到评判模型进行模型推理和基于模型的评估的任何请求都会计入模型的消耗量。 下表显示了 Gen AI Evaluation Service 和底层评判模型的配额:
请求配额 默认配额
每分钟的 Gen AI Evaluation Service 请求数 每个区域中每个项目 1,000 个请求
Gemini 吞吐量 取决于模型和消耗选项
并发评估运行作业 每个项目在每个区域中可以有 20 个并发评估运行作业

如果您在使用 Gen AI Evaluation Service 时收到与配额相关的错误,则可能需要提交配额增加请求。如需了解详情,请参阅查看和管理配额

限制
Gen AI Evaluation Service 请求超时 60 秒

在新项目中首次使用 Gen AI Evaluation Service 时,您可能会遇到初始设置延迟,最长可达两分钟。如果第一个请求失败,请等待几分钟,然后重试。后续评估请求通常会在 60 秒内完成。

基于模型的指标的输入和输出词元数上限取决于用作评判模型的模型。如需查看模型列表,请参阅 Google 模型

Gemini Enterprise Agent Platform Pipelines 配额

每个调优作业都使用 Gemini Enterprise Agent Platform Pipelines。如需了解详情, 请参阅 Agent Platform Pipelines 配额和限制

后续步骤

概览

了解标准即用即付,这是一种 Agent Platform 消耗选项,可让您仅为消耗的资源付费,而无需预先做出财务承诺。

资源

与 Agent Platform 相关的配额和系统限制,不包括特定于产品的配额和系统限制。

概览

了解 Google Cloud 如何限制 Google Cloud 项目可使用的资源量,以及配额如何适用于一系列资源类型,包括硬件、软件和网络组件。