本文档列出了适用于 Agent Platform 上生成式 AI 模型的配额和系统限制。
- 配额 具有默认值,但您通常可以申请调整。
- 系统限制 是无法更改的固定值。
Google Cloud 使用配额来帮助确保公平性并减少资源使用和可用性的激增。配额用于限制您的 Google Cloud 项目可使用多少Google Cloud 资源。配额适用于一系列资源类型,包括硬件、软件和网络组件。例如,配额可以限制对某项服务的 API 调用次数、您的项目并发使用的负载均衡器数量或者您可以创建的项目数量。配额可以防止服务过载,从而保护Google Cloud 用户社区。配额还可以帮助您管理自己的 Google Cloud 资源。
Cloud 配额系统执行以下操作:
在大多数情况下,当您尝试消耗的资源超出其配额允许的范围时,系统会阻止对资源的访问,并且您尝试执行的任务会失败。
配额通常在 Google Cloud 项目级别应用。您在一个项目中使用资源不会影响您在另一个项目中的可用配额。在 Google Cloud 项目中,配额在所有应用和 IP 地址间共享。
如需了解详情,请参阅 Cloud 配额概览。
Agent Platform 资源也有 系统限制。 系统限制不能更改。
Gemini Enterprise Agent Platform 资源也有 限制。系统限制不能更改。
已调优的模型配额
已调优的模型推理与基本模型共享同一配额。 已调优的模型推理没有单独的配额。
嵌入限制
对gemini-embedding-001 和 gemini-embedding-2 的请求受全局配额限制。
| 基本模型 | Quota | 指标 |
|---|---|---|
| base_model: gemini-embedding | 1 亿次 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding | 10 万次 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 2 亿次 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 6 万次 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
使用 predict API 对 gemini-embedding-001 的请求也受以下配额限制:
| 基本模型 | Quota | 指标 |
|---|---|---|
| base_model:不适用 | 3 万次 | aiplatform.googleapis.com/online_prediction_requests |
Agent Runtime 配额
以下配额适用于 Agent Runtime,适用于每个区域中给定 项目:| 说明 | Quota | 指标 |
|---|---|---|
| 每分钟创建、删除或更新的 Agent Runtime 资源数 | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| 每分钟创建、删除或更新的 Agent Runtime 会话数 | 100 | aiplatform.googleapis.com/session_write_requests |
| 每分钟获取、列出或检索的 Agent Runtime 会话数 | 10000 | aiplatform.googleapis.com/session_read_requests |
每分钟的 Query 或 StreamQuery Agent Runtime 数 |
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| 每分钟向 Agent Runtime 会话附加的事件数 | 300 | aiplatform.googleapis.com/session_event_append_requests |
| Agent Runtime 资源数上限 | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| 每分钟创建、删除或更新的 Agent Runtime 内存资源数 | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| 每分钟从 Agent Runtime 记忆库中获取、列出或检索的次数 | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| 每分钟的沙盒环境(代码执行)执行请求数 | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| 每个区域的沙盒环境(代码执行)实体数 | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| 每分钟的沙盒环境(代码执行)写入请求数 | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
每分钟的 A2A 智能体 POST 请求数(例如 sendMessage 和 cancelTask) |
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
每分钟的 A2A 智能体 GET 请求数(例如 getTask 和 getCard)
|
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
每分钟使用 BidiStreamQuery API 的并发实时双向连接数 |
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
多模态输入配额
以下配额适用于每个区域中给定项目的generateContent 和 streamGenerateContent 请求的多模态输入。每个配额都按基本模型和分辨率强制执行。相同的限制适用于使用相应 ..._global 指标通过全局端点处理的请求。
| 说明 | Quota | 指标 |
|---|---|---|
| 每个基本模型和分辨率每分钟的图片输入内容生成请求数 | 3400 万次 | aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| 每个基本模型和分辨率每分钟的视频输入内容生成请求数 | 1.92 亿次 | aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| 每个基本模型和分辨率每分钟的音频输入内容生成请求数 | 1100 万次 | aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| 每个基本模型和分辨率每分钟的文档输入内容生成请求数 | 120 万次 | aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
如需申请提高这些配额的上限,请与您的 Google Cloud 客户支持 团队联系;您无法通过 Google Cloud 控制台提高这些配额的上限。
生成式媒体配额
如需在 Google Cloud 控制台中查看和修改生成式媒体配额,请执行以下操作:
- 确保已为您的项目 启用 Agent Platform API。如果该 API 尚未启用,则不会显示 Agent Platform 配额。
-
前往配额和系统限制 页面。
-
在过滤条件 文本框中,输入以下查询:
Metric: METRIC_NAME
Dimensions (e.g. location): MODEL_NAME请替换以下内容:
-
METRIC_NAME:要搜索的指标名称,可以是以下任一名称:
-
Gemini Omni:
global_generate_content_requests_per_minute_per_project_per_base_model -
Veo:
long_running_online_prediction_requests_per_base_model -
Lyria:
global_generate_content_requests_per_minute_per_project_per_base_model
-
Gemini Omni:
- MODEL_NAME:您使用的模型的名称。
-
METRIC_NAME:要搜索的指标名称,可以是以下任一名称:
- 如需调整配额,请点击 更多 ,然后选择修改配额。
- 在窗格中输入新的配额值,然后点击提交请求 。
批量推理
批量推理作业的配额和限制在所有区域中都是相同的。Gemini 模型的并发批量推理作业限制
Gemini 模型的批量推理没有预定义的配额限制。相反,批量服务提供对大型共享资源池的访问权限,并根据模型在所有客户中的实时可用性和需求动态分配资源。 当更多客户处于活跃状态并使模型容量达到饱和时,您的批量请求可能会因容量不足而排队。非 Gemini 模型的并发批量推理作业配额
下表列出了并发批量推理作业数的配额,这些配额不适用于 Gemini 模型:| 配额 | 值 |
|---|---|
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
在 Google Cloud 控制台中查看和修改配额
如需在 Google Cloud 控制台中查看和修改配额,请执行以下操作:- 前往配额和系统限制 页面。
- 如需调整配额,请在过滤条件中复制和粘贴属性
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs。按 Enter 键。 - 点击行末的三个点,然后选择修改配额。
- 在窗格中输入新的配额值,然后点击提交请求 。
语义治理政策配额
以下配额适用于每个区域中给定项目的语义治理政策:| 说明 | Quota | 指标 |
|---|---|---|
| 每分钟获取或列出的语义治理政策资源数 | 600 | aiplatform.googleapis.com/semantic_governance/policy_read_requests |
| 每分钟创建、更新或删除的语义治理政策资源数 | 60 | aiplatform.googleapis.com/semantic_governance/policy_write_requests |
| 每分钟获取的语义治理政策引擎资源数 | 600 | aiplatform.googleapis.com/semantic_governance/engine_read_requests |
| 每分钟更新或取消预配的语义治理政策引擎资源数 | 60 | aiplatform.googleapis.com/semantic_governance/engine_write_requests |
| 每个项目每个位置的语义治理政策资源数。 | 1000 | aiplatform.googleapis.com/semantic_governance/policy_count |
在 Google Cloud 控制台中查看和修改配额
如需在 Google Cloud 控制台中查看和修改配额,请执行以下操作:- 前往配额和系统限制 页面。
- 如需调整配额,请在过滤条件中复制和粘贴属性
aiplatform.googleapis.com/semantic_governance/policy_write_requests。按 Enter 键。 - 点击行末的三个点,然后选择修改配额。
- 在窗格中输入新的配额值,然后点击提交请求 。
Gemini Enterprise Agent Platform 上的 RAG 引擎
对于使用 RAG 引擎执行检索增强生成 (RAG) 的每项服务,以下配额适用,配额以每分钟请求数 (RPM) 为单位进行计量。| 服务 | 配额 | 指标 |
|---|---|---|
| RAG 引擎数据管理 API | 60 RPM | VertexRagDataService requests per minute per region |
RetrievalContexts API |
600 RPM | VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1,500 RPM | Online prediction requests per base model per minute per region per base_model您可以指定其他过滤条件,即 base_model: textembedding-gecko |
| 服务 | 限制 | 指标 |
|---|---|---|
并发 ImportRagFiles 请求数 |
3 RPM | VertexRagService concurrent import requests per region |
每个 ImportRagFiles 请求的文件数上限 |
10,000 | VertexRagService import rag files requests per region |
Gen AI Evaluation Service
Gen AI Evaluation Service 使用 Gemini 2.5 Flash 作为基于模型的指标的默认评判模型。 对基于模型的指标的单个评估请求可能会导致对 Gen AI Evaluation Service 发出多个底层请求。每个模型的消耗量都是在组织级层计算的,这意味着定向到评判模型进行模型推理和基于模型的评估的任何请求都会计入模型的消耗量。 下表显示了 Gen AI Evaluation Service 和底层评判模型的配额:| 请求配额 | 默认配额 |
|---|---|
| 每分钟的 Gen AI Evaluation Service 请求数 | 每个区域中每个项目 1,000 个请求 |
| Gemini 吞吐量 | 取决于模型和消耗选项 |
| 并发评估运行作业 | 每个项目在每个区域中可以有 20 个并发评估运行作业 |
如果您在使用 Gen AI Evaluation Service 时收到与配额相关的错误,则可能需要提交配额增加请求。如需了解详情,请参阅查看和管理配额。
| 限制 | 值 |
|---|---|
| Gen AI Evaluation Service 请求超时 | 60 秒 |
在新项目中首次使用 Gen AI Evaluation Service 时,您可能会遇到初始设置延迟,最长可达两分钟。如果第一个请求失败,请等待几分钟,然后重试。后续评估请求通常会在 60 秒内完成。
基于模型的指标的输入和输出词元数上限取决于用作评判模型的模型。如需查看模型列表,请参阅 Google 模型。
Gemini Enterprise Agent Platform Pipelines 配额
每个调优作业都使用 Gemini Enterprise Agent Platform Pipelines。如需了解详情, 请参阅 Agent Platform Pipelines 配额和限制。