本页面提供了按区域和模型列出的配额列表,并展示了如何在
控制台中查看和修改配额。 Google Cloud
已调优的模型配额
已调优的模型推理与基本模型共享同一配额。
已调优的模型推理没有单独的配额。
嵌入限制
对
gemini-embedding-001 的请求受区域配额限制,而对
gemini-embedding-2 的请求受全局配额限制。
| 基本模型 |
Quota |
指标 |
| base_model: gemini-embedding |
1 亿次 |
aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 |
2 亿次 |
aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 |
60000 |
aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
使用 predict API 对 gemini-embedding-001 的请求也受以下配额限制:
| 基本模型 |
Quota |
指标 |
| base_model: gemini-embedding |
10 万次 |
aiplatform.googleapis.com/online_prediction_requests_per_base_model |
| base_model: N/A |
30000 |
aiplatform.googleapis.com/online_prediction_requests |
Agent Runtime 配额
以下配额适用于
Agent Runtime,适用于每个区域中给定
项目:
| 说明 |
Quota |
指标 |
|
每分钟创建、删除或更新的 Agent Runtime 资源数
|
10 |
aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| 每分钟创建、删除或更新的 Agent Runtime 会话数 |
100 |
aiplatform.googleapis.com/session_write_requests |
| 每分钟获取、列出或检索的 Agent Runtime 会话数 |
10000 |
aiplatform.googleapis.com/session_read_requests |
每分钟的 Query 或 StreamQuery Agent Runtime 数 |
90 |
aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| 每分钟向 Agent Runtime 会话附加的事件数 |
300 |
aiplatform.googleapis.com/session_event_append_requests |
| Agent Runtime 资源数上限 |
100 |
aiplatform.googleapis.com/reasoning_engine_service_entities |
|
每分钟创建、删除或更新的 Agent Runtime 内存资源数 |
100 |
aiplatform.googleapis.com/memory_bank_write_requests |
|
每分钟从 Agent Runtime 记忆库中获取、列出或检索的次数
|
300 |
aiplatform.googleapis.com/memory_bank_read_requests |
| 每分钟的沙盒环境(代码执行)执行请求数 |
1000 |
aiplatform.googleapis.com/sandbox_environment_execute_requests |
| 每个区域的沙盒环境(代码执行)实体数 |
1000 |
aiplatform.googleapis.com/sandbox_environment_entities |
| 每分钟的沙盒环境(代码执行)写入请求数 |
500 |
aiplatform.googleapis.com/sandbox_environment_write_requests |
每分钟的 A2A 智能体 POST 请求数(例如 sendMessage 和 cancelTask) |
60 |
aiplatform.googleapis.com/a2a_agent_post_requests |
每分钟的 A2A 智能体 GET 请求数(例如 getTask 和 getCard)
|
600 |
aiplatform.googleapis.com/a2a_agent_get_requests |
每分钟使用 BidiStreamQuery API 的并发实时双向连接数 |
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
以下配额适用于每个区域中给定项目的
generateContent 和
streamGenerateContent 请求的多模态输入。每个配额都按基本模型和分辨率强制执行。相同的限制适用于使用相应
..._global 指标通过全局端点处理的请求。
| 说明 |
Quota |
指标 |
| 每个基本模型和分辨率每分钟的图片输入内容生成请求数 |
3400 万次 |
aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| 每个基本模型和分辨率每分钟的视频输入内容生成请求数 |
1.92 亿次 |
aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| 每个基本模型和分辨率每分钟的音频输入内容生成请求数 |
1100 万次 |
aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| 每个基本模型和分辨率每分钟的文档输入内容生成请求数 |
120 万次 |
aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
如需申请提高这些配额的限制,请与您的 Google Cloud 客户支持
团队联系;无法通过 Google Cloud 控制台提高这些配额。
批量推理
批量推理作业的配额和限制在所有区域中都是相同的。
Gemini 模型的并发批量推理作业限制
Gemini 模型的批量推理没有预定义的配额限制。相反,批量服务提供对大型共享资源池的访问权限,并根据模型在所有客户中的实时可用性和需求动态分配资源。
当更多客户处于活跃状态并使模型容量达到饱和时,您的批量请求可能会因容量不足而排队。
非 Gemini 模型的并发批量推理作业配额
下表列出了并发批量推理作业数的配额,这些配额不适用于 Gemini 模型:
| 配额 |
值 |
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
如果提交的任务数量超过分配的配额,则会将任务放入队列中,并在配额容量可用时进行处理。
在 Google Cloud 控制台中查看和修改配额
如需在
控制台中查看和修改配额,请执行以下操作:
Google Cloud - 前往配额和系统限制 页面。
前往“配额和系统限制”
- 如需调整配额,请在过滤条件中复制和粘贴属性
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs。按 Enter 键。
- 点击行末的三个点,然后选择修改配额。
- 在窗格中输入新的配额值,然后点击提交请求 。
语义治理政策配额
以下配额适用于每个区域中给定项目的
语义治理政策:
| 说明 |
Quota |
指标 |
|
每分钟获取或列出的语义治理政策资源数
|
600 |
aiplatform.googleapis.com/semantic_governance/policy_read_requests |
|
每分钟创建、更新或删除的语义治理政策资源数
|
60 |
aiplatform.googleapis.com/semantic_governance/policy_write_requests |
|
每分钟获取的语义治理政策引擎资源数
|
600 |
aiplatform.googleapis.com/semantic_governance/engine_read_requests |
|
每分钟更新或取消预配的语义治理政策引擎资源数
|
60 |
aiplatform.googleapis.com/semantic_governance/engine_write_requests |
|
每个项目每个位置的语义治理政策资源数。
|
1000 |
aiplatform.googleapis.com/semantic_governance/policy_count |
在 Google Cloud 控制台中查看和修改配额
如需在
控制台中查看和修改配额,请执行以下操作:
Google Cloud - 前往配额和系统限制 页面。
前往“配额和系统限制”
- 如需调整配额,请在过滤条件中复制和粘贴属性
aiplatform.googleapis.com/semantic_governance/policy_write_requests。按 Enter 键。
- 点击行末的三个点,然后选择修改配额。
- 在窗格中输入新的配额值,然后点击提交请求 。
Gemini Enterprise Agent Platform 上的 RAG 引擎
对于使用 RAG 引擎执行检索增强生成 (RAG) 的每项服务,以下配额适用,配额以每分钟请求数 (RPM) 为单位进行计量。
| 服务 |
配额 |
指标 |
| RAG 引擎数据管理 API |
60 RPM |
VertexRagDataService requests per minute per region |
RetrievalContexts API |
600 RPM |
VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1,500 RPM |
Online prediction requests per base model per minute per region per base_model
您可以指定其他过滤条件,即 base_model: textembedding-gecko
|
适用的限制如下:
| 服务 |
限制 |
指标 |
并发 ImportRagFiles 请求数 |
3 RPM |
VertexRagService concurrent import requests per region |
每个 ImportRagFiles 请求的文件数上限 |
10,000 |
VertexRagService import rag files requests per region |
Gen AI Evaluation Service
Gen AI Evaluation Service 使用 Gemini 2.5 Flash 作为基于模型的指标的默认评判模型。
对基于模型的指标的单个评估请求可能会导致对 Gen AI Evaluation Service
发出多个底层请求。每个模型的消耗量都是在组织级计算的,这意味着定向到评判模型进行模型推理和基于模型的评估的任何请求都会计入模型的消耗量。
下表显示了
Gen AI Evaluation Service 和底层评判模型的配额:
| 请求配额 |
默认配额 |
| 每分钟的 Gen AI Evaluation Service 请求数 |
每个区域中每个项目 1,000 个请求 |
| Gemini 吞吐量 |
取决于模型和消耗选项 |
| 并发评估运行作业 |
每个项目在每个区域中可以有 20 个并发评估运行作业 |
如果您在使用 Gen AI Evaluation Service 时收到与配额相关的错误,则可能需要提交配额增加请求。如需了解详情,请参阅查看和管理配额。
| 限制 |
值 |
| Gen AI Evaluation Service 请求超时 |
60 秒 |
在新项目中首次使用 Gen AI Evaluation Service 时,您可能会遇到初始设置延迟,最长可达两分钟。如果第一个请求失败,请等待几分钟,然后重试。后续评估请求通常会在 60 秒内完成。
基于模型的指标的输入和输出词元数上限取决于用作评判模型的模型。如需查看模型列表,请参阅 Google 模型。
Gemini Enterprise Agent Platform Pipelines 配额
每个调优作业都使用 Gemini Enterprise Agent Platform Pipelines。如需了解详情,
请参阅 Agent Platform Pipelines 配额和限制。
后续步骤
概览
了解标准即用即付,这是一种 Agent Platform 消耗选项,可让您仅为消耗的资源付费,而无需预先做出财务承诺。
资源
与 Agent Platform 相关的配额和系统限制,不包括特定于产品的配额和系统限制。
概览
了解 Google Cloud 如何限制 Google Cloud 项目可使用的资源量,以及配额如何适用于一系列资源类型,包括硬件、软件和网络组件。