xAI Grok 模型可在 Gemini Enterprise Agent Platform 上用作受管理的 API。您可以流式传输回答,以降低最终用户对延迟时间的感知度。流式回答使用服务器发送的事件 (SSE) 来逐步流式传输回答。
受管理的 xAI 模型
xAI 提供了以下模型,可在 Gemini Enterprise Agent Platform 中使用。如需访问 xAI 模型,请前往其 Model Garden 模型卡片。
Grok 4.3
Grok 4.3 是 xAI 的旗舰模型。
Grok 4.20(推理)
Grok 4.20(推理)是 xAI 的旗舰级模型,具有业界领先的低幻觉率。擅长处理文档理解任务和长期限代理工具调用。
Grok 4.20(非推理)
Grok 4.20(非推理)是 xAI 的旗舰级非思考模型,具有业界领先的低幻觉率。在对延迟敏感的应用场景(例如客户支持和分类)中表现出色。
Grok 4.1 Fast(推理)
Grok 4.1 Fast(推理)是 xAI 最具成本效益的模型,具有强大的工具调用功能和高效的知识库整合能力。擅长执行涉及网络数据和内部知识库工具的搜索任务。
Grok 4.1 Fast(非推理)
Grok 4.1 Fast(非推理)是 xAI 最具成本效益的非思考模型,针对低延迟性能进行了优化。擅长处理数据量较大的任务,例如总结和分类。
使用 xAI 模型
对于受管模型,您可以使用 curl 命令通过以下模型名称向 Gemini Enterprise Agent Platform 端点发送请求。如需了解如何对 xAI 模型进行流式调用和非流式调用,请参阅调用开放模型 API。
对于受管理的模型,您可以使用 curl 命令通过以下模型名称向 Gemini Enterprise Agent Platform 端点发送请求:
- 对于 Grok 4.3,请使用
grok-4.3 - 对于 Grok 4.20(推理),请使用
grok-4.20-reasoning - 对于 Grok 4.20(非推理),请使用
grok-4.20-non-reasoning - 对于 Grok 4.1 Fast(推理),请使用
grok-4.1-fast-reasoning - 对于 Grok 4.1 Fast(非推理),请使用
grok-4.1-fast-non-reasoning
Grok 配额
Grok 模型具有全局配额。配额在每分钟查询次数 (QPM) 和每分钟词元数 (TPM) 中指定。TPM 包括输入和输出词元。
为了保持整体服务性能和可接受的使用情况,配额上限可能会因账号而异,并且在某些情况下,访问可能会受到限制。在 Google Cloud 控制台的配额和系统限制页面上查看项目的配额。 您还必须拥有以下可用配额:
global_generate_content_requests_per_minute_per_project_per_base_model用于定义 QPM 配额。对于 TPM,有两个配额值适用于特定模型:
global_generate_content_input_tokens_per_minute_per_base_model定义输入 TPM 配额,global_generate_content_output_tokens_per_minute_per_base_model定义输出 TPM 配额。
如需了解哪些模型会分别统计输入和输出 token,请参阅特定模型页面。
后续步骤
- 了解如何调用开放模型 API。
- 了解如何调用 Responses API。