xAI Grok 模型

xAI Grok 模型可在 Gemini Enterprise Agent Platform 上用作受管理的 API。您可以流式传输回答,以降低最终用户对延迟时间的感知度。流式回答使用服务器发送的事件 (SSE) 来逐步流式传输回答。

受管理的 xAI 模型

xAI 提供了以下模型,可在 Gemini Enterprise Agent Platform 中使用。如需访问 xAI 模型,请前往其 Model Garden 模型卡片。

Grok 4.3

Grok 4.3 是 xAI 的旗舰模型。

前往 Grok 4.3 模型卡片

Grok 4.20(推理)

Grok 4.20(推理)是 xAI 的旗舰级模型,具有业界领先的低幻觉率。擅长处理文档理解任务和长期限代理工具调用。

前往 Grok 4.20(推理)模型卡片

Grok 4.20(非推理)

Grok 4.20(非推理)是 xAI 的旗舰级非思考模型,具有业界领先的低幻觉率。在对延迟敏感的应用场景(例如客户支持和分类)中表现出色。

前往 Grok 4.20(非推理)模型卡片

Grok 4.1 Fast(推理)

Grok 4.1 Fast(推理)是 xAI 最具成本效益的模型,具有强大的工具调用功能和高效的知识库整合能力。擅长执行涉及网络数据和内部知识库工具的搜索任务。

前往 Grok 4.1 Fast(推理)模型卡片

Grok 4.1 Fast(非推理)

Grok 4.1 Fast(非推理)是 xAI 最具成本效益的非思考模型,针对低延迟性能进行了优化。擅长处理数据量较大的任务,例如总结和分类。

前往 Grok 4.1 Fast(非推理)模型卡片

使用 xAI 模型

对于受管模型,您可以使用 curl 命令通过以下模型名称向 Gemini Enterprise Agent Platform 端点发送请求。如需了解如何对 xAI 模型进行流式调用和非流式调用,请参阅调用开放模型 API

对于受管理的模型,您可以使用 curl 命令通过以下模型名称向 Gemini Enterprise Agent Platform 端点发送请求:

  • 对于 Grok 4.3,请使用 grok-4.3
  • 对于 Grok 4.20(推理),请使用 grok-4.20-reasoning
  • 对于 Grok 4.20(非推理),请使用 grok-4.20-non-reasoning
  • 对于 Grok 4.1 Fast(推理),请使用 grok-4.1-fast-reasoning
  • 对于 Grok 4.1 Fast(非推理),请使用 grok-4.1-fast-non-reasoning

Grok 配额

Grok 模型具有全局配额。配额在每分钟查询次数 (QPM) 和每分钟词元数 (TPM) 中指定。TPM 包括输入和输出词元。

为了保持整体服务性能和可接受的使用情况,配额上限可能会因账号而异,并且在某些情况下,访问可能会受到限制。在 Google Cloud 控制台的配额和系统限制页面上查看项目的配额。 您还必须拥有以下可用配额:

  • global_generate_content_requests_per_minute_per_project_per_base_model 用于定义 QPM 配额。

  • 对于 TPM,有两个配额值适用于特定模型:global_generate_content_input_tokens_per_minute_per_base_model 定义输入 TPM 配额,global_generate_content_output_tokens_per_minute_per_base_model 定义输出 TPM 配额。

如需了解哪些模型会分别统计输入和输出 token,请参阅特定模型页面。

后续步骤