全托管式 Llama 模型


Llama 模型可在 Gemini Enterprise Agent Platform 上用作受管理的 API 和自行部署的模型。您可以流式传输回答,以降低最终用户对延迟时间的感知度。流式回答使用服务器发送的事件 (SSE) 来逐步流式传输回答。

受管理的 Llama 模型

Llama 模型以 API 形式提供全代管式无服务器模型。如需在 Agent Platform 上使用 Llama 模型,请直接向 Agent Platform API 端点发送请求。将 Llama 模型用作托管式 API 时,无需预配或管理基础设施。

Llama 提供了以下模型,可在 Gemini Enterprise Agent Platform 中使用。如需访问 Llama 模型,请前往其 Model Garden 模型卡片。

Llama 4 Maverick 17B-128E 规模最大、功能最强大的多模态 Llama 4 模型(MoE 17B 活跃 / 400B 总计),针对编码、深度推理、复杂对话和高精度图片理解进行了优化。
Llama 4 Scout 17B-16E 高效的 MoE 模型(170 亿个有效参数 / 1,090 亿个总参数),在长上下文检索、文档摘要和大型代码库推理方面取得了前沿结果。
Llama 3.3 70B 纯文本 70B 指令调优模型,用于纯文本应用时,相对于 Llama 3.1 70B 和 Llama 3.2 90B,可提供增强的性能。

使用 Llama 模型

对于受管模型,您可以使用 curl 命令通过以下模型名称向 Gemini Enterprise Agent Platform 端点发送请求。如需了解如何对 Llama 模型进行流式调用和非流式调用,请参阅调用开放模型 API。

如需使用自行部署的 Gemini Enterprise Agent Platform 模型,请执行以下操作:

  1. 前往 Model Garden 控制台。
  2. 找到相关的 Gemini Enterprise Agent Platform 模型。
  3. 点击启用,然后填写提供的表单,以获取必要的商业用途许可。

如需详细了解如何部署和使用合作伙伴模型,请参阅部署合作伙伴模型并发出预测请求。

后续步骤

了解如何使用 Llama 模型。