本部分介绍了预配吞吐量如何适用于 Gemini Omni 模型,包括配额强制执行行为和最低生成式 AI 扩缩单元 (GSU) 购买增量。
对于 Gemini Omni 模型,配额强制执行期因您为该模型购买的 GSU 数量而异,并且可能会发生变化。以下部分列出了不同规模的 GSU 的配额强制执行期。
Gemini Omni Flash 预览版:配额强制执行时间段
以下是 Gemini Omni Flash 预览版针对不同规模的 GSU 的配额强制执行期:
- 1-9 个 GSU:2,000 秒
- 10-19 个 GSU:200 秒
- 20-39 个 GSU:100 秒
- 40-66 个 GSU:50 秒
- 67 个以上 GSU:30 秒
列出的值与请求延迟时间无关。处理您的请求所用的时间与配额强制执行期不同。
GSU 数量较小时,强制执行时间窗口会更大,以确保较小的请求在窗口内成功处理。随着模型的 GSU 数量增加,处理请求不再需要较长的窗口时间。如果您需要使用预配吞吐量更频繁地处理 Omni Flash 上的输出,建议您增加购买的 GSU 数量,并查看相应的强制执行时间窗口。
例如,假设您为一项需要生成一段时长为 10 秒的 1080p 视频的工作负载购买了 1 个 GSU 的 Omni Flash Preview。在这种情况下,您通常可以在 60 秒内生成此视频,并且流量会作为预置吞吐量进行处理。不过,如果您想生成另一段时长相同的视频,则必须等到配额强制执行时间窗口结束(1 GSU 为 2,000 秒)。此强制执行时间段由 Gemini Enterprise Agent Platform 时钟时间决定,与发出请求的时间无关。强制执行期限取决于后端算法,可能会发生变化。
我们建议您在发出请求时设置时长和分辨率 API 参数。如果提供,预配吞吐量可以提供更准确的体验。如果未提供这些参数,预配吞吐量请求大小估算会假设最长时长和最高分辨率,这可能会导致过早地、不必要地溢出到随用随付,并降低所购买的预配吞吐量的利用率。
估算 GSU 要求
我们建议您使用“预配吞吐量”页面上的估算工具来估算工作负载所需的 GSU 数量。该工具需要您输入特定频次窗口的总输入 token 数和输出 token 数估计值。如需详细了解如何使用估算工具,请参阅下达标准预配吞吐量订单。
如需估算 token 数量,请使用以下方法:
- 输入文本 token:使用 SDK 词元化器或 countTokens API。
- 其他模态的输入 token:根据价格页面中的假设使用估算值。
- 现有工作负载:将特定时间窗口内生成的回答的 token 使用量相加。
例如,假设某个工作负载每 30 秒生成 5 个 10 秒的 720p 视频和 5 个 10 秒的 1080p 视频(总共 10 个请求)。假设每个请求有 20 个输入文本 token、一张图片(1,120 个 token)和 100 个响应思考 token。GSU 估算器的输入如下:
- 频次:30 秒
- 输入文本 token 总数:20 × 10(请求数)= 200
- 图片 token 总数:1,120 × 10(请求数)= 11,200
- 输出推理 token 总数:100 × 10(请求数)= 1,000
- 输出视频的 token 总数:10 秒(时长)× 5,792(token/秒)× 5 个视频(720p)+ 10 秒(时长)× 8,688(token/秒)× 5 个视频(1080p)= 724,000
- 估计 GSU 数:434
高分辨率和高时长视频场景
单个大型请求无法拆分到两个违规处置窗口中。如果某个请求需要的吞吐量超过了强制执行窗口的容纳量,则每次都会按即用即付方式提供服务,无论您发送该请求的频率有多低,也无论后续窗口中可能存在多少未使用的预配吞吐量配额。
这只会影响时长不短于 7 秒的 4K 视频。在 360p、720p 和 1080p 分辨率下,所有支持的时长都适合任何购买规模的单个窗口;6 秒或更短的 4K 视频也是如此(假设典型的输入和推理令牌少于 88,000 个令牌)。
如果您生成时长不短于 7 秒的 4K 视频,请将估算工具的结果与下表进行比较,并按较大者订购:
| 最长的 4K 视频 | 1-9 个 GSU | 10-19 个 GSU | 20-39 个 GSU | 40-66 个 GSU | 67 个以上的 GSU |
|---|---|---|---|---|---|
| 7 秒 | 2 | 12 | 23 | 46 | 76 |
| 8 秒 | 2 | 13 | 26 | 52 | 87 |
| 9 秒 | 2 | 15 | 29 | 58 | 97 |
| 10 秒 | 2 | 17 | 33 | 65 | 107 |
查看与您的 GSU 估算数量相符的列。例如,假设您每 2,000 秒生成 6 个时长为 10 秒的 4K 视频。估算器返回 10 个 GSU,足以满足平均吞吐量。不过,在 10 GSU 时,强制执行时间窗口为 200 秒,而您的所有 10 秒视频都无法在一个窗口内完成。将这 6 个请求的间隔时间拉长也无法解决此问题。为了在不发生随用随付溢出的情况下成功处理请求,请订购 17 个 GSU。
这些数据假设了典型的提示和推理 token 数,即文本或图片提示,或时长不超过 10 秒的待编辑视频。