您可以为微调后的 Gemini 模型使用上下文缓存,以提高性能并降低包含大量上下文的提示所产生的费用。通过缓存常用上下文,您可以避免在每次向微调后的模型发送请求时都重新发送大量数据。
调优后的 Gemini 模型的上下文缓存管理操作(Read、Update、Delete)与基础模型保持一致。只有缓存内容创建和推理需要进行特定调整,具体如下所述。
前提条件
微调 Gemini 模型:您需要基于受支持的基础模型部署微调后的 Gemini 模型(请参阅上下文缓存概览)。如需详细了解如何微调 Gemini 模型,请参阅微调 Gemini 模型。如需获取所部署的调优后模型的端点,请参阅部署调优后的模型。
确保您拥有以下信息:
- 调优后的 Gemini 模型的 ID 和版本
- 所部署的微调后模型的端点资源名称
支持的版本
微调后的 Gemini 模型支持特定版本的隐式缓存。如需查看支持的模型及其功能的列表,请参阅 Google 模型。
微调模型不支持显式缓存。