TPU 容量模式
TPU 提供两种容量模式:受管理的容量模式和全容量模式。每种模式都定义了如何处理硬件维护和主机错误,以及您对 TPU 硬件拓扑的可见性和控制程度。
TPU 容量模式概览
下表总结了受管容量模式与“所有容量”模式之间的主要区别:
| 受管理的容量模式 | 全容量模式 | |
|---|---|---|
| 容量访问权限 | Google 会在可用基础设施中管理容量分配和主机恢复。 | 工作负载可使用 100% 的预留容量。您负责管理备用容量以进行故障恢复。您可以定位到特定块或子块,以实现精确的拓扑感知型工作负载布置。 |
| 硬件拓扑可见性 | Compute Engine 会抽象化物理拓扑。 | 全面了解集群、块、子块和主机拓扑及利用率。 |
| 故障恢复 | Compute Engine 会自动检测有故障的 TPU 切片,并在运行状况良好的硬件上重启这些切片。 | Google 会自动检测并修复故障硬件。您负责监控 TPU 切片的健康状况,并将健康状况不佳的切片重新调度到您在预留中预留的健康备用硬件。 |
| 维护控制 | Compute Engine 会安排和管理维护事件。您可以选择在预定的维护时间之前开始维护。 | 您可以精细控制预留、块或子块级层的维护安排和启动。 |
| 支持的 TPU 版本 | 所有 TPU 版本。 | TPU v6e (Trillium) 和 TPU7x (Ironwood) |
| 支持的消费选项 | 所有使用选项。 | 您必须拥有未来预留,且预留的最小容量大小至少为一年。不支持日历模式下的未来预留。如需了解详情并申请全容量模式预留,请与您的 Google Cloud 客户支持团队联系。 |
受管理的容量模式
默认情况下,TPU 容量以受管理容量模式运行。在此模式下,Compute Engine 会自动检测硬件故障并替换受影响的 TPU 实例,以确保工作负载可以在正常的硬件上重新启动。
受管容量模式具有以下特点:
- 自动实例恢复:对于按需、灵活启动和预留使用选项,Compute Engine 会自动检测硬件故障并替换受影响的 TPU 实例。
- 简化管理:主机维护或修复操作无需人工干预。
全容量模式
全容量模式旨在让您基于预留直接控制 TPU 资源。在全容量模式下,您可以访问 100% 的预留容量。您负责使用足够的健康备用容量来管理 TPU 切片恢复,并负责安排维护事件。
全容量模式具有以下功能:
- 完全分配容量:不受任何限制地访问所有预留容量,包括为故障恢复或工作负载突增分配的任何备用容量。
- 拓扑感知型布置:全面了解集群、块、子块和主机拓扑,以优化工作负载布置。
- 高级维护控制:在预留、块或子块级层安排和触发维护事件。
- 报告并维修:报告性能不佳的硬件以进行维修。
请与您的 Google Cloud 客户支持团队联系,请求全容量模式预留。如需了解详情,请参阅全容量模式概览。