术语

以下条款适用于 AI Hypercomputer。

加速器
一种专用硬件设备,例如 GPU 或 TPU,旨在比通用处理器更高效地执行特定任务,例如机器学习工作负载。

屏蔽
一组相互连接的子区块。在区块内,任何 GPU 都可以通过网络结构访问,从而确保分布式训练任务实现超低延迟通信。

集群
通过高速结构连接的一组互连区块。 借助无阻塞的东西向网络结构,您可以在数千个 GPU 上扩展大规模训练作业,而不会遇到性能或带宽瓶颈。

集群 GPU
GPU 的一类机器系列,包括 A4X、A4、A3 Ultra、A3 Mega 和 A3 High(8 个 GPU)。借助集群 GPU,团队可以使用专用网络结构和同步维护,将数千个互联的加速器部署和扩缩为一个紧密耦合的系统。它们非常适合需要极高的计算能力、内存和高速网络同步的工作负载。常见应用场景包括使用数万亿参数预训练基础模型、部署前沿模型以及进行药物研发模拟。

紧急维护
有时也称为紧急维护。由严重的硬件、软件或安全问题引起的计划外维护事件。对于支持的加速器机器类型,紧急维护会提前通知,而不是立即中断。收到此通知后,您有时间安全排空工作负载,并可选择在系统终止虚拟机之前触发修复。

通用 GPU
一类 GPU 机器家族,包括 G2、G4、A2、N1+T4 和 A3 Edge。借助通用 GPU,团队可以完全自主地部署和扩缩 NVIDIA 加速器,从而绕过协调式超级计算集群的架构复杂性。它们非常适合优先考虑高可用性、自助服务配置和独立伸缩的工作负载。常见用例包括实时推理、RAG、原型设计以及中小型模型训练。

网络结构
网络结构可在集群中的所有区块和 Google Cloud 服务之间提供高带宽、低延迟的连接。Jupiter 是 Google 的数据中心网络架构,它利用软件定义网络和光学电路开关来改进网络并优化其性能。

节点或主机
数据中心内的单个物理服务器机器。每个主机都有关联的计算资源,例如加速器。这些计算资源的数量和配置取决于机器家族。Compute Engine 实例是在物理主机上预配的。

NVLink 网域(也称为子块)是 A4X Max 和 A4X 机器的核心容量单位。NVLink 网域由 18 个 A4X Max 或 A4X 实例(72 个 GPU)组成,这些实例通过多节点 NVLink 系统连接在一起。

子区块
位于单个物理机架上的一组主机和关联的连接硬件。在 A4X Max 和 A4X 机器的上下文中,子块也称为 NVLink 网域。

超级区块
数据中心内互连机器的物理分组。通过将机器放置在超块内,您可以实现执行紧密耦合的训练工作负载所需的极高网络吞吐量和亚毫秒级延迟时间。

更多信息

以下文档进一步说明了与相应主题相关的术语: