术语

以下条款适用于 AI Hypercomputer。

加速器
一种专用硬件设备,例如 GPU 或 TPU,旨在比通用处理器更高效地执行特定任务,例如机器学习工作负载。

屏蔽
一组通过无阻塞高速网络互连的子区块,可为区块中的所有宿主机提供高带宽。

集群
通过高速网络结构互连的块集合。每个集群都是全局唯一的。 对于 A4X、A4、A3 Ultra、A3 Mega 和 A3 High(8 个 GPU)机器,集群可为您的加速器容量块提供通用的无阻塞网络结构。在集群内,节点间通信(东西向流量)对于整个块集合是非阻塞的。

集群 GPU
GPU 的机器系列类别,包括 A4X、A4、A3 Ultra、A3 Mega 和 A3 High(8 个 GPU)。借助集群 GPU,团队可以使用专用网络结构和同步维护,将数千个互联的加速器部署和扩缩为单个紧密耦合的系统。它们非常适合需要极高的计算能力、内存和高速网络同步的工作负载。常见应用场景包括使用数万亿参数预训练基础模型、部署前沿模型以及进行药物研发模拟。

紧急维护
有时也称为紧急维护。由严重的硬件、软件或安全问题导致的计划外维护事件。 对于支持的加速器机器类型,紧急维护会提前通知,而不是立即中断。收到此通知后,您有时间正常排空工作负载,并可选择在系统终止虚拟机之前触发修复。

通用 GPU
一类 GPU 机器家族,包括 G2、G4、A2、N1+T4 和 A3 Edge。 借助通用 GPU,团队可以完全自主地部署和扩缩 NVIDIA 加速器,从而绕过协调式超级计算集群的架构复杂性。它们非常适合优先考虑高可用性、自助服务配置和独立伸缩的工作负载。常见用例包括实时推理、RAG、原型设计以及中小型模型训练。

网络结构
高速网络基础设施,可在集群中的所有区块和 Google Cloud 服务之间提供高带宽和低延迟。该光纤网采用 Jupiter 网络架构。为了优化性能,该网络结构使用软件定义网络和光开关。

节点或主机
数据中心内的单个物理服务器机器。每个主机都有关联的计算资源,例如加速器。这些计算资源的数量和配置取决于机器家族。Compute Engine 实例是在物理主机上预配的。

NVLink 网域(也称为子块)是 A4X Max 和 A4X 机器的核心容量单位。NVLink 网域由 18 个 A4X Max 或 A4X 实例(72 个 GPU)组成,这些实例通过多节点 NVLink 系统连接在一起。

子区块
位于单个物理块上的一组主机和关联的连接硬件。在 A4X Max 和 A4X 机器的上下文中,子块也称为 NVLink 网域。

超级块
数据中心内互连机器的物理分组。通过将机器放置在超块内,您可以实现执行紧密耦合的训练工作负载所需的极高网络吞吐量和亚毫秒级延迟时间。

更多信息

以下文档进一步说明了与相应主题相关的术语: