Google 会使用 AI 技术将内容翻译成您偏好的语言。AI 翻译可能包含错误。
术语
使用集合让一切井井有条
根据您的偏好保存内容并对其进行分类。
以下条款适用于 AI Hypercomputer。
加速器link
一种专用硬件设备,例如 GPU 或 TPU,旨在比通用处理器更高效地执行特定任务,例如机器学习工作负载。
屏蔽link
一组相互连接的子区块。在区块内,任何 GPU 都可以通过网络结构访问,从而确保分布式训练任务实现超低延迟通信。
集群link
通过高速结构连接的一组互连区块。
借助无阻塞的东西向网络结构,您可以在数千个 GPU 上扩展大规模训练作业,而不会遇到性能或带宽瓶颈。
集群 GPU link
GPU 的一类机器系列,包括 A4X、A4、A3 Ultra、A3 Mega 和 A3 High(8 个 GPU)。借助集群 GPU,团队可以使用专用网络结构和同步维护,将数千个互联的加速器部署和扩缩为一个紧密耦合的系统。它们非常适合需要极高的计算能力、内存和高速网络同步的工作负载。常见应用场景包括使用数万亿参数预训练基础模型、部署前沿模型以及进行药物研发模拟。
紧急维护link
有时也称为紧急维护。由严重的硬件、软件或安全问题引起的计划外维护事件。对于支持的加速器机器类型,紧急维护会提前通知,而不是立即中断。收到此通知后,您有时间安全排空工作负载,并可选择在系统终止虚拟机之前触发修复。
通用 GPUlink
一类 GPU 机器家族,包括 G2、G4、A2、N1+T4 和 A3 Edge。借助通用 GPU,团队可以完全自主地部署和扩缩 NVIDIA 加速器,从而绕过协调式超级计算集群的架构复杂性。它们非常适合优先考虑高可用性、自助服务配置和独立伸缩的工作负载。常见用例包括实时推理、RAG、原型设计以及中小型模型训练。
网络结构link
网络结构可在集群中的所有区块和 Google Cloud 服务之间提供高带宽、低延迟的连接。Jupiter 是 Google 的数据中心网络架构,它利用软件定义网络和光学电路开关来改进网络并优化其性能。
节点或主机link
数据中心内的单个物理服务器机器。每个主机都有关联的计算资源,例如加速器。这些计算资源的数量和配置取决于机器家族。Compute Engine 实例是在物理主机上预配的。
NVLink 网域link
NVLink 网域(也称为子块)是 A4X Max 和 A4X 机器的核心容量单位。NVLink 网域由 18 个 A4X Max 或 A4X 实例(72 个 GPU)组成,这些实例通过多节点 NVLink 系统连接在一起。
子区块link
位于单个物理机架上的一组主机和关联的连接硬件。在 A4X Max 和 A4X 机器的上下文中,子块也称为 NVLink 网域。
超级区块link
数据中心内互连机器的物理分组。通过将机器放置在超块内,您可以实现执行紧密耦合的训练工作负载所需的极高网络吞吐量和亚毫秒级延迟时间。
以下文档进一步说明了与相应主题相关的术语:
如未另行说明,那么本页面中的内容已根据知识共享署名 4.0 许可获得了许可,并且代码示例已根据 Apache 2.0 许可获得了许可。有关详情,请参阅 Google 开发者网站政策。Java 是 Oracle 和/或其关联公司的注册商标。
最后更新时间 (UTC):2026-08-13。
[null,null,["最后更新时间 (UTC):2026-08-13。"],[],[]]