已知问题

本页面介绍了在运行 AI 优化型虚拟机或集群时可能会遇到的已知问题。如需了解 Compute Engine 虚拟机的问题,请参阅 Compute Engine 已知问题

问题

以下部分列出了 AI Hypercomputer 的已知问题和解决方法。

由于 NVIDIA B200 GPU 的固件问题,A4 虚拟机上的工作负载中断

NVIDIA 发现了 A4 虚拟机使用的 B200 GPU 存在两个固件问题。这些问题可能会导致工作负载中断,例如 nvidia-smi 命令无响应。如果您发现 A4 虚拟机上的工作负载中断,请确认是否满足以下任一条件:

  • 虚拟机的正常运行时间 (lastStartTimestamp) 超过 65 天。
  • 日志显示一条 提及 0x02aXid 149 错误消息。

如果满足上述任一条件,您必须重置连接到 A4 虚拟机的 GPU。为防止日后因固件问题导致工作负载中断,我们建议您至少每 60 天重置一次 GPU。如需了解详情,请参阅重置 GPU

元数据服务器可能会显示旧的 physicalHost 虚拟机元数据

遇到主机错误或使用报告故障主机 API 将计算实例移至新主机后,当您查询元数据服务器时,它可能会显示计算实例之前主机的 physicalHost 元数据。

如需解决此问题,请执行以下任一操作: