本文档介绍如何排查在 AI 优化型虚拟机或集群上运行的工作负载的性能缓慢问题。
如需了解如何识别性能缓慢问题,请参阅 监控 Compute Engine 实例和 Slurm 集群。
识别并解决工作负载中任何可疑的 Straggler: 完成以下步骤:
检查是否可以为工作负载使用 Straggler 检测。如需查看 使用 Straggler 检测的限制和要求, 请参阅 监控 Compute Engine 实例和 Slurm 集群。
如果无法使用 Straggler 检测,请 使用其他选项来排查性能缓慢问题。
如需检查工作负载中是否有任何虚拟机是可疑的 Straggler,请查看 Straggler 检测指标。
例如,如需在 Cloud Monitoring 中直观呈现项目的所有可疑 Straggler,请完成以下步骤:
-
在 Google Cloud 控制台中,前往 信息中心 页面:
如果您使用搜索栏查找此页面,请选择子标题为监控 的结果。
在过滤条件窗格的 Type 部分,点击 Google 服务。
在名称 列中,点击 Cluster Director 健康状况监控 。
系统随即会打开信息中心的详情页面。
使用工具栏中的时间范围选择器选择性能缓慢的时间范围。Straggler 检测通常最多需要 10 分钟才能报告 Straggler。
如需检查工作负载中是否有任何虚拟机是可疑的 Straggler,请查看 Straggler 检测 部分。使用此查询查看可疑 Straggler 实例 表是否列出了工作负载的任何虚拟机。
-
根据工作负载中可疑 Straggler 虚拟机的数量,按如下方式操作:
如果 没有 虚拟机是可疑的 Straggler,请验证 Straggler 检测是否正常运行。如需验证 Straggler 检测 服务是否正在为项目运行,请按照说明 查看 Straggler 检测日志 ,并为项目中的所有 Straggler 检测日志指定 查询。 然后,按如下方式操作:
如果您的项目没有 Straggler 检测日志,但虚拟机至少运行了 10 分钟,则 Straggler 检测服务未在为您的项目运行。如需解决 此问题,请与 Cloud Customer Care 联系,或稍后 重试。
否则,如果您已验证 Straggler 检测正在为您的项目运行,并且您的工作负载支持 Straggler 检测,则性能缓慢可能是由其他问题引起的。 使用其他选项来排查性能缓慢问题。
如果工作负载中报告为可疑 Straggler 的虚拟机数量 较少 ,请测试将工作负载从可疑虚拟机迁移出去。然后,按如下方式操作:
如果迁移确实恢复了工作负载的性能,则 可疑虚拟机可能存在故障。对于每个此类虚拟机,请按照报告有故障的主机的步骤操作,并将
FAULT_REASON设置为PERFORMANCE,并将DESCRIPTION设置为straggler node。如果迁移未恢复性能,则可能存在 更多可疑 Straggler 虚拟机,或者性能缓慢可能是由 其他问题引起的。您可以 检查工作负载中是否有更多虚拟机是可疑的 Straggler 或 使用其他选项来排查性能缓慢问题。
如果工作负载中报告为 可疑 Straggler 的虚拟机数量 较多 ,请使用其他选项来排查性能缓慢问题。
使用其他选项来排查性能缓慢问题:如果报告的可疑 Straggler 虚拟机列表很长,或者移除报告的 Straggler 虚拟机无法恢复性能,请使用其他选项来排查性能缓慢问题,例如:
- 使用集群健康状况扫描器测试集群。
- 查看其他性能指标。
- 查看其他问题排查文档。例如,请参阅 Compute Engine 文档中的 排查 GPU 虚拟机问题 。