排查性能下降问题

本文档介绍如何排查在 AI 优化型虚拟机或集群上运行的工作负载的性能缓慢问题。

如需了解如何识别性能缓慢问题,请参阅 监控 Compute Engine 实例和 Slurm 集群

  1. 识别并解决工作负载中任何可疑的 Straggler: 完成以下步骤:

    1. 检查是否可以为工作负载使用 Straggler 检测。如需查看 使用 Straggler 检测的限制和要求, 请参阅 监控 Compute Engine 实例和 Slurm 集群

      如果无法使用 Straggler 检测,请 使用其他选项来排查性能缓慢问题

    2. 如需检查工作负载中是否有任何虚拟机是可疑的 Straggler,请查看 Straggler 检测指标。

      例如,如需在 Cloud Monitoring 中直观呈现项目的所有可疑 Straggler,请完成以下步骤:

      1. 在 Google Cloud 控制台中,前往  信息中心 页面:

        前往信息中心

        如果您使用搜索栏查找此页面,请选择子标题为监控 的结果。

      2. 在过滤条件窗格的 Type 部分,点击 Google 服务

      3. 名称 列中,点击 Cluster Director 健康状况监控

        系统随即会打开信息中心的详情页面。

      4. 使用工具栏中的时间范围选择器选择性能缓慢的时间范围。Straggler 检测通常最多需要 10 分钟才能报告 Straggler。

      5. 如需检查工作负载中是否有任何虚拟机是可疑的 Straggler,请查看 Straggler 检测 部分。使用此查询查看可疑 Straggler 实例 表是否列出了工作负载的任何虚拟机。

    3. 根据工作负载中可疑 Straggler 虚拟机的数量,按如下方式操作:

  2. 使用其他选项来排查性能缓慢问题:如果报告的可疑 Straggler 虚拟机列表很长,或者移除报告的 Straggler 虚拟机无法恢复性能,请使用其他选项来排查性能缓慢问题,例如: