计算可靠性数据分析概览

Compute Reliability Insights 提供了一系列功能,可提高 Compute Engine 工作负载的可靠性。此工具可让您了解潜在风险,并通过详细的解决方案和主动建议实现有效的风险管理。

本页面提供了有关 Compute Reliability Insights 的概念信息。如需详细了解如何查看和应用可靠性建议,请参阅 查看和应用可靠性 建议

了解可靠性风险

可靠性风险是指 Compute Engine 功能或设置配置错误可能会对基础架构的稳定性和可用性产生不利影响的情况。这种情况可能以以下方式发生:

  • 意外的级联故障:Google 基础架构的一个可用区或区域发生中断可能会意外中断其他可用区或区域中的资源。
  • 外部依赖项:您的资源可能依赖于位于主要资源位置之外的 特定 Compute Engine 区域的可用性。

风险类型

Compute Reliability Insights 可识别工作负载中的一部分潜在风险:

风险严重级别和优先级

Compute Reliability Insights 使用以下严重级别和优先级定义来确定风险的优先级。

严重级别 优先级 说明
P1 当区域性中断发生时, 中断多个区域中常用服务 (例如,虚拟机创建)的配置错误或设置。
媒介 P2 当区域性中断发生时, 中断多个区域中不太重要的服务 (例如, 实例模板创建)的配置错误或设置。

遥测和延迟时间

Compute Reliability Insights 依赖于遥测数据来识别风险。 使用此功能时,请考虑以下行为:

  • 新项目和不活跃的资源:对于过去 7 天内创建的项目或包含不活跃虚拟机的项目,建议可能不可用 ,因为流水线需要更多遥测数据。
  • 缓解延迟:缓解风险后, Google Cloud 控制台和 API 最长可能需要 24 小时才会停止显示建议。这是因为提取流水线每 24 小时运行一次,以清除已解决的建议。

后续步骤