借助 Error Reporting,您可以监控和诊断 Google Cloud 项记录错误消息但不记录堆栈轨迹的服务的平台故障。例如,如果 Cloud Run 达到其容器实例数量上限,Error Reporting (when used with Stackdriver) 会对日志事件进行分组、发送通知,并提供指向特定于服务的问题排查文档的直接链接。
查看服务错误组
在 Google Cloud 控制台中,前往 Error Reporting 页面:
您也可以使用搜索栏查找此页面。
当 Error Reporting 确定存在服务故障时,它会将这些错误事件分组,并将错误类型设置为 Service error。Error Reporting 概览会显示错误类型以及有关错误组的其他信息:
对于有记录解决方案的服务错误事件,Error Reporting 会提供指向 Google Cloud 服务的排查指南的链接。
服务错误事件示例
下表列出了 Error Reporting (when used with Stackdriver) 中的“服务错误”功能捕获的部分(而非全部)错误事件。
| Google Cloud 服务名称 | 错误类型 |
|---|---|
| Dataflow | 工作器日志节流 内存不足(系统) 缺少自定义子网 步骤中的操作耗时过长 JRE 崩溃 工作器 JAR 文件配置错误 |
| Cloud Run | 超出内存上限 无可用实例 |
| Google Kubernetes Engine | Pod 运行状况不佳,探测失败 Pod 调度失败 以退避方式重启失败的容器 卷未装载 容器映像拉取失败 未能更新端点 未找到 Secret/ConfigMap |