管理服务错误事件

借助 Error Reporting,您可以监控和诊断 Google Cloud 项记录错误消息但不记录堆栈轨迹的服务的平台故障。例如,如果 Cloud Run 达到其容器实例数量上限,Error Reporting (when used with Stackdriver) 会对日志事件进行分组、发送通知,并提供指向特定于服务的问题排查文档的直接链接。

查看服务错误组

在 Google Cloud 控制台中,前往 Error Reporting 页面:

前往 Error Reporting

您也可以使用搜索栏查找此页面。

当 Error Reporting 确定存在服务故障时,它会将这些错误事件分组,并将错误类型设置为 Service error。Error Reporting 概览会显示错误类型以及有关错误组的其他信息:

Error Reporting 概览页面

对于有记录解决方案的服务错误事件,Error Reporting 会提供指向 Google Cloud 服务的排查指南的链接。

服务错误事件示例

下表列出了 Error Reporting (when used with Stackdriver) 中的“服务错误”功能捕获的部分(而非全部)错误事件。

Google Cloud 服务名称 错误类型
Dataflow 工作器日志节流
内存不足(系统)
缺少自定义子网
步骤中的操作耗时过长
JRE 崩溃
工作器 JAR 文件配置错误
Cloud Run 超出内存上限
无可用实例
Google Kubernetes Engine Pod 运行状况不佳,探测失败
Pod 调度失败
以退避方式重启失败的容器
卷未装载
容器映像拉取失败
未能更新端点
未找到 Secret/ConfigMap