事件類型

本文說明可在圖表上顯示為註解的事件類型。事件是指會影響系統運作的活動,例如重新啟動或當機。顯示事件有助於在排解問題時,將不同來源的資料建立關聯。

每個事件都會提供參考資料或疑難排解說明文件的連結,以及如何查詢事件的相關資訊。舉例來說,如果系統透過分析記錄檔找出事件,就會提供適用於 Logs Explorer 或以記錄檔為準的警告政策的查詢。

如要在圖表中新增註解,請設定顯示圖表的資訊主頁或分頁。舉例來說,您可以設定 Google Cloud 控制台「資訊主頁」頁面上的大多數資訊主頁,顯示事件。同樣地,您也可以設定某些服務專用的「可觀測性」分頁 (例如 Compute Engine 和 Google Kubernetes Engine 的分頁),顯示事件。如需設定資訊,請參閱「在資訊主頁上顯示事件」。

下圖顯示的圖表是透過分析記錄項目識別出的多個事件,以及一個 Service Health 事件:

圖表:顯示警告和資訊事件註解。

每個註解都可以列出多個事件。在先前的螢幕截圖中,列出了 GKE 部署作業的事件。

快訊事件類型

本節說明可在資訊主頁上顯示的快訊事件類型。

已開啟的警告

開啟的快訊事件可協助您將圖表資料與事件開啟時間建立關聯。如果符合下列條件,系統就會顯示快訊開啟事件:

  • 對應事件是在資訊主頁指定的時間範圍內開啟。
  • 對應的事件未關閉。

如果事件是在資訊主頁指定的時間範圍外開啟,系統不會顯示該事件的註解。同樣地,如果對應事件在資訊主頁指定的時間範圍內開啟並隨即關閉,系統就不會顯示「開啟快訊」事件。

開啟警示事件的工具提示包含下列資訊:

  • 警告政策的名稱。
  • 摘要資訊 (如有)。舉例來說,這項資訊可能包括門檻和測量值。
  • 事件的持續時間,以及事件開啟的日期和時間。
  • 指標和資源標籤。工具提示可能不會顯示所有標籤。
  • 「查看」按鈕,可開啟事件的「詳細資料」頁面。

Google Kubernetes Engine 事件類型

本節說明可在資訊主頁上顯示的 Google Kubernetes Engine 事件類型。

已修補或更新的 GKE 工作負載

這類事件有助於排解 GKE 工作負載部署或 StatefulSet 變更問題,因為這些事件可能與效能迴歸或其他效能問題有關。工作負載建立、更新或刪除時,系統會顯示這類事件。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id(cloudaudit.googleapis.com%2Factivity)
resource.type=k8s_cluster protoPayload.methodName=(
    io.k8s.apps.v1.deployments.create OR io.k8s.apps.v1.deployments.patch OR
    io.k8s.apps.v1.deployments.update OR io.k8s.apps.v1.deployments.delete OR
    io.k8s.apps.v1.statefulsets.create OR io.k8s.apps.v1.statefulsets.patch OR
    io.k8s.apps.v1.statefulsets.update OR io.k8s.apps.v1.statefulsets.delete OR
    io.k8s.apps.v1.daemonsets.create OR io.k8s.apps.v1.daemonsets.patch OR
    io.k8s.apps.v1.daemonsets.update OR io.k8s.apps.v1.daemonsets.delete
)
-protoPayload.authenticationInfo.principalEmail=("system:addon-manager" OR "system:serviceaccount:kube-system:namespace-controller")
-protoPayload.request.metadata.namespace=(kube-system OR gmp-system OR gmp-public OR gke-gmp-system OR istio-system)
-protoPayload.response.metadata.namespace=(kube-system OR gmp-system OR gmp-public OR gke-gmp-system OR istio-system)
-protoPayload.resourceName=~"namespaces/(kube-system|gmp-system|gmp-public|gke-gmp-system|istio-system)"

詳情請參閱「工作負載部署作業總覽」和「查看可觀測性指標」。

GKE Pod 異常終止

這個事件類型可協助您找出並排解 GKE Pod 異常終止的問題。Pod 異常終止可能是因為記憶體用盡或應用程式發生錯誤。發生下列任一情況時,系統會顯示這個事件類型:

  • Pod 狀態為 CrashLoopBackoff
  • Pod 以非零的結束代碼終止。
  • Pod 因記憶體不足而終止。
  • Pod 遭到驅逐。
  • 完備性/有效性探測失敗。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

(
    log_id(events)
    (
        (resource.type=k8s_pod jsonPayload.reason=(BackOff OR Unhealthy OR Killing OR Evicted)) OR
        (resource.type=k8s_node jsonPayload.reason=OOMKilling)
    )
    severity=WARNING
) OR (
    log_id(cloudaudit.googleapis.com%2Factivity) resource.type=k8s_cluster
    (protoPayload.methodName=io.k8s.core.v1.pods.eviction.create OR
        (protoPayload.methodName=io.k8s.core.v1.pods.delete
        protoPayload.response.status.containerStatuses.state.terminated.exitCode:*
        -protoPayload.response.status.containerStatuses.state.terminated.exitCode=0
        )
    )
)

如需疑難排解資訊,請參閱「疑難排解:CrashLoopBackOff」。

無法排定 GKE Pod 的時間

這個事件類型可協助您找出無法在節點上排定 Pod 的情形,並進行疑難排解。如果 Pod 排程因下列任一原因而失敗,系統就會顯示這個事件類型:

  • 節點 CPU 不足。
  • 節點記憶體不足。
  • 沒有節點的 taint 或容許條件。
  • 節點的 Pod 數量達到上限。
  • 節點集區大小上限。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

(
    log_id(events) resource.type=k8s_pod jsonPayload.reason=(NotTriggerScaleUp OR FailedScheduling)
) OR (
    log_id(container.googleapis.com/cluster-autoscaler-visibility)
    resource.type=k8s_cluster jsonPayload.noDecisionStatus.noScaleUp:*
)

如需疑難排解資訊,請參閱「疑難排解:無法指派 Pod」。

無法建立 GKE 容器

這個事件類型有助於找出並排解無法建立 GKE 容器的問題。可能是因為磁碟區掛接失敗,或是映像檔提取失敗等。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id(events) resource.type=k8s_pod jsonPayload.reason=(Failed OR FailedMount) severity=WARNING

如需有關映像檔提取的疑難排解資訊,請參閱「排解映像檔提取問題」。

Pod 自動配置器擴充及縮減

這類事件可讓您瞭解水平 Pod 自動調度器重新調度資源的情況,包括工作負載的執行中 Pod 數量增加或減少。詳情請參閱「水平自動調度 Pod 資源」。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=k8s_cluster log_id(events)
jsonPayload.involvedObject.kind=HorizontalPodAutoscaler jsonPayload.reason=SuccessfulRescale

叢集自動調度器擴充及縮減

這項事件可讓您瞭解叢集自動配置器何時會調高或調低叢集節點集區中的節點數量。詳情請參閱「關於叢集自動調度資源」和「查看叢集自動配置器事件」。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

(resource.type=k8s_cluster log_id(container.googleapis.com%2Fcluster-autoscaler-visibility)
jsonPayload.decision:*)

建立及刪除叢集

這類事件會記錄 GKE 叢集的建立和刪除動作。詳情請參閱「建立 Autopilot 叢集」、「建立區域叢集」和「刪除叢集」。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=gke_cluster log_id(cloudaudit.googleapis.com%2Factivity)
protoPayload.methodName=(
    google.container.v1alpha1.ClusterManager.CreateCluster OR
    google.container.v1beta1.ClusterManager.CreateCluster OR
    google.container.v1.ClusterManager.CreateCluster OR
    google.container.v1alpha1.ClusterManager.DeleteCluster OR
    google.container.v1beta1.ClusterManager.DeleteCluster OR
    google.container.v1.ClusterManager.DeleteCluster
)
operation.first=true

更新叢集

這類事件會記錄 GKE 叢集的更新情形,包括控制層版本自動升級、手動升級和叢集設定變更。詳情請參閱手動升級叢集或節點集區標準叢集升級

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=gke_cluster log_id(cloudaudit.googleapis.com%2Factivity)
(
    protoPayload.methodName=(
        google.container.internal.ClusterManagerInternal.PatchCluster OR
        google.container.internal.ClusterManagerInternal.UpdateClusterInternal OR
        google.container.internal.ClusterManagerInternal.UpdateCluster
    )
) OR (
    protoPayload.methodName=(
        google.container.v1beta1.ClusterManager.UpdateCluster OR
        google.container.v1.ClusterManager.UpdateCluster
    )
    operation.first=true
)
protoPayload.metadata.operationType=(UPGRADE_MASTER OR REPAIR_CLUSTER OR UPDATE_CLUSTER)

更新節點集區

這類事件會記錄 GKE 節點集區的更新情形,包括節點集區版本自動升級、手動升級、設定變更和大小調整。詳情請參閱手動升級叢集或節點集區標準叢集升級

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=gke_nodepool log_id(cloudaudit.googleapis.com%2Factivity)
(
    protoPayload.methodName=(
        google.container.internal.ClusterManagerInternal.UpdateClusterInternal OR
        google.container.internal.ClusterManagerInternal.RepairNodePool
    )
) OR (
    protoPayload.methodName=(
        google.container.v1beta1.ClusterManager.UpdateNodePool OR
        google.container.v1.ClusterManager.UpdateNodePool OR
        google.container.v1beta1.ClusterManager.SetNodePoolSize OR
        google.container.v1.ClusterManager.SetNodePoolSize OR
        google.container.v1beta1.ClusterManager.SetNodePoolManagement OR
        google.container.v1.ClusterManager.SetNodePoolManagement OR
        google.container.v1beta1.ClusterManager.SetNodePoolAutoscaling OR
        google.container.v1.ClusterManager.SetNodePoolAutoscaling
    )
    operation.first=true
)

Cloud Run 事件類型

本節說明資訊主頁上可顯示的 Cloud Run 事件類型。

Cloud Run 部署作業

這個事件類型可協助您找出並排解 Cloud Run 部署失敗問題。部署作業可能會因服務帳戶已刪除、權限不正確、匯入容器失敗或容器啟動失敗等原因而失敗。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id(cloudaudit.googleapis.com%2Factivity) resource.type=cloud_run_revision
protoPayload.methodName=google.cloud.run.v1.Services.ReplaceService

如需疑難排解資訊,請參閱「疑難排解:Cloud Run 問題」。

Cloud SQL 事件類型

本節說明可在資訊主頁上顯示的 Cloud SQL 事件類型。

Cloud SQL 容錯移轉

這類事件可協助您判斷何時發生手動或自動容錯移轉。 如果執行個體或可用區發生故障,待命執行個體就會成為新的主要執行個體,這就是容錯移轉。容錯移轉期間,Cloud SQL 會自動切換為從待命執行個體提供資料。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=cloudsql_database
(
    (
        log_id(cloudaudit.googleapis.com%2Factivity)
        protoPayload.methodName=cloudsql.instances.failover
        operation.last=true
    ) OR (
        log_id(cloudaudit.googleapis.com%2Fsystem_event)
        protoPayload.methodName=cloudsql.instances.autoFailover
    )
)

詳情請參閱「關於高可用性」。

啟動或停止 Cloud SQL

這個事件類型可協助您判斷 Cloud SQL 執行個體是否已手動啟動、停止或重新啟動。執行個體停止時,所有連線、開啟的檔案和執行中的作業都會一併停止。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id(cloudaudit.googleapis.com%2Factivity) resource.type=cloudsql_database
protoPayload.methodName=cloudsql.instances.update operation.last=true
protoPayload.metadata.intents.intent=(START_INSTANCE OR STOP_INSTANCE)

詳情請參閱「關於高可用性」和「啟動、停止及重新啟動執行個體」。

Cloud SQL 儲存空間

這個事件類型可協助您找出與 Cloud SQL 儲存空間相關的事件,包括資料庫儲存空間已滿,以及資料庫因儲存空間用盡而關閉的情況。為防止資料損毀,如果資料庫的儲存空間用盡,而且未啟用自動增加儲存空間功能,就有可能關閉。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=cloudsql_database
(
    (
        (log_id(cloudsql.googleapis.com%2Fpostgres.log) OR log_id(cloudsql.googleapis.com%2Fmysql.err))
        textPayload=~"No space left on device"
        severity=(ERROR OR EMERGENCY)
    ) OR (
        log_id(cloudaudit.googleapis.com%2Fsystem_event)
        protoPayload.methodName=cloudsql.instances.databaseShutdownOutOfStorage
    )
)

Cloud Interconnect 事件類型

本節說明可在資訊主頁上顯示的 Cloud Interconnect 事件類型。

互連網路維護作業已開始

這個事件類型會追蹤互連網路基礎架構維護作業的開始時間。維護作業期間,虛擬區域網路 (VLAN) 連結的邊界閘道通訊協定 (BGP) 工作階段會停止運作。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id("maintenance.googleapis.com/maintenance_events")
jsonPayload.resource.type="compute.googleapis.com/Interconnect"
jsonPayload.state="RUNNING"
labels."maintenance.googleapis.com/updated_fields" : "state"

詳情請參閱「基礎架構維護事件」。

互連網路維護作業已完成

這個事件類型會追蹤互連網路基礎架構維護作業的結束時間。某些維護事件後,邊緣裝置的乙太網路 MAC 位址可能會變更。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id("maintenance.googleapis.com/maintenance_events")
jsonPayload.resource.type="compute.googleapis.com/Interconnect"
jsonPayload.state="SUCCEEDED"
labels."maintenance.googleapis.com/updated_fields" : "state"

詳情請參閱「基礎架構維護事件」。

Cloud VPN 事件類型

本節說明資訊主頁上可顯示的 Cloud VPN 事件類型。

VPN 維護作業

這個事件類型會追蹤 VPN 工作基礎架構維護作業。包括維護作業開始和維護作業完成的事件。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id("cloud.googleapis.com/ipsec_events")
resource.type="vpn_gateway"
(
    textPayload:"Starting VPN task maintenance" OR
    textPayload:"VPN task maintenance Completed"
)

VPN 流量選取器範圍已縮小

這個事件類型有助於找出子 SA 的流量選取器縮小範圍時。包括本機和遠端流量選取器的事件。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id("cloud.googleapis.com/ipsec_events")
resource.type="vpn_gateway"
(
    textPayload:"Warning: Local traffic selectors narrowed for Child SA" OR
    textPayload:"Warning: Remote traffic selectors narrowed for Child SA"
)

Compute Engine 事件類型

本節說明可在資訊主頁上顯示的 Compute Engine 事件類型。

虛擬機器終止

這個事件類型可協助您找出虛擬機器 (VM) 終止事件,包括手動觸發的重設和停止作業、客體 OS 終止事件、維護作業終止事件和主機錯誤。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=gce_instance
(
    (
        log_id(cloudaudit.googleapis.com%2Factivity)
        protoPayload.methodName=(
            beta.compute.instances.reset OR v1.compute.instances.reset OR
            beta.compute.instances.stop OR v1.compute.instances.stop
        )
        operation.first=true
    ) OR (
        log_id(cloudaudit.googleapis.com%2Fsystem_event)
        protoPayload.methodName=(
            compute.instances.hostError OR
            compute.instances.guestTerminate OR
            compute.instances.terminateOnHostMaintenance
        )
    )
)

詳情請參閱「停止及啟動 VM」和「排解 VM 關機和重新啟動的問題」。

VM 執行個體啟動失敗

這類事件會記錄 Compute Engine VM 執行個體啟動失敗的情形,包括因多種錯誤而無法啟動的狀況,例如資源用盡、IP 空間耗盡、超過配額或受防護的 VM 完整性有異狀。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=gce_instance
(
    (
        log_id(cloudaudit.googleapis.com%2Factivity)
        protoPayload.methodName=(beta.compute.instances.insert OR v1.compute.instances.insert)
        protoPayload.status.message=(ZONE_RESOURCE_POOL_EXHAUSTED OR IP_SPACE_EXHAUSTED OR QUOTA_EXCEEDED)
    ) OR (
        log_id(compute.googleapis.com%2Fshielded_vm_integrity)
        severity="ERROR"
    )
)

VM 執行個體訪客 OS 錯誤

這類事件會記錄特定 Compute Engine VM 執行個體客體 OS 錯誤,相關內容列於序列控制台記錄檔。會記錄的錯誤包括磁碟空間已滿、檔案系統掛接失敗,以及導致 Linux 緊急模式啟動的開機失敗情況。

如要查看這些事件,請在 VM 或專案中繼資料中設定 serial-port-logging-enable=true,啟用以 Cloud Logging 記錄序列埠輸出內容的功能。詳情請參閱「啟用及停用序列埠輸出記錄功能」。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=gce_instance
log_id(serialconsole.googleapis.com%2Fserial_port_1_output)
textPayload=~("No space left on device" OR "Failed to mount" OR "You are in emergency mode")

更新代管執行個體群組

這個事件類型可協助您找出代管執行個體群組 (MIG) 的更新時間。舉例來說,可能是新增或移除 VM,或是更新大小限制。詳情請參閱「在 MIG 中自動套用 VM 設定更新」一文。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=gce_instance_group_manager
log_id(cloudaudit.googleapis.com%2Factivity) operation.first=true
protoPayload.methodName=(beta.compute.instanceGroupManagers.patch OR v1.compute.instanceGroupManagers.patch)

詳情請參閱「使用代管執行個體」和「排解代管執行個體群組問題」。

代管執行個體群組自動調度器

這類事件會追蹤 MIG 自動調度器的資源調度決策。這些決策可能包括 MIG 建議大小的變更,或是自動配置器本身的狀態異動。詳情請參閱「自動調度執行個體群組資源」一文。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

resource.type=autoscaler log_id(cloudaudit.googleapis.com%2Fsystem_event)
protoPayload.methodName=(compute.autoscalers.resize OR compute.autoscalers.changeStatus)

Personalized Service Health 事件類型

本節說明可在資訊主頁上顯示的 Personalized Service Health 類型。

Google Cloud 事件

排解問題時,您可能需要區分失敗原因,是來自您擁有的服務,還是來自您使用的Google Cloud 服務。在資訊主頁上啟用 Personalized Service Health 註解後,即可查看 Google Cloud 服務的中斷情形或服務健康狀態事件。如要查看與 Service Health 整合的服務清單,請參閱「支援的 Google 產品」。

與其他事件類型不同, Google Cloud 系統不會透過分析記錄項目來識別事件,如要在發生這些事件時收到通知,請建立警告政策。您可以使用「Service Health 資訊主頁」頁面的選項,選取預先設定的警告政策。詳情請參閱「快速入門:設定快訊」。

監控功能會向 Service Health API 發出要求,然後篩選出與您查看資料相關的事件,藉此識別 Google Cloud 事件。要求的設定如下:

  • Relevance 列舉設為 RELATEDIMPACTEDPARTIALLY_RELATED。 這項限制可確保資訊主頁只顯示專案使用的 Google Cloud 服務Google Cloud 事件。

  • DetailedState 列舉未設為 FALSE_POSITIVE

Service Health 註解會顯示開始時間和持續時間。圖表的背景顏色會變更,顯示時間長度。事件的工具提示會顯示下列資訊: Google Cloud

  • Google Cloud 服務。
  • 事件是否已開啟或解決。
  • 活動的日期和開始時間。
  • 顯示受影響產品和地點數量的資訊方塊。 如要列出受影響的產品或地點,請將指標放在相應的晶片上。
  • 「查看」按鈕,選取後會開啟事件的詳細資料頁面。

如要瞭解如何向 Service Health API 發出要求,請參閱「使用 Service Health 檢查中斷情形」。

如需疑難排解資訊,請參閱「排解 Service Health 常見問題」。

運作時間檢查事件類型

本節說明資訊主頁上可顯示的運作時間檢查事件類型。

運作時間檢查失敗

這個事件類型有助於找出所設區域的運作時間檢查失敗情形。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id(monitoring.googleapis.com%2Fuptime_checks)
(
  resource.type=uptime_url OR resource.type=gce_instance OR
  resource.type=gae_app OR resource.type=k8s_service OR
  resource.type=servicedirectory_service OR resource.type=cloud_run_revision OR
  resource.type=aws_ec2_instance OR resource.type=aws_elb_load_balancer
)
labels.uptime_result_type=UptimeCheckResult
severity=NOTICE

如需疑難排解資訊,請參閱「排解合成監控器和運作時間檢查問題」。

Agent for SAP 事件類型

本節說明可在資訊主頁上顯示的 Agent for SAP 事件類型。

SAP 可用性

這個事件類型可協助您找出與 Agent for SAP 可用性相關的事件。SAP HANA、SAP NetWeaver 或 Pacemaker 叢集的可用性有異動時,就會觸發這些事件。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id(google-cloud-sap-agent)
(
  resource.type=generic_node OR resource.type=gce_instance OR
  resource.type=aws_ec2_instance OR resource.type=baremetalsolution.googleapis.com/Instance
)
jsonPayload.metricEvent=true
jsonPayload.metric=(workload.googleapis.com/sap/hana/service OR workload.googleapis.com/sap/hana/availability OR
  workload.googleapis.com/sap/nw/service OR workload.googleapis.com/sap/nw/availability OR
  workload.googleapis.com/sap/cluster/nodes OR workload.googleapis.com/sap/cluster/resources)

SAP Backint

這個事件類型可協助您找出與 Agent for SAP Backint 相關的事件。所有 Backint 備份或復原作業都會寫入事件,詳細說明成功或失敗的情形,以及轉移作業統計資料。系統只會在失敗時列出記錄備份和復原事件,但無論成功或失敗,都會顯示資料備份和復原事件。

log_id(google-cloud-sap-agent-backint)
(
  resource.type=generic_node OR resource.type=gce_instance OR
  resource.type=aws_ec2_instance OR resource.type=baremetalsolution.googleapis.com/Instance
)
(jsonPayload.fileType=data OR (jsonPayload.fileType=log AND jsonPayload.success=false))
jsonPayload.message=SAP_BACKINT_FILE_TRANSFER

SAP 作業

這個事件類型有助於找出與 Agent for SAP 作業相關的事件。SAP HANA 複製作業狀態有異動時,就會觸發這些事件。

如要為這個事件類型建立記錄式警告政策,請使用下列查詢:

log_id(google-cloud-sap-agent)
(
  resource.type=generic_node OR resource.type=gce_instance OR
  resource.type=aws_ec2_instance OR resource.type=baremetalsolution.googleapis.com/Instance
)
jsonPayload.metricEvent=true
jsonPayload.metric=workload.googleapis.com/sap/hana/ha/replication

後續步驟

如要瞭解如何在資訊主頁上顯示事件,請參閱「在資訊主頁上顯示事件」。