注入指标概览
支持的平台:
Google SecOps
SIEM
Google SecOps 提供详细的注入指标,以便您了解安全数据流水线的运行状况、数据量和处理状态。监控这些指标对于确保数据正确流动、发现潜在问题以及优化 Google SecOps 部署至关重要。
为什么提取指标很重要
- 健康监控:跟踪数据 Feed 和收集代理的状态。
- 问题排查:快速诊断数据丢失、解析错误或连接问题等问题。
- 流量跟踪:了解从各种来源提取的数据量,有助于进行容量规划和成本管理。
- 标准化数据分析:监控日志解析为统一数据模型 (UDM) 的成功率。
- 提醒:针对数据流中的异常情况、错误或流量变化配置通知。
在哪里查看提取指标
Google Cloud Monitoring:
- 将 Google SecOps 指标集成到 Cloud Monitoring 中,以便您根据指标(例如已提取的日志数量、大小和归一化事件)的阈值创建信息中心并设置提醒政策。
- 指标以
Chronicle Collector和Chronicle Log Type等前缀开头。 - 参考文档:使用 Cloud Monitoring 获取提取数据方面的分析洞见
Google SecOps Health Hub:
- 健康状况中心可在 Google SecOps 平台内提供集中式视图,用于监控数据源状态、提取量和解析健康状况。它会突出显示错误,并提供可供深入了解的链接。
- 参考文档:使用健康数据中心
BigQuery Export:
- Google SecOps 可以将详细的
ingestion_metrics表导出到您的 BigQuery 数据集。这样一来,您就可以基于 SQL 进行深入分析、生成自定义报告,以及与其他数据联接。 - 参考:BigQuery 中的 Google SecOps 数据
- 参考:Looker 和 BigQuery 的注入指标参考
- Google SecOps 可以将详细的
关键指标类别和字段
提取指标按提取流水线的不同组件(例如,转发器、提取 API、规范化器、Feed)细分。以下是一些您会遇到的关键字段:
数量指标:
log_count:已接收或处理的原始日志条目数。log_volume:已接收或处理的日志总大小(以字节为单位)。event_count:解析后生成的 UDM 事件数量。
归一化指标:
state:日志的归一化过程的结果(例如parsed、failed_parsing、failed_validation)。total_events:成功验证的 UDM 事件的数量。total_error_events:解析或验证失败的事件数。drop_reason_code:日志或事件被舍弃的原因。
健康与表现:
last_heartbeat_time:表示收集器或 Feed 上次处于活动状态的时间。drop_count:组件丢弃的日志数量。cpu_used、memory_used、disk_used:本地组件(例如 Bindplane 代理或旧版转发器)的资源利用率。latency_count:与从提取到归一化之间所用时间相关的指标。
配额指标(Ingestion API):
quota_rejected_long_term_log_volume:因超出配额限制而被拒绝的日志量。
了解维度
指标通常按维度细分,以便您过滤和分组数据:
component:指标所指的提取流水线部分(例如Forwarder、Ingestion API、Normalizer、Out-of-Band Processor)。log_type:日志源的类型(例如WINDOWS_DNS、CS_EDR)。collector_id/feed_id:特定收集器实例或数据 Feed 的唯一标识符。namespace:用于整理日志,通常在 API 提取中使用。
注意:如提取指标架构中所述,汇总提取指标应视为近似量指标,而不是任何给定时间范围内的确切数量。
使用注入指标
- 问题排查:在 Normalizer 指标中按
log_type和state(例如failed_parsing)进行过滤,以查找解析问题。检查drop_count和drop_reason_code是否有数据丢失。 - 提醒:在 Cloud Monitoring 中设置提醒,以在关键日志源的
log_count突然下降或total_error_events出现高比率时收到提醒。 - 容量规划:分析 BigQuery 中的
log_volume趋势,以预测未来需求。 - 验证配置:设置新的数据源后,请检查指标,确认数据正在流动并按预期进行解析。
通过定期监控和了解这些提取指标,您可以确保 Google SecOps 实例的数据流水线可靠高效。