注入指标概览

支持的平台:

Google SecOps 提供详细的注入指标,以便您了解安全数据流水线的运行状况、数据量和处理状态。监控这些指标对于确保数据正确流动、发现潜在问题以及优化 Google SecOps 部署至关重要。

为什么提取指标很重要

  • 健康监控:跟踪数据 Feed 和收集代理的状态。
  • 问题排查:快速诊断数据丢失、解析错误或连接问题等问题。
  • 流量跟踪:了解从各种来源提取的数据量,有助于进行容量规划和成本管理。
  • 标准化数据分析:监控日志解析为统一数据模型 (UDM) 的成功率。
  • 提醒:针对数据流中的异常情况、错误或流量变化配置通知。

在哪里查看提取指标

  • Google Cloud Monitoring

    • 将 Google SecOps 指标集成到 Cloud Monitoring 中,以便您根据指标(例如已提取的日志数量、大小和归一化事件)的阈值创建信息中心并设置提醒政策。
    • 指标以 Chronicle CollectorChronicle Log Type 等前缀开头。
    • 参考文档:使用 Cloud Monitoring 获取提取数据方面的分析洞见
  • Google SecOps Health Hub

    • 健康状况中心可在 Google SecOps 平台内提供集中式视图,用于监控数据源状态、提取量和解析健康状况。它会突出显示错误,并提供可供深入了解的链接。
    • 参考文档:使用健康数据中心
  • BigQuery Export

关键指标类别和字段

提取指标按提取流水线的不同组件(例如,转发器、提取 API、规范化器、Feed)细分。以下是一些您会遇到的关键字段:

  • 数量指标

    • log_count:已接收或处理的原始日志条目数。
    • log_volume:已接收或处理的日志总大小(以字节为单位)。
    • event_count:解析后生成的 UDM 事件数量。
  • 归一化指标

    • state:日志的归一化过程的结果(例如 parsedfailed_parsingfailed_validation)。
    • total_events:成功验证的 UDM 事件的数量。
    • total_error_events:解析或验证失败的事件数。
    • drop_reason_code:日志或事件被舍弃的原因。
  • 健康与表现

    • last_heartbeat_time:表示收集器或 Feed 上次处于活动状态的时间。
    • drop_count:组件丢弃的日志数量。
    • cpu_usedmemory_useddisk_used:本地组件(例如 Bindplane 代理或旧版转发器)的资源利用率。
    • latency_count:与从提取到归一化之间所用时间相关的指标。
  • 配额指标(Ingestion API)

    • quota_rejected_long_term_log_volume:因超出配额限制而被拒绝的日志量。

了解维度

指标通常按维度细分,以便您过滤和分组数据:

  • component:指标所指的提取流水线部分(例如 ForwarderIngestion APINormalizerOut-of-Band Processor)。
  • log_type:日志源的类型(例如 WINDOWS_DNSCS_EDR)。
  • collector_id / feed_id:特定收集器实例或数据 Feed 的唯一标识符。
  • namespace:用于整理日志,通常在 API 提取中使用。

注意:如提取指标架构中所述,汇总提取指标应视为近似量指标,而不是任何给定时间范围内的确切数量。

使用注入指标

  • 问题排查:在 Normalizer 指标中按 log_typestate(例如 failed_parsing)进行过滤,以查找解析问题。检查 drop_countdrop_reason_code 是否有数据丢失。
  • 提醒:在 Cloud Monitoring 中设置提醒,以在关键日志源的 log_count 突然下降或 total_error_events 出现高比率时收到提醒。
  • 容量规划:分析 BigQuery 中的 log_volume 趋势,以预测未来需求。
  • 验证配置:设置新的数据源后,请检查指标,确认数据正在流动并按预期进行解析。

通过定期监控和了解这些提取指标,您可以确保 Google SecOps 实例的数据流水线可靠高效。

需要更多帮助?获得社区成员和 Google SecOps 专业人士的解答。