了解搜索的数据可用性
本文档详细介绍了数据注入生命周期,包括端到端数据流和延迟时间,以及这些因素如何影响最近注入的数据的可用性,以便进行查询和分析。
在 Google SecOps 中注入和处理数据
本部分介绍了 Google SecOps 如何注入、处理和分析安全数据。
数据注入
数据注入流水线首先从以下来源收集原始安全数据:
- 内部系统的安全日志
- 存储在 Cloud Storage 中的数据
- 安全运维中心 (SOC) 和其他内部系统
Google SecOps 使用其安全注入方法之一将此数据引入平台。
主要注入方法包括:
直接 Google Cloud 注入
Google SecOps 使用 直接 Google Cloud 注入功能自动从组织中提取日志和遥测数据 Google Cloud,包括 Cloud Logging、Cloud Asset Inventory 元数据和 Security Command Center Premium 发现结果。
注入 API
使用 Google SecOps 的公共 REST 注入 API 将数据直接发送到 Google SecOps。您可以使用此方法进行自定义集成,或将数据作为非结构化日志或预先格式化的统一数据模型 (UDM) 事件发送。
Bindplane 代理
您可以在环境(本地或其他云端)中部署多功能的 Bindplane 代理,以从各种来源收集日志并将其转发到 Google SecOps。
数据 Feed
在 Google SecOps 中,您可以配置 数据 Feed 以从第三方来源(例如特定的第三方 Cloud Storage 存储分区(如 Amazon S3)或第三方 API(如 Okta 或 Microsoft 365))提取日志。
标准化和数据丰富化
数据到达 Google SecOps 后,平台会通过以下阶段对其进行处理:
解析和标准化
解析器首先处理原始日志数据,以验证、提取数据并将其从原始格式转换为标准化 UDM。通过解析和标准化 ,您可以使用单个一致的架构分析不同的数据源(例如防火墙日志、 端点数据、云日志)。原始日志仍与 UDM 事件一起存储。
编入索引
标准化后,Google SecOps 会对 UDM 数据编入索引,以便在海量数据集中实现快速查询,从而使 UDM 事件可供搜索。
UDM 别名和丰富化
- Google SecOps 会执行 UDM 别名和丰富化
,通过识别和添加
日志实体的上下文数据和指标,为 UDM 事件添加有价值的上下文。例如,它会将用户的
login name与其各种IP addresses、hostnames和MAC addresses相关联。 - 地理位置: Google SecOps 会使用 地理位置 数据丰富 IP 地址。
- Google SecOps 会执行 UDM 别名和丰富化
,通过识别和添加
日志实体的上下文数据和指标,为 UDM 事件添加有价值的上下文。例如,它会将用户的
ECG 丰富化
Google SecOps 会执行 ECG 别名 ,该别名会合并来自多个来源(例如 IdP、CMDB 和 威胁情报)的上下文,以在 实体上下文图表中构建整合的实体配置文件。
威胁情报: Google SecOps 会自动 将事件数据与 Google 的海量威胁情报( 包括 Google Threat Intelligence 和 Safe Browsing 等来源) 进行比较,以识别已知的恶意威胁,例如
domains、IP addresses和file hashes。WHOIS: Google SecOps 会使用网域名称的 公开注册 WHOIS 信息丰富网域名称。
用于分析的数据可用性
经过处理和丰富化后,UDM 数据可立即用于分析:
实时检测
检测引擎会针对实时传入数据自动运行启用实时规则的自定义规则和 Google 构建的规则,以识别威胁并生成提醒。
搜索和调查
分析师可以使用搜索方法搜索所有这些标准化和丰富化的数据。例如,使用 UDM 搜索在相关实体(例如
user、asset、恶意domain)之间切换,并调查提醒。
搜索方法
Google SecOps 提供了几种不同的数据搜索方法,每种方法都有不同的用途。
UDM 搜索
UDM 搜索是主要且最快的搜索方法,适用于大多数调查。
- 搜索内容: 它会查询标准化和编入索引的 UDM 事件。由于所有数据都会解析为这种标准格式,因此您可以编写一个查询,以在所有不同的产品(例如 Windows、Okta、Linux)中查找相同的活动(例如登录)。
- 工作原理: 您可以使用特定语法查询字段、运算符和值。
示例:
principal.hostname = "win-server" AND target.ip = "10.1.2.3"结果通常会在注入后 2 到 15 分钟内提供。
原始日志搜索
使用 原始日志搜索 功能在原始的未解析日志消息中查找可能未映射到 UDM 字段的内容。此搜索方法针对高速搜寻进行了优化,通常会在 2 秒内返回特定指标(例如文件哈希或 IP 地址)的结果。
- 搜索内容: 它会在日志解析和标准化之前扫描日志的原始文本。 这对于查找未编入索引的 UDM 字段中的特定字符串、命令行参数或其他工件非常有用。
- 工作原理: 您可以使用
raw =前缀。它可能比 UDM 搜索慢,因为它不会搜索编入索引的字段。 - 示例(字符串):
raw = "PsExec.exe" - 示例(正则表达式):
raw = /admin\$/
统计搜索
使用统计搜索功能进行长期趋势分析,该功能会聚合数百万行数据。由于平台必须执行统计分析和分组,因此这些查询的加载时间会更长。
自然语言搜索 (Gemini)
借助自然语言搜索 (Gemini),您可以使用简单的英语提问,然后 Gemini 会将问题转换为正式的 UDM 查询。
- 搜索内容: 它提供了一个对话界面,用于查询 UDM 数据。
- 工作原理: 您输入一个问题,Gemini 会为您生成底层 UDM 搜索查询,然后您可以运行或优化该查询。
- 示例: “Show me all failed logins from user 'bob' in the last 24 hours”(显示过去 24 小时内用户“bob”的所有登录失败记录)
SOAR 搜索
SOAR 搜索特定于 SOAR 组件。您可以使用它来管理安全事件,而不是在日志中搜寻。
- 搜索内容: 它会在 SOAR 平台中搜索案例 和实体 (例如用户、资产、IP 地址)。
- 工作原理: 您可以使用自由文本或基于字段的过滤条件来查找案例,例如按案例 ID、提醒名称、状态和分配的用户查找。
- 示例: 搜索
CaseIds:180或AlertName:Brute Force
从数据注入流水线到搜索可用性
端到端数据可用性是指事件发生时与事件在 Google SecOps 中可用于搜索或规则执行时的总时间。此延迟时间是以下两个组件的总和:
来源端可用性延迟: 事件发生时与来源系统使日志数据可用于注入时之间的时间。此延迟时间取决于来源系统的架构、处理、批处理和 API 发布时间表。Google SecOps 无法影响此延迟时间。示例包括系统将日志写入存储桶或将其发布到 API 端点时的延迟。
Google SecOps 处理时间: Google SecOps 在收到数据后处理数据所需的时间。此持续时间包括内部流水线阶段,例如注入、解析、标准化、编入索引和丰富化。
在排查数据可见性时间轴问题时,您必须同时考虑这两个组件。
源自数据源的延迟
以下因素可能会影响来源端可用性延迟:
- 批处理: 某些系统会按设定的时间间隔(例如每小时)批量生成日志。
- API 延迟: 来源 API 在使新事件可查询时可能会有固有的延迟。
- 事件创建和发布时间: 日志中的事件时间戳可能比日志最终确定并可供收集的时间戳早得多。
- 限制: 来源端 API 速率限制可能会降低数据检索速度。
- 初始回填: 提供和注入大量历史数据需要时间。
这些延迟时间因数据源和日志类型而异。如需详细了解注入方法,请参阅数据注入概览。Feed 管理 API 参考文档介绍了 Microsoft Graph、SentinelOne、Okta 和 CrowdStrike 等日志类型的具体注意事项。
Google SecOps 处理时间
系统会通过多个步骤处理新注入的数据。这些步骤的持续时间决定了新注入的数据何时可用于查询和分析。
下表按搜索方法细分了新注入数据的处理步骤。完成这些步骤后,新注入的数据即可供搜索。
| 搜索方法 | 要搜索的数据 | 影响可用时间的处理步骤 |
|---|---|---|
| 标准化和丰富化的 UDM 事件 |
|
|
| 原始日志搜索 | 原始的未解析日志文本 |
|
| 检测引擎(规则) | 标准化事件 |
|
| SOAR 搜索 | 案例和实体 |
这是一个不同的生命周期,因为它搜索的是提醒和案例,而不是日志。时间基于:
|
数据流示例
以下示例演示了 Google SecOps 如何注入、处理、增强和分析安全数据,使其可用于搜索和进一步分析。
数据处理步骤示例
- 从 Amazon S3 等云服务或从 Google Cloud中检索安全数据。Google SecOps 会在传输过程中加密此数据。
- 将加密的安全数据分离并存储在您的账号中。只有您和少数 Google 员工可以访问这些数据,以便进行产品支持、开发和维护。
- 解析和验证原始安全数据,使其更易于处理和查看。
- 对数据进行标准化和编入索引,以便快速搜索。
- 将解析和编入索引的数据存储在您的账号中。
- 使用上下文数据丰富数据。
- 为用户提供安全访问权限,以便搜索和查看其安全数据。
- 将您的安全数据与 Google Threat Intelligence 恶意软件数据库进行比较,以识别匹配项。在 Google SecOps 事件视图(例如“资产”视图)中,点击 VT Context 可查看 Google Threat Intelligence 信息。 Google SecOps 不会与 Google Threat Intelligence 分享您的安全数据。
搜索可用性预计时间示例
新注入的数据可用于搜索的预计时间是数据流中各个流持续时间的总和。
例如,在 UDM 搜索中,数据可用性的典型平均时间约为 5 分 30 秒,从数据发送到 Google SecOps 注入服务时开始计算。
| 数据流步骤 | 说明 | 流持续时间 |
|---|---|---|
| Cloud Storage 到原始日志 | 从 Cloud Storage 注入原始日志。 | 不到 30 秒 |
| 安全日志 到数据转发服务 | 将内部系统的安全日志传输到平台。 | 不适用 |
| 数据转发服务 到原始日志 | 将从各种来源收到的原始安全数据发送到注入流水线。 | 不到 30 秒 |
| 原始日志 到解析和验证 | 将原始日志解析和验证为 UDM 格式。 | 不到 3 分钟 |
| 解析和验证 到索引 | 对解析后的 UDM 数据编入索引,以便快速搜索。 | 不适用 |
| 索引 到解析后的客户数据 | 使编入索引的数据可作为解析后的客户数据用于分析。 | 不到 2 分钟 |
问题排查
本部分提供了问题排查指南。
延迟时间和限制
Google SecOps 平台中的处理和可视化延迟时间受以下架构限制的约束(在 Google SecOps 收到数据后):
- 搜索可见性: 注入后 2 到 15 分钟。
- 规则执行: 事件到达后 5 到 10 分钟。
- 界面可视化: 为保持浏览器性能,海量日志数据受 10,000 行可视化限制。