智能体 AI 应用场景:编排安全运维工作流

Last reviewed 2026-04-08 UTC

本文档介绍了多智能体 AI 系统 的高级架构,该系统可在 安全运维中心 (SOC)中编排复杂的调查和分诊流程。 智能体系统可编排不同安全系统(例 如 安全信息和事件管理 (SIEM) 系统、威胁情报 Feed、云安全状况管理 (CSPM) 平台以及端点检测和响应 (EDR) 解决方案)的工作流。智能体系统可以执行以下操作:

  • 查找 Google Security Operations中的关键提醒。
  • 使用 Google Threat Intelligence丰富提醒。
  • 从第三方 CSPM 工具中查找资产错误配置。
  • 实现人机协同审批。
  • 从第三方 EDR 工具检索详细的端点遥测数据和进程执行历史记录,以调查遭入侵或可疑的端点。

此架构有助于减少上下文切换,并让运维人员能够使用单个界面执行复杂的多阶段调查,从而提高运维人员的工作效率。

本文档的目标受众群体包括负责设计、构建和实现智能体 AI 应用以及将这些应用与云环境中的现有安全系统集成的架构师和开发者。目标受众群体还包括负责监督安全运维、使用威胁情报进行主动防御以及管理可靠的 SecOps 工作流以进行突发事件检测、调查和响应的 SOC 分析师和系统管理员。本文档假定您对智能体 AI 概念有基本的了解,包括多智能体系统、智能体工具使用和智能体编排。本文档还假定您熟悉威胁情报使用场景、安全运维工作流和常用安全工具。如需了解威胁情报 和常用安全工具,请参阅 威胁情报使用场景和示例

架构

您可以根据自己的要求选择以下部署模型:

  • Cloud Run 部署:一个全代管式 无服务器平台,可让您将整个智能体应用、 各个组件或自定义工具部署为可伸缩的 HTTP 端点,而无需 管理底层基础架构。
  • Gemini Enterprise Agent Platform 上的 Agent Runtime: 一个全代管式、有主张的运行时,可用于以尽可能少的运维开销部署、运行 和扩缩智能体应用。

如需了解如何选择智能体运行时,请参阅 选择智能体 AI 架构组件

以下标签页提供了架构图,其中显示了 Cloud Run 部署和 Agent Runtime with Gemini Enterprise 部署。

Cloud Run

下图展示了在 Cloud Run 上部署的 SOC 智能体系统 的详细架构:

部署在 Cloud Run 上的 SOC 代理系统的详细架构。

该架构显示了以下组件:

Cloud Load Balancing
应用负载平衡器将来自安全分析师的传入推理请求路由到智能体系统。
Google Cloud Armor
根据 配置的 Web 应用防火墙 (WAF) 规则强制执行安全政策。
Identity-Aware Proxy (IAP)
强制执行零信任 安全模型并验证用户身份。
Model Armor
借助 Model Armor,您可以检查和清理提示、工具 互动和回答。它为 任何底层 AI 模型提供灵活的安全控制。对于在 Cloud Run 上运行的自定义智能体,请使用 Model Armor API 集成 Model Armor。
智能体组成
智能体开发套件 (ADK) 是一种智能体开发框架,可帮助您构建智能体并将其 部署为无服务器 Cloud Run 服务。如需详细了解此智能体系统的内部 架构,请参阅本文档后面的 智能体系统架构 部分。
AI 模型
为了提供推理服务,此 架构中的智能体使用 Gemini Enterprise Agent Platform 上的 AI 模型。
MCP 服务器

Model Context Protocol (MCP) 有助于访问工具,并标准化 智能体与工具之间的互动。智能体系统使用以下 MCP 服务器:

使用的产品

此示例架构使用以下 Google Cloud 产品和工具:

Agent Runtime with Gemini Enterprise

下图展示了在 Agent Runtime with Gemini Enterprise 上部署的 SOC 智能体 AI 系统的详细架构:

在 Agent Runtime 上使用 Gemini Enterprise 部署的 SOC 代理 AI 系统的详细架构。

架构图显示了以下组件:

Gemini Enterprise
用户通过 聊天助理 与智能体系统互动,该助理由 Gemini Enterprise 提供。
智能体组成
智能体开发套件 (ADK) 是一种智能体开发框架,可帮助您创建自定义 智能体、在 Agent Runtime 上部署智能体,以及向 Gemini Enterprise 注册 智能体。如需详细了解此智能体系统的内部架构,请参阅本文档后面的智能体系统架构部分。
AI 模型
此架构中的智能体使用 Agent Platform Model Garden 中的 AI 模型执行推理。
Model Armor
为了强制执行企业安全和合规性政策,Model Armor 直接与 Google Cloud 服务集成,以 提供对用户提示和模型 回答的内嵌检查和清理。通过与 Gemini Enterprise 和 Agent Platform 的内置集成, Model Armor 会自动筛查用户与托管智能体之间的互动。如需了解详情,请参阅 Model Armor 与 Google Cloud 服务集成。
MCP 服务器

Model Context Protocol (MCP) 有助于访问工具,并标准化 智能体与工具之间的互动。智能体系统使用以下 MCP 服务器:

  • Google SecOps MCP 服务器:一个由 Google 管理的 MCP 服务器,可提供 对 Google SecOps SIEMGoogle SecOps SOAR 数据的访问权限,包括事件、 实体、原始日志和支持请求详细信息。
  • Google Threat Intelligence MCP 服务器:一个本地 MCP 服务器,可提供对 Google Threat Intelligence的访问权限。 Google Threat Intelligence 将内部提醒与 全球对手数据相关联,并简化了 SOC 工作流中已知 恶意指标的识别。
  • 第三方 MCP 服务器:由第三方 供应商管理的连接器,可让您与外部安全 工具互动。

使用的产品

此示例架构使用以下 Google Cloud 产品和工具:

智能体系统架构

本部分介绍了上述 Cloud Run 或 Gemini Enterprise 部署的自定义 SOC 智能体系统的架构。为了编排复杂的安全工作流,智能体使用 分层任务分解模式。 无论您选择哪种部署方法,智能体的组成都保持一致。

下图展示了智能体系统架构的详细视图: 适用于智能 SecOps 工作流的详细智能体 AI 系统架构。

该架构显示了以下组件:

应用
与用户互动的前端应用(例如聊天界面)。您可以选择使用 Cloud Run 或 Agent Runtime with Gemini Enterprise 部署应用。
智能体

此架构使用以下智能体:

  • 根智能体:一个 协调器 智能体,用于接收来自用户的请求。根智能体会解读用户的 请求,并尝试自行解决该请求。如果任务需要专用工具,则根智能体会将请求委托给相应的专用智能体。
  • 专用智能体:根智能体会调用以下 专用智能体:
    • 一级分析师:在查询 Google SecOps 和相关遥测数据源时,检索提醒详细信息、识别受影响的 资产并提取用户上下文。
    • 网络威胁情报 (CTI) 研究员:研究与特定提醒相关的威胁 行为者策略。此智能体通过查询威胁情报平台来关联内部失陷指标 (IOC)与已知威胁行为者群体和记录的战术、技术和程序 (TTPs),从而提供活动风险评估。

智能体系统架构图展示了一个使用两个 SOC 角色的示例架构。您可以根据具体的使用场景部署 其他 SOC 角色,也可以创建自己的自定义角色。如需查看可帮助您增强安全运维的更广泛的 SOC 角色列表,请参阅 SOC 角色

RAG 知识数据库
此数据库为 检索增强生成 (RAG) 提供接地来源。该数据库用于为 智能体提供 突发事件响应计划AI 运行手册。 AI 运行手册是 智能体技能形式的规范性工作流。
制品服务
一项代管式服务,用于在 Cloud Storage 中存储调查报告 和证据。
记忆库
一个持久性状态管理系统,用于存储自定义记忆主题,并让智能体在会话中维护有关环境和威胁上下文的上下文。
AI 模型
为了提供推理服务,此架构中的智能体使用 最新的 Gemini 模型 (位于 Agent Platform 上)。
MCP 服务器
MCP 服务器有助于访问工具,并标准化 智能体与工具之间的互动。对于每个智能体-工具对,MCP 客户端都会向 MCP 服务器发送请求,智能体通过该服务器访问 工具,例如数据库、文件系统或 API。
智能体工具
借助这些工具,智能体可以检索接地数据, 例如相应的 AI 运行手册、 突发事件响应计划、 之前的报告、内部文档和 playbook。
ADK
ADK 提供用于开发、测试和部署智能体的工具和框架。 ADK 抽象化了智能体创建的复杂性,让 AI 开发者可以专注于智能体的逻辑和功能。

该架构显示了以下数据传输:

  1. 安全分析师向 SOC 管理员( 协调器智能体)提交请求。例如,分析师提交请求以调查支持请求 #37。
  2. 部署在 Cloud Run 或 Gemini Enterprise 上的应用会将请求路由到 SOC 管理员。
  3. SOC 管理员使用 Gemini 来解读用户的请求。
  4. SOC 管理员执行以下任务来收集有关请求的上下文:
    1. 向 RAG 知识数据库发送查询,以提取相应的 AI 运行手册、 AI 技能形式的规范性工作流和 突发事件响应计划
    2. 提取之前的 记忆,以确定 智能体系统是否分析过类似突发事件。
    3. 检查 制品服务 中是否存在与请求相关的现有报告或证据。
  5. SOC 管理员使用 Gemini 及其检索到的上下文将请求分解为一系列子任务,并确定合适的工具。
  6. SOC 管理员动态地将子任务定向到专用子智能体,例如一级分析师和网络威胁情报 (CTI) 研究员。
  7. 每个子智能体执行以下操作来执行其分配的子任务:
    1. 使用 Gemini 来解读任务目标。
    2. 从 RAG 知识数据库、记忆和制品中提取相关上下文。
    3. 使用 MCP 服务器收集以下其他上下文以接地回答:
      • 知识文档,例如之前的报告、内部文档和 playbook。
      • 使用 Google SecOps 和 Google Threat Intelligence 中的数据的安全情报和遥测数据。
    4. 使用 Gemini 及其检索到的上下文生成研究结果。
    5. 将其研究结果打包成结构化摘要。
    6. 将中间响应转发回 SOC 管理员。
  8. SOC 管理员收到来自子智能体的中间响应,并根据 AI 运行手册要求评估研究结果。
    1. 如果研究结果不符合评估条件,SOC 管理员会重复分析用户的请求,并将子任务委托给子智能体以收集其他数据。在此迭代循环中,SOC 管理员会保留之前的上下文链,以便为后续工具调用和子智能体委托提供信息并进行扩充。SOC 管理员会继续此循环,直到研究结果符合评估条件。
    2. 如果研究结果符合评估条件或退出条件(例如最大迭代次数),则 SOC 管理员会执行以下操作:
      1. 使用 Gemini 将所有子智能体研究结果整合到调查报告中,并将报告保存到 制品服务
      2. 使用 Google SecOps MCP 服务器将结果发布到 支持请求墙
      3. 将新 记忆 保存到 Agent Platform Memory Bank
  9. SOC 管理员将制品链接和报告摘要发送回安全分析师。

使用的产品

本文档中的智能体系统架构使用以下 Google Cloud 产品和工具:

如需了解如何为智能体 AI 系统选择替代组件(包括框架、智能体运行时、工具、记忆和设计模式), 请参阅 选择智能体 AI 架构组件

设计考虑事项

如需在生产环境中实现此架构,请考虑以下建议:

  • 智能体工具访问权限:为了减少 token 消耗并强制执行 最小权限原则, 请根据需要为不同的智能体提供工具子集。
  • 智能体范围:为了提高模型准确率,请确定每个智能体的运行手册和 系统说明的范围。
  • 上下文窗口管理:为了最大限度地减少 token 消耗,请将提示 和工具输出设计得简洁明了。使用 RAG 代码库,并使用智能体技能预加载上下文并总结大型工具响应。
  • 提示缓存:为了降低输入 token 费用,请缓存静态智能体内容, 例如系统说明、角色、运行手册和工具架构。
  • 模型选择:为 AI 应用选择的模型会直接影响费用和 性能。根据智能体系统中不同的智能体角色和任务要求选择不同的模型。对于复杂的推理和任务分解,请使用 Gemini Pro 等思考模型。对于小型直接任务,请使用 Gemini Flash 等快速低成本模型。
  • MCP 架构兼容性:为了防止 AI 模型错误解读 工具定义并进行不正确的工具调用,请清理工具架构。 为 JSON 架构 $ref$defs 创建自包含的构造,并规范化大写类型字符串。
  • 身份验证环境:为了确保跨 环境的无缝身份验证,请配置部署流水线以管理从开发身份验证策略的转换。例如,您可能需要从 本地执行中的 应用默认凭据 (ADC) 转换为 Identity and Access Management (IAM) 为生产环境中的托管远程 MCP 服务器管理的服务账号。

部署

如需部署此架构的示例实现,以提供自定义 SOC 智能体,请使用 GitHub 中提供的 Agentic SOC Gemini Enterprise 代码示例

我们建议您按以下顺序迭代智能体:

  1. 使用 ADK Web 在本地部署 :加快原型设计并快速迭代智能体逻辑。
  2. 部署到本地容器:确保具有一致依赖项的可移植且不可变的环境 。
  3. 将容器部署到 Cloud Run 或 Agent Runtime: 扩缩智能体以实现有效的安全运维,并将应用 从开发环境迁移到生产环境。

后续步骤

贡献者

作者:

其他贡献者: