访问指标

本文档介绍了如何访问 Gemini Enterprise 应用生成的指标。这些指标可帮助您了解应用的性能和运行状况。

您可以使用 Metrics Explorer 查看指标遥测数据,也可以使用代理的可观测性 标签页直接在各个代理中查看。

主要概念

本部分介绍了与 Gemini Enterprise 中的可观测性相关的主要概念。

概念 说明
指标 指标是系统随时间收集的数值测量结果。这些 测量结果代表系统的性能、资源利用率或 行为。工程师使用指标来监控系统运行状况, 识别趋势和触发提醒。
代理范围的指标 用于衡量单个代理的活动的指标,例如其 会话、对话轮次和工具调用。这些指标列在 Gemini Enterprise 代理 资源类型下,并且 仅当为该代理启用启用 OpenTelemetry 跟踪记录和日志的插桩 可观测性设置时才会收集。
应用范围的指标 用于衡量应用的所有流量(而不是单个 代理的流量)的指标,例如请求数和端到端延迟时间。这些指标列在 Gemini Enterprise 引擎 资源类型下,其中 引擎 是 Gemini Enterprise 应用的 API 名称,并且无论可观测性设置如何,都会收集这些指标。

准备工作

请确保您已备好:

  • Gemini Enterprise Admin 角色或 Google Cloud 控制台 Gemini Enterprise User 角色。

  • 现有的 Gemini Enterprise Web 应用。如需了解如何创建新 应用,请参阅创建应用。

  • 如需访问 Metrics Explorer,您必须拥有 Monitoring Viewer 角色 (roles/monitoring.viewer)。

  • 启用启用 OpenTelemetry 跟踪记录和日志的插桩 可观测性设置。根据代理类型,在应用级配置(对于 Core Assistant 代理)或代理的配置 标签页内(对于 Workflow Builder 员工制作的代理和 Deep Research 代理)启用此设置。如需了解详情,请参阅 管理可观测性设置。 此设置是代理范围的指标所必需的。应用范围的指标列在 Gemini Enterprise 引擎 资源类型下,无需此设置即可收集。

数据保留

Gemini Enterprise 应用生成的指标存储在 您的 Google Cloud 项目的 Cloud Monitoring 中,其保留期限由 Cloud Monitoring 决定。Gemini Enterprise 指标在 discoveryengine.googleapis.com/ 前缀下发布,该前缀属于 "所有其他 Google Cloud 指标" 层级,默认保留期限为 6 周 。超出保留期限的数据会自动删除。如需了解权威 且最新的保留期限值,请参阅 Cloud Monitoring 配额和限制文档中的 数据保留。

在 Metrics Explorer 中访问指标

如需访问指标,请按以下步骤操作:

  1. 在 Google Cloud 控制台中,前往 Metrics Explorer 页面。

    转到 Metrics Explorer

  2. 选择创建 Gemini Enterprise 应用的 Google Cloud 项目。

  3. 点击选择一个指标 以打开搜索栏。

  4. 在搜索栏中,查找以下指标:

    指标名称 说明
    Gemini Enterprise 代理 - Gemini Enterprise 代理会话数 Gemini Enterprise 代理处理的会话数。
    Gemini Enterprise 代理 - Gemini Enterprise 代理工具数 Gemini Enterprise 代理调用工具的次数。
    Gemini Enterprise 代理 - Gemini Enterprise 代理轮次计数 Gemini Enterprise 代理会话中的对话轮次数量。
    Gemini Enterprise 代理 - Gemini Enterprise 代理总 延迟时间 Gemini Enterprise 代理响应的总延迟时间。
    Gemini Enterprise 代理 - Gemini Enterprise 代理工具总 延迟时间 Gemini Enterprise 代理内执行工具所产生的总延迟时间。
    Gemini Enterprise DataConnector - Gemini Enterprise DataConnector 请求数 向 Gemini Enterprise 数据 连接器(在 Google Cloud 控制台中也称为数据存储区)发出的请求总数。
    Gemini Enterprise DataConnector - Gemini Enterprise DataConnector 请求延迟时间 (Beta 版)向 Gemini Enterprise 数据 连接器(在控制台 Google Cloud 中也称为数据存储区)发出的请求的延迟时间(以毫秒为单位)。
    Gemini Enterprise 引擎 - Gemini Enterprise 引擎请求数 您的 Gemini Enterprise 应用收到的请求总数,涵盖应用的所有流量,而不是 单个代理的流量。按 API 方法、规范 gRPC 响应代码、响应代码类别、查询类型和模型细分。
    Gemini Enterprise 引擎 - Gemini Enterprise 引擎请求总 延迟时间 Gemini Enterprise 应用的端到端请求延迟时间分布。为每个请求记录,包括返回错误的请求。
    Gemini Enterprise 引擎 - Gemini Enterprise 引擎首次 回答延迟时间 接收请求和 流式传输第一个回答令牌之间的延迟时间分布。仅针对生成至少一个回答令牌的请求记录。
    Gemini Enterprise 引擎 - Gemini Enterprise 引擎首次 令牌延迟时间 接收请求和 流式传输第一个令牌之间的延迟时间分布,无论该令牌是模型思考过程的一部分还是最终答案。仅针对 生成至少一个流式传输令牌的请求记录。
  5. 选择要探索的指标,然后点击应用 。

  6. (可选)设置其他标签过滤条件、聚合元素,并调整时间范围。

     Google Cloud 控制台中 Metrics Explorer 的屏幕截图,显示了 Gemini Enterprise Agent 指标。

访问代理的指标

您还可以在 Google Cloud 控制台中代理的可观测性 标签页上,直接查看各个代理的运营、工具专用和会话指标信息中心。

如需访问代理的指标,请执行以下操作:

  1. 在 Google Cloud 控制台中,前往您的应用,然后点击代理。
  2. 选择要检查的代理,然后点击可观测性 标签页。

可观测性 标签页提供关键运营遥测数据,分为四个视图:概览、工具、延迟时间 和错误率。

指标概览

此视图提供了一个信息中心,用于汇总标准会话和代理健康数据,包括:

  • 会话:用户会话总数。
  • 每次会话的平均时间:会话期间经过的平均时间。
  • 代理调用:代理被调用的总次数。
  • 代理延迟时间:随时间和特定指标变化的延迟时间。
  • 代理流量:入站请求量。
  • 代理错误率:代理调用失败的百分比。

 Google Cloud 控制台中“可观测性”标签页的“概览”视图的屏幕截图,其中显示了会话数、每次会话的平均轮数、代理调用次数、延迟时间、流量和错误率

工具指标

此视图专门关注与代理关联的工具的使用情况和延迟时间,包括:

  • 调用总数:工具执行请求数。
  • 按工具统计的 P95 延迟时间:按工具分类的执行延迟时间第 95 百分位数。
  • 按工具统计的调用次数:不同工具之间的调用总数。
  • 按工具统计的错误率:按工具统计的执行失败率。
  • “未调用工具”比例 :互动未触发任何工具执行的比例。

延迟时间指标

此视图显示代理的响应延迟时间。每个指标都显示为所选时间范围的 p50 和 p95 摘要卡片,以及显示随时间变化的趋势的时序图表。您还可以按功能过滤延迟时间指标。 该视图显示以下指标:

  • 首次令牌延迟时间 (TTFT):接收请求和 流式传输第一个令牌之间的延迟时间,无论该令牌是模型 思考过程的一部分还是答案的一部分。
  • 首次回答延迟时间 (TTFA):接收请求和 流式传输第一个回答令牌(即不属于模型思考过程的第一个令牌)之间的延迟时间。如果代理在开始回答后调用工具,则测量会重新开始,因此 TTFA 反映的是用户阅读的答案开始流式传输的时间,而不是任何临时旁白。
  • 最后一个令牌延迟时间 (TTLT):接收请求和 流式传输最后一个令牌(即响应完成时)之间的延迟时间。

按功能过滤延迟时间指标

功能是指轮次代表的互动类型,例如网页搜索或图片生成。按功能过滤延迟时间指标,以查看哪些互动类型最慢,并防止某个慢速功能影响整体延迟时间。

如需按功能过滤延迟时间指标,请执行以下操作:

  1. 在代理的可观测性 标签页上,点击延迟时间 视图。
  2. 点击按功能过滤 。
  3. 选择要检查的功能。

然后,摘要卡片和时序图表将仅显示该功能的轮次。

如需一次比较所有功能,请使用功能遥测数据 表格,其中列出了每个功能的以下信息:

  • 流量份额:归因于该功能的轮次的百分比。
  • TTFT、TTFA 和 TTLT:该功能的 p50 和 p95 延迟时间。

您可以使用以下功能进行过滤:

  • 参数化:仅向模型发送请求以获取文本输出 (不使用工具)的互动,例如翻译任务。
  • 媒体内容生成:图片和视频生成任务。
  • 仅网页搜索:使用 网页搜索工具向模型发送请求的互动。
  • 上传的文件分析:涉及用户上传文件的模型互动。
  • 连接器:向内部或第三方 连接器发送请求的查询。
  • Canvas:使用 Canvas 的生成任务。
  • 技能:调用技能的互动。
  • 其他:适用于跨越多个功能或尚 未分类的轮次的兜底项。

 Google Cloud 控制台中“可观测性”标签页的“延迟时间”视图的屏幕截图,其中显示了功能过滤条件、p50 和 p95 摘要卡片、首次令牌时间、首次回答时间和最后令牌时间的时间序列图表,以及“功能”遥测表,其中列出了每个功能及其流量份额以及 p50 和 p95 延迟时间

错误率指标

此视图显示代理的请求如何解决,按响应类别分组: OK (2xx)、客户端错误 (4xx)、服务器错误 (5xx)和 已取消。具体包括:

  • 请求量(按响应类别):入站请求数随时间变化, 按响应类别堆叠。
  • 错误率(按响应类别):失败请求的百分比 随时间变化,按响应类别拆分。
  • 客户端错误代码 (4xx) 和服务器错误代码 (5xx):各个规范 gRPC 响应代码随时间变化,例如 INVALID_ARGUMENT 或 INTERNAL,以便您了解哪些特定错误 导致峰值。
  • 总计:所选时间范围内每种结果的请求数和占总请求数的百分比,以及单独的表格,用于对各个客户端和服务器错误代码进行排名。

 Google Cloud 控制台中“可观测性”标签页的“错误率”视图的屏幕截图,其中显示了按响应类划分的请求量和错误率、客户端和服务器错误代码的时序图,以及汇总表

后续步骤