使用 Grafana 信息中心监控 Spanner Omni

使用 Grafana 信息中心监控 Spanner Omni 部署的运行状况和性能。这些信息中心将提取到 Prometheus 中的 Spanner Omni 指标可视化,从而全面了解部署的运行状态。您可以了解整体系统运行状况、资源消耗情况和关键内部流程。

信息中心清单

下表简要总结了可用的信息中心:

信息中心 关键指标 主要目的
概览 QPS、延迟时间、吞吐量 监控简要部署性能,包括每秒查询次数 (QPS)、请求延迟时间和数据吞吐量。
系统分析洞见 CPU、内存、锁定等待时间 重点关注所选数据库的数据库级资源消耗情况和运行状况(例如 CPU、内存和锁定等待时间)。
部署分析洞见 CPU、内存和网络利用率 提供有关整体部署资源消耗情况 和网络统计信息的详细分析洞见。
Spanner Omni 文件系统 文件操作、延迟时间和吞吐量 监控底层文件系统操作、性能、延迟时间和 吞吐量。
gRPC RPC 计数、状态和延迟时间 跟踪服务器端和客户端 通信的详细 RPC 统计信息。
压缩 压缩成功率和失败率、压缩延迟时间 将后台数据维护性能可视化,重点关注 压缩成功率和失败率以及压缩延迟时间。
拆分、合并和移动 拆分、合并和移动计数;实例组大小 监控数据的动态分布,包括目录操作 (拆分、合并和移动)、数据实例组大小和潜在的热点。
平板 平板计数、负载分配 深入了解平板统计信息、操作和负载 分配,并识别潜在的热点。
TrueTime 漂移、不确定性、违反服务等级协议 (SLA) 监控 Spanner Omni TrueTime 服务的运行状况和可靠性,包括漂移、不确定性和违反服务等级协议 (SLA) 的情况。
共享日志 写入速率、排序错误率 监控共享日志性能,特别是写入速率和排序 错误率。

以下是信息中心中提供的一些图表:

  • 计算容量 (vCPU):在整个部署中预配的 vCPUs 总数。

  • 内存容量:在整个 部署中预配的物理内存总容量。

  • 存储容量:文件系统的总存储容量和可用存储容量。

  • 节点状态:跟踪 部署中的服务器总数和运行状况不佳的服务器数量。

  • 计算利用率:已使用的 vCPU 总容量所占的百分比。

  • 内存利用率:整个部署的总内存用量。由于 Spanner Omni 将空闲内存用于缓存,因此预计利用率会很高。

  • 存储利用率:已使用的总存储容量所占的百分比。

  • 每个 vCPU 使用的存储空间:已使用的总存储空间与总vCPU数量的比率。

  • 服务器:详细表格,显示每个服务器和每个可用区的 CPU利用率、内存利用率、正常运行时间、vCPU总数、内存总容量、 已使用的存储空间和存储容量的指标。

系统分析洞见信息中心

系统分析洞见信息中心重点关注部署中数据库的运行状况和性能。此信息中心包含以下图表:

  • CPU 利用率概览:在所选服务器上汇总的数据库整体 CPU 利用率。

  • 按用户和系统划分的 CPU 利用率:所选 数据库中的 CPU 利用率,按用户和系统任务以及优先级分组。

  • 按操作类型划分的 CPU 利用率:在所选服务器上汇总的所选数据库的 CPU 利用率(按 操作类型分组)。

  • 按操作类型划分的 CPU 利用率 - 高优先级:在所选服务器上汇总的所选 数据库 的 CPU利用率(按操作类型分组并按高优先级过滤)。

  • 按操作类型划分的 CPU 利用率 - 中优先级:在所选服务器上汇总的所选数据库的 CPU利用率(按操作类型分组并按中优先级过滤)。

  • 按操作类型划分的 CPU 利用率 - 低优先级:在所选服务器上汇总的所选 数据库的 CPU利用率(按操作类型分组并按低优先级过滤)。

  • 请求延迟时间 (P50P90P99):所选数据库中的延迟时间,按所选服务器上的读取和写入方法分组。

  • 按方法划分的请求延迟时间 (P50P90P99):所选数据库中的延迟时间,按所选服务器上的 API 方法分组。

  • 事务延迟时间 (P50P90P99):所选数据库中的请求延迟时间,按所选服务器上的事务类型和主要副本参与情况分组。

  • 吞吐量:所选数据库中跨 所选服务器的读取和写入吞吐量。

  • 按方法划分的吞吐量 :所选数据库中按所选服务器上的 方法分组的吞吐量。

  • 每秒操作次数:所选数据库中按所选服务器上的读取和写入方法分组的每秒操作次数。

  • 按方法划分的每秒操作次数:所选 数据库中按所选服务器上的方法分组的每秒操作次数。

  • 按数据库划分的存储利用率: 每个数据库使用的非复制物理字节数。每个实例组的主要平板提供此指标。实例组的所有平板的实际复制物理字节数可能会因每个平板上的压缩状态而异,但此指标可大致了解每个数据库使用的非复制物理存储空间量。

  • 锁定等待时间:在 5 分钟的时间间隔内,所选 数据库的锁定冲突的总锁定等待时间。

  • 事务取消率:已取消事务的比率。当事务之间发生冲突时,取消率可能会更高。

  • 架构对象计数:所选数据库的架构对象数量。

  • 事务参与者:数据库的每次提交尝试中事务 参与者数量的分布情况。

部署分析洞见信息中心

部署分析洞见信息中心可进一步了解部署资源消耗情况。此信息中心包含以下图表:

  • CPU 利用率:所选服务器的汇总 CPU 利用率。

  • 服务器 CPU 利用率:每个所选服务器的 CPU 利用率。

  • 进程 CPU 利用率CPU 在所选服务器上汇总的每个进程的利用率 。

  • 内存利用率:所选 服务器的汇总内存利用率。由于 Spanner Omni 会将数据缓存在内存中,并且 Spanner Omni 可以根据需要释放内存,因此预计值会很高。

  • 服务器内存利用率:每个所选 服务器的内存利用率。由于 Spanner Omni 会将数据缓存在内存中,并且 Spanner Omni 可以根据需要释放内存,因此预计值会很高。

  • 进程驻留内存大小:所选服务器的每个进程的驻留内存大小。

  • 进程虚拟内存大小:所选服务器的每个进程的虚拟内存大小。

  • 服务器内存细分:在所选服务器上汇总的按类别(缓存、碎片、memtable_pinned、系统、更新、其他)划分的内存利用率。此内存特定于 span_server 进程。

  • 网络发送的字节数:在所有 服务器上汇总的每个接口发送的字节数。

  • 网络接收的字节数:在 所有服务器上汇总的每个接口接收的字节数。

  • 网络发送的字节数最多的前 10 个服务器:网络发送的字节数最多的前 10 个服务器 (表格视图)。

  • 网络接收的字节数最多的前 10 个服务器:网络接收的字节数最多的前 10 个服务器(表格视图)。

Spanner Omni 文件系统信息中心

Spanner Omni 文件系统信息中心监控对性能至关重要的底层文件系统操作,包括操作速率、延迟时间和吞吐量。此信息中心包含以下图表:

  • 文件操作图表:

    • 每秒操作次数:跟踪文件操作的总速率, 按操作分组。

    • 每秒本地和远程操作次数:跟踪文件 操作的速率,按本地访问与远程访问分开。

    • 每秒操作错误数:显示失败的文件系统 操作的速率,按操作和状态分组。

  • 延迟图表:包括P50P90P99延迟的图表,适用于本地和远程文件操作,按操作分组。

  • 吞吐量图表

    • 本地和远程读取和写入吞吐量:跟踪读取和写入吞吐量的速率,按本地访问与远程访问分开。

    • 每次操作的字节数:包括P50P90本地和远程访问的每次操作传输的字节数。

  • 文件系统统计信息

    • 按可用区划分的文件系统总大小:显示预配的 文件系统总大小,按 Spanner Omni 可用区分组。

    • 按可用区划分的文件系统用量:显示当前使用的文件系统 大小,按 Spanner Omni 可用区分组。

gRPC 信息中心

gRPC 信息中心跟踪部署中所有服务器的详细 RPC 统计信息。此信息中心包含以下图表:

  • 服务器端指标:从服务器的角度监控 RPC 性能。

    • 按方法划分的 RPC 延迟时间 (P50P90P99):服务器端每个 RPC 方法的延迟时间。

    • 按方法划分的服务器发送吞吐量:所选服务器的每种方法的每秒发送字节数。

    • 按进程划分的服务器发送吞吐量:所选服务器的每个 进程的每秒发送字节数。

    • 按方法划分的服务器接收吞吐量:所选服务器的每种方法的每秒接收字节数。

    • 按进程划分的服务器接收吞吐量:每秒接收字节数 所选服务器的每个进程。

    • 按方法划分的服务器规范状态计数:所选服务器的每种方法的 规范状态代码出现率。

    • 按方法划分的服务器已完成 RPC:所选服务器的每种方法的已完成 RPCs 的速率。

    • 服务器活跃通道:自应用启动以来创建的服务器端 gRPC 通道总数,这些通道仍处于活跃状态。

  • 客户端指标:从客户端的角度监控 RPC 性能。

    • 按方法划分的客户端往返延迟时间 (P50P90P99):每种方法的往返 RPC延迟时间,包括服务器延迟时间、网络和 队列时间。

    • 按方法划分的客户端发送吞吐量:所选服务器的每种方法的每秒发送字节数 。

    • 按进程划分的客户端发送吞吐量:所选服务器的每个 进程的每秒发送字节数。

    • 按方法划分的客户端接收吞吐量:所选服务器的每种方法的每秒接收字节数。

    • 按进程划分的客户端接收吞吐量:所选服务器的每个进程的每秒接收字节数 。

    • 按方法划分的客户端规范状态计数:所选 服务器的每种方法的 规范状态代码出现率(作为 gRPC 客户端)。

    • 按方法划分的客户端已完成 RPC:所选服务器的每种方法的已完成客户端 RPCs 的速率。

压缩信息中心

压缩信息中心以可视化方式显示后台压缩任务的性能。此信息中心包含以下图表:

  • 成功和失败的压缩(过去 1 小时):跟踪按压缩类型和每个服务器分组的压缩类型的成功和 失败计数。

  • 压缩输出字节速率:跟踪 压缩在 2 分钟的时间间隔内的输出字节速率,按压缩类型和每个 服务器分组。

  • 压缩输入大小分布:热图显示 压缩输入大小的分布情况。

  • 压缩输入大小(平均值):显示平均压缩输入大小, 按压缩类型和每个服务器分组。

  • 压缩输入大小(百分位估计值):提供压缩输入大小的百分位 估计值(P50P95P99),按压缩类型和每个服务器 分组。

  • 主要压缩延迟时间分布:热图显示 在所有服务器上汇总的主要压缩延迟时间分布。

  • 每个服务器的主要压缩延迟时间(平均值):显示每个服务器的主要 压缩延迟时间的平均值。

  • 每个服务器的主要压缩延迟时间(百分位估计值):提供 每个服务器的主要压缩延迟时间的百分位估计值(P50P90P99)。

拆分、合并和移动信息中心

拆分、合并和移动信息中心跟踪集群中数据的动态分布,包括目录操作和实例组大小。此信息中心包含以下图表:

  • 拆分大小分布:目录拆分的大小,包括 P50P90P99P100 百分位,在所选 服务器上汇总。

  • 实例组大小分布:为实例组分配的所有字节(持久性 和内存中),包括 P50P90P99P100 百分位,在所选服务器上汇总。

  • 内存中实例组大小分布:为实例组分配的所有字节 内存中数据结构,包括 P50P90P99P100 百分位, 在所选服务器上汇总。

  • 按可用区划分的实例组大小:实例组的所有 分配字节(持久性和内存中)的P50P90P99P100 大小,按 Spanner Omni 可用区分组。

  • 成功内部数据移动次数:在 1 小时的时间范围内,目录和实例组 移动、拆分和合并的计数,按发起者、 操作和移动类型分组。

  • 失败内部数据移动次数:在 1 小时的时间范围内,尝试 目录和实例组移动、拆分和合并时发生的错误计数。

  • 按原因和类型划分的无法拆分的错误:无法拆分的错误率 其中过载的拆分会被忽略,因为范围无法拆分。

  • 峰值拆分 CPU 利用率得分:每个数据库的所有 拆分的最高 CPU 利用率负载。

平板信息中心

平板信息中心深入了解平板统计信息、操作和潜在的热点。此信息中心包含以下图表:

  • 平板总数:整个 部署中的 Paxos 平板总数。

  • 按可用区划分的平板计数:平板数量,按 Spanner Omni 可用区分组。

  • 按服务器划分的平板计数:所选服务器上的平板数量。

  • 按可用区划分的主要平板计数:主要平板计数,按 Spanner Omni 可用区分组。

  • 按服务器划分的主要平板计数:所选服务器上的主要平板计数。

  • 每个可用区的未分配平板:每个可用区的未分配平板数量。

  • 按可用区划分的平板负载:按可用区分组的平板负载速率。

  • 按可用区和原因划分的平板卸载:每个可用区的平板卸载速率, 按卸载原因分类。

  • 每个服务器的最大片负载:表格视图显示每个服务器上片的最大计算负载。

  • 热门平板计数:热门平板(超过 计算负载阈值的平板)的总数。

  • 平板负载分布:每个平板的计算负载分布, 显示 P50P90 百分位估计值以及确切的 MAX 值。

TrueTime 信息中心

TrueTime 信息中心可让您了解 Spanner Omni TrueTime 服务的运行状况和可靠性。此信息中心包含以下图表:

  • TrueTime 可用性:监控 TrueTime 服务的整体可用性。

  • P99 TrueTime 漂移:跟踪 TrueTime 漂移的第 99 百分位。

  • P99 TrueTime 不确定性:跟踪 TrueTime 不确定性的第 99 百分位。

  • 时钟违反服务等级协议 (SLA) 的次数:显示违反时钟 服务等级协议 (SLA) 的次数。

  • 虚拟机迁移计数:跟踪虚拟机迁移次数。

  • 主要平板上的 TrueTime 漂移:专门监控 主要节点上的 TrueTime 漂移。

  • TrueTime 预期和实际转向 ppm:比较预期和实际的 百万分率 (ppm) 转向值。

  • TrueTime 转向错误:跟踪 TrueTime 转向 机制中的错误。

共享日志信息中心

共享日志信息中心是一个专用信息中心,用于监控共享日志性能和恢复状态。此信息中心包含以下图表:

  • 共享日志写入速率:每秒共享日志条目计数,按数据库汇总和 细分。

  • 共享日志写入的字节数:每秒写入的共享日志字节数 (吞吐量),按数据库汇总和细分。

  • 共享日志批次写入速率:每秒写入的共享日志批次 在所选服务器上汇总。

  • 共享日志批次写入延迟时间分布:共享日志批次写入的 P50P90P99 延迟时间分布。

  • 共享日志批次条目计数分布:共享日志批次中条目计数的P50P90P99 分布。

  • LogSort 请求速率:在 所选服务器上汇总的 LogSort 请求速率。

  • LogSort 排序错误率:在所选服务器上汇总的 LogSort 排序错误率 。

  • 正在进行的共享日志读取器:参与平板恢复的共享日志读取器总数 。

后续步骤