操作场景
随着业务规模的增长,缓存实例的稳定性和性能表现直接影响业务的响应速度与用户体验。腾讯云分布式缓存数据库提供覆盖实例、Redis 节点和 Proxy 节点三个维度的监控服务,支持5秒级数据采集粒度,适用于以下场景:
性能瓶颈定位:当业务出现延迟抖动或响应变慢时,通过多维度监控(CPU、内存、网络、时延、慢查询等指标)快速定位瓶颈所在层级,无需逐一排除。
容量规划与成本优化:通过内存使用率、Key 总数、流量使用率等指标的历史趋势分析,为扩缩容决策提供数据支撑,避免资源不足或过度扩容。
异常回溯与根因分析:支持多种数据粒度(5秒/1分钟/5分钟/1小时/1天),结合连接数、限流次数、Key 驱逐等指标回溯异常事件,还原问题发生时的系统状态。
日常运维巡检:定期查看实例的 CPU 使用率、内存使用率、连接数等核心指标,及时发现潜在风险。
功能说明
腾讯云分布式缓存数据库的监控功能提供以下核心能力:
三维度监控覆盖:支持实例级、Redis 节点级和 Proxy 节点级的监控数据查看,实例监控通过 SUM、AVG、MAX、LAST 等算法聚合各节点数据。
多粒度数据采集:支持5秒、1分钟、5分钟、1小时、1天多个监控粒度,满足从实时监控到长期趋势分析的需求。
API 接口支持:通过腾讯云可观测平台 API 接口拉取监控数据,支持自动化运维和自定义监控面板集成。
监控粒度
监控数据支持以下粒度,不同粒度的数据保留时长不同:
监控粒度 | 数据保留时长 | 适用场景 |
5秒 | 1天 | 实时监控和异常快速定位 |
1分钟 | 15天 | 日常运维巡检和短期趋势分析 |
5分钟 | 31天 | 中期性能趋势观察 |
1小时 | 93天 | 长期容量规划和历史趋势分析 |
1天 | 186天 | 按天维度的长期运营报表 |
前提条件
实例处于运行中状态。
操作步骤
说明:
实例发生故障切换、扩容、缩容等运维操作后,底层节点 ID 会发生变化。如果通过 API 查询节点级监控数据,需要重新调用
DescribeInstanceNodeInfo 接口获取当前的节点 ID。监控数据有一定的采集和上报延迟,通常在秒级范围内。实时监控页面的数据刷新会有短暂延迟,属于正常现象。
不同监控粒度的数据保留时长不同,历史数据超过保留期限后将自动清理,无法恢复。如需长期保留监控数据,建议通过 API 定期拉取并存储到自有系统中。
方式一:在实例列表快速查看
适用于快速查看单个实例核心指标的场景,无需进入实例详情页面。
1. 登录 腾讯云分布式缓存数据库控制台。
2. 在右侧实例列表页面上方,选择地域。
3. 在实例列表中,找到目标实例。
4. 在监控列中,单击
,即可在右侧弹出面板中快速查看核心监控数据。


方式二:在系统监控页面查看
适用于查看详细监控数据和多维度分析的场景。
1. 登录 腾讯云分布式缓存数据库控制台。
2. 在右侧实例列表页面上方,选择地域。
3. 在实例列表中,找到目标实例。
4. 单击目标实例 ID,进入实例详情页面。
5. 选择系统监控页签,可以实时查看实例及其各底层组件(如 Proxy 节点、Redis 节点等)的运行状态,提供全局与局部的双重视图,帮助您全方位分析性能瓶颈:
页面区域 | 核心定位 | 主要控件与支持的操作 | 典型应用场景 |
主监控视图 (顶部区域) | 单指标深度分析:提供大画幅的折线图,用于聚焦查看单一核心指标的详细波动趋势。 | 切换视图与指标: 在视图下拉列表,切换要查看的组件层级(如实例、Proxy);在指标下拉列表,切换具体指标(如 CPU 使用率)。 设置时间与粒度: 在时间区域,自定义查询的时间范围和数据点的聚合粒度。 查看单点明细: 将鼠标悬停在折线图上,查看特定时间点的精确数值。 开启全节点对比: 单击右上角全节点对比,同图横向比较当前层级下所有节点的数据。 | 问题排查: 当收到特定指标(如 CPU 飙升)的告警时,在此区域放大查看该指标的精确走势。 横向对比: 结合“全节点对比”功能,排查是否存在个别节点负载过高、请求倾斜的问题。 |
详细指标看板 (底部区域) | 多维度全局概览:平铺展示当前对象的所有关键指标,用于快速评估系统整体健康度与性能极值。 | 下钻定位节点: 在左侧资源导航树中,展开并单击具体节点,查看该单节点的各项监控数据。 设置时间与粒度: 在时间区域,自定义查询的时间范围和数据点的聚合粒度。 纵览统计极值: 直接读取各项指标右侧的 Max(最大值)、Min(最小值)和 Avg(平均值),无需人工计算。 发起历史对比: 单击数据对比,对比不同时间段的监控趋势。 设置告警与导出: 单击设置告警,跳转配置告警策略页面;单击导出数据,可将当前页面的监控数据导出至本地。 | 日常巡检: 一目了然地纵览 CPU、内存、网络连接等各项指标的整体运行状态。 峰值评估: 通过极值统计快速判断业务高峰期的资源消耗是否触达系统瓶颈。 |

通过 API 查看监控数据
参数 | 说明 |
Namespace | 固定值 QCE/REDIS_MEM。 |
MetricName | 填写需要查询的指标英文名,例如 CpuUtil、Connections、Commands 等。 |
Period | 监控数据粒度,单位为秒。支持5、60、300、3600、86400。 |
Instances.N.Dimensions | 查询实例级监控:设置 instanceid 为实例 ID。查询 Redis 节点监控:额外设置 rnodeid 为 Redis 节点 ID。查询 Proxy 节点监控:额外设置 pnodeid 为 Proxy 节点 ID。 |
相关 API
API 接口名称 | 说明 |
查询监控数据 | |
获取 Proxy 节点 ID 和 Redis 节点 ID | |
查询实例列表,获取实例监控版本信息 | |
查询实例访问来源信息 | |
查询实例访问的耗时分布 | |
查询实例访问命令 | |
查询实例 CPU 耗时 |
常见问题
如何判断实例的监控粒度版本?
通过以下两种方式判断:
1. 控制台方式:进入实例详情页面,单击系统监控 > 监控指标,页面展示的最小时间粒度即为该实例支持的监控粒度。
2. API 方式:调用
DescribeInstances 接口,查看返回参数 InstanceSet.MonitorVersion。返回 5s 表示支持5秒粒度,返回 1m 表示支持1分钟粒度。内存倾斜率和总请求倾斜率如何解读?
内存倾斜率(
mem_slope_util):表示各分片主节点的内存使用量与所有分片平均值的比值。当某个分片的内存倾斜率超过100%时,说明该分片存储的数据量高于平均水平,可能存在大 Key 或数据分布不均的情况,建议排查 Key 的分布是否合理。总请求倾斜率(
qps_slope_util):表示各分片主节点的请求数量与所有分片平均值的比值。当某个分片的请求倾斜率超过100%时,说明该分片承受的请求压力高于平均水平,可能存在热点 Key,建议通过热 Key 分析功能进一步排查。通过 API 查询节点级监控数据时提示节点不存在?
实例在故障切换、扩缩容等操作后,底层节点 ID 会发生变化。请调用 DescribeInstanceNodeInfo 接口重新获取当前的 Proxy 节点 ID 和 Redis 节点 ID,然后使用新的节点 ID 查询监控数据。