由客户云上购买和使用的资源实例与产品产生的监控事件包括:
事件中文名称 | 事件英文名称 | 事件类型 | 从属维度 | 有无恢复 | 事件描述 | 处理方法和建议 |
全部事件 | All events | cynosdb_mysql:ErrorEvent:All | 实例/集群 | 无 | 兜底事件,匹配所有 TDSQL-C MySQL 事件 | 一般无需单独处理,已在事件总线做兜底订阅;细分事件见各子类 |
云 API 操作事件(基于操作审计投递) | Cloud API actions (CloudAudit) | cynosdb_mysql:CloudEvent:ApiCall | 账号/API 调用 | 无 | 通过操作审计投递 OpenAPI 调用操作记录 | 接入审计日志分析,关注异常账号的高危 API 调用(删除实例、修改密码等) |
计划外高可用切换 | Unplanned high availability | cynosdb_mysql:ErrorEvent:HA | 集群/实例 | 有 | 主节点故障,系统自动切换到备机 | 1. 查看切换原因 2. 检查应用重连 3. 复核主从数据一致性 4. 排查源主机根因 |
控制台操作事件(基于操作审计投递) | Console operations (CloudAudit) | cynosdb_mysql:CloudEvent:ConsoleCall | 账号/控制台 | 无 | 通过操作审计投递控制台操作记录 | 接入审计日志,配合 CAM 做敏感操作复核 |
数据库代理异常 | Database agent exception | cynosdb_mysql:ErrorEvent:ProxyUnHealthy | 数据库代理/实例 | 有 | 数据库代理进程或节点异常,影响读写分离路由 | 1. 查看代理节点状态 2. 检查代理连接数 3. 必要时重启代理或提单 |
小程序操作事件(基于操作审计投递) | Mini program operations (CloudAudit) | cynosdb_mysql:CloudEvent:MiniProgramCall | 账号/小程序 | 无 | 通过操作审计投递小程序渠道操作记录 | 与小程序授权策略联动,发现异常远程控制及时止损 |
内存 OOM | OOM | cynosdb_mysql:ErrorEvent:AlarmMemOverKill | 实例/节点 | 有 | 实例内存触达上限触发 OOM Killer | 1. 查看慢 SQL 与大查询 2. 评估升配 3. 优化 Buffer Pool/临时表设置 |
实例只读(存储超限) | Instance read-only due to storage full | cynosdb_mysql:ErrorEvent:AlarmDiskOverQuota | 实例/集群 | 有 | 磁盘使用率100%,实例自动切换只读 | 1. 紧急扩容或清理数据 2. 排查空间增长来源 3. 恢复只读后验证写入 |
版本升级事件 | Version upgrade events | cynosdb_mysql:ErrorEvent:UpgradeVersion | 实例/集群 | 有 | 数据库内核或代理版本升级 | 1. 低峰期升级 2. 升级后验证功能性能 3. 检查不兼容 SQL |
跨可用区延迟 | Cross-AZ latency | cynosdb_mysql:ErrorEvent:CrossAzReplicationLag | 跨可用区复制 | 有 | 跨 AZ 主备复制延迟超阈值 | 1. 排查主库写入压力 2. 评估跨 AZ 带宽 3. 调整告警阈值 |
数据库代理挂载节点剔除 | The database agent mount node is removed. | cynosdb_mysql:ErrorEvent:ProxyNodeFaultEliminated | 数据库代理/实例 | 有 | 代理探测到后端节点异常,从路由中剔除 | 1. 关注是否5分钟内恢复 2. 持续剔除需排查节点状态 |
RDMA 降级 | RdmaDowngrade | cynosdb_mysql:ErrorEvent:RdmaDowngrade | 节点/网络 | 有 | RDMA 高性能网络降级为 TCP | 1. 关注性能指标 2. 提单排查 RDMA 链路 3. 评估切换流量 |
计划内高可用切换 | Planned high availability | cynosdb_mysql:ErrorEvent:FailureAvoid | 集群/实例 | 有 | 计划内 HA 切换(版本升级、主机维修等预防性切换) | 1. 确认业务重连 2. 检查切换耗时 3. 关注切换后性能 |
数据库审计低风险 | AuditLowRisk | cynosdb_mysql:ErrorEvent:AuditLowRisk | 审计规则 | 无 | 命中审计低风险规则(简单 SELECT、常规 DML) | 1. 接入审计日志存储 2. 周期复盘异常来源 3. 必要时收紧权限 |
数据库审计中风险 | AuditMediumRisk | cynosdb_mysql:ErrorEvent:AuditMediumRisk | 审计规则 | 无 | 命中审计中风险规则(大批量 UPDATE、敏感表访问) | 1. 通知安全/DBA 复核 2. 评估权限回收 3. 排查 SQL 来源 |
数据库审计高风险 | AuditHighRisk | cynosdb_mysql:ErrorEvent:AuditHighRisk | 审计规则 | 无 | 命中审计高风险规则(DROP TABLE、TRUNCATE、权限绕过) | 1. 立即告警通知安全/合规 2. 联动操作审计定位账号 3. 必要时应急响应 |
集群隔离 | ClusterIsolated | cynosdb_mysql:ErrorEvent:ClusterIsolated | 集群 | 有 | 集群因欠费/违规被隔离,停止服务但保留数据 | 1. 立即充值或处理违规 2. 评估数据保留期 3. 解除隔离后验证 |
Serverless 实例成功跨机迁移 | ServerlessExpandNodeBySwitchSuccess | cynosdb_mysql:ErrorEvent:ServerlessExpandNodeBySwitchSuccess | Serverless 实例 | 有 | Serverless 实例扩缩容跨机迁移成功 | 一般无需处理,关注迁移期间业务延迟 |
存储用量超限恢复 | StorageUseOverRecover | cynosdb_mysql:ErrorEvent:StopStorageOver | 实例/集群 | 有(恢复事件) | "存储用量超限"恢复事件,磁盘使用率回落到阈值以下 | 用于自动关闭告警,建议作为告警链路闭环事件 |
存储用量超限 | StorageUseOver | cynosdb_mysql:ErrorEvent:ReportStorageOver | 实例/集群 | 有 | 磁盘使用率超过设定阈值(未到100%) | 1. 提前扩容 2. 归档冷数据 3. 调整告警阈值 |
跨可用区半同步降级 | SemiSyncDowngrade | cynosdb_mysql:ErrorEvent:SemiSyncDowngrade | 跨可用区复制 | 有 | 跨 AZ 半同步降级为异步,影响数据可靠性 | 1. 排查跨 AZ 网络 2. 关注 RPO 3. 修复后回切半同步 |
全球数据库计划外运维事件 | global database HA | cynosdb_mysql:ErrorEvent:GdnSwitchStandby | 全球数据库(GDN) | 有 | GDN 非计划主备切换 | 1. 关注跨地域链路质量 2. 评估 RTO/RPO 3. 必要时提单跟进 |
实例隔离 | InstanceIsolated | cynosdb_mysql:ErrorEvent:InstanceIsolated | 实例 | 有 | 实例因欠费/违规被隔离 | 1. 立即充值 2. 解除隔离后验证 3. 长期欠费有回收风险 |
实例删除 | InstanceDeleted | cynosdb_mysql:ErrorEvent:InstanceDeleted | 实例 | 无 | 实例被删除 | 1. 排查删除来源 2. 回收站期内可恢复 3. 建议接入审批流 |
集群删除 | ClusterDeleted | cynosdb_mysql:ErrorEvent:ClusterDeleted | 集群 | 无 | 集群被删除 | 1. 排查删除来源 2. 回收站期内可恢复 3. 建议接入审批流 |
机器故障隐患 | DeviceFault | cynosdb_mysql:ErrorEvent:DeviceFaultEvent | 主机/物理机 | 有 | 底层物理机/虚拟机存在硬件或资源隐患 | 1. 关注业务指标 2. 腾讯云会自调迁移 3. 建议提单跟进 |
分析引擎同步链路中断 | LibradbSyncBreak | cynosdb_mysql:ErrorEvent:LibradbSyncBreak | 分析引擎/同步链路 | 有 | 分析引擎与主库数据同步链路中断 | 1. 检查同步链路 2. 评估对分析任务影响 3. 联系腾讯云跟进 |
分析引擎 OOM | LibradbOom | cynosdb_mysql:ErrorEvent:LibradbOom | 分析引擎实例 | 有 | 分析引擎节点 OOM,分析任务可能失败 | 1. 排查大查询/复杂聚合 2. 评估升配 3. 拆分慢分析任务 |
分析引擎实例删除 | LibradbInstanceDeleted | cynosdb_mysql:ErrorEvent:LibradbInstanceDeleted | 分析引擎实例 | 无 | 分析引擎实例被删除 | 1. 排查删除来源 2. 回滚分析任务依赖 |
分析引擎实例隔离 | LibradbInstanceIsolated | cynosdb_mysql:ErrorEvent:LibradbInstanceIsolated | 分析引擎实例 | 有 | 分析引擎实例因欠费被隔离 | 1. 立即充值 2. 解除隔离后验证 3. 关注下游报表任务 |
分析引擎磁盘使用超限 | LibradbDiskUsageOverThreshold | cynosdb_mysql:ErrorEvent:LibradbDiskUsageOverThreshold | 分析引擎实例 | 有 | 分析引擎磁盘使用率超阈值 | 1. 清理临时数据 2. 扩容磁盘 3. 调整数据保留策略 |
分析引擎节点故障 | LibradbNodeError | cynosdb_mysql:ErrorEvent:LibradbNodeError | 分析引擎节点 | 有 | 分析引擎节点故障 | 1. 立即提单 2. 评估任务迁移 3. 关注任务 SLA |
自动扩容失败 | AutoExtendStorageError | cynosdb_mysql:ErrorEvent:AutoExtendStorageError | 实例/集群 | 有 | 系统自动扩容磁盘失败(欠费、配额不足等) | 1. 检查账户余额 2. 检查实例配额 3. 提单排查扩容链路 |
自动扩容成功 | AutoExtendStorageSuccess | cynosdb_mysql:ErrorEvent:AutoExtendStorageSuccess | 实例/集群 | 有 (恢复事件) | 自动扩容磁盘成功 | 一般无需处理,记录到运维台账 |
实例重启 | InstanceRestart | cynosdb_mysql:ErrorEvent:NodeRestart | 实例 | 有 | 实例节点重启(内核升级、底层故障恢复等) | 1. 确认业务重连 2. 查看重启前后性能 3. 频繁发生需提单 |
实例跨 numa | Instance cross numa | cynosdb_mysql:ErrorEvent:NumaDowngrade | 实例/节点 | 有 | 实例从绑定 NUMA 节点迁移到其他 NUMA | 1. 评估对延迟敏感业务影响 2. 提单跟进 NUMA 调度 3. 必要时迁移回原 NUMA |