概述
数据剖析(Data Profiling)对一张表自动生成完整的字段级统计报告与漂移分析仪表盘,帮助您在使用数据前快速理解表的「长什么样」。DataBuddy 的数据剖析支持快照、时序、推理三类剖析,覆盖数值型、字符串、时间、布尔等字段的统计指标,并支持基于基线表计算分布漂移。
前提条件
在开始本操作前,请确保满足以下条件:
已开通 DataBuddy 服务并完成空间初始化。
配置权限 :仅表 Owner 与拥有表 Manager 权限的用户可以开启或编辑数据剖析(角色权限说明详见 成员与权限管理)。
查看权限 :拥有表读取权限即可查看仪表盘与运行记录。
已准备好可用的计算资源用于执行剖析作业。
如果需要计算漂移指标,请提前确定基线表。
使用限制
限制项 | 说明 |
入口 | Catalog 表详情页 质量 Tab 中的「数据剖析」入口 |
漂移产出条件 | 仅在配置了基线表时产生漂移指标,否则漂移指标为空 |
推理剖析必需列 | 至少配置时间戳、预测列与模型 ID 列;公平性指标需额外指定标签列、对照组、保护组 |
仪表盘删除 | 当前删除仪表盘会一并删除中间表,后续会优化为只删配置保留中间表 |
通知 | 剖析任务的告警通知本期不支持 |
操作步骤
步骤 1:在表详情页开启数据剖析
1. 登录 DataBuddy 控制台。
2. 进入 数据目录 > 选中目标表 > 质量 。
3. 在数据剖析 区域打开开关。开关开启后会弹出配置抽屉。
步骤 2:选择剖析类型
剖析类型决定了需要填写的配置项与最终产出的指标集合。
类型 | 适用场景 | 必填配置 |
快照(Snapshot) | 静态表的整体分布与质量摘要 | 计算资源、资源模式、资源配置 |
时序(TimeSeries) | 按时间维度持续观察分布趋势 | 计算资源、资源模式、资源配置、时间戳、指标粒度 |
推理(Inference) | 监控 ML 模型推理日志的特征漂移与模型质量 | 计算资源、资源模式、资源配置、时间戳、指标粒度、标签列、预测列、模型 ID |
步骤 3:配置剖析参数
1. 检测对象 :默认展示当前表(不可修改)。
2. 计算资源 :从下拉列表中选择资源组。
3. 调度方式 :在 高级选项 中切换为定时调度,或保持默认手动调度。
手动:首次创建时执行一次,后续通过点击 刷新仪表盘 主动触发。
周期调度:首次创建时执行一次,之后按调度计划周期执行,调度逻辑复用工作流。
1. 基线表 :在高级选项中选择,用于计算漂移指标。未配置时漂移指标为空。
2. 指标粒度 (时序与推理类型必填):从小时、天、周、月中选择。
3. 推理类型额外参数 :
参数 | 是否必填 | 说明 |
问题类型 | 是 | 分类 / 回归 |
时间戳列 | 是 | 推理请求的时间戳字段 |
预测列(prediction_column) | 是 | 模型输出的预测值字段 |
模型 ID 列(model_id_column) | 是 | 模型标识字段,支持多版本对比 |
标签列(label_column) | 是 | 配置后可计算准确率、精确率等模型质量指标 |
1. 公平性与偏差参数 (仅分类模型,可选):在选择预测列与标签列后,额外指定对比列、保护组、对照组。
步骤 4:确认并启动
完成配置后确认。系统会基于当前配置启动剖析作业,并生成对应的 Profiling 仪表盘。
提示
首次执行时,系统会对全表数据生成一个完整的统计指标快照,作为后续增量更新的基础。
步骤 5:管理仪表盘与剖析作业
开启数据剖析后,质量 Tab 的剖析区域会出现以下操作:
操作 | 说明 |
查看仪表盘 | 跳转到仪表盘模块,定位到该表的剖析仪表盘 |
刷新仪表盘 | 重新执行仪表盘上的查询,从中间表拉取最新数据;不会重新计算指标,也不会改变图表结构 |
删除仪表盘 | 移除当前仪表盘的所有图表与剖析数据;点击后弹出二次确认 |
编辑配置信息 | 右侧抽屉打开配置抽屉,所有字段均可再编辑,保存后按新配置更新仪表盘 |
运行记录 | 弹窗展示剖析的执行历史(执行时间、触发方式、策略、状态、耗时),可点击查看日志 |
注意
删除仪表盘 都会覆盖或清除当前剖析结果,请确认无下游依赖后再操作。
参数说明
基础配置
参数 | 说明 | 是否必填 | 默认值 | 取值范围 |
剖析类型 | 决定指标集合与必填项 | 是 | 快照 | 快照 / 时序 / 推理 |
计算资源 | 执行剖析作业的计算资源 | 是 | - | Workspace 可用计算资源 |
调度方式 | 控制剖析的触发方式 | 是 | 手动 | 手动 / 周期调度(高级选项内) |
基线表 | 用于漂移对比的参照表 | 否 | - | 同 Workspace 中的表 |
时序与推理类型必填配置
参数 | 时序 | 推理 | 说明 |
时间戳列 | 是 | 是 | 用于按时间分桶聚合 |
指标粒度 | 是 | 是 | 小时 / 天 / 周 / 月 |
标签列 | - | 是 | 推理类型可选,配置后计算模型质量指标 |
预测列 | - | 是 | 推理类型必填 |
模型 ID 列 | - | 是 | 推理类型必填 |
统计指标参考
漂移指标
漂移指标基于「当前剖析结果 vs 用户指定的基线表」对比计算。
数值型字段 :
指标 | 英文名 | 说明 |
KS 检验 | Kolmogorov-Smirnov Test | 检验两个分布是否来自同一总体 |
PSI | Population Stability Index | 衡量分布偏移程度,业界最常用 |
Wasserstein 距离 | Wasserstein Distance | 两个分布之间的「搬土」距离 |
类别型字段 :
指标 | 英文名 | 说明 |
卡方检验 | Chi-Square Test | 检验分类分布是否显著变化 |
JS 散度 | Jensen-Shannon Divergence | 衡量两个分布的对称距离 |
TV 距离 | TV Distance | 衡量两个概率分布差异的核心指标 |
切比雪夫距离 | L∞ Distance | 衡量两个分布在单一维度上的最大差异 |
推理指标(推理类型)
配置
predict 与 label 列后,平台额外产出以下模型质量指标:模型类型 | 指标 | 说明 |
分类 | 准确率(accuracy_score) | 正确预测的比例 |
分类 | 混淆矩阵 | 仅在仪表盘展示,不在规则模板中固化 |
分类 | 精确率(precision) | TP / (TP + FP) |
分类 | 召回率(recall) | TP / (TP + FN) |
分类 | F1 分数(f1_score) | 精确率与召回率的调和平均 |
回归 | MSE / RMSE / MAE / MAPE | 误差类指标,越低越好 |
回归 | 决定系数 R² | 介于 0 和 1 之间,越接近 1 拟合越好 |
分类(公平性) | 预测奇偶性、预测平等性、机会均等性、统计奇偶性 | 需额外指定保护组、对照组 |
验证结果
完成开启与首次执行后,您可以通过以下方式验证:
1. 在质量 Tab 中可以看到剖析区域的查看仪表盘 ;点击进入仪表盘模块后能正常加载图表。
2. 在「运行记录」弹窗中能看到首次执行的实例记录与状态。
3. 如配置了基线表,仪表盘中漂移指标区域有具体数值;未配置时漂移指标为空。
常见问题
Q:分区表与非分区表的剖析行为有什么差别?
A:分区表的剖析仅扫描新增分区并合并历史统计量,全局指标(如中位数)通过历史值与新增分区联合重算;非分区表每次重新扫描全表并覆盖上次结果。
Q:如果中途关闭了漂移检测,历史漂移数据会保留吗?
A:会保留。历史漂移数据保持不变,但后续剖析不再追加漂移计算。
Q:仪表盘看到的是中间表数据,重新计算指标该怎么做?
A:「刷新仪表盘」只是重新拉取已有中间表的数据,不会重新执行 Profiling。如需重新计算指标,请使用「重新生成仪表盘」。
相关文档
创建质量规则
创建仪表盘与布局