帮你快速理解、总结文档立即下载

数据剖析(Data Profiling)

最近更新时间:2026-09-11 18:24:35
我的收藏

概述

数据剖析(Data Profiling)对一张表自动生成完整的字段级统计报告与漂移分析仪表盘,帮助您在使用数据前快速理解表的「长什么样」。DataBuddy 的数据剖析支持快照、时序、推理三类剖析,覆盖数值型、字符串、时间、布尔等字段的统计指标,并支持基于基线表计算分布漂移。

前提条件

在开始本操作前,请确保满足以下条件:
已开通 DataBuddy 服务并完成空间初始化。
配置权限 :仅表 Owner 与拥有表 Manager 权限的用户可以开启或编辑数据剖析(角色权限说明详见 成员与权限管理)。
查看权限 :拥有表读取权限即可查看仪表盘与运行记录。
已准备好可用的计算资源用于执行剖析作业。
如果需要计算漂移指标,请提前确定基线表。

使用限制

限制项
说明
入口
Catalog 表详情页 质量 Tab 中的「数据剖析」入口
漂移产出条件
仅在配置了基线表时产生漂移指标,否则漂移指标为空
推理剖析必需列
至少配置时间戳、预测列与模型 ID 列;公平性指标需额外指定标签列、对照组、保护组
仪表盘删除
当前删除仪表盘会一并删除中间表,后续会优化为只删配置保留中间表
通知
剖析任务的告警通知本期不支持

操作步骤

步骤 1:在表详情页开启数据剖析

1. 登录 DataBuddy 控制台
2. 进入 数据目录 > 选中目标表 > 质量
3. 数据剖析 区域打开开关。开关开启后会弹出配置抽屉。

步骤 2:选择剖析类型

剖析类型决定了需要填写的配置项与最终产出的指标集合。
类型
适用场景
必填配置
快照(Snapshot)
静态表的整体分布与质量摘要
计算资源、资源模式、资源配置
时序(TimeSeries)
按时间维度持续观察分布趋势
计算资源、资源模式、资源配置、时间戳、指标粒度
推理(Inference)
监控 ML 模型推理日志的特征漂移与模型质量
计算资源、资源模式、资源配置、时间戳、指标粒度、标签列、预测列、模型 ID

步骤 3:配置剖析参数

1. 检测对象 :默认展示当前表(不可修改)。
2. 计算资源 :从下拉列表中选择资源组。
3. 调度方式 :在 高级选项 中切换为定时调度,或保持默认手动调度。
手动:首次创建时执行一次,后续通过点击 刷新仪表盘 主动触发。
周期调度:首次创建时执行一次,之后按调度计划周期执行,调度逻辑复用工作流。
1. 基线表 :在高级选项中选择,用于计算漂移指标。未配置时漂移指标为空。
2. 指标粒度 (时序与推理类型必填):从小时、天、周、月中选择。
3. 推理类型额外参数
参数
是否必填
说明
问题类型
分类 / 回归
时间戳列
推理请求的时间戳字段
预测列(prediction_column)
模型输出的预测值字段
模型 ID 列(model_id_column)
模型标识字段,支持多版本对比
标签列(label_column)
配置后可计算准确率、精确率等模型质量指标
1. 公平性与偏差参数 (仅分类模型,可选):在选择预测列与标签列后,额外指定对比列、保护组、对照组。

步骤 4:确认并启动

完成配置后确认。系统会基于当前配置启动剖析作业,并生成对应的 Profiling 仪表盘。
提示
首次执行时,系统会对全表数据生成一个完整的统计指标快照,作为后续增量更新的基础。

步骤 5:管理仪表盘与剖析作业

开启数据剖析后,质量 Tab 的剖析区域会出现以下操作:
操作
说明
查看仪表盘
跳转到仪表盘模块,定位到该表的剖析仪表盘
刷新仪表盘
重新执行仪表盘上的查询,从中间表拉取最新数据;不会重新计算指标,也不会改变图表结构
删除仪表盘
移除当前仪表盘的所有图表与剖析数据;点击后弹出二次确认
编辑配置信息
右侧抽屉打开配置抽屉,所有字段均可再编辑,保存后按新配置更新仪表盘
运行记录
弹窗展示剖析的执行历史(执行时间、触发方式、策略、状态、耗时),可点击查看日志
注意
删除仪表盘 都会覆盖或清除当前剖析结果,请确认无下游依赖后再操作。

参数说明

基础配置

参数
说明
是否必填
默认值
取值范围
剖析类型
决定指标集合与必填项
快照
快照 / 时序 / 推理
计算资源
执行剖析作业的计算资源
-
Workspace 可用计算资源
调度方式
控制剖析的触发方式
手动
手动 / 周期调度(高级选项内)
基线表
用于漂移对比的参照表
-
同 Workspace 中的表

时序与推理类型必填配置

参数
时序
推理
说明
时间戳列
用于按时间分桶聚合
指标粒度
小时 / 天 / 周 / 月
标签列
-
推理类型可选,配置后计算模型质量指标
预测列
-
推理类型必填
模型 ID 列
-
推理类型必填

统计指标参考

漂移指标

漂移指标基于「当前剖析结果 vs 用户指定的基线表」对比计算。
数值型字段
指标
英文名
说明
KS 检验
Kolmogorov-Smirnov Test
检验两个分布是否来自同一总体
PSI
Population Stability Index
衡量分布偏移程度,业界最常用
Wasserstein 距离
Wasserstein Distance
两个分布之间的「搬土」距离
类别型字段
指标
英文名
说明
卡方检验
Chi-Square Test
检验分类分布是否显著变化
JS 散度
Jensen-Shannon Divergence
衡量两个分布的对称距离
TV 距离
TV Distance
衡量两个概率分布差异的核心指标
切比雪夫距离
L∞ Distance
衡量两个分布在单一维度上的最大差异

推理指标(推理类型)

配置 predictlabel 列后,平台额外产出以下模型质量指标:
模型类型
指标
说明
分类
准确率(accuracy_score)
正确预测的比例
分类
混淆矩阵
仅在仪表盘展示,不在规则模板中固化
分类
精确率(precision)
TP / (TP + FP)
分类
召回率(recall)
TP / (TP + FN)
分类
F1 分数(f1_score)
精确率与召回率的调和平均
回归
MSE / RMSE / MAE / MAPE
误差类指标,越低越好
回归
决定系数 R²
介于 0 和 1 之间,越接近 1 拟合越好
分类(公平性)
预测奇偶性、预测平等性、机会均等性、统计奇偶性
需额外指定保护组、对照组

验证结果

完成开启与首次执行后,您可以通过以下方式验证:
1. 在质量 Tab 中可以看到剖析区域的查看仪表盘 ;点击进入仪表盘模块后能正常加载图表。
2. 在「运行记录」弹窗中能看到首次执行的实例记录与状态。
3. 如配置了基线表,仪表盘中漂移指标区域有具体数值;未配置时漂移指标为空。

常见问题

Q:分区表与非分区表的剖析行为有什么差别?

A:分区表的剖析仅扫描新增分区并合并历史统计量,全局指标(如中位数)通过历史值与新增分区联合重算;非分区表每次重新扫描全表并覆盖上次结果。

Q:如果中途关闭了漂移检测,历史漂移数据会保留吗?

A:会保留。历史漂移数据保持不变,但后续剖析不再追加漂移计算。

Q:仪表盘看到的是中间表数据,重新计算指标该怎么做?

A:「刷新仪表盘」只是重新拉取已有中间表的数据,不会重新执行 Profiling。如需重新计算指标,请使用「重新生成仪表盘」。

相关文档

创建质量规则
创建仪表盘与布局