帮你快速理解、总结文档立即下载

智能分类与打标

最近更新时间:2026-09-11 18:24:32
我的收藏
智能分类与打标让您通过自然语言描述完成敏感数据识别和业务标签管理,Buddy 自动扫描字段特征、推荐治理标签,并在关键节点等待您确认后批量落地。

概述

数据分类与打标是数据治理中连接资产发现与安全策略的核心环节。通过对表和字段进行分类打标,可以为后续的安全策略配置、质量规则推荐提供基础依据。本功能覆盖以下场景:
敏感字段自动识别:扫描表字段名,自动识别手机号、身份证号、邮箱、银行卡等 PII 字段,匹配系统内置敏感标签。如果用户在 Catalog 中预览过该表的数据,AI 还会结合实际数据内容进行识别(如判断某列值是否符合手机号格式),提高识别准确率。若未预览过数据,则仅基于字段名称进行推断。
自定义标签支持:除系统内置标签外,支持用户自定义治理标签,Agent 能够基于自定义标签体系进行识别与推荐,满足业务特有的敏感字段识别需求。
业务标签推荐:基于表名、字段语义和所属 Schema 的业务上下文,推荐适合的业务标签(如 domain:financetier:gold)。
批量打标:一次性为多张表、多个字段批量应用推荐的治理标签,无数量上限限制。
合规标识关联:对已识别的敏感字段,AI 会在对话中推荐关联 PII / GDPR / PIPL 等合规框架标识,并与用户逐项确认后再执行关联操作。

前提条件

工作空间已开通 Buddy。
当前账号拥有 Buddy 开发模式权限。
对需要打标的 Catalog / Schema 拥有查看权限。
如需写入标签,需要对应 Catalog 的标签管理权限。
使用自定义标签体系时,需先在 治理标签概述 中创建好标签定义。

您必须提供的信息

Buddy 在执行分类与打标前会要求您提供以下最小信息集,其余由 AI 自动推荐:
信息项
说明
打标范围
目标 Catalog、Schema 或具体表名
打标目的
敏感识别 / 业务标签推荐 / 合规标识关联(可通过自然语言隐含表达)
如果您的输入不完整,Buddy 会通过「Ask User 卡片」反问缺失信息后再继续。

AI 可智能生成的内容

内容项
AI 生成方式
敏感字段识别结果
未预览数据时基于字段名称模式推断(如 phoneid_cardemail);预览过数据时结合实际数据内容特征匹配
敏感标签推荐
匹配系统内置标签库(PII、金融、医疗等分类)
自定义标签匹配
基于用户已创建的自定义标签定义,AI 识别匹配的字段
业务标签推荐
分析表名、Schema 名、字段语义与业务上下文,推荐 domaintier 等业务标签
合规框架关联
根据敏感字段类型推荐关联 PII / GDPR / PIPL 等合规标识,需用户在对话中确认

操作步骤

步骤 1:表达分类打标需求

在 Buddy 输入框用自然语言描述需求,Buddy 会自动识别打标类型与目标范围。
示例输入
扫描 ods_catalog.user_info 的所有字段,帮我识别哪些是敏感字段
给 dw_order Schema 下的所有表打上 domain:ecommerce 业务标签
这个表有哪些字段需要关注 PIPL 合规?
帮我把这些敏感字段都打上系统内置标签
基于我们自定义的「业务敏感分级」标签体系,扫描 user_domain 下的敏感字段

步骤 2:补充缺失信息

如果输入不完整,Buddy 会通过 Ask User 卡片反问您:
未指定 Catalog / Schema / 表时,列出可用范围供选择。
使用自定义标签但未指定标签体系时,列出已创建的标签体系供选择。
回答后 Buddy 继续执行。

步骤 3:审阅 AI 识别与推荐结果

Buddy 会以表格形式展示扫描结果:
敏感字段识别
字段名、所属表、字段类型
识别到的敏感类型(手机号、身份证、邮箱、银行卡等)
推荐的敏感标签
匹配置信度
识别依据(字段名推断、数据内容识别)
业务标签推荐
表名、字段名
推荐标签及推荐理由
当前已有标签(避免重复打标)
说明:
您可以在推荐结果中修改、删除或新增标签后再确认。

步骤 4:确认并批量打标

确认标签推荐后,Buddy 调用 DataBuddy 接口批量写入标签,展示:
成功打标的表、字段数量
失败条目及原因(如权限不足、标签不存在)
批量打标无数量上限限制。

步骤 5:确认合规标识关联

对已识别的敏感字段,Buddy 会在对话中逐项推荐关联 PII / GDPR / PIPL 等合规框架标识:
AI 展示每个敏感字段推荐的合规标识
您在对话中逐项确认或拒绝
确认后 Buddy 执行关联操作并展示结果

步骤 6:联动后续治理(可选)

Buddy 在完成敏感识别与打标后,会主动提示是否继续联动后续治理操作:
联动操作
说明
安全策略配置
「已识别 N 个敏感字段,是否为它们推荐脱敏策略?」→ 联动 安全策略推荐
合规覆盖检查
「是否检查当前 Schema 下所有敏感字段的安全策略覆盖情况?」→ 联动 安全策略推荐

关键节点确认

确认项
确认时机
说明
扫描范围
扫描前
确认要扫描的 Catalog / Schema / 表
标签体系
使用自定义标签时
确认使用哪套标签定义
识别结果
打标前
审阅敏感识别与标签推荐,可修改
批量打标
写入前
确认影响范围与标签列表
合规标识
关联前
在对话中逐项确认合规框架标识关联

常见问题

Q:敏感字段识别的依据是什么?

A:识别依据取决于您是否在 Catalog 中预览过该表的数据。如果未预览过数据,Buddy 仅基于字段名称模式推断(如 phone → 手机号、id_card → 身份证号);如果预览过数据,AI 还会结合实际数据内容特征进行识别(如判断某列值是否符合手机号格式),准确率更高。

Q:批量打标会覆盖已有标签吗?

A:不会。Buddy 默认采用「追加」模式,仅新增推荐的标签,不删除已有标签。如果推荐的标签与已有标签冲突,会在结果中标记提示。

Q:自定义标签如何创建?

A:请在 治理标签概述 中创建自定义标签分类与标签值。创建完成后,Buddy 即可在扫描时使用这些自定义标签进行匹配。

Q:合规标识关联是自动完成还是需要确认?

A:需要确认。Buddy 会在对话中推荐关联 PII / GDPR / PIPL 等合规框架标识,并与您逐项确认后再执行关联操作,不会自动关联。

Q:Buddy 识别到的敏感字段和数据安全模块的内置识别规则有什么关系?

A:Buddy 的敏感识别结果会写入治理标签系统,与数据安全模块的内置识别规则互为补充。两者识别到的敏感字段在 Catalog 中统一展示。

相关文档