语义建模让您通过自然语言完成语义模型、指标、维度的智能管理与查询,Buddy 自动理解业务意图、创建或修改语义对象,并支持自然语言查询语义元数据(含相似度检测),帮助分析人员快速了解和使用指标体系。
概述
语义建模是数据分析的核心基础设施,业务分析人员在开展数据分析前,通常需要创建指标、管理已有的语义模型与维度,或面对大量已有指标时快速定位所需信息。传统方式需要在多个页面反复操作,学习成本高。本功能覆盖以下场景:
语义模型管理:通过自然语言创建、修改、查询语义模型,包括模型的表关联关系、度量定义、维度绑定等配置。
指标管理:通过自然语言创建原子指标、派生指标、复合指标,配置指标口径、计算逻辑、时间粒度等属性,支持批量创建与修改。
维度管理:通过自然语言创建和管理维度、维度属性、层级关系,配置维度与事实表的关联。
自然语言查询语义元数据:用自然语言描述需求,AI 在语义层元数据中进行语义搜索,返回匹配的模型、指标、维度信息,支持相似度检测(识别名称、口径相似的指标,避免重复定义)。
指标体系探索:新入职分析师或不熟悉指标体系的用户,可通过对话式交互了解现有指标体系结构、指标间关系、使用方式等。
前提条件
工作空间已开通 Buddy。
当前账号拥有 Buddy 开发模式权限。
对需要管理的语义模型、指标、维度拥有查看权限。
如需创建或修改语义对象,需要拥有语义层的编辑权限。
语义层中已有基础数据模型(物理表或视图),以便创建语义模型时关联底表。
您必须提供的信息
Buddy 在执行语义建模操作前会要求您提供以下最小信息集,其余由 AI 自动推荐:
信息项 | 说明 |
操作目标 | 要管理的对象类型(语义模型 / 指标 / 维度)及具体名称 |
操作意图 | 创建 / 修改 / 查询 / 探索(可通过自然语言隐含表达) |
如果您的输入不完整,Buddy 会通过「Ask User 卡片」反问缺失信息后再继续;输入完整时会直接执行并展示结果。
AI 可智能生成的配置
配置项 | AI 生成方式 |
指标口径 | 基于用户的自然语言描述,自动生成 SQL 计算逻辑与聚合方式 |
指标属性 | 根据指标名称与口径描述,推荐数据类型、时间粒度、统计周期 |
维度关联 | 分析指标计算逻辑中涉及的字段,自动推荐关联维度 |
模型关联关系 | 基于表的外键、命名规则与字段类型,推荐事实表与维度表的关联关系 |
相似指标检测 | 对新建指标进行名称与口径的相似度匹配,提示已存在的相似指标 |
指标分类建议 | 根据指标名称与业务语义,推荐所属的指标分类目录 |
操作步骤
步骤 1:表达语义建模需求
在 Buddy 输入框用自然语言描述需求,Buddy 会自动识别操作类型与目标对象。
示例输入:
指标管理场景:
帮我创建一个"日活跃用户数"指标,基于 dwd_user_login 表的 user_id 去重计数
修改"GMV"指标的计算口径,需要排除退款订单
给"订单转化率"指标配置按天和按周两个时间粒度
语义模型管理场景:
基于 dwd_order_detail 和 dim_product 创建一个订单分析语义模型
给订单分析模型添加一个"客单价"度量
维度管理场景:
创建一个"地域"维度,包含省、市、区三个层级
把"商品类目"维度关联到订单分析模型上
语义元数据查询场景:
有没有和"用户活跃度"相关的指标?
帮我找一下计算口径包含"支付金额"的所有指标
"DAU"和"日活用户数"是同一个指标吗?
指标体系探索场景:
我们的指标体系是怎么组织的?有哪些大类?
交易域下有哪些核心指标?它们之间什么关系?
"GMV"这个指标的口径是什么?有哪些派生指标?
步骤 2:补充缺失信息
如果输入不完整,Buddy 会通过 Ask User 卡片反问您:
创建指标但未指定底表时,列出可用的事实表供选择。
创建指标但口径描述不够明确时,要求补充计算逻辑。
创建维度但未指定关联表或主键时,要求确认。
回答后 Buddy 继续执行。
步骤 3:相似度检测(创建场景自动触发)
当您请求创建新的指标或维度时,Buddy 会自动进行相似度检测:
名称相似度:检测已有指标、维度中是否存在名称相近的对象(如「日活用户数」与"DAU")。
口径相似度:对比计算逻辑是否与已有指标高度相似,避免重复定义。
检测结果展示:
如果未发现相似对象,直接进入下一步。
如果发现相似对象,展示相似项列表:
相似指标、维度名称
相似度评分
口径对比
Buddy 建议:复用已有、确认为新建
说明:
相似度检测帮助避免指标重复定义,保持指标体系的一致性与规范性。
步骤 4:审阅 AI 生成的配置
Buddy 会以结构化卡片展示待创建、修改的语义对象配置:
指标创建:
指标名称、指标编码
指标类型(原子、派生、复合)
计算口径(SQL 表达式)
聚合方式、数据类型
时间粒度、统计周期
关联维度
所属分类目录
语义模型创建:
模型名称、关联底表
事实表与维度表的关联关系(Join 条件)
度量列表与维度列表
维度创建:
维度名称、维度编码
维度属性列表
层级关系(如省→市→区)
关联表与主键
说明:
您可以在卡片上修改任意配置后再确认,Buddy 会按修改后的配置落地。
步骤 5:确认并落地
确认配置后,Buddy 调用 DataBuddy 语义层接口执行创建、修改操作,展示:
操作结果(成功、失败)
创建的对象 ID 与状态
失败条目及原因(如命名冲突、权限不足、底表不存在)
步骤 6:联动后续操作(可选)
Buddy 在完成语义建模后,会根据场景主动提示后续操作:
联动操作 | 说明 |
指标发布 | 「指标已创建,是否发布到生产环境?」 |
关联质量规则 | 「是否为新创建的指标配置质量监控规则?」→ 联动 质量任务创建与调度 |
继续探索 | 「是否查看该指标的相关派生指标或上下游关系?」 |
关键节点确认
确认项 | 确认时机 | 说明 |
操作对象 | 操作前 | 确认要创建 / 修改的语义对象 |
相似度检测结果 | 创建新指标时 | 审阅相似指标,确认是复用还是新建 |
配置详情 | 创建 / 修改前 | 审阅指标口径、维度关联、模型配置 |
发布操作 | 发布前 | 确认是否将语义对象发布到生产环境 |
常见问题
Q:Buddy 支持创建哪些类型的指标?
A:支持创建原子指标、派生指标和复合指标。原子指标定义基础的度量计算(如
COUNT(DISTINCT user_id)),派生指标在原子指标基础上添加时间限定与维度筛选(如「近 7 天日活用户数」),复合指标由多个指标组合计算(如「转化率 = 支付用户数、访问用户数」)。Q:相似度检测的判定标准是什么?
A:Buddy 从名称相似度和口径相似度两个维度进行检测。名称相似度基于语义匹配(如"DAU"与「日活跃用户数」会被判定为高度相似),口径相似度基于 SQL 逻辑的等价分析。当任一维度相似度超过阈值时会触发提示。
Q:通过 Buddy 创建的指标和在语义层页面手动创建的有区别吗?
A:完全没有区别。Buddy 通过 DataBuddy 语义层接口创建指标,创建的指标与手动创建的在同一套管理体系中,您可以在语义层页面统一查看和管理。
Q:新入职分析师如何快速了解指标体系?
A:可以直接用自然语言向 Buddy 提问,例如「我们的指标体系是怎么组织的」「交易域有哪些核心指标」「GMV 的计算口径是什么」。Buddy 会以对话方式介绍指标体系结构、指标含义、指标间关系等,帮助新人快速上手。
Q:语义元数据查询和数据目录中的搜索有什么区别?
A:数据目录搜索面向物理层(表、字段),而语义元数据查询面向语义层(模型、指标、维度)。Buddy 的语义查询基于语义理解进行匹配,能理解业务含义的等价表达(如搜索「用户活跃」能匹配到"DAU"指标),并支持口径级别的相似度对比。
Q:批量创建指标时有数量限制吗?
A:单次对话中 Buddy 建议一次性创建不超过 20 个指标,以确保每个指标的口径和配置都能得到充分审阅。如果需要大批量创建,建议分多次对话完成。