系统首先对输入语句进行自然语言处理,提取时间、地域、指标、维度等关键实体,同时判断用户的任务类型——是简单的数据查询、对比分析、归因探索还是预测性分析。这一过程依赖大语言模型的语义理解能力,能够处理口语化表达和业务术语。
企业环境中同一个业务概念在不同部门可能有不同定义,比如"销售额"在财务、运营和销售部门的统计口径各不相同。大数据智能体通过语义目录(Semantic Catalog)将每个业务概念映射到标准的指标定义对象,其中包含标准名称、计算逻辑、来源字段和关联维度,确保所有分析基于统一的口径。
为提高准确性,许多系统采用多阶段转换而非直接生成 SQL。常见的路径是从自然语言先转换为中间表示语言(如指标查询语言 MQL),再由确定性引擎编译为标准 SQL。这种分阶段的方式将语义理解与语法生成解耦,大幅降低了大模型直接生成复杂 SQL 时的出错概率。
高级的智能体还会结合用户画像和持久化记忆来增强意图理解。系统会参考用户的历史交互行为、常用分析维度和配置偏好,在不同场景下做出更符合用户期望的解读。例如同一句"查看销售数据",对不同地区的运营人员可能会自动关联对应的区域范围。