帮你快速理解、总结文档立即下载

数据探索概述

最近更新时间:2026-09-11 20:57:31
本文档已由 AI 辅助审校
我的收藏

什么是数据探索

数据探索(Data Exploration) 是 DataBuddy 中面向数据分析师的轻量化分析入口。您在这里通过 Spark SQL 直接查询统一 Catalog 中的库表,把查询结果立即转成图表,并将常用查询沉淀为收藏,无需进入 Workflow 编排或 Notebook 开发流程。
举一个典型例子:业务同学想看「最近 7 天某个产品线的下单趋势」,只需要在数据探索中新建一段 SQL,选择 Catalog → Schema → 运行,下方表格立即出现结果,再点一下 图表 就可以得到一张折线图,分享链接给同事即可。

与数据工程中 SQL 的关系

数据探索与 开发工作台 SQL 共享同一套底层能力 :相同的 Spark SQL 引擎、相同的 Serverless 数据分析型计算资源组、相同的统一 Catalog、相同的查询执行链路。两者的区别在于产品入口与定位:
维度
数据探索(5.1)
Studio SQL(3.1.3)
目标读者
数据分析师、业务分析人员
数据工程师、ETL 开发人员
产品入口
左侧导航 数据探索
左侧导航 开发工作台
主要场景
即席查询、可视化探查、临时分析
数据加工脚本开发、参数化复用、调度准备
协作语境
独立 SQL 脚本文件 + 全局运行历史 + 可视化
Notebook / SQL / Python 多文件协作 + Git
与 Workflow 的关系
通常不调度,验证想法用
可一键作为 SQL 任务 加入工作流
提示
两个入口的 SQL 文件在 Workspace 中互通 :数据探索中保存的 .sql 文件可以在 Studio 中打开继续编辑,反之亦然;都遵循同一套 文件权限 规则。这意味着分析师沉淀的查询,工程师可以直接复用并加入 Workflow 调度。

核心能力

能力
说明
即席查询
在统一编辑器中编写 Spark SQL,秒级提交到 Serverless 资源组运行,结果以表格展示在编辑器下方。
查询收藏
将常用查询沉淀为收藏列表,下次打开后一键加载到编辑器。
结果可视化
一键将查询结果生成柱状图、折线图、饼图等可视化图表,无需切换到仪表盘。
结果导出
将查询结果下载为 CSV / Excel / TXT,用于离线汇报或对外交付。
AI 辅助
内置 Buddy「数据分析」模式,支持自然语言生成 SQL、查询解读、报告生成、归因分析等。
联邦查询
通过统一 Catalog 接入外部数据源(MySQL、Doris、ClickHouse 等),用同一套 Spark SQL 语法跨源查询。

关键概念

理解数据探索,您需要熟悉以下核心概念:
数据探索空间 :Workspace 中所有数据探索 SQL 文件的集合,按多级文件夹组织。文件级 ACL 与 Studio SQL 一致。等同于 Databricks 的 SQL Editor / Queries 、阿里 DataWorks 的 数据分析
Spark SQL 方言 :底层执行引擎统一使用 Spark SQL;所有跨数据源查询都走统一 Catalog,使用同一套语法。详见 SQL IDE 基础操作。
交互式分析型 Serverless 资源 :数据探索使用的执行资源,由平台动态扩缩容,分析师无需感知具体实例。详见 计算资源概述
统一 Catalog :基于 Unity Catalog 的三段命名空间 catalog.schema.table,承载内部引擎与外部数据源的元数据。详见 三级命名空间
查询历史、查询收藏 :分别对应「过去运行过什么」「想再次复用什么」两类工作流;支持按文件 ACL 过滤个人可见范围。
完整术语请参考 术语表

适用场景

场景
适用方式
临时业务问数
写一段 SQL,看一次结果,不需要保存
重复性日常查询
收藏常用 SQL,每次打开秒级加载
趋势 / 占比分析
在结果区直接生成图表,无需进入仪表盘
离线汇报 / 数据交付
将结果下载为 CSV / Excel
跨源联邦查询
通过 External Catalog 接入外部数据源
分析结果固化为报表
将探索成果沉淀到仪表盘,形成可分享视图
探索成果转生产任务
将 SQL 文件直接绑定为 Workflow SQL 任务

相关文档

SQL IDE 基础操作
仪表盘概述