帮你快速理解、总结文档立即下载

数据分析师快速上手

最近更新时间:2026-09-11 20:57:30
我的收藏
提示
预计用时 60 分钟。学习目标:以销售业绩分析场景为例,端到端跑通 建表灌数 → 即席 SQL 分析 → 结果可视化 → 沉淀仪表盘 → 发布订阅 的完整数据分析链路。

场景介绍

您是一名刚入职的数据分析师,业务团队希望快速看到「分地区、分产品的销售情况」,并能每天打开一个固定看板查看最新数据。
本教程将带您:
1. SQL 分析 创建样例销售表,并写入若干天的演示数据。
2. 完成首批即席查询:基础探查、按地区聚合、按时间趋势、窗口排名、参数化复用。
3. 把查询结果一键转成图表,导出为 Excel 用于汇报。
4. 把查询沉淀到 仪表盘 ,组合 KPI 卡、柱图、折线图、表格四种组件。
5. 加入全局筛选器,发布仪表盘。
完成本教程后,您将掌握数据分析师在 DataBuddy 中日常最高频的全套操作。

前提条件

在开始本教程前,请确保满足以下条件:
已开通 DataBuddy 服务并完成空间初始化。
当前账号在目标工作空间中拥有 空间成员 角色或更高权限(角色权限说明详见 成员与权限管理 )。
工作空间已绑定 交互式分析集群资源 (用于即席 SQL 查询与仪表盘查询,详见 计算资源概述 )。
工作空间已绑定数据湖仓 Catalog(默认 DataLakeCatalog),且当前账号具备 Catalog 的 建库、建表、读写 权限。
默认邮箱已绑定到当前账号(订阅推送验证环节会用到)。
提示
本教程不依赖任何外部数据源,所有样例数据都通过 SQL INSERT 写入数据湖仓。如您的工作空间已有真实业务表,可在 步骤 3 起把表名替换为业务表,跳过 步骤 2

教程数据模型

教程中所有 SQL 都基于一张 sales_data 表:
字段
类型
说明
date
STRING
销售日期(YYYY-MM-DD
product
STRING
产品名称
region
STRING
销售大区:North / South / East / West
quantity
INT
销售数量
revenue
DOUBLE
销售金额
提示
为避免多人同时跑教程时表名冲突,请把 <your_name> 替换成您自己的姓名前缀,例如 alice_databasealice_sales_data

步骤 1:进入 SQL 分析

SQL 分析是数据分析师进行即席查询、可视化与结果导出的统一入口。
1. 登录 DataBuddy 控制台,选择要进入的工作空间。
2. 在左侧导航选择 数据探索
3. 左上角单击新建 SQL ,文件名例如 quickstart_sales.sql,选择父文件夹后单击 确定 ,进入 SQL 编辑器。
4. 在编辑器右上角:
计算资源 :下拉选择 交互式分析集群
默认 Catalog :选择 DataLakeCatalog(设置后 SQL 中可省略 Catalog 前缀)。

步骤 2:创建数据库和样例表

在编辑器中依次写入并运行以下 SQL(选中片段后按 ⌘ + Enter,Windows 用户用 Ctrl + Enter):
-- 建库(请把 your_name 替换成您自己的姓名前缀)
CREATE DATABASE IF NOT EXISTS DataLakeCatalog.your_name_database;
-- 建表
CREATE TABLE IF NOT EXISTS DataLakeCatalog.your_name_database.sales_data (
date STRING,
product STRING,
region STRING,
quantity INT,
revenue DOUBLE
);
-- 写入 15 行演示数据
INSERT INTO DataLakeCatalog.your_name_database.sales_data VALUES
('2025-01-01', 'Widget A', 'North', 239, 6915.68),
('2025-01-01', 'Widget B', 'South', 185, 12430.50),
('2025-01-01', 'Widget C', 'East', 327, 28025.76),
('2025-01-01', 'Widget D', 'North', 340, 8986.75),
('2025-01-01', 'Widget E', 'East', 421, 25079.72),
('2025-01-02', 'Widget A', 'West', 150, 4350.00),
('2025-01-02', 'Widget B', 'North', 275, 18562.50),
('2025-01-02', 'Widget C', 'South', 310, 26556.00),
('2025-01-02', 'Widget D', 'East', 198, 5237.10),
('2025-01-02', 'Widget E', 'West', 460, 27416.00),
('2025-01-03', 'Widget A', 'East', 305, 8845.00),
('2025-01-03', 'Widget B', 'West', 220, 14850.00),
('2025-01-03', 'Widget C', 'North', 290, 24824.00),
('2025-01-03', 'Widget D', 'South', 175, 4627.50),
('2025-01-03', 'Widget E', 'North', 388, 23124.80);
-- 验证:应返回 15 行
SELECT COUNT(*) AS total_rows FROM DataLakeCatalog.your_name_database.sales_data;
注意
建库与写入操作需要 Catalog 的 CREATEINSERT 权限。若提示权限不足,请联系工作空间管理员或参考 结构化数据_Catalog

步骤 3:进行第一次即席查询

接下来用一组典型分析语句熟悉编辑器、结果区与日志的使用。

3.1 基础探查

DESCRIBE DataLakeCatalog.your_name_database.sales_data;
SELECT * FROM DataLakeCatalog.your_name_database.sales_data LIMIT 10;
运行后,编辑器下方分三个 Tab 展示运行信息:
Tab
内容
结果
查询结果表格,支持排序、显示字段、检索、筛选、复制、下载、可视化。
日志
Spark 执行日志、错误堆栈。
代码
本次运行的查询语句。

3.2 按地区聚合(多语句一次运行)

把以下 SQL 整段粘贴后单击操作栏 全部运行
-- 各地区销售总览(用作仪表盘 KPI 与柱图数据集)
SELECT
region,
SUM(quantity) AS total_quantity,
SUM(revenue) AS total_revenue,
ROUND(AVG(revenue / quantity), 2) AS avg_unit_price
FROM DataLakeCatalog.your_name_database.sales_data
GROUP BY region
ORDER BY total_revenue DESC;
多语句运行时,每条 SQL 都会生成一个独立的结果 Tab,便于切换查看。
提示
SQL 写得不够工整?单击操作栏 格式化 (或快捷键 ⌘ + ⇧ + F)自动统一缩进、换行与关键字大小写。详见 SQL IDE 基础操作 。

3.3 时间趋势

-- 每日销售趋势(用作仪表盘折线图数据集)
SELECT
date,
SUM(revenue) AS daily_revenue,
SUM(quantity) AS daily_quantity
FROM DataLakeCatalog.your_name_database.sales_data
GROUP BY date
ORDER BY date;

3.4 窗口排名

-- 各地区内产品销售排名(用作仪表盘表格组件数据集)
SELECT
region,
product,
SUM(revenue) AS product_revenue,
RANK() OVER (PARTITION BY region ORDER BY SUM(revenue) DESC) AS revenue_rank
FROM DataLakeCatalog.your_name_database.sales_data
GROUP BY region, product
ORDER BY region, revenue_rank;

3.5 参数化复用

把日期写死的 SQL 改成可复用的参数化查询:
-- 参数化:按地区和时间窗口筛选
SELECT
region,
product,
SUM(revenue) AS total_revenue
FROM DataLakeCatalog.your_name_database.sales_data
WHERE region = '${target_region}'
AND date BETWEEN '${start_date}' AND '${end_date}'
GROUP BY region, product
ORDER BY total_revenue DESC;
在 SQL 编辑器的工具栏点击「参数」图标,在弹窗中会自动识别代码中的参数名,输入参数值 target_region=Northstart_date=2025-01-01end_date=2025-01-31 后单击 确定
提示
参数化语法、运行时取值规则、与工作流参数的优先级关系详见 参数配置参数使用

3.6 保存与收藏

单击操作栏 保存 (或 ⌘ + S)生成一个手动版本(最多保留 200 个),方便日后回滚。单击 收藏 把当前查询加入个人收藏夹,下次打开 SQL 分析首页可一键加载。

步骤 4:把查询结果一键转成图表

3.2 与 3.3 的查询适合做可视化呈现,无需切换到仪表盘也能完成。
1. 切换到 3.2 按地区聚合 的结果 Tab。
2. 在结果区单击 创建图表 图标,进入图表面板。
3. 在图表面板顶部选择 柱状图
4. 在右侧配置面板中拖拽字段:
X 轴、类别region
Y 轴、度量total_revenue,聚合方式选择 不聚合 (SQL 已聚合)。
单击右下角的 确定 图标,保存图表后配置随当前 SQL 文件保留,再次打开后自动恢复。
切换到 3.3 时间趋势 的结果 Tab,重复以上操作,选择 折线图 ,X 轴 date,Y 轴 daily_revenue

步骤 5:导出查询结果(可选)

如需把数据交付给离线汇报或外部协作方:
1. 在结果 Tab 顶部单击 下载
2. 下载范围 分为预览数据和全部数据。
3. 选择导出格式:
CSV :UTF-8 编码,跨平台通用性最好。
Excel(.xlsx) :保留列类型与展示格式,便于直接编辑。
TXT :制表符分隔。
1. 单击 下载 ,文件按 <SQL 文件名>_<查询 ID>_<时间>.<ext> 命名后下载到本地。
提示
单次下载行数与文件大小受平台规格限制,数据量不超过 500M。如需全量交付,请改用「写入目标表、离线同步导出」方案。

步骤 6:将查询结果沉淀为仪表盘示例

在开始配置仪表盘前,请确认已完成以下准备工作:
已在 SQL 中成功执行本文档前面的步骤。 当前账号具备仪表盘创建和相关数据表访问权限。 有可用的计算资源。 示例中的字段名称、数据集名称和表名仅用于说明,实际配置时请以当前工作空间中的数据表结构为准。

6.1 新建仪表盘

1. 在左侧导航选择 数据分析 > 仪表盘
2. 在仪表盘列表页右上角单击 创建仪表盘 ,进入编辑态。
3. 单击顶部标题,把仪表盘命名为 销售业绩日报 - <your_name>
4. 在画布顶部 计算资源 下拉中选择合适可用的资源组,等待状态变为可用。

6.2 添加数据集

点击顶部导航栏「数据」, 进入数据配置页面, 在左侧面板中,单击 从 SQL 创建 图标,把 3.2 按地区聚合 的 SQL 粘贴进去(只保留一条 SELECT ),单击 运行 ,确认有结果后点击更多操作,重命名数据集为 ds_region_summary
按同样方法依次创建:
数据集名称
来源 SQL
ds_region_summary
3.2 按地区聚合
ds_daily_trend
3.3 每日销售趋势
ds_product_rank
3.4 窗口排名
ds_detail
SELECT * FROM DataLakeCatalog.your_name_database.sales_data

6.3 添加图表组件

回到画布, 在画布下方常驻工具栏单击 图表 ,依次添加以下 4 个组件,并在每个组件的右侧面板中设置数据集、维度、指标与标题。

组件 1:KPI 卡(总收入)

图表类型 :指标卡。
数据集ds_region_summary
指标total_revenue,计算方式选择 求和
显示名称总收入,样式中类型选择 自定义 - 货币

组件 2:地区收入柱状图

图表类型 :柱状图。
数据集ds_region_summary
X 轴region
Y 轴total_revenue,计算方式 不聚合 (SQL 已聚合)。
标题各地区销售收入

组件 3:每日趋势折线图

图表类型 :折线图。
数据集ds_daily_trend
X 轴date
Y 轴daily_revenue(可同时加入 daily_quantity 作为副 Y 轴)。
标题每日销售趋势

组件 4:产品排名表格

图表类型 :表格。
数据集ds_product_rank
字段regionproductproduct_revenuerevenue_rank
标题各地区产品 TOP 排行

6.4 调整布局

把鼠标移到组件边缘可拖动、调整尺寸。
仪表盘所有改动自动以草稿形式保存 ,无需手动单击保存。

6.5 添加筛选器(让看板支持分地区切换)

1. 在画布下方工具栏单击 页面筛选器
2. 筛选字段 :选择 ds_region_summary.region
3. 筛选 :下拉选择多个值。
4. 默认值: 选择需要展示的地区。保存后,画布顶部出现 地区 选择项。

步骤 7:发布仪表盘

7.1 发布仪表盘

1. 在仪表盘编辑态右上角单击 发布
2. 在发布弹窗中可选择:
共享发布者的数据权限
遵循查看者自有数据权限
1. 单击 发布 ,右上角 toast 提示成功。可单击切换到 发布态 预览查看者视角。

7.2 复制分享链接(可选)

在仪表盘发布态顶部单击 分享 > 复制链接 即可把链接直接发出。访问者已登录工作空间且具备权限即可查看发布态。

验证结果

完成全部步骤后,您应当确认:
1. SQL 文件 quickstart_sales.sql 在 SQL 分析中可见,已保存至少 1 个手动版本。
2. 样例表 DataLakeCatalog.<your_name>_database.sales_data 中有 15 行数据,4 类聚合 SQL 均可成功运行并产出结果。
3. 可视化图表 已随 SQL 文件保存:3.2 按地区聚合 → 柱状图;3.3 每日趋势 → 折线图。
4. 仪表盘 销售业绩日报 - <your_name> 在仪表盘列表可见,状态为 已发布

总结

在本教程中,您完成了:
SQL 分析 中创建数据库与样例表,并通过 5 段典型 SQL 完成基础探查、聚合、趋势、窗口排名与参数化复用。
使用 图表面板 把 SQL 结果一键转换为柱状图与折线图,并随 SQL 文件保留配置。
把多段查询沉淀为 数据集图表组件 ,组合成一张完整的销售日报仪表盘。
配置 筛选器 把单张仪表盘适配多个地区视角。
完成仪表盘的发布
本流程覆盖了数据分析师在 DataBuddy 中日常 80% 以上的高频操作。后续可继续探索:从 Catalog 表、指标模型、本地文件直接构建数据集、跨页面全局筛选器等进阶能力。