帮你快速理解、总结文档立即下载
文档中心>大数据智能体工作台 DataBuddy>数据工程>Studio 概述>Notebook开发>Notebook 运行(内核配置、环境管理、运行结果处理)

Notebook 运行(内核配置、环境管理、运行结果处理)

最近更新时间:2026-09-11 20:57:30
我的收藏
Notebook 文件运行依赖 远程内核(Remote Kernel) :每个 Notebook 文件对应一个 Kernel,Kernel 在 Serverless 计算资源上启动。本节介绍 Kernel 的连接、新建、切换、释放,以及环境管理与运行结果处理。

概述

DataBuddy 中 Notebook 的运行模型如下:
一个 Notebook 文件对应一个 内核 (Kernel)。
Kernel 运行在工作空间的 作业集群类型计算资源 上,按量计费、动态扩缩容。
每个 Kernel 拥有独立的运行环境(Python 解释器、已安装依赖库 + Spark 配置)。
同一个 Notebook 文件新建 Kernel 会自动释放之前的 Kernel,原会话中的变量与缓存被清空。
运行结果以单元格为单位展示在单元格下方,支持表格化交互(排序、筛选、下载)。

前提条件

当前工作空间已绑定可用的 作业集群类型计算资源 。详见 计算资源概述
您具备当前 Notebook 的「运行」「编辑」或「管理」权限。
如需访问 Catalog 中的库表,您需具备相应的数据访问权限。

操作步骤

步骤 1:连接 Kernel

1. 打开 Notebook 文件。
2. 在编辑器右上角单击 未连接 ,选择一个计算资源,采用默认环境配置进行连接。
3. 如需修改环境配置参数,点击 修改配置 ,在「环境」抽屉中填写参数(详见下方 新建 Kernel 参数)后进行连接。
4. 点击连接 后,会显示当前的 Kernel 连接进度。
5. 连接成功后,右上角状态为「计算资源名称(已连接)」。

步骤 2:运行单元格、全部运行

1. 单元格运行:单击单元格左侧的运行 ,或使用快捷键 ⌘ + Enter
2. 全部运行:单击操作栏的 全部运行 ,按顺序执行所有单元格。
3. 部分运行:选中代码片段后使用 Ctrl + Shift + Enter 仅运行选中部分。
4. 运行上方、下方所有单元格:使用 ⌥ + Shift + ↑ / ⌥ + Shift + ↓
5. 停止运行:单击操作栏停止 ,立即终止当前正在运行的单元格。

步骤 3:处理运行结果

3.1 表格结果交互

调用 display(df) 或运行 pandas.DataFrame / pyspark.sql.DataFrame 时,下方以表格展示数据,支持:
操作
说明
复制
选中单元格区域后右键复制,或使用 ⌘ + A / ⌘ + C 全选复制。
下载
单击右上角 下载 ,支持 CSV / Excel / TXT 三种格式。
排序
单击列名按升序 / 降序排序。
字段配置
选择显示 / 隐藏列、冻结列、调整列顺序。
数据检索
在结果区查找指定文本,高亮命中并支持上下条切换。
结果筛选
添加筛选条件(多个条件用 AND / OR 连接)。

3.2 隐藏与查看运行信息

单元格运行结束后,hover 输出区域可查看 运行人、运行时间、运行耗时
单击单元格折叠按钮,可隐藏运行结果。

步骤 4:管理环境

在 Notebook 文件左侧单击 环境管理 抽屉,可查看与调整运行环境:
区域
说明
资源模式
支持选择分布式单节点
如果选择分布式模式,则会分别启动一个 Driver 和多个 Executor 节点,适用于大数据的分布式处理。
如果选择单节点模式,则仅启动一个 Driver 作为单节点计算资源,适用于运行纯 Python 代码。注意:如果选择单节点模式,但代码中使用了 SQL 或者 Spark,则会自动转成分布式模式,分别启动一个所配规格的 Driver 和 Executor 节点。
基础环境
支持选择默认自定义
如果选择默认,则对应资源组内置镜像。
如果选择自定义,则支持选择一个声明依赖库列表的.yml/.yaml 文件,启动 Kernel 时会在内置镜像的基础上自动安装文件中的依赖库。
高级参数
支持自定义运行环境的规格参数(如 Spark Executor CU 数 (spark.executor.memory)、Spark Executor 个数 (spark.executor.number)等)。
依赖库
连接计算资源后,可以查看当前环境中所安装的依赖库列表,包括默认安装和自定义安装两种类型。
应用
修改后单击 应用 ,按新配置重建内核。会清空通过代码安装的依赖与定义的变量。
重置环境
单击 更多 > 重置环境 ,将运行环境恢复到基础环境状态,清空所有 pip install 的依赖与变量。
重置环境
单击 更多 > 导出环境 ,支持将当前运行环境导出为.yaml 文件并保存到 Studio 开发目录中,便于在不同文件复用环境配置。
注意
单击 应用重置环境 后,会重建内核;通过 pip install 安装的依赖、dlcutils.widgets.text(...) 之外的变量都会被清空。

通过 pip install 添加依赖

%pip install pandas==2.2.0 jieba
依赖安装后立即在当前会话生效;新建会话或重置环境后会被清空,需要重新安装。

步骤 5:重启或释放内核

重启内核 :单击文件上方 重启内核 ,仅重启 Kernel, 不会创建已创建的 Spark APP。
断开连接 :单击右上角资源组名称 → 断开连接 ,弹窗确认后释放当前 Spark APP,状态回到「未连接」。
自动释放机制 :Kernel 在不活跃时间达到设定值(默认 10 分钟)后会自动释放,再次进入文件时需要重新连接。Spark APP 在不活跃时间达到设定值(默认 2 小时)后会自动释放,如果 Kernel 释放后,Spark APP 尚未释放,则下次连接时会直接连上已存在的 Spark APP。

使用限制

Kernel 仅支持连接 作业集群-Spark 类型 的计算资源 ,其他类型暂不支持。
通过代码 %pip install 安装的依赖在新建内核或重置环境后丢失;如需持久化,请使用自定义基础环境功能。
运行结果仅支持展示前 1w 行,大小不超过 2M;结果集下载同样遵循此限制。

常见问题

Q1:运行时报「未连接 Kernel」怎么办? 单击右上角 未连接 > 选择计算资源 创建 Kernel 即可。如果当前没有可用的计算资源,请联系工作空间管理员在 创建计算资源 创建。
Q2:运行卡住了怎么强制停止? 单击操作栏 停止 终止当前单元格。如仍未释放,可在右上角资源组下拉中 断开连接 ,再重新创建内核。
Q3:内存不足(OOM)怎么办? 单击 环境管理 > 高级参数 ,调高 spark.executor.memory / spark.driver.memory

相关文档