Notebook 文件运行依赖 远程内核(Remote Kernel) :每个 Notebook 文件对应一个 Kernel,Kernel 在 Serverless 计算资源上启动。本节介绍 Kernel 的连接、新建、切换、释放,以及环境管理与运行结果处理。
概述
DataBuddy 中 Notebook 的运行模型如下:
一个 Notebook 文件对应一个 内核 (Kernel)。
Kernel 运行在工作空间的 作业集群类型计算资源 上,按量计费、动态扩缩容。
每个 Kernel 拥有独立的运行环境(Python 解释器、已安装依赖库 + Spark 配置)。
同一个 Notebook 文件新建 Kernel 会自动释放之前的 Kernel,原会话中的变量与缓存被清空。
运行结果以单元格为单位展示在单元格下方,支持表格化交互(排序、筛选、下载)。
前提条件
当前工作空间已绑定可用的 作业集群类型计算资源 。详见 计算资源概述。
您具备当前 Notebook 的「运行」「编辑」或「管理」权限。
如需访问 Catalog 中的库表,您需具备相应的数据访问权限。
操作步骤
步骤 1:连接 Kernel
1. 打开 Notebook 文件。
2. 在编辑器右上角单击 未连接 ,选择一个计算资源,采用默认环境配置进行连接。
3. 如需修改环境配置参数,点击 修改配置 ,在「环境」抽屉中填写参数(详见下方 新建 Kernel 参数)后进行连接。
4. 点击连接 后,会显示当前的 Kernel 连接进度。
5. 连接成功后,右上角状态为「计算资源名称(已连接)」。
步骤 2:运行单元格、全部运行
1. 单元格运行:单击单元格左侧的运行 ,或使用快捷键
⌘ + Enter。2. 全部运行:单击操作栏的 全部运行 ,按顺序执行所有单元格。
3. 部分运行:选中代码片段后使用
Ctrl + Shift + Enter 仅运行选中部分。4. 运行上方、下方所有单元格:使用
⌥ + Shift + ↑ / ⌥ + Shift + ↓。5. 停止运行:单击操作栏停止 ,立即终止当前正在运行的单元格。
步骤 3:处理运行结果
3.1 表格结果交互
调用
display(df) 或运行 pandas.DataFrame / pyspark.sql.DataFrame 时,下方以表格展示数据,支持:操作 | 说明 |
复制 | 选中单元格区域后右键复制,或使用 ⌘ + A / ⌘ + C 全选复制。 |
下载 | 单击右上角 下载 ,支持 CSV / Excel / TXT 三种格式。 |
排序 | 单击列名按升序 / 降序排序。 |
字段配置 | 选择显示 / 隐藏列、冻结列、调整列顺序。 |
数据检索 | 在结果区查找指定文本,高亮命中并支持上下条切换。 |
结果筛选 | 添加筛选条件(多个条件用 AND / OR 连接)。 |
3.2 隐藏与查看运行信息
单元格运行结束后,hover 输出区域可查看 运行人、运行时间、运行耗时 。
单击单元格折叠按钮,可隐藏运行结果。
步骤 4:管理环境
在 Notebook 文件左侧单击 环境管理 抽屉,可查看与调整运行环境:
区域 | 说明 |
资源模式 | 支持选择分布式 或单节点 。 如果选择分布式模式,则会分别启动一个 Driver 和多个 Executor 节点,适用于大数据的分布式处理。 如果选择单节点模式,则仅启动一个 Driver 作为单节点计算资源,适用于运行纯 Python 代码。注意:如果选择单节点模式,但代码中使用了 SQL 或者 Spark,则会自动转成分布式模式,分别启动一个所配规格的 Driver 和 Executor 节点。 |
基础环境 | 支持选择默认 或自定义 。 如果选择默认,则对应资源组内置镜像。 如果选择自定义,则支持选择一个声明依赖库列表的.yml/.yaml 文件,启动 Kernel 时会在内置镜像的基础上自动安装文件中的依赖库。 |
高级参数 | 支持自定义运行环境的规格参数(如 Spark Executor CU 数 (spark.executor.memory)、Spark Executor 个数 (spark.executor.number)等)。 |
依赖库 | 连接计算资源后,可以查看当前环境中所安装的依赖库列表,包括默认安装和自定义安装两种类型。 |
应用 | 修改后单击 应用 ,按新配置重建内核。会清空通过代码安装的依赖与定义的变量。 |
重置环境 | 单击 更多 > 重置环境 ,将运行环境恢复到基础环境状态,清空所有 pip install 的依赖与变量。 |
重置环境 | 单击 更多 > 导出环境 ,支持将当前运行环境导出为.yaml 文件并保存到 Studio 开发目录中,便于在不同文件复用环境配置。 |
注意
单击 应用 或 重置环境 后,会重建内核;通过
pip install 安装的依赖、dlcutils.widgets.text(...) 之外的变量都会被清空。通过 pip install 添加依赖
%pip install pandas==2.2.0 jieba
依赖安装后立即在当前会话生效;新建会话或重置环境后会被清空,需要重新安装。
步骤 5:重启或释放内核
重启内核 :单击文件上方 重启内核 ,仅重启 Kernel, 不会创建已创建的 Spark APP。
断开连接 :单击右上角资源组名称 → 断开连接 ,弹窗确认后释放当前 Spark APP,状态回到「未连接」。
自动释放机制 :Kernel 在不活跃时间达到设定值(默认 10 分钟)后会自动释放,再次进入文件时需要重新连接。Spark APP 在不活跃时间达到设定值(默认 2 小时)后会自动释放,如果 Kernel 释放后,Spark APP 尚未释放,则下次连接时会直接连上已存在的 Spark APP。
使用限制
Kernel 仅支持连接 作业集群-Spark 类型 的计算资源 ,其他类型暂不支持。
通过代码
%pip install 安装的依赖在新建内核或重置环境后丢失;如需持久化,请使用自定义基础环境功能。运行结果仅支持展示前 1w 行,大小不超过 2M;结果集下载同样遵循此限制。
常见问题
Q2:运行卡住了怎么强制停止?
单击操作栏 停止 终止当前单元格。如仍未释放,可在右上角资源组下拉中 断开连接 ,再重新创建内核。
Q3:内存不足(OOM)怎么办?
单击 环境管理 > 高级参数 ,调高
spark.executor.memory / spark.driver.memory。