DataBuddy 数据科学模块支持通过 UI 或 SDK 创建机器学习实验。
前提条件
在创建实验前,请确保满足以下条件:
已开通 DataBuddy 服务并完成空间初始化。
当前账号在目标 Workspace 中拥有创建 Notebook 与实验的权限。
计划使用 AutoML 实验时:可用的训练数据已通过 Catalog 进行管理,且您拥有读取该表的权限。
计划使用深度学习的自定义实验时:已在 计算资源概述 中准备好带 GPU 的计算集群。
创建自定义模型训练实验
1.通过 UI 创建
1. 登录 DataBuddy 控制台,在左侧导航栏选择 数据科学 > 模型实验 。
2. 点击自定义模型 ,在弹出的创建窗口中填写:
名称 :必填,自定义实验名称。
描述 (可选):实验用途说明。
1. 点击仅创建实验 。系统会创建实验,实时显示在实验列表中。用户可通过点击实验名称进入实验详情页,点击 前往 Notebook 创建任务 创建 Notebook 任务。点击创建实验并进入 Notebook ,自动创建实验,跳转到 Notebook,创建 Notebook 后将示例代码复制进单元格按需修改后运行。示例如下:
import mlflowfrom sklearn.datasets import load_diabetesfrom sklearn.model_selection import train_test_splitfrom sklearn.ensemble import RandomForestRegressor# 设置实验 IDmlflow.set_experiment(experiment_id="3")# 自动记录实验过程(如参数、模型、指标等)mlflow.autolog()# 加载数据集db = load_diabetes()X_train, X_test, y_train, y_test = train_test_split(db.data, db.target)# 创建并训练模型rf = RandomForestRegressor(n_estimators=100, max_depth=6, max_features=3)rf.fit(X_train, y_train)predictions = rf.predict(X_test)
2.通过 Notebook 创建
在开发工作台 点击创建, 可直接创建 Notebook,在中直接调用 MLflow API:
import mlflow# 创建新实验(如果同名实验已存在则报错)experiment_id = mlflow.create_experiment(name="customer_churn_v1")# 或:设置实验。如果同名实验不存在则自动创建mlflow.set_experiment("customer_churn_v1")
实验创建后会自动出现在 数据科学 > 模型实验 列表中。
创建 AutoML 实验
1.创建 AutoML 分类实验
适合业务分析师在不写算法代码的前提下,通过界面配置自动训练分类模型。
提示
AutoML 实验由系统自动调用 Serverless CPU 资源池,无需手动选择计算集群。
1. 登录 DataBuddy 控制台,在左侧导航栏选择 数据科学 > 模型实验 。
2. 单击 分类模型 ,进入创建表单页面。
3. 按照以下区域完成表单填写:
基础配置
实验名称 :输入不超过 50 个字符的实验名称。
实验描述 :可选,输入不超过 100 个字符的用途说明。
资源组 :下拉选择用于训练的资源组。
数据配置
训练数据 :下拉选择 Catalog 中的训练数据表(格式为
Catalog 名 / Schema / 表名)。选定后右侧自动展示数据配置区。Join 特征表 :可选,单击 展开配置 添加特征表并指定主键和时间戳键,用于拼接额外特征列。默认收起。
结果列 :单选训练数据中作为分类标签的列。选定后该列在右侧数据配置区中自动标记为用于结果。
训练列 :多选参与模型训练的特征列。未选中的列不参与训练。
数据配置区(右侧面板) :选定训练数据后,右侧自动展示数据表的字段列表,您可以在此查看和调整各列配置:
列 | 说明 |
用于结果 | 标记为分类标签的列(单选,与左侧结果列联动) |
用于训练 | 勾选参与训练的特征列(多选,与左侧训练列联动) |
列名 | 字段名称 |
来源表 | 字段所属的数据表,点击后可跳转至 Catalog 中对应表详情界面 |
数据类型 | 字段类型如 integer、decimal、string 等 |
缺失值 | 下拉选择该列的缺失值补全方式 |
训练配置
评估指标 :下拉选择模型评估指标,默认自动选择。
搜索空间 :多选需要自动测试的模型框架(默认全选,可选 sklearn / xgboost / lightgbm)。
最大运行时间 :设置单次实验的最长执行时长,单位为分钟,超时将停止实验。
最大运行次数 :设置实验最多生成的运行任务数量。
最大运行并发 :设置同时运行的运行任务数量上限。
提示
最大运行并发为上限值,实际并发数还受限于资源组可用资源。
1. 单击确定 ,系统自动启动 AutoML 训练并跳转到实验详情页。
2.创建 AutoML 回归实验
操作流程与分类实验一致,单击 回归模型 进入创建表单,区别如下:
数据配置中 结果列 改为选择回归预测的目标列(数值类型)。
训练配置中 评估指标 可选:Deviance / RMSE / MAE /R2 / MSE。
其余配置项与分类实验完全一致。
3.创建 AutoML 时序预测实验
操作流程与分类实验一致,单击 时序预测模型 进入创建表单,区别如下:
数据配置
除训练数据外,还需配置以下时序特有字段:
选择时间列 :单选训练数据中的时间维度列,必须为 datetime 或 timestamp 类型。
预测范围 :点击下拉选择时间序列单位(可选秒、分钟、小时、天、周、月、年)。
预测结果保存 :选择 Catalog 中保存预测结果的路径,并输入表名。
数据配置区与分类实验一致,缺失值补全额外支持按时序补全。
训练配置
评估指标 :可选 SMAPE / MSE / RMSE / MAE / MDAPE。
搜索空间 :可选 Prophet / ARIMA / Deep-AR。
其余训练配置项与分类实验一致。
4.AutoML 实验自动生成的 Notebook
AutoML 实验启动后,系统会在 Workspace 用户根目录的
/automl/<实验名>/ 下自动生成以下结构:路径 | 内容 |
<实验名> | 实验对象本体 |
<实验名>+preprocessing | 数据清洗、特征工程、缺失值处理、类别编码 |
<实验名>+training | 模型训练主流程、参数设置、训练过程、结果展示 |
<实验名>+tuning | 超参数搜索与优化过程 |
trials/ | 每次试验的独立 Notebook,命名为时间戳+模型类型+随机编码 |
failed-notebooks/ | 运行失败的 Notebook,记录失败参数、代码片段、错误日志 |
您可以在实验详情页点击对应运行名称进入详情界面,再点击 进入对应 Notebook 进行复查或二次开发。
创建 Agent 实验
适合需要构建智能体(Agent)应用的场景,支持基于 OpenAI 框架或 LangGraph 框架快速创建 Agent,内置代码模板、调试工具与一键部署能力,并通过 MLflow 自动追踪 Agent 行为。
1. 登录 DataBuddy 控制台,在左侧导航栏选择 数据科学 > 模型实验 。
2. 在 智能体 页签下,选择框架模板:
代码开发(OpenAI 框架) :基于 OpenAI Agents SDK 开发,支持 Function Calling。
代码开发(LangGraph 框架) :有状态多步 Agent,支持工作流编排。
1. 单击对应模板,进入创建表单页面,按照以下区域填写:
基础信息
智能体名称 :输入英文字母、数字、短横杠组合的名称,最大长度 30 个字符。
智能体描述 :推荐填写,描述该智能体的功能用途,最多 500 个字符。
资源配置
MLflow 实验 :下拉选择一个 MLflow 实验或直接创建新的实验,用于追踪 Agent 的行为记录。
1. 单击 确定 ,系统创建 Agent 并跳转到开发页面。
常见问题
AutoML 实验创建失败,提示资源不足怎么办?
AutoML 实验依赖 Serverless CPU 资源池。如果当前 Workspace 资源池占用过高,请稍后重试或联系工作空间管理员申请扩容。
实验删除后如何恢复?
删除实验会进入 Workspace 回收站,您可在 Workspace 回收站找回。删除的实验对应的 Notebook 会同步进入回收站。
注意
删除运行任务后,运行任务不直接进入回收站。如需找回,请使用
mlflow.restore_runs API 配合实验 ID 与删除时间戳恢复:import mlflowruns_restored = mlflow.restore_runs(experiment_id="<实验 ID>",min_timestamp_millis=<删除时间戳>,max_runs=10,)