数据科学是 DataBuddy 面向数据科学家、机器学习工程师提供的端到端机器学习开发的模块,覆盖从实验追踪、特征工程、模型注册到模型服务部署的完整流程。该模块基于开源 MLflow 平台构建,将机器学习工件与 DataBuddy Catalog 统一治理体系打通,实现机器学习资产与数据资产的同源管理。
提示
模块定位
数据科学模块基于 MLOps 理念构建,为机器学习模型的全生命周期提供标准化、自动化、可持续改进的过程管理,帮助企业稳定、规模化、高质效地持续生产模型为业务赋能。其核心理念为:
以业务目标为牵引推进 AI 项目研发;
以数据为中心实现 AI 研发;
以模块化平台驱动全生命周期:数据探索、特征工程、模型训练、在线服务;
以自动化流程实现持续训练、持续集成与持续交付。
功能概述
DataBuddy 数据科学模块建设了实验管理、特征管理、模型管理和模型服务四个核心功能模块,承接开发工作台、工作流、数据质量、计算资源等周边产品,实现实验追踪、特征复用、模型版本管理 、在线推理服务的全生命周期的端到端能力,搭建 MLOps 闭环。
开发流程通常从在开发工作台 中加载并清洗数据开始,将带主键和时间戳的数据登记为特征表以便复用;随后创建实验,通过自定义训练或 AutoML 记录参数、指标与模型工件,并对比多次运行选出最佳模型;将所需模型注册到 Catalog 后统一进行管理,最终部署为在线推理服务对外提供能力。
核心模块
模块 | 核心功能 | 详细文档 |
模型实验 | 模型实验面板跟踪训练的参数、指标、工件;支持自定义模型实验、智能体实验及 AutoML 实验(分类 / 回归 / 时序预测)等无代码开发三种类型的实验 | |
特征管理 | 在 开发工作台 中对于每一个特征表可使用特征工程 SDK 完成创建、写入、读取、查找、同步、消费等操作,并在特征管理页面中进行查看、管理特征,实现特征统一管理、统一消费 | |
模型管理 | 可以在实验中通过调用 MLflow 的相关函数来注册模型,或者在实验管理中执行可视化的模型注册。在管理界面中支持查看已注册模型的关键信息,以及与实验/运行、服务等关联关系。 | |
模型服务 | 将注册模型部署为在线推理 API,支持版本切换、流量分发与资源监控等功能 |
周边模块
模块 | 与数据科学的协作关系 |
开发工作台 | 提供开发环境,用户可在 开发工作台 中编辑、调试、运行代码,并且调用 MLflow 和特征工程 API,实现特征表增删改查、模型训练、模型注册等操作。 |
Catalog | 模型、特征表的统一存储与治理底座,提供权限、标签、血缘 |
工作流 | 提供自动化流程的工作区,在 开发工作台 中调试好代码后,可提交至工作流设置周期性调度,实现模型的自动化、周期性生产。 |
数据质量 | 模型服务推理表、特征表、训练数据表都可以通过发起数据质量任务,查看相应的字段分析、漂移分析、模型指标等质量信息。 |
必要说明及前置条件
类型 | 说明 |
开发工作台 | 必须开通 开发工作台 才可使用数据科学相关功能。开发工作台 是 AI 开发的主要工作区,用户在其中编辑、调试、运行代码,并调用 MLflow 和特征工程 API,完成特征表增删改查、模型训练、模型注册等操作。 |
计算资源支持 | DataBuddy 开发工作台 的计算资源可用于模型训练、实验上报、特征管理、模型注册;AutoML 实验需在创建计算资源时勾选机器学习 镜像(非默认基础镜像)。 |
MLflow 版本 | 实验管理兼容 MLflow >= 3.0.0(< 4.0.0),相关 SDK 在 Kernel 启动时由预执行脚本自动安装(非预装在镜像中)。连接 开发工作台 运行环境后可执行以下命令检查: %pip list | grep mlflow 官方文档:MLflow 文档 |
离线特征存储 | 离线特征表仅支持 Catalog 中的表;具有主键和时间戳的表会被自动识别为特征表。注册特征表时必须指定主键及时间戳键,后续以该主键和时间戳键进行特征索引。 |
在线特征存储 | DataBuddy 当前仅支持 PostgreSQL 作为在线特征存储,准备步骤如下: 前往云数据库创建 PostgreSQL 实例,地域、网络需与调度资源组、所使用的引擎保持一致。 在 DataBuddy 的 **平台管理 > 数据源管理 ** 添加 PostgreSQL 数据源,测试可连通调度资源组。 在 开发工作台 中连接远程内核后,验证 PostgreSQL 是否连通: import psycopg2PG_HOST = "myhost" # 示例:"10.0.0.51"PG_PORT = "myport" # 示例:"5432"PG_DB = "mydb"PG_USER = "myuser"PG_PWD = "mypwd" # 如果没有密码可注释掉此行及下方 password 参数try: conn = psycopg2.connect( host=PG_HOST, port=PG_PORT, dbname=PG_DB, user=PG_USER, password=PG_PWD, connect_timeout=3, ) conn.close() print("PostgreSQL 可连接")except Exception as e: print("PostgreSQL 连接失败:", e) |
表操作权限 | 需在 **计算资源 > 对应资源 > 更多 > 权限 ** 授权,并在 DataBuddy 目录 > 对应 Catalog / Schema / 表 > 权限 授权。 |
模型操作权限 | 需在 DataBuddy 目录 > 对应模型 Catalog > 权限 对用户授权。 |
特征工程包 | 连接引擎后执行以下命令安装特征工程包(要求 0.2.3 及以上): %pip install "wedata3-feature-engineering[mlflow3]>=0.2.3" 可执行以下命令检查版本: %pip list | grep wedata3-feature-engineering |
环境变量设置 | DataBuddy 中 MLflow / Feast 服务地址、临时凭证等由 Kernel 启动时的预执行脚本自动注入,用户无需手动设置。 |