概述
DataBuddy 数据接入提供从外部系统将数据导入数据湖仓的统一入口,覆盖离线同步 、实时同步 、文件上传 三类场景,支持单表、批量单表、整库多表、分库分表等多种粒度。无论数据源类型与同步频率如何,统一遵循「连接数据源 → 选择来源对象 → 配置目标 → 设置运行策略 → 发布运行」的主体流程。
接入方案总览
DataBuddy 提供以下 5 类接入方案,您可以根据数据源类型、数据规模与时效性要求选择合适的方案:
接入方案 | 典型场景 | 入口 | 配套文档 |
离线数据同步 | 周期性批量同步关系型数据库、大数据存储、消息队列等数据到数据湖仓 | 数据接入 → 任务管理 → 创建同步任务 → 离线单表同步 / 离线批量同步 | |
实时数据同步 | 实时同步关系型数据库 CDC、消息队列数据,支持 DDL 变更同步 | 数据接入 → 任务管理 → 创建同步任务 → 实时整库多表同步 / 实时分库分表同步 | |
文件上传到表 | 将本地或 COS 文件解析后落入结构化表 | 数据接入 → 文件上传 → 文件到表 / COS 文件到表 | |
文件上传到卷 | 将文件以原始格式上传到 Volume,保留原文件结构 | 数据接入 → 文件上传 → 文件到卷 | |
文件批量同步到卷 | 在离线同步任务中,将结构化数据按指定格式写入 Volume;或将非结构化文件批量同步到 Volume | 数据接入 → 任务管理 → 创建同步任务(目标端选择 Volume 类型 Catalog) |
通用接入流程
无论选择哪种接入方案,您都需要完成以下步骤:
1. 准备数据源连接(数据源配置)↓2. 准备计算资源(实时接入用实时集群,离线接入用平台集群)↓3. 创建同步任务并选择同步方式↓4. 配置来源(选库 / 选表 / 选文件路径,必要时配置筛选条件、过滤规则)↓5. 配置目标(Catalog / Schema / Table / Volume,必要时配置自动建表或手动建表)↓6. 配置字段映射与运行参数(脏数据阈值、并发数、限速、checkpoint 间隔等)↓7. 配置告警与运行策略↓8. 保存 / 发布 / 启动任务
离线同步与实时同步对比
维度 | 离线同步 | 实时同步 |
同步粒度 | 单表、批量单表 | 整库多表、分库分表 |
触发方式 | 由工作流调度或手动调试运行 | 启动后持续运行,捕获源端 CDC 变更 |
来源端读取模式 | 全量读取、增量读取(按筛选条件) | 全量 + 增量、仅增量 |
写入模式 | overwrite / append / upsert | append/upsert |
自动建表 | 支持手动建表 | 支持自动建表(Kafka 等部分来源端除外) |
Schema 变更同步 | 不涉及(按任务执行时刻的 Schema) | 支持 DDL 变更同步(MySQL / 腾讯云 MySQL / TDSQL-C MySQL 完整支持) |
数据对账 | 支持全量、增量数据对账,按条数对账 | 支持全量、增量数据对账,按条数 / 内容对账 |
适用场景 | 定时数仓刷新、ODS 层加载、报表数据准备 | 数据库实时入湖、CDC 流式分析 |
文件接入能力
文件接入为非结构化或半结构化数据进入湖仓提供入口,覆盖以下 3 类用法:
入口 | 说明 | 适用文件类型 |
文件到表 | 上传文件后自动解析为结构化表,落入指定 Catalog 下的 Schema | .csv / .tsv / .json / .jsonl / .avro / .parquet / .txt / .xml |
文件到卷 | 文件以原格式落入 Volume,保留二进制 / 原始结构 | 任意类型 |
COS 文件到表 | 从腾讯云对象存储 COS 选择文件,解析为结构化表 | .csv / .json / .xml / .avro / .parquet / .txt |
文件上传支持文件级解析参数(行、列分隔符、表头、转义符、JSON 嵌套、XML 行标签等),上传后表会被自动注册到 Catalog 中。
接入方式选型建议
您的需求 | 推荐方案 |
业务库每日定时同步到数据湖仓 | 离线单表同步 + Workflow 调度 |
多张同源表批量同步到湖仓 | 离线批量同步任务 |
业务库 CDC 实时入湖 | 实时整库多表同步任务 |
多个分库分表合并到一张目标表 | 实时分库分表同步任务 |
一次性导入历史 CSV / Parquet 文件做分析 | 文件到表 |
文件原样归档到湖仓 | 文件到卷 |
前提条件
在使用任何接入方案前,请确保已经完成以下准备:
已开通 DataBuddy 服务并完成空间初始化。
当前账号在目标 Workspace 中拥有 数据接入相关权限 (详见 成员与权限管理)。
已创建用于数据接入的计算资源(详见 创建计算资源)。
已根据来源端类型创建并测试通过对应的数据源连接(详见 添加数据源连接)。
目标端已规划好 Catalog 与 Schema(详见 统一元数据管理架构)。
使用限制
限制项 | 说明 |
计算资源 | 实时接入任务仅支持选择 实时集群 计算资源;离线接入任务仅支持选择 平台集群 计算资源 |
来源端类型 | 完整数据源支持范围参见 支持的数据源与读写能力 |
目标端类型 | 当前结构化任务的目标端固定为 catalog 数据表(基于 Iceberg 原生表);非结构化数据写入支持 catalog Volume 卷 |
文件上传容量 | 文件到表:单次最多 10 个文件,总容量 ≤ 2 GB;文件到卷:单次最多 100 个文件,单文件 ≤ 5 GB |