帮你快速理解、总结文档立即下载

支持的接入方案

最近更新时间:2026-09-11 20:57:30
本文档已由 AI 辅助审校
我的收藏

概述

DataBuddy 数据接入提供从外部系统将数据导入数据湖仓的统一入口,覆盖离线同步实时同步文件上传 三类场景,支持单表、批量单表、整库多表、分库分表等多种粒度。无论数据源类型与同步频率如何,统一遵循「连接数据源 → 选择来源对象 → 配置目标 → 设置运行策略 → 发布运行」的主体流程。

接入方案总览

DataBuddy 提供以下 5 类接入方案,您可以根据数据源类型、数据规模与时效性要求选择合适的方案:
接入方案
典型场景
入口
配套文档
离线数据同步
周期性批量同步关系型数据库、大数据存储、消息队列等数据到数据湖仓
数据接入 → 任务管理 → 创建同步任务 → 离线单表同步 / 离线批量同步
实时数据同步
实时同步关系型数据库 CDC、消息队列数据,支持 DDL 变更同步
数据接入 → 任务管理 → 创建同步任务 → 实时整库多表同步 / 实时分库分表同步
文件上传到表
将本地或 COS 文件解析后落入结构化表
数据接入 → 文件上传 → 文件到表 / COS 文件到表
文件上传到卷
将文件以原始格式上传到 Volume,保留原文件结构
数据接入 → 文件上传 → 文件到卷
文件批量同步到卷
在离线同步任务中,将结构化数据按指定格式写入 Volume;或将非结构化文件批量同步到 Volume
数据接入 → 任务管理 → 创建同步任务(目标端选择 Volume 类型 Catalog)

通用接入流程

无论选择哪种接入方案,您都需要完成以下步骤:
1. 准备数据源连接(数据源配置)
2. 准备计算资源(实时接入用实时集群,离线接入用平台集群)
3. 创建同步任务并选择同步方式
4. 配置来源(选库 / 选表 / 选文件路径,必要时配置筛选条件、过滤规则)
5. 配置目标(Catalog / Schema / Table / Volume,必要时配置自动建表或手动建表)
6. 配置字段映射与运行参数(脏数据阈值、并发数、限速、checkpoint 间隔等)
7. 配置告警与运行策略
8. 保存 / 发布 / 启动任务

离线同步与实时同步对比

维度
离线同步
实时同步
同步粒度
单表、批量单表
整库多表、分库分表
触发方式
由工作流调度或手动调试运行
启动后持续运行,捕获源端 CDC 变更
来源端读取模式
全量读取、增量读取(按筛选条件)
全量 + 增量、仅增量
写入模式
overwrite / append / upsert
append/upsert
自动建表
支持手动建表
支持自动建表(Kafka 等部分来源端除外)
Schema 变更同步
不涉及(按任务执行时刻的 Schema)
支持 DDL 变更同步(MySQL / 腾讯云 MySQL / TDSQL-C MySQL 完整支持)
数据对账
支持全量、增量数据对账,按条数对账
支持全量、增量数据对账,按条数 / 内容对账
适用场景
定时数仓刷新、ODS 层加载、报表数据准备
数据库实时入湖、CDC 流式分析

文件接入能力

文件接入为非结构化或半结构化数据进入湖仓提供入口,覆盖以下 3 类用法:
入口
说明
适用文件类型
文件到表
上传文件后自动解析为结构化表,落入指定 Catalog 下的 Schema
.csv / .tsv / .json / .jsonl / .avro / .parquet / .txt / .xml
文件到卷
文件以原格式落入 Volume,保留二进制 / 原始结构
任意类型
COS 文件到表
从腾讯云对象存储 COS 选择文件,解析为结构化表
.csv / .json / .xml / .avro / .parquet / .txt
文件上传支持文件级解析参数(行、列分隔符、表头、转义符、JSON 嵌套、XML 行标签等),上传后表会被自动注册到 Catalog 中。

接入方式选型建议

您的需求
推荐方案
业务库每日定时同步到数据湖仓
离线单表同步 + Workflow 调度
多张同源表批量同步到湖仓
离线批量同步任务
业务库 CDC 实时入湖
实时整库多表同步任务
多个分库分表合并到一张目标表
实时分库分表同步任务
一次性导入历史 CSV / Parquet 文件做分析
文件到表
文件原样归档到湖仓
文件到卷

前提条件

在使用任何接入方案前,请确保已经完成以下准备:
已开通 DataBuddy 服务并完成空间初始化。
当前账号在目标 Workspace 中拥有 数据接入相关权限 (详见 成员与权限管理)。
已创建用于数据接入的计算资源(详见 创建计算资源)。
已根据来源端类型创建并测试通过对应的数据源连接(详见 添加数据源连接)。
目标端已规划好 Catalog 与 Schema(详见 统一元数据管理架构)。

使用限制

限制项
说明
计算资源
实时接入任务仅支持选择 实时集群 计算资源;离线接入任务仅支持选择 平台集群 计算资源
来源端类型
完整数据源支持范围参见 支持的数据源与读写能力
目标端类型
当前结构化任务的目标端固定为 catalog 数据表(基于 Iceberg 原生表);非结构化数据写入支持 catalog Volume 卷
文件上传容量
文件到表:单次最多 10 个文件,总容量 ≤ 2 GB;文件到卷:单次最多 100 个文件,单文件 ≤ 5 GB

相关文档