概述
实时整库多表任务用于将来源端数据库中的一张或多张表 通过 CDC 链路实时同步到 DataBuddy 数据湖仓。任务一次配置即可覆盖整库范围或多张指定表,支持自动建表、字段变更(DDL)同步与运行中自动加减表。本文介绍任务的完整配置流程。
前提条件
在开始本操作前,请确保满足以下条件:
已开通 DataBuddy 服务并完成空间初始化。
当前账号在目标 Workspace 中拥有数据接入相关权限(详见 成员与权限管理)。
已创建并通过连通性测试的来源端 数据源连接 (详见 添加数据源连接)。
已创建用于实时同步的 实时集群 计算资源(详见 创建计算资源)。
来源端已开启 CDC 能力(如 MySQL Binlog 设置为 ROW、Oracle LogMiner、SQL Server CDC 等),具体要求参见各数据源章节。
目标 Catalog 已规划好;如需自动建表,当前账号需要拥有目标 Catalog 的写入与建表权限。
使用限制
限制项 | 说明 |
来源端类型 | MySQL、腾讯云 MySQL、TDSQL-C MySQL、PostgreSQL、Oracle、SQL Server、Kafka、CKafka、MongoDB、腾讯云 MongoDB |
目标端类型 | DataBuddy 数据湖仓 Catalog 下的 Iceberg 原生表 |
计算资源 | 仅支持 实时集群 计算资源 |
资源占用 | 单任务范围 1 ~ 256 CU,步长 1 CU |
来源表数量上限 | 单任务最多选择 5000 张表 |
自动建表 | Kafka 作为来源端时不支持自动建表,需在目标端预先建表 |
映射匹配预览 | Kafka、MongoDB 不支持映射匹配预览 |
库表自动加减 | 仅 正则匹配 模式支持运行中自动接入新匹配的表;指定表 模式需暂停任务后手动加减 |
操作步骤
实时整库多表任务采用向导式配置,包含 基本信息 → 来源 → 目标 → 数据对账 → 运行设置 五个步骤。
步骤 1:进入任务创建页
1. 登录 DataBuddy 控制台。
2. 从工作空间列表进入目标工作空间。
3. 进入 数据集成 > 接入任务 ,点击 创建任务 。
4. 选择数据源类型后,在接入方式中选择 实时整库多表接入 。
步骤 2:基本信息设置
步骤 3:来源设置
1. 选择数据源连接,可进行连通性测试。失败时点击 重试 ,可查看具体原因。
2. 选择 来源表 :
指定表 :通过库名、表名过滤后勾选具体表。
正则匹配表 :填写库名、表名正则表达式,运行期内匹配的新增表会自动接入。
1. 选择 读取模式 :全量、增量 (默认)或 仅增量 。
2. 在 订阅类型 中至少保留一个:插入、更新、删除。
3. 如需设置分片参数、控制元数据字段写入等高级行为,展开 高级设置 配置。
提示
不同数据源类型支持的配置有差异,具体内容见数据源列表下的各种数据源类型文档,如 Kafka 数据源
步骤 4:目标设置
1. 基本配置 :选择目标 Catalog 与系统字段。
2. 建表配置 :当前仅支持 Iceberg 原生表。Kafka 来源时本节置灰,需手动建表。
3. 映射匹配预览 :检查每张来源表与目标表的映射关系。可点击 编辑 调整字段映射、目标 Schema/Table、同步主键。
注意
修改字段映射后,DDL 变更不再支持新增列、删除列、重命名列、修改列类型 。如果来源表发生此类变更,任务可能报错。仅在确实需要差异化映射时使用。
步骤 5:数据对账(可选)
步骤 6:运行设置
1. 配置 DDL 消息处理策略 :决定收到来源端 DDL 时是否自动同步、忽略或停止任务。(部分数据源无此配置,具体以实际页面为准。)
2. 配置 任务运行策略 :Checkpoint 间隔、写入异常策略、最大重启次数。
3. 配置 告警通知 :选择已有告警渠道并启用监控指标。详细规则参见 告警通知。
4. 如需调整透传参数,展开 高级设置 。
步骤 7:保存或发布
操作 | 行为 | 任务状态 |
仅保存 | 保存配置但不发布 | 未发布 |
保存并发布 | 保存并提交发布 | 待启动 |
参数说明
基本设置
参数 | 说明 | 是否必填 | 默认值 |
接入类型 | 选择来源端类型 | 是 | — |
接入方式 | 实时整库多表接入 / 实时分库分表接入 | 是 | 实时整库多表接入 |
任务名称 | 大小写字母、中文、数字、下划线,长度 ≤ 256 | 是 | ${数据源类型}_YYYYMMDD_HHmmss |
计算资源 | 实时同步使用的 实时集群 计算资源 | 是 | — |
资源占用 | CU 数量,范围 1 ~ 256,步长 1 | 是 | — |
负责人 | 任务运行账号;需具备目标端访问权限 | 是 | 当前创建用户 |
任务描述 | ≤ 200 字符 | 否 | — |
来源设置
参数 | 说明 | 是否必填 |
数据来源 | 当前 Workspace 下匹配类型的数据源连接 | 是 |
来源表 | 是 | |
读取模式 | 全量+增量 / 仅增量 | 是 |
订阅类型 | 插入 / 更新 / 删除 ,至少保留一项 | 是 |
高级设置 | 数据源专属高级参数 | 否 |
来源表的两种选择模式
模式 | 行为 | 运行中自动加减表 |
指定表 | 按库名、表名过滤后勾选;最多 5000 张 | ❌ 需暂停任务后手动编辑 |
正则匹配表 | 填写库表正则;运行期内匹配的新增表自动接入 | ✅ 自动加减,加减的表必须在正则范围内 |
目标设置
基本配置
参数 | 说明 | 是否必填 |
数据位置 | 选择目标 Catalog;支持本地新建(需 Catalog 创建权限) | 是 |
Schema 匹配策略 | 控制目标 Schema 的命名规则 | 是 |
表匹配策略 | 控制目标表的命名规则 | 是 |
系统字段 | 否 |
系统字段(元数据字段)
可勾选写入到目标表的内置字段:
字段名 | 类型 | 说明 |
datasource_wedata_di | string | 数据源名称 |
database_wedata_di | string | 数据库名称 |
table_wedata_di | string | 数据表名 |
sequence_id_wedata_di | string | 增量事件记录 ID,唯一且递增 |
type_wedata_di | string | 操作类型 |
ts_wedata_di | timestamp | 日志时间 |
processing_time_wedata_di | timestamp | 处理时间(机器本地) |
before_image_wedata_di | string | 是否更新前的记录,取值 Y / N |
after_image_wedata_di | string | 是否更新后的记录,取值 Y / N |
注意
任务发布运行后再取消勾选某个系统字段,目标表中的字段不会被删除 ,但后续数据将写为空。请在保存前再次确认。
建表配置
参数 | 说明 |
建表类型 | 当前仅支持 原生表(Iceberg) |
字段映射 | 平台按默认规则填充字段类型映射,支持按需修改 |
映射匹配预览
预览每张来源表与目标表的映射关系,列含序号、源库、源 Schema(如有)、源表、目标 Schema、目标表、同步主键、表创建方式、字段映射、操作。
项 | 说明 |
同步主键 | 自动填充:使用已有表填该表主键;自动建表填待建表主键。无主键时需选择 1+ 列作为联合替代主键 |
字段映射 | 默认 默认映射 ;点击 编辑 修改后变为 自定义映射 (DDL 变更能力受限) |
操作(移除) | 仅 指定表 模式可用;正则匹配模式下移除按钮置灰 |
操作(编辑) | 打开右侧抽屉,按目标 DataBuddy 类型展示并允许调整字段映射 |
数据量过大时不支持预览,可在任务发布运行后通过运维详情查看实际链路明细。
运行设置
DDL 消息处理策略
策略 | 行为 |
自动同步 | 在目标端自动执行对应的 DDL |
忽略 | 跳过 DDL;后续数据可能因 Schema 不匹配失败 |
任务运行策略
参数 | 说明 |
Checkpoint 间隔 | 状态快照写入间隔 |
写入异常策略 | 单条写入失败时的处理方式 |
最大重启次数 | 任务异常自动重启的次数上限 |
告警通知
告警类型 | 说明 | 关键阈值 |
任务失败 | 任务进入失败状态时告警 | - |
业务延迟 | 同步链路延迟超过阈值 | 延迟阈值 (秒)、持续时间 (分) |
Failover 次数 | 观测窗口内重启次数超过阈值 | 观测窗口 (分)、重启次数 (次) |
DDL 通知 | 发生选定的 DDL 类型时通知 | 类型多选:新增列、删除列、重命名列、修改列类型、删除表、清空表、重命名表 |
参数 | 含义 | 取值范围 | 默认 | 提示 |
延迟阈值 (秒) | 业务延迟告警的延迟下限 | 1 ~ 86400,步长 1 | 120 | 建议 ≥ Checkpoint 间隔的 2 倍 |
持续时间 (分) | 持续超过延迟阈值多久后告警 | 1 ~ 60,步长 1 | 5 | 设置过短可能因网络抖动产生误报 |
观测窗口 (分) | Failover 统计窗口 | 5 ~ 60,步长 1 | 10 | 建议 10 ~ 30 分钟 |
重启次数 (次) | 观测窗口内重启次数告警阈值 | 1 ~ 20,步长 1 | 3 | 建议小于自动重启次数上限 |
任务版本管理
任务编辑页右上角支持查看版本:
保存 即生成版本,记录保存时间与保存人。
点击具体版本进入只读态;点击 回到此版本 转为编辑态,编辑保存后产生新版本。
任务运行中的版本附 生产 标识。
任务列表中通过「修改负责人」「修改告警」入口的变更不会生成新版本。
验证结果
操作完成后,您可以通过以下方式确认:
1. 在 数据集成 > 接入任务 > 实时 列表中可看到任务,状态符合预期:
未发布 :仅保存。
待启动 :已发布,可点击 启动 进入运行。
1. 启动后状态依次为 操作中 → 运行中 。点击任务名称可进入运维详情查看运行进度(详见 实时同步任务运维监控)。
2. 在目标 Catalog 下查看自动创建的目标表,全量阶段完成后会有数据写入;增量阶段持续追加变更。
常见问题
Q:来源端新增了一张表,运行中的任务没自动接入?
A:仅在 正则匹配表 模式下,新增表落入正则范围才会自动接入。指定表 模式需要暂停任务,编辑添加新表后重新发布、启动。
Q:自动建表失败?
A:以下情况会导致自动建表失败:
当前账号没有目标 Catalog 的建表权限——请联系管理员授权。
来源表字段类型在目标端没有对应类型——可在 映射匹配预览 中点击 编辑 ,手动调整字段类型后重试。
Kafka 作为来源端时不支持自动建表——需要预先在目标端建表后再选择 使用已有表 。
Q:取消勾选系统字段后目标表的对应列还在?
A:是。系统字段在目标表中创建后不会因取消勾选而删除,仅停止写入新数据。如需彻底移除,请在数据接入任务外手动调整目标表 Schema。
Q:编辑过字段映射后再发生 DDL 变更,任务报错?
A:自定义字段映射模式下,DDL 变更(新增列、删除列、重命名列、修改列类型)不再自动同步。建议:
评估是否可以恢复为 默认映射 。
如必须保留自定义映射,则在来源端发生变更时同步手动调整目标表 Schema 与任务字段映射。