帮你快速理解、总结文档立即下载

本地文件上传到表

最近更新时间:2026-09-11 20:42:32
我的收藏

概述

本地文件上传到表用于把本地的结构化、半结构化文件解析为结构化数据表,并落入 Catalog(数据目录)下指定的 Schema。上传完成后,表在 数据目录 中可被检索,可直接用于 SQL 查询、仪表盘与下游任务加工。
控制台的入口卡片名称为 文件上传到表 ,交互形式为右侧抽屉,整体流程为「选择文件 → 预览数据并确认 Schema → 存储设置 → 建表」。

适用场景

一次性数据分析 :把手工整理的销售表、库存表、对账文件等直接建表,用于临时分析。
样本数据快速入湖 :把小规模样例数据入表,用于验证 SQL 逻辑或搭建仪表盘原型。
无需建模的散落文件 :源数据只有文件、没有可连接的数据库时,直接由文件生成表。
如果需要周期性把新增文件持续拉取入表,请改用 文件到表同步。如果文件需要保留原始格式、不做解析,请使用 本地文件上传到卷

前提条件

条件
说明
数据集成权限
当前账号在所属 Workspace(工作空间)中拥有数据集成模块的操作权限,详见 成员与权限管理
计算资源
当前 Workspace 下存在可用的交互式集群计算资源,用于解析文件与建表,详见 创建计算资源
目标 Catalog 与 Schema
拥有目标 Catalog、Schema 的写入权限;如没有可用 Schema,可在存储设置步骤中即时创建
待上传文件
文件类型与容量符合 支持的文件类型及约束

使用限制

限制项
说明
文件类型
CSV、JSON、Avro、Parquet、Text、XML,对应扩展名 .csv.json.avro.parquet.txt.xml
文件数量
单次至少 1 个,最多 10 个,允许多种类型混合
文件容量
所有文件大小之和不超过 2 GB
预览行数
数据预览最多展示 50 行
各类型的解析行为、字段命名规则与完整错误提示,详见 支持的文件类型及约束

操作步骤

步骤 1:进入文件上传到表

1. 登录 DataBuddy 控制台,切换到目标 Workspace。
2. 在左侧导航栏选择 数据集成 ,确认当前位于「接入方式」Tab。
3. 在「文件」区域点击 文件上传到表 卡片,系统在右侧打开「文件上传到表」抽屉。

步骤 2:选择本地文件

支持两种方式添加文件:
拖拽 :把文件直接拖到抽屉中的文件上传区。
点击选择 :点击 选择文件 ,在系统文件浏览器中单选或多选文件。
注意
文件数量或总容量超出限制时,页面会给出非阻断式提示并在数秒后自动消失,超限文件不会被加入列表。请先拆分或精简文件后重试。

步骤 3:选择服务资源

服务资源用于解析上传文件并执行建表,为必选项。
参数
说明
是否必填
默认值
服务资源
单选。下拉列表仅展示当前账号有使用权限的交互式集群计算资源,并显示资源的当前状态
选中资源后,页面展示该资源的创建人与资源类型;点击 详情 可在新标签页打开计算资源详情页。
如所选资源当前未启动,系统会在解析文件前自动启动该资源。
提示
计算资源按实际使用量计费,资源规格与自动启停策略详见 计算资源概述

步骤 4:预览数据与确认 Schema

上传文件以后自动进入「数据预览」步骤。系统先把文件写入湖仓再解析,解析完成后,预览表格展示数据样本,各项操作恢复可用。
在本步骤中,您需要确认以下内容:

1. 确认表名:表名不能跟现有表重复。
2. 确认字段:勾选需要落库的字段,并按需修改字段名、字段类型与 DECIMAL 精度。至少需要保留 1 个字段。
3. 校正解析规则:点击 高级设置 ,按文件类型调整分隔符、行标签解析参数。
字段编辑的完整说明详见 预览与 Schema 编辑;各文件类型可调整的解析参数详见 文件解析与推断
注意
修改「高级设置」会触发重新解析,已手动调整的字段名与字段类型可能恢复为系统推断结果。建议先把解析规则调整稳定,再编辑字段。

步骤 5:存储设置

确认预览结果后进入「存储设置」步骤,指定表的落库位置与同名处理方式。
参数
说明
是否必填
默认值
目标位置
在目录树中选择 Catalog 与 Schema,表将创建在所选 Schema 下。仅展示您有权限的目录
处理方式
同名覆盖 :用本次数据覆盖已存在的同名表;新建副本 :另建一张新表,名称为「表名_1」
目录树支持按关键字搜索 Catalog 与 Schema。
鼠标悬停在目录上时,右侧出现 + Schema ,点击可直接创建 Schema,无需退出当前流程。
点击 数据目录 可在新标签页浏览完整的数据目录。
警告
选择「同名覆盖」会用本次上传的数据替换目标表中的原有数据,覆盖后数据不可恢复。如需保留原表数据,请选择「新建副本」。

步骤 6:建表并验证结果

1. 点击 建表 。建表期间当前步骤的所有选项不可操作。
2. 建表成功后,页面自动跳转到 数据目录 中该表所在的位置。
3. 在数据目录中确认表已生成、字段与预期一致,随后即可通过 SQL 查询该表,表的元数据管理详见 数据目录概述

复用最近一次上传

打开「文件上传到表」抽屉时,如果您在 24 小时内有成功提交过的上传记录,页面会提示最近一次上传的文件,点击 预览文件 可直接沿用该批文件继续后续步骤,无需重新选择本地文件。
特性
说明
有效期
24 小时,超期后记录不再展示
可见范围
仅当前账号自己的上传记录,其他成员的上传记录不会展示

常见问题

Q:单次上传超过 10 个文件或总容量超过 2 GB 怎么办?

A:分批多次上传;如果数据量较大或需要周期性接入,请改用 文件到表同步 通过离线同步任务处理。

Q:多个文件字段不完全一致,能合并成一张表吗?

A:可以。合表上传时字段取各文件字段的并集,缺少该字段的数据行填充为 null。若各文件结构差异较大,建议改用分表上传,避免产生大量空值字段。

Q:JSON、XML 中的嵌套结构会展开成多列吗?

A:不会。嵌套内容整体解析为一个文本字段。如需拆解,可在入表后通过 SQL 函数处理,详见 文件解析与推断

Q:源文件字段名是中文,建表后字段名会变化吗?

A:会。系统会自动把字段名规范化,中文转为拼音、非法字符替换为下划线。您可以在数据预览步骤手动改为需要的名称,规则详见 支持的文件类型及约束

Q:上传的表结构后续还能调整吗?

A:建表后的字段调整需要在数据目录或通过 SQL 任务完成。如果只是本次上传解析有误,建议在数据预览步骤修正后重新建表。

Q:提示「无权限执行上传服务」怎么办?

A:通常是数据集成模块权限或计算资源使用权限发生变更。请联系管理员确认权限配置,详见 成员与权限管理

相关文档