帮你快速理解、总结文档立即下载

文件解析与推断

最近更新时间:2026-09-11 20:57:30
我的收藏

概述

DataBuddy 在「数据预览」阶段会自动推断 文件的结构与字段类型,您可以通过 转换设置 入口对推断结果进行校正。本文按文件类型逐一说明可调整的参数。
转换设置的入口位于「数据预览」页面字段表上方,点击 高级设置 弹出参数面板。

CSV

配置
默认值
说明
列分隔符
自动推断;无法推断时回退为 ,
可选:自定义、,;、Tab
转义符
\\
可选:"\\。用于对值中出现的非法字符进行转义存储
第一行作为字段行
勾选
取消勾选时字段名自动生成为 t__c0 / t__c1 … ,原始第一行作为数据行写入
行跨行
不勾选
是否允许单条记录跨越多行(用于值中含换行的情况)
提示
:源文件部门字段值为 <script://alert('abc')>。当转义符为 " 时,存储为 <script:"/"/alert("'abc"')>;当转义符为 \\ 时,存储为 <script:\\/\\/alert(\\'abc\\')>

Text

配置
默认值
说明
列分隔符
自动推断;无法推断时回退为 |
可选:自定义、;|、Tab
行分隔符
自动推断;无法推断时回退为「断行 \\n
可选:自定义、回车 \\r、断行 \\n
第一行作为字段行
勾选
取消勾选时字段名自动生成为 t__c0 / t__c1 … ,原始第一行作为数据行写入
转义字符
\\
用于转义非法字符

JSON

配置
默认值
说明
将时间文本转换为时间类型
勾选
当字段值符合时间特征时,自动识别为时间类型;否则解析为文本
允许使用单引号
勾选
勾选时把单引号当作双引号解析;取消勾选且文本含单引号时会提示「无法推断出 JSON 格式」
过滤注释
勾选
仅支持单行 // 与多行 /* */ 标准注释;不支持 ? 注释、约定 key 等非标准注释
行跨行
勾选
勾选时只关注完整 JSON 体,忽略不完整的行;取消勾选时不完整行解析为空行(所有字段为 null)
JSON 推荐格式
多 JSON 体形式:每行一条独立 JSON 对象。
数组形式:根元素为 JSON 数组,每个数组元素是一条记录。
嵌套处理 :当存在 JSON 嵌套时,嵌套字段整体解析为一个文本对象,不会自动展开为多列 。如需拆解,建议在入表后通过 SQL 任务用 get_json_object / from_json 等函数后处理。

XML

配置
默认值
说明
行标签
自动推断(取最外层一级标签)
决定哪个标签作为一行数据的分隔;如自动推断错误可手动指定
属性作为字段
勾选
勾选时把 XML 元素的属性作为单独字段;取消勾选时属性被忽略
属性前缀
_
「属性作为字段」勾选时,字段名形式为 属性前缀 + 属性名
提示
行标签嵌套行为 :若 XML 中行标签出现在嵌套结构中,仅以行标签定义的层级作为数据行;该层级的父级数据视为无意义数据,不会写入字段。
属性前缀冲突处理 :若「属性前缀、属性名」与已有字段名重名,自动在末尾追加 _序号(如 a_name_1),以避免覆盖。

Avro / Parquet

Avro 与 Parquet 是自描述格式 ,文件中已包含 Schema 信息。系统直接读取并展示推断结果,无需额外转换设置。
如需调整字段类型或字段名,可直接在「数据预览」页面的字段表上修改,详见 预览与 Schema 编辑

字段类型自动推断

预览阶段,系统会基于前若干行数据为每个字段自动推断类型。当前支持的字段类型包括(在字段类型下拉菜单中可选):
类型族
说明
字符串
STRING / VARCHAR
整数
INT / BIGINT
浮点
FLOAT / DOUBLE
高精度数
DECIMAL(需指定精度与小数位)
布尔
BOOLEAN
时间
DATE / TIMESTAMP
DECIMAL 精度设置 :当字段类型设为 DECIMAL 时,悬停在类型上会显示编辑图标;点击后可设置精度与小数位。
参数
取值范围
说明
精度(precision)
1 ~ 38
小数点左侧的最大位数
小数位(scale)
0 ~ 精度
小数点右侧的最大位数。超过精度上限时会以红色错误提示

「高级设置」与字段编辑的关系

「高级设置」修改的是解析规则 (如分隔符、行标签)。修改后系统会重新解析文件,预览数据与字段列表会刷新。
「字段名、字段类型、建表字段」修改的是目标表的 Schema 。这些修改不会再次触发解析,仅影响最终建表的字段定义。
如果在调整「高级设置」前已手动改过字段名或类型,重新解析后字段列表可能恢复为系统默认推断结果。建议先把转换规则调整稳定,再编辑字段

相关文档