概述
HDFS(Hadoop Distributed File System)是 Hadoop 生态的分布式文件系统,用于存储大规模数据文件。DataBuddy 数据接入支持将 HDFS 作为来源端,读取其中的文件进行离线同步。本文介绍其连接配置、能力支持范围、前提条件与常见问题。
支持的版本
类型 | 支持版本 |
HDFS | 2.x / 3.x(Hadoop 发行版) |
读取能力
能力 | 支持情况 | 说明 |
离线同步(读 / 写) | ✓ / - | 支持作为离线同步任务的源端读取数据;DataBuddy 数据源仅支持接入读取,不支持写入 |
使用限制
限制项 | 说明 |
认证方式 | 支持 Kerberos / Simple |
读取对象 | 以目录或文件为粒度读取 |
路径匹配 | 支持通配符匹配多个文件 |
支持的文件格式
前提条件
Kerberos 认证(推荐用于安全集群)
配置项 | 说明 |
Principal | Kerberos principal |
Keytab | 客户端认证的 keytab 文件 |
krb5.conf | Kerberos 配置文件 |
请确保 DataBuddy 运行环境与 HDFS NameNode 网络连通,且拥有目标目录的读取权限。
创建数据源
操作步骤
1. 登录 DataBuddy 控制台。
2. 在顶部切换到目标地域和 Workspace。
3. 进入 数据集成 > 数据源管理(或 平台管理 > 数据源管理)。
4. 点击 添加数据源,选择 HDFS。
5. 填写连接配置与认证信息,详见 参数说明。
6. 点击 测试连接(参见 数据源连通性测试)。
7. 测试通过后点击 保存 或 保存 & 创建任务。
参数说明
参数 | 说明 | 是否必填 | 默认值 |
数据源名称 | 数据源在工作空间内的唯一标识 | 是 | — |
NameNode 地址(defaultFS) | HDFS 命名节点地址,格式 hdfs://host:port | 是 | — |
认证方式 | Kerberos / Simple | 是 | Simple |
Principal | Kerberos 认证下的 principal | 认证方式为 Kerberos 时必填 | — |
Keytab | Kerberos 认证下的 keytab 文件 | 认证方式为 Kerberos 时必填 | — |
krb5.conf | Kerberos 配置文件 | 认证方式为 Kerberos 时必填 | — |
在数据接入任务中使用
离线文件读取
配置项 | 说明 |
数据来源 | 已配置的 HDFS 数据源 |
读取路径 | 目标目录或文件路径,支持通配符(如 /data/dt=*) |
文件格式 | 选择 Text / CSV / JSON / Parquet / ORC / Avro 等 |
最佳实践
实践 | 建议 |
认证方式 | 安全集群优先使用 Kerberos |
目录规划 | 按日期分区组织目录,便于增量同步 |
网络打通 | 确保与 NameNode / DataNode 网络连通 |
常见问题
Q:连接 NameNode 失败?
A:检查 NameNode 地址与端口可达性,确认 Kerberos 配置正确。
Q:读取不到文件?
A:确认读取路径正确、账号具备目录读取权限,且文件格式选择与源文件一致。