帮你快速理解、总结文档立即下载

CDC 作业术语表

最近更新时间:2026-09-15 10:33:00
本文档已由 AI 辅助审校
我的收藏
下表列出了 Pipeline 作业开发中常用的术语及其含义,供快速查阅。
术语
英文
说明
Pipeline 作业
Data Pipeline
在 Flink CDC 中,数据从上游流转到下游遵循 Pipeline 模式,整个 ETL 作业被称为 Data Pipeline。一个 Pipeline 作业由 source、sink、pipeline 以及可选的 route、transform 组成,在 Flink 集群中对应一个作业。
数据源
Data Source
用于访问元数据并从外部系统读取变更数据的组件。一个数据源可以同时读取多个表。
数据目标
Data Sink
用于应用表结构变更并向外部系统写入变更数据的组件。一个数据目标可以同时写入多个表。
表标识
Table ID
用于建立连接器与外部系统存储对象(如表)之间映射关系的标识,由命名空间、模式名、表名三部分组成。
路由
Route
用于匹配一个或多个源表并映射到目标表的路由规则,常用于分库分表的合并同步。
数据转换
Transform
对数据进行字段投影、过滤、主键/分区键重设等操作的规则。
表结构演进
Schema Evolution
将上游的 DDL 变更(建表、加列、改列类型等)自动同步到下游的能力。
数据变更事件
DataChangeEvent
数据同步过程中承载行级数据变更的事件,如插入、更新、删除。
表结构变更事件
SchemaChangeEvent
承载表结构变更的事件,如 create.table、add.column 等。
元数据字段
Metadata Field
在 transform 规则中可引用的隐藏列,如 __namespace_name__、__schema_name__、__table_name__、__data_event_type__。
用户自定义函数
UDF
由用户自定义、可在 transform 表达式中使用的函数。
精确一次
Exactly-Once
作业失败重启后仍能保证端到端的数据不重不丢的处理语义。
整库同步
Full Database Synchronization
通过配置库表匹配规则,在一个作业中同步一个数据库实例下的多张表。