下表列出了 Pipeline 作业开发中常用的术语及其含义,供快速查阅。
术语 | 英文 | 说明 |
Pipeline 作业 | Data Pipeline | 在 Flink CDC 中,数据从上游流转到下游遵循 Pipeline 模式,整个 ETL 作业被称为 Data Pipeline。一个 Pipeline 作业由 source、sink、pipeline 以及可选的 route、transform 组成,在 Flink 集群中对应一个作业。 |
数据源 | Data Source | 用于访问元数据并从外部系统读取变更数据的组件。一个数据源可以同时读取多个表。 |
数据目标 | Data Sink | 用于应用表结构变更并向外部系统写入变更数据的组件。一个数据目标可以同时写入多个表。 |
表标识 | Table ID | 用于建立连接器与外部系统存储对象(如表)之间映射关系的标识,由命名空间、模式名、表名三部分组成。 |
路由 | Route | 用于匹配一个或多个源表并映射到目标表的路由规则,常用于分库分表的合并同步。 |
数据转换 | Transform | 对数据进行字段投影、过滤、主键/分区键重设等操作的规则。 |
表结构演进 | Schema Evolution | 将上游的 DDL 变更(建表、加列、改列类型等)自动同步到下游的能力。 |
数据变更事件 | DataChangeEvent | 数据同步过程中承载行级数据变更的事件,如插入、更新、删除。 |
表结构变更事件 | SchemaChangeEvent | 承载表结构变更的事件,如 create.table、add.column 等。 |
元数据字段 | Metadata Field | 在 transform 规则中可引用的隐藏列,如 __namespace_name__、__schema_name__、__table_name__、__data_event_type__。 |
用户自定义函数 | UDF | 由用户自定义、可在 transform 表达式中使用的函数。 |
精确一次 | Exactly-Once | 作业失败重启后仍能保证端到端的数据不重不丢的处理语义。 |
整库同步 | Full Database Synchronization | 通过配置库表匹配规则,在一个作业中同步一个数据库实例下的多张表。 |