帮你快速理解、总结文档立即下载

术语表

最近更新时间:2026-08-12 16:15:01
我的收藏
DataBuddy 术语
英文
说明
数据目录
Catalog
三级命名空间(Catalog.Schema.Table)中的最顶层容器,用于统一管理跨工作空间的元数据、权限与数据资产,是数据治理与访问控制的核心边界。
Schema
Schema
数据目录(Catalog)下的二级命名空间,用于对表、视图、函数等对象进行逻辑分组与隔离,通常对应业务域、项目或环境。
Table
结构化数据的基本存储单元,包含明确的列定义与数据类型。
视图
View
基于一条或多条 SQL 查询定义的虚拟表,本身不存储数据,查询时动态计算,常用于数据封装、权限隔离与逻辑复用。
Volume
面向非结构化及半结构化数据(如图片、音视频、PDF、JSON、Parquet 文件等)的存储单元,位于 Schema 之下,纳入统一权限管理,供 Notebook、任务与模型训练直接访问。
函数
Function
用户自定义的可复用计算逻辑,可通过 SQL 或 Python 编写,注册在 Schema 下并受权限管控,用于扩展平台的数据处理与业务计算能力。
指标
Metric
面向业务场景的可度量数值定义(如 GMV、留存率、活跃用户数),包含口径、计算逻辑、维度与聚合方式,作为语义层的核心资产供 BI 和 Agent,与下游应用统一调用。
语义模型
Semantic Model
位于数据物理层之上的业务语义抽象层,统一定义指标、维度、实体及其关系,为 BI 分析、自然语言问数与 AI 应用提供一致的语义口径。
Notebook
Notebook
交互式数据开发与探索环境,支持 SQL、Python 等多语言混合编写,具备可视化输出、版本管理能力。
SQL
SQL
结构化查询语言脚本资产,用于数据查询、加工与建模,可独立保存、版本化管理并作为工作流节点参与调度。
工作流
Workflow
数据任务的编排与调度单元,以 DAG 形式串联 Notebook、SQL、数据接入、模型训练等节点,支持依赖管理、定时触发与告警等能力。
实时接入
Realtime Ingestion
基于 CDC(变更数据捕获)等技术的低延迟数据同步方式,将源系统的数据变更实时同步至数据湖,支撑实时数仓与实时分析场景。
离线接入
Batch Ingestion
按周期批量将外部数据源(数据库、消息队列、SaaS 应用、对象存储等)同步到数据湖的方式,适用于对时效性要求不高的大规模数据集成。
模型
Model
机器学习模型资产,包含模型文件、依赖、签名与元数据,支持版本管理、血缘追踪与生命周期管理,可注册到模型仓库供推理或再训练使用。
模型服务
Model Service
将注册后的模型部署为在线或批量推理服务的能力,提供 REST API、弹性扩缩容、流量路由与监控,用于将模型能力接入业务系统。
模型实验
Experiment
机器学习训练过程的跟踪单元,记录每次运行(Run)的参数、指标、代码版本、数据版本与产物(Artifact),用于实验对比、复现与模型选型。
仪表盘
Dashboard
面向业务用户的数据可视化看板,通过图表、筛选器与交互组件展示指标与分析结果,支持定时刷新、订阅分发与嵌入。
智能体
Agent
具备规划、工具调用与记忆能力的 AI 应用单元,可对接指标、数据、模型与外部系统,完成复杂的业务任务与自动化流程。
Buddy
Buddy
内嵌于平台的 AI 智能助手,覆盖数据开发、分析、治理、运维等场景,可通过自然语言协助用户写 SQL、解释代码、排查任务、生成文档等。
Buddy 分析空间
Buddy analysis space
Buddy 助手感知业务上下文的工作单元,包含关联的数据资产、指标、文档与知识,用于让 AI 更准确地理解并响应业务问题。
工作空间
Workspace
平台的顶层资源与权限隔离容器,包含开发文件、任务、集群、成员与配置,通常按团队、项目或环境进行划分。
文件
File
工作空间中的开发资产文件,涵盖 Notebook、SQL、Python、配置等类型,是代码开发与版本管理的基本单位。
文件夹
Folder
工作空间中对文件进行组织的目录结构,支持嵌套、权限继承与批量管理。
Git 文件夹
Git Folder
与远程 Git 仓库关联的特殊文件夹,支持拉取、提交、分支切换等操作,实现代码版本化与团队协作开发。
补数据
Backfill
针对历史时间范围重新执行任务的能力,用于修复数据缺失、修正逻辑错误或初始化历史分区,支持按业务日期批量回溯。
治理标签
Governed Tags
在数据目录中对 Catalog、Schema、表、列等对象打上的受控标签,用于数据分级分类、敏感数据识别、访问策略与合规审计。