DataBuddy 采用 Agent 原生、Data + AI 一体化、全模态支持 的一体化产品架构。整个产品由上至下融合 业务交付层(Agent + 可视化分析)、能力平台层(数据资产、语义、治理)、引擎与存储层 三个层次,围绕企业数据从“接入 → 建仓 → 语义化 → 消费 → 治理”的全链路闭环设计。
架构总览

说明
上图对应 DataBuddy 端到端的核心链路:多模态数据入湖仓 → 全模态资产管理 → 统一语义构建 → AI-Ready 数据知识 → Agent 或可视化分析消费。全流程由 DataBuddy Harness 体系 提供 Agent 底座能力,由 数据治理 Agent 横向守护,由 统一元数据 TC Catalog(Tencent Cloud Catalog,腾讯云统一元数据目录) 提供统一目录视图,最终落地在托管的湖仓与计算引擎之上。
一、数据源接入范围
DataBuddy 支持企业内外部各类数据源的接入,覆盖以下类型:
数据仓库(Data Warehouses)
本地系统(On-premises Systems)
SaaS 应用(SaaS Applications)
机器与应用日志(Machine & Application Logs)
应用事件(Application Events)
移动与 IoT 数据(Mobile & IoT Data)
说明:
涵盖关系型数据库、数仓、湖仓、NoSQL、KV、消息队列、流、文件、对象存储、API、多模态等国内外数据源,提供 5 大接入方案:离线同步、实时同步、文件到 Table、文件到 Volume、批量到 Volume。
二、业务交付层:Agent 原生、面向“对话即交付”
DataBuddy 遵循 “Agent 为主、可视化为辅” 的产品逻辑:Agent 生成的代码、任务、语义模型、看板均沉淀到统一元数据 TC Catalog,可通过 GUI 或 Notebook 进行代码化、图形化二次编排。
三大内置 Agent
场景 | 交付 Agent | 关键能力 |
数据工程 | 数据工程 Agent | 数据开发、PL(Pipeline,数据流水线)工作流构建与配置、智能运维与系统自恢复 |
数据分析 | 数据分析 Agent | 自然语言问数、异动识别、归因分析、分析报告、智能可视化报表 |
数据治理 | 数据治理 Agent | 质量规则定义 AI 自动治理、数仓质量诊断、元数据补齐、资产盘点与敏感字段 AI 识别 |
可视化分析(DashBoard)
DashBoard 是数据分析域的独立消费入口,直接从 AI-Ready 数据知识 取数:
承载 Agent 产出的看板、报表、探索结果。
支持业务人员在图形化界面上自助创建、调整仪表盘。
与分析 Agent 双通道协同:Agent 自动生成看板后,可在 DashBoard 中二次编辑。
三、DataBuddy Harness 体系:Agent 原生底座
Harness 体系是三大 Agent 稳定“对话即交付”的核心底座,跨越工程、分析、治理三条业务线,统一提供以下能力:
知识库:企业级知识注入,包括业务本体、数据资产、SOP(Standard Operating Procedure,标准作业流程)等。
上下文:多轮对话上下文管理、跨会话状态保持。
记忆:Agent 长期记忆持久化,沉淀用户偏好与历史决策。
大数据领域 Skill、Tools:内置面向数据工程、语义建模、治理、分析等场景的领域 Skill 与工具集。
Agent 安全:双向 Guardrails(护栏机制,输入侧提示注入检测 + 输出侧结果防护)、OBO(On Behalf Of,以用户身份代理执行)权限强绑定、高危 SQL 拦截、意图校验,覆盖 OWASP LLM Top 10 全部风险。
Agent 评测:Skill 与 Tool 调用轨迹追踪、任务成功率、Token 消耗、语义还原度等多维评测。
四、能力平台层
4.1 多模态数据入湖仓
DataBuddy 在湖仓内部完成多层建仓,形成标准数仓分层结构:
ODS(Operational Data Store,操作数据层):承载入湖后的原始明细。
DWD(Data Warehouse Detail,明细数据层):完成清洗、标准化。
DWS(Data Warehouse Summary,汇总数据层):构建主题汇总宽表。
DIM(Dimension,维度层):抽取公共维度供上层复用。
ADS(Application Data Store,应用数据层):直接服务于分析、报表、Agent 消费。
多模态支持:结构化数据落入 Table,非结构化、半结构化数据(图片、视频、文档、音频、日志)落入 Volume,一套建仓分层同时覆盖。
AI 加持:数据工程 Agent 支持自然语言创建接入与建仓任务、AI 智能问答、任务异常 AI 根因定位。
4.2 全模态资产管理
DataBuddy 通过 TC Catalog 提供统一的多模态资产视图,让“结构化、非结构化、模型、外部镜像”共享一套元数据、权限与血缘:
资产类型 | 说明 |
Table Catalog | 表、视图、函数(结构化数据) |
Volume Catalog | 日志、图像、PDF、音视频等非结构化数据 |
Model Catalog | 机器学习模型、版本管理、血缘 |
External Catalog | 外部数据源镜像(免 ETL 即查) |
4.3 统一语义构建(Unity Semantics)
统一语义层是 DataBuddy “AI-Ready” 的关键——通过标准化的本体建模与指标、维度体系,消除口径歧义:
本体建模(Ontology,业务本体建模):标准化实体、属性、业务逻辑,构建业务本体模型。
指标、维度:企业级“语义知识图谱”,统一指标口径与维度定义。
关联关系:跨主题域实体关联、属性映射。
语义治理:与数据治理 Agent 联动,实现 口径校验、语义可迭代。
4.4 AI-Ready 数据知识
语义构建的产物——本体模型、指标、维度、语义模型、数据集——被封装为 AI-Ready 数据知识,作为 Agent 与可视化分析的共享供数层:
向 数据分析 Agent 供数:驱动自然语言问数、智能报表、归因分析等对话式消费。
向 DashBoard 供数:作为可视化分析的语义源,避免图表与实际业务口径脱节。
4.5 数据治理 Agent
数据治理 Agent 横向作用于 多模态数据入湖仓、全模态资产管理、统一语义构建 三大能力域,通过 Agent 化实现“人工治理 → AI 智能守护”的跃迁。核心功能:
质量规则定义 AI 自动治理:自然语言下发规则,Agent 补齐规则细节并自动挂载至链路。
数仓质量诊断:三类模式(快照、时序、推理),配合 KS、PSI、Wasserstein、卡方、JS 散度等漂移指标。
元数据补齐:Table 与 Column 级描述、业务口径、Owner 的自动补全。
资产盘点与敏感字段 AI 识别:批量识别 PII(Personally Identifiable Information,个人身份信息)、财务、身份等敏感字段,联动数据分级与脱敏,并对全域资产进行盘点。
4.6 统一元数据 TC Catalog
TC Catalog 是整个平台的“元数据中枢”:Table Catalog、Volume Catalog、Model Catalog、External Catalog 共享同一套目录、权限、血缘、标签,向上支撑 Agent 与可视化分析,向下打通引擎与存储。
五、引擎与存储层
5.1 计算引擎
引擎 | 定位 | 典型场景 |
批量计算引擎 | 大规模数据并行处理 | 批处理 ETL、数仓建仓、模型训练、大规模数据加工 |
OLAP(Online Analytical Processing,在线分析处理)分析引擎 (规划中) | 交互式亚秒响应 | 交互式分析、报表加速、DashBoard 供数 |
5.2 湖仓存储 TCLake
托管存储 + 读写请求计费,客户免运维。
全模态:同时承载 Table(结构化)与 Volume(图片、视频、文档、音频、日志)。
一份数据,多引擎共享:批量计算引擎与 OLAP 引擎同源读写,避免数据冗余搬迁。
5.3 客户外部数据源
对客户已有数据源(MySQL、PG 等)通过 External Catalog 与联邦查询能力实现 免搬迁分析。
六、架构核心特征
1. Agent 原生(Agent-Native):三大内置 Agent + Harness 体系提供的知识、上下文、记忆、Skill、安全、评测能力,让“对话即交付”成为默认交付形态。
2. Data + AI 一体化:数据平台与 AI 平台共用一套元数据、血缘、权限、调度、存储,避免“两套系统”的搬迁与治理成本。
3. 全模态支持:Table、Volume、Model、External 一体,覆盖结构化、半结构化、非结构化、模型资产、外部镜像。
4. 统一语义驱动:本体建模与指标、维度体系统一业务口径,是 Agent 与 DashBoard 稳定交付的关键基础。
5. AI-Ready 数据知识共享:语义产物封装为供数层,同时服务 Agent 与可视化分析,消除“分析口径漂移”。
6. 一体化治理:数据治理 Agent 横跨入湖仓、资产管理、语义构建,配合 Harness 的 Agent 安全能力,让 AI 深度介入企业数据仍然可控。
7. 开放连接:既能托管接入多种外部数据源,也能通过 External Catalog 对客户已有 MySQL、PG 等做免搬迁的联邦分析。