Agent-Native 原生架构
DataBuddy 不是“传统平台外挂 AI 插件”的拼装式产品,而是从底层引擎到上层交互都为 Agent 场景重新设计:
三大内置 Agent 开箱即用:工程 Agent、治理 Agent、分析 Agent 深度绑定腾讯云大数据生态,面向大数据领域深度优化的 Skill 体系、专属知识库、上下文优化与持续记忆
Agent 双向防护:提示注入检测、OBO 权限强绑定、高危 SQL 拦截、“三要素”精准拦截,覆盖 OWASP LLM Top10 全部风险
持续进化飞轮:每次使用都在沉淀知识和记忆,越用越好,模型红利持续加持到数据平台
Data + AI 一体化平台
一份数据、一套计算,同时服务数据分析与 AI 应用:
统一 DAG(Directed Acyclic Graph,有向无环图)混合编排:大数据任务与 AI 任务(模型训练、推理、特征工程)在同一工作流里编排,血缘贯通
MLOps(Machine Learning Operations,机器学习工程运维)全生命周期:MLflow 跟踪、AutoML、大模型实验、特征管理,覆盖机器学习全生命周期:训练、评估、部署、监控
成本优化:CPU、GPU 算力复用,避免数据在两套系统间来回流动
上线周期:端到端模型上线周期从 30 天缩短到 7 天,特征复用率提升 1.5 倍,开发效率提升到 2 倍
统一语义层 Unity Semantics
LLM 时代的瓶颈不在模型,而在于模型对业务的理解会更好一些。DataBuddy 通过统一语义层解决 NL2SQL(Natural Language to SQL,自然语言转 SQL)的三大幻觉陷阱:
幻觉陷阱 | 无语义层表现 | 语义层解决方案 |
指标歧义 | “收入” 有 8 种口径,Agent 随机选 | 指标、实体、业务口径标准化 |
JOIN 错乱 | 关联键靠猜,SQL 跑通但数据错 | 语义模型固化关联关系 |
查询条件乱写 | “上季度”、“华东区” 靠猜字段 | 本体建模明确维度绑定 |
效果对比:
无语义层:NL2SQL 准确率 60% ~ 70%
完整语义层:NL2SQL 准确率 90%+
配合治理 Agent 持续更新校验(语义不过期),“缺语义会导致幻觉、缺治理会导致过期”,同时解决这两类问题,正是 DataBuddy 的护城河。
多模态治理 · 治理对象全域化
TCCatalog(Tencent Cloud Catalog,腾讯云统一数据目录)一个入口统管四类资产:
Table Catalog:表、视图、函数
Volume Catalog:日志、图像、PDF、视频、音频
Model Catalog:ML 模型、版本管理
External Catalog:外部数据源镜像,免 ETL(Extract-Transform-Load,数据抽取转换加载)即查
配套能力:
端到端数据血缘:自动采集 SQL 与集成任务,模型血缘覆盖训练到推理全链路
数据质量:新鲜度、完整度、一致性全链路监控,异常自动检测
敏感数据识别:AI 自动打标分级,一键审核确认
细粒度权限:Catalog、Schema、Object 三层级联
总拥有成本(TCO)显著降低
DataBuddy 一体化架构降低架构成本,具体体现:
免版本费:专业版、企业版的差异仅体现在计费项单价递增——客户“零门槛”开通,先用起来再随规模付费
按量、包月双计费:以 CU 为统一计量单位,波峰用按量、稳态用包月,客户可自主优化成本
AI 能力独立商业化:Agent 订阅 198 元 / 人 / 月起,积分包 5 档按需购买,用量弹性扩容
云原生一体化,隐藏复杂度:基础资源打包进 CU、GU(GPU Unit,GPU 计算单元),统一订单出口,客户无需拼装多方账单