核心概念
本文围绕结构化数据场景、多模态数据场景、本体及Data Agent场景三类典型业务场景,对平台核心概念进行介绍。三类场景支持独立使用,也可相互组合;业务处理无需走完全部链路,可按需选用。
简单理解三类场景定位:
- 结构化数据场景:提供结构化数据采集、管理、处理、数仓建模的全生命周期治理能力。
- 多模态数据场景:提供多模态数据采集、管理、处理、检索的一站式治理能力。
- 本体及Data Agent场景:面向Agent提供高质量的上下文,辅助业务分析决策。
说明:不同产品版本、部署形态及租户配置支持的功能范围存在差异。本文用于帮助您理解概念及典型业务组合,不代表当前版本已开放全部能力。实际可用功能、菜单项及权限,请参考版本购买说明及控制台页面实际展示内容。
场景一:结构化数据场景
适用业务
结构化数据指按照字段、记录规整组织的数据,典型载体为数据表,如客户表、订单表、库存表。当数据可明确定义每列字段含义、每行记录代表的实体时,即可采用本场景开展业务。
典型业务任务包含:
- 客户、订单、库存等业务数据查询;
- 清洗无效值、重复数据、缺失字段等脏数据;
- 多表关联、指标统计计算;
- 按日/周/月周期完成数据批量加工;
- 将加工完成的数据输出至报表、第三方应用或下游任务。
核心概念
数据表:结构化数据存储载体
数据表用于存储客户、订单等具备明确字段、数据类型的结构化数据。数据表可被SQL、数据管道、数据质量、数据血缘、数据搜索、数据服务等能力引用;实际可引用范围受表类型、计算引擎、账号权限、产品版本约束。
数仓建模
数仓建模基于业务主题对数据进行分层、规范化组织的过程,通过分层设计(ODS/DWD/DWS/ADS)完成原始数据清洗、明细加工、聚合汇总、业务应用输出,实现数据复用、降低计算冗余、统一业务口径。
主题域与子主题域
主题域用于按业务主题对平台数据进行分类整理,默认分为两个层级:
- 主题域:对业务场景或业务数据的中心概括,例如
财务管理; - 子主题域:对同一性质主题的进一步划分,包含若干联系紧密的主题,例如
销售营业额。
说明:仅支持删除不包含数据的主题域与子主题域。
数仓分层
数仓分层按层次划分数据,使数据依赖关系清晰、加工链路可追溯。百度胜算默认划分为四层:
| 分层 | 中文名称 | 模型类型 | 命名前缀 | 分层说明 |
|---|---|---|---|---|
| ODS | 数据引入层 | 贴源表 | ods_ |
存放未经处理的原始数据,表结构与源系统保持一致 |
| DWD | 明细数据层 | 维度表 | dim_ |
对ODS层数据完成清洗,采用维度退化方式重新建模,代表业务最小粒度 |
| DWS | 汇总数据层 | 汇总表 | dws_ |
按业务划分与指标需求,对DWD层数据完成聚合汇总 |
| ADS | 应用数据层 | 应用表 | ads_ |
存放个性化统计指标,用于报表输出 |
数据标准
数据标准用于统一字段的命名、定义、数据类型与取值规范。建模时字段可关联数据标准,实现事前治理;平台同时支持依据数据标准生成数据质量作业,对物化后的物理表完成质量监控。
数据指标
数据指标用于建立统一的指标体系,集中管理指标口径与计算逻辑,避免多方操作导致口径不一致。指标分为三类:
- 原子指标:度量与属性来源于事实表和维度表,用于明确业务的统计口径与计算逻辑,例如
支付金额; - 衍生指标:由原子指标、时间周期、修饰词构成,例如
近一周上海地域销售金额; - 复合指标:由一个或多个衍生指标叠加计算而成,维度与限定继承自衍生指标。
模型类型
- 贴源表:与源系统结构保持一致的原始数据表;
- 维度表:描述业务分析视角,通过代理键与事实表关联;
- 事实表:记录业务过程数据,字段区分维度与度量,可关联维度表代理键;
- 汇总表:按主题完成聚合,字段可关联统计维度或指标;
- 应用表:面向报表与应用输出的结果表。
场景二:多模态数据场景
适用业务
多模态数据包含图片、音频、视频、文档等非表格类文件,无法直接作为数据表查询,需先解析提取文件内有效信息。
典型业务任务包含:
- 从合同文档提取合同编号、签约金额、签署日期等关键字段;
- 图片OCR识别,抽取图片内业务信息;
- 音频、视频内容解析,生成可检索文本信息;
- 海量文档切片、清洗处理,输出可供上层应用消费的数据。
核心概念
数据目录
数据目录为元数据第一层,用于按业务或项目维度隔离数据资产,目录下可创建数据模式。数据目录名称在同一元存储内不可重复。
数据目录详情可查看存储路径、创建信息,以及目录下数据表、数据卷、数据集、算子、模型的数量。同时支持配置可访问该目录的工作空间,并对用户完成授权与撤销。
说明:每个工作空间预置一个
system数据目录,提供平台内置的数据与AI资产,不支持重命名。数据目录仅在不存在数据表、数据卷的情况下才可删除。
数据模式
数据模式为元数据第二层,在数据目录下创建,用于进一步归集数据表、数据卷、数据集、算子与模型。数据模式名称在同一数据目录内不可重复。
每个数据目录创建后默认包含一个名称为default的数据模式。
注意:数据模式内存在数据表、数据卷、数据集、算子或模型时不可删除;删除后无法恢复。
数据表
数据表以行和列的形式存储结构化数据,适合管理客户、订单等有明确字段和数据类型的数据。数据表可以被 SQL、数据管道、数据质量、数据血缘、数据搜索和数据服务等能力引用,具体可用范围取决于表类型、引擎、权限和版本。
外部表
外部表是在平台中登记外部存储或外部系统数据位置的表对象,适合在不完整复制数据的情况下引用外部数据。外部表的查询、采集、写入和血缘能力取决于数据源类型、连接插件和当前引擎,创建成功不代表所有下游任务均可使用。
数据集
数据集是面向应用使用的数据资产载体,可以组织文件集合、结构化数据或多模态数据,并记录数据类型、Schema、存储格式和版本等信息。数据集与数据表不是同义词:数据表强调行列结构,数据集强调面向应用组织和使用数据。
数据集分为内部数据集与外部数据集:内部数据集由平台统一管理数据文件;外部数据集用于管理存储在对象存储中的数据。创建时需指定数据类型,支持文本、图片、音频、视频。
数据集通过版本管理实际数据内容。创建版本时需选择数据解析格式。版本内支持上传、预览、下载、删除文件,并可通过SQL对版本数据完成查询分析。
数据卷
数据卷是面向文件或非表格数据的存储对象,适合按文件路径管理原始文件、工程文件或非结构化数据,可被开发机、数据管道或多模态处理使用。数据卷不等同于项目文件管理目录,具体读写方式以页面和引擎支持为准。
数据卷分为内部数据卷与外部数据卷:内部数据卷在元存储对应路径下统一管理;外部数据卷以挂载方式引用其他对象存储路径的数据,需配置存储路径与访问凭证。
模型
模型用于在数据模式中统一管理模型文件及其版本,供多模态解析、内容理解、自定义算子等需要模型推理的任务引用。
模型分为内部模型与外部模型:内部模型由平台统一管理模型文件;外部模型用于管理存储在外部对象存储中的模型文件。模型通过版本管理具体模型文件,支持文件上传、搜索、预览、下载与删除。
定位区分:模型用于管理模型文件资产;模型服务用于将模型部署为可调用的在线推理服务,二者不是同一能力。
算子
算子为数据处理的最小执行单元,使用Python编写,可完成文本、图片、音频、视频、文档等数据的解析与加工,也可包含模型推理逻辑。多个算子通过串联、并联方式编排为工作流,由计算引擎调度运行。
算子按处理逻辑分为以下类型:extract、transform、filter、dedup、embedding、others。
平台在system数据目录中内置多个算子,可查看算子的描述、使用说明与版本信息。算子版本详情包含代码语言、算子代码路径、算子类型、运行环境、输入参数、输出参数、运行参数,以及支持引擎(Ray、Spark)与资源配置(CPU、GPU)。
如内置算子无法满足业务需求,可在数据模式中创建自定义算子,并通过算子版本上传执行代码,指定算子类型、支持引擎、资源类型、执行镜像与依赖模型。
注意:算子名称在同一数据模式中不可重复;算子的实际可用引擎与资源类型以算子版本配置为准。
场景三:本体及Data Agent场景
适用业务
业务数据库存储大量底层字段,但业务人员更关注客户、订单、设备、供应商等业务实体,以及实体之间的关联关系。
通过本体能力,可将底层数据库字段抽象为业务对象与对象关系。例如底层字段customer_id、order_id、amount,可抽象业务关系:客户 —[拥有订单]→ 订单。
业务人员无需理解底层表名、字段,即可从业务视角使用数据;配合数据搜索、自定义函数等上下文配置后,可通过Data Agent提交自然语言业务问题,自动完成查询、统计与分析。
数据资产相关概念
结构化数据集
结构化数据集用于以字段和记录的形式管理可分析数据,适合被数据管道、数据搜索或其他应用作为结构化输入使用。它的具体输入方式、存储格式、版本和下游能力以当前版本和数据集配置为准。
媒体集
媒体集用于组织图片、音频、视频和文档等非结构化或多模态内容,通常配合内容理解、数据管道或搜索能力使用。媒体集关注文件集合及其内容处理,不等同于数据表。
本体与Data Agent逻辑关系
本体与Data Agent常搭配使用,但能力定位不同:
1本体:将底层数据抽象为客户、订单等业务对象
2↓
3数据搜索 / 自定义函数:构建可查询、可复用的业务上下文
4↓
5Data Agent:针对业务问题自动完成查询、计算、分析
可以将本体理解为业务词典,Data Agent为依托该词典完成分析的智能助手。
注意:本体不是Data Agent的强制前置依赖。Data Agent同样支持基于数据集、函数、数据搜索等上下文开展分析,实际能力以版本、租户配置及用户权限为准。
本体相关概念
Object Type:业务对象类型定义
Object Type定义一类业务对象的结构、属性、主键。例如客户Object Type,可定义客户编号、客户名称、所属地区等属性。
说明:Object Type属于业务对象模板,描述对象应当具备的字段,本身不代表单条实际业务数据。
Object:业务对象实例
Object为对应Object Type下的单条实际业务数据。例如客户Object Type下,“示例客户A”即为一条Object实例。
Link Type:对象关联关系定义
Link Type定义两个Object Type之间的业务关联。例如配置客户拥有订单,建立「客户」与「订单」的对象关联。
说明:Link Type定义关联规则模板,不代表单条真实的对象关联实例。
Action Type:业务操作定义
Action Type定义可对业务对象执行的业务动作,例如调整客户等级。聚焦业务行为定义,区别于对象关联关系。
Data Agent相关概念
Data Agent:业务数据分析代理
Data Agent是面向业务问题的数据分析代理,针对需要查询、统计、对比、综合研判的业务问题完成分析。
示例业务问题:
- 本月销售额排名前三的地区是哪些?
- 哪些客户连续两个月订单金额发生下滑?
- 对比两款产品销量变化,输出潜在原因分析。
核心能力:无需用户手动编写完整SQL语句,在用户已授权访问的配置上下文内,完成业务问题的分析计算。
Data Agent可使用上下文
Data Agent可结合如下一类或多类上下文开展分析:
- 已授权访问的业务数据集;
- Object Type及对应的业务属性、关联关系;
- 自定义业务函数;
- 数据搜索能力;
- 其他已配置业务上下文。
Data Agent可通过查询、推理、计算、可视化等形式输出结果,同时展示分析链路与工具执行记录。实际支持的上下文、分析范围、工具集,由产品版本、租户配置、用户权限共同决定。
逻辑建模:可复用业务逻辑组件
逻辑建模为可复用的业务逻辑组件,支持本体对象查询、数据处理、调用平台业务能力。配置完成后,Data Agent可调用逻辑建模服务实现特定业务计算与处理逻辑。
Data Agent 与 AI FDE 的差异
| 能力 | 定位 | 典型示例 |
|---|---|---|
| Data Agent | 业务数据分析,回答数据说明了什么 | 分析上季度客户流失情况 |
| AI FDE | 平台操作辅助,回答如何在平台完成操作 | 帮我创建一条数据采集任务 |
二者均可调用平台数据与工具,但是业务目标不同。
其他通用概念
工作空间、项目、文件
- 工作空间:人员、项目、资源、权限的协作隔离边界;
- 项目:用于归集数据开发脚本、Notebook、本体、函数等业务资源;
- 文件:管理项目内文件夹与脚本文件,为Notebook、开发机、AI FDE提供文件运行上下文。
数据质量与数据血缘
- 数据质量:配置完整性、唯一性、有效性等校验规则,通过监控任务执行校验,输出质量报告,汇总校验状态与异常问题。
- 数据血缘:记录数据从采集、加工到消费的全链路流转关系,支持追溯上游数据源、评估下游任务影响、查看任务依赖。血缘完整度依赖任务、计算引擎、外部系统适配支持。
SQL、Notebook、数据管道:三类数据加工能力
| 能力 | 适用场景 |
|---|---|
| SQL | 表格数据即时查询、简单加工处理 |
| Notebook | 交互式数据探索、逻辑调试、数据分析,支持边编码边查看执行结果 |
| 数据管道 | 将清洗、过滤、转换、表关联等逻辑固化,构建可重复执行的数据处理流程 |
选型指引:一次性临时查询选用SQL;探索式开发调试选用Notebook;长期、批量、周期性执行的业务任务选用数据管道。
工作流:多任务编排调度
数据管道定义单业务链路的数据加工逻辑;工作流负责编排多个任务的执行依赖关系与调度时机。
工作流支持接入数据采集、Notebook、Shell、训练任务等任务节点,同时提供任务状态监控、日志查看、失败重试、告警通知等运维管理能力。
数据服务与模型服务
- 数据服务:封装数据查询、处理逻辑,对外提供可调用接口,解决应用如何调用业务数据的问题。
- 模型服务:将大语言模型、Embedding向量模型等算法模型部署为在线推理服务,解决对外提供模型推理能力的问题。
限制说明:内容理解、数据搜索、Data Agent、AI FDE能否调用指定模型服务,取决于产品版本、模型类型、租户配置,不默认支持全部模型服务互通。
评价此篇文章
