向量数据库和传统数据库的区别

从 VectorDB 的关键概念、架构设计和索引管理入手,了解向量数据、数据表、记录、标量索引与向量索引在组织和检索方式上的差异。

数据组织方式

VectorDB 文档用实例、数据库、数据表、字段和记录说明向量数据库的数据组织结构,并与关系型数据库中的表和行建立对应关系。

实例与数据库

实例是百度云中独立运行的数据库环境,是用户购买向量数据库服务的基本单位;每个数据库实例可以创建并包含多个数据库。

数据表与记录

在向量数据库中,数据表类似于关系型数据库中的表,包含多条文档数据;记录可以指一个文档或数据实体,相当于关系型数据库中的一行数据。

字段与向量

字段是文档中的属性或数据项,表示为键值对;向量是一组数值的有序集合,用于表示对象或事物的属性或特征。

索引与检索方式

VectorDB 同时涉及标量字段、向量字段、标量索引和向量索引,不同索引服务于不同查询或检索任务。

标量索引

标量索引用于加速基于标量字段值的精确查询或检索。二级索引可针对非主键字段取值进行查询或过滤,过滤索引用于加速带有标量过滤的向量检索场景。

Primary Index根据主键取值顺序组织数据存储,用以加速基于主键取值的查询和扫描操作。
Secondary Index通过索引快速定位该行的主键取值,再通过主键取值查询整行。
Filtering Index为了加速带有标量过滤的向量检索场景而引入。

向量索引

向量索引是针对向量类型数据建立的索引机制,目的也是加速向量检索过程;由于向量检索本质与传统标量检索不同,向量索引原理也不一样。

常见类型平坦索引、倒排类索引、树形索引和图结构索引等。
无索引不对向量字段建立向量索引,仍可提供召回率为 100% 的 KNN 检索。
HNSW一种基于图的高维向量相似性搜索算法,用于加速搜索过程。

分布式架构与资源隔离

VectorDB 基于自研“莫愁”向量数据库内核构建,后端由管控层和内核层构成。

管控层

管控层与控制台协作,完成产品实例的购买、释放、计费、扩缩容等操作,并将产品信息通过控制台暴露给客户。

内核层

内核层是数据库内核系统,提供数据库核心能力,负责完成建库建表、增删查改等数据相关操作。

分片与副本

分片将数据分布存储在不同节点上,提高数据库性能和可扩展性;副本作为硬件故障时的冗余备份,保护数据不丢失。

适用场景

向量数据库常用于需要相似度计算、语义检索或大模型知识管理的场景。

信息相似度检索

在快速而准确地检索文本和图片数据的挑战下,向量数据库提供高效、安全且智能的解决方案。

大模型问答记忆

通过实时存储和检索会话数据,降低幻觉情况的发生,提升问答的准确性和用户体验。

大模型私域知识库

在私有云环境中构建专属的私域知识库,针对私域数据提供定制化、高效的知识管理和检索服务。

相关文档

继续查看 VectorDB 关键概念、架构设计、向量索引和应用场景说明。

关键概念

说明向量、实例、分片、副本、数据库、数据表、字段、记录和索引等概念。

设计架构

介绍 VectorDB 的托管型产品架构、管控层、内核层和资源组织方式。

向量索引的选择与管理

说明向量索引机制、索引评估、索引选择和无索引 KNN 检索。

应用场景

介绍信息相似度检索、大模型问答记忆和大模型私域知识库等场景。

相关专题页

查看更多 VectorDB、Milvus 与 RAG 检索相关内容。

Milvus 向量数据库与 VectorDB 实例创建指南

了解 VectorDB 对 Milvus 引擎实例的支持、实例规格和向量索引管理。

向量数据库怎么选:VectorDB 检索能力与规格参考

了解 VectorDB 检索能力与规格选择。

RAG 与向量数据库:VectorDB 知识库问答实践

查看 RAG 与向量数据库的知识库问答实践。

继续了解 VectorDB 的数据与检索模型

查看关键概念与索引管理文档,了解向量数据库的数据组织、索引机制和典型业务场景。