元数据过滤和向量检索
通过元数据过滤和向量检索结合,查询出用户想要的结果。
VectorDB 产品页明确提供元数据过滤、向量检索、BM25 检索、多路召回和融合排序等检索能力。
通过元数据过滤和向量检索结合,查询出用户想要的结果。
当数据更新的时候,VectorDB 会自动更新索引,提供最快的检索效果。
基于关键词和短语的 BM25 检索结合向量检索,提供精确检索的能力;基于多种检索进行多路召回及融合排序,提供更加高质量的检索结果。
向量索引用于加速向量检索过程,不同索引在成本、性能和召回率之间需要权衡。
从业务角度来看,选择何种类型的向量索引需要仔细评估。很难有一种向量索引在成本、性能和召回率三个关键指标中都取得非常理想的表现,需要业务在这些指标中进行权衡。
VectorDB 当前支持多种类型的向量索引,同时也支持“无索引”,即不对向量字段建立任何向量索引,仍然可以提供向量检索,而且是召回率为 100% 的 KNN 检索。
HNSW 是一种经典的图结构索引,优势在于性能和召回率都比较稳定,整体效果受向量数据集的分布或倾斜影响很小。
PUCK 是百度自行研发的向量索引,在百度内部得到了广泛应用;IVF 向量索引通过将向量空间划分为多个聚类,并在每个区域内独立执行搜索来减少计算复杂度。
产品规格文档和产品页分别提供了分布式架构、节点规格、实例类型和企业级能力说明。
百度向量数据库以分布式架构为基础,各个节点之间协同通信和协调,以实现高效的数据存储和检索。客户端请求通过负载均衡机制智能地分发到多个节点上,从而提高整体性能和可用性。
VectorDB 产品页列出了大模型私域知识库,并提供私有化、公有云、软硬一体等服务模式。
把用户知识库内容录入到向量数据库,通过相关知识的相似性检索可以实现基于知识库的问答。
私有化适合强数据安全与隐私需求的场景;公有云适合快速体验效果、对部署环节要求不高的场景。
软硬一体适合开箱即用且高可用需求的场景,支持软硬一体交付、高可用保证、多算力资源适配和国产化支持。