开源向量数据库迁移到 VectorDB

Milvus 离线迁移 VectorDB 解决方案提供了从数据导出、表结构转换、数据导入到迁移后检查的流程。VectorDB 支持全面检索能力、企业级能力和多种服务模式,可用于向量检索业务迁移与选型评估。

迁移流程关注什么

Milvus 离线迁移文档提供了导出、转换、导入和检查的关键步骤。

导出 Milvus 数据

运行 export.py,并检查输出结果。输出目录中包含 data 目录、warning.log、table_config.json 和 csv 文件。

转换表结构

table_config.json 为由 Milvus 表转化而来的、符合 VDB 概念的表结构,用于在 VDB 中创建对应的表。

导入 VectorDB

csv2vdb_config.yaml 需要根据目标端 VDB 集群信息修改相关配置项,运行 import.py 后在 VDB 中检查数据是否成功导入。

导入配置需要哪些信息

迁移文档的 csv2vdb_config.yaml 示例列出了目标端 VDB 集群的关键配置。

数据库连接配置

hostVDB 实例的 IP 地址。
portVDB 实例端口号。
accountVDB 的账号。
api_keyVDB 的 api 秘钥。

目标库和数据路径

db_name导入目标数据库名。
data_path导入数据源,例如 ./data。
检查方式运行 import.py 后,使用 mochow-cli 检查迁移后的数据表。

迁移后为什么要关注索引

迁移文档提示导入完成后考虑在检索前重建索引;索引选择文档说明不同索引在成本、性能和召回率之间需要权衡。

重建索引提升查询速度

迁移文档说明,在使用前推荐用户重建向量索引以提升查询速度,相关操作可查阅 OpenAPI 或 SDK 相关文档。

无索引和 FLAT

无索引是不建立向量索引,在检索时读取原始向量数据并执行 KNN 检索;FLAT 将原始向量数据平坦地摆放在内存中,本质是全内存加 KNN 检索。

HNSW、PUCK 和 IVF

HNSW 是经典的图结构索引;PUCK 是百度自行研发的向量索引;IVF 通过将向量空间划分为多个聚类,并在每个区域内独立执行搜索来减少计算复杂度。

迁移到 VectorDB 后可使用哪些能力

VectorDB 产品页介绍了检索能力、性能、上下游集成和企业级能力。

全面的检索能力

通过元数据过滤和向量检索结合,查询出用户想要的结果;基于关键词和短语的 BM25 检索结合向量检索,提供精确检索的能力;基于多种检索进行多路召回及融合排序,提供更加高质量的检索结果。

性能与上下游集成

标准数据集、不同召回率情况下,向量检索的 QPS 性能优于开源 1~10 倍。VectorDB 产品兼容市面上大部分的模型,并且有百度智能云的大模型生态加持。

企业级能力

  • 多租户隔离,确保不同部门、不同业务线、不同业务单元等具有相应权限。
  • 提供对关键业务的更高可用性和可靠性的能力,业务可以获得更高的 SLA 保证。
  • 提供安全白名单、TLS 传输加密,企业级客户可以安全地访问数据。

推荐文档

继续查看迁移、索引选择、产品介绍和规格相关文档。

Milvus离线迁移VectorDB解决方案

查看 Milvus 到 VectorDB 的离线迁移流程、导出导入脚本配置和迁移后检查方式。

向量索引的选择与管理

了解无索引、FLAT、HNSW、PUCK、IVF、DISKANN 等索引类型和适用场景。

向量数据库 VectorDB

了解 VectorDB 的产品定义、索引类型、相似度算法、向量规模和查询延迟。

产品规格

查看 VectorDB 分布式架构、节点类型、节点规格、标准版和免费版实例类型。

相关专题页

继续了解 VectorDB 选型、概念和 RAG 场景。

向量数据库怎么选:VectorDB 检索能力与规格参考

向量数据库是什么:VectorDB 产品能力与应用场景

RAG 与向量数据库:VectorDB 的知识库和检索场景

评估 VectorDB 迁移与选型方案

查看产品介绍和迁移文档,继续了解 Milvus 离线迁移、向量索引重建、检索能力和企业级部署能力。