导出 Milvus 数据
运行 export.py,并检查输出结果。输出目录中包含 data 目录、warning.log、table_config.json 和 csv 文件。
Milvus 离线迁移文档提供了导出、转换、导入和检查的关键步骤。
运行 export.py,并检查输出结果。输出目录中包含 data 目录、warning.log、table_config.json 和 csv 文件。
table_config.json 为由 Milvus 表转化而来的、符合 VDB 概念的表结构,用于在 VDB 中创建对应的表。
csv2vdb_config.yaml 需要根据目标端 VDB 集群信息修改相关配置项,运行 import.py 后在 VDB 中检查数据是否成功导入。
迁移文档的 csv2vdb_config.yaml 示例列出了目标端 VDB 集群的关键配置。
迁移文档提示导入完成后考虑在检索前重建索引;索引选择文档说明不同索引在成本、性能和召回率之间需要权衡。
迁移文档说明,在使用前推荐用户重建向量索引以提升查询速度,相关操作可查阅 OpenAPI 或 SDK 相关文档。
无索引是不建立向量索引,在检索时读取原始向量数据并执行 KNN 检索;FLAT 将原始向量数据平坦地摆放在内存中,本质是全内存加 KNN 检索。
HNSW 是经典的图结构索引;PUCK 是百度自行研发的向量索引;IVF 通过将向量空间划分为多个聚类,并在每个区域内独立执行搜索来减少计算复杂度。
VectorDB 产品页介绍了检索能力、性能、上下游集成和企业级能力。
通过元数据过滤和向量检索结合,查询出用户想要的结果;基于关键词和短语的 BM25 检索结合向量检索,提供精确检索的能力;基于多种检索进行多路召回及融合排序,提供更加高质量的检索结果。
标准数据集、不同召回率情况下,向量检索的 QPS 性能优于开源 1~10 倍。VectorDB 产品兼容市面上大部分的模型,并且有百度智能云的大模型生态加持。