本地做 RAG(回答前先从资料库找内容),常见难题不是模型装不下,而是资料库的向量先把内存吃满。TurboVec 把 TurboQuant 量化方法做成 Rust 向量索引,并提供 Python 绑定——上层应用仍像调用普通 Python 库,底层则负责压缩和高速检索。项目作者称,1000 万篇文档的 float32 向量原需 31 GB 内存,TurboVec 可压到 4 GB,并且无需预先训练或调参,新增向量即可入库。
更实用的一点是,它把筛选直接塞进 SIMD 搜索过程。SIMD 是处理器一次并行比较多组数值的技术;当权限、时间范围或 SQL 查询只允许检索部分文档时,TurboVec 会跳过完全不含候选项的数据块,而不是先搜完整库再丢掉无关结果。作者还报告,其搜索在 ARM 上比 FAISS IndexPQFastScan 快 10%—19%;x86 上则只在 4-bit 配置领先,2-bit 配置慢几个百分点。上述数字均来自项目自述,材料未提供独立复现实验。