向量数据库

系统选型的常见误区

进阶系统架构约 20 分钟kp-023

前置知识

一句话定义

向量库选型的错误大多不是"选了个慢的系统",而是决策框架错误:被营销叙事("必须专用库")、幸存者偏差("pgvector 永远够用")、跑分幻觉(拿论文数字外推自家负载)带偏——本篇逐条拆解七个高频误区并给出反驳判据。

为什么重要

选型错误的代价以"年"计:选重的团队为不存在的规模付运维税;选轻的团队在业务爆发后经历痛苦的迁库(换库=重嵌入评估+双写迁移+业务回归,常常一个季度起)。本篇与 kp-027 的决策树互为表里:误区告诉你"别怎么想",决策树告诉你"该怎么想"。

前置知识

kp-018(谱系地图——误区都发生在谱系误判上)。

核心概念

原理与机制

七大误区逐条拆解(误区 → 真相 → 判据):

  1. "上向量库必须用专用向量数据库"
  2. 真相:谱系各有所长(kp-018),十万级数据 + 已有 PostgreSQL 的场景,pgvector 的总成本几乎必胜。判据:先算"运维税 + 团队学习成本",再比性能。

  3. "pgvector 永远够用,专用库是营销"
  4. 真相:亿级 + 高 QPS + 复杂低选择率过滤 + 高频写入的组合,专用库的 filterable HNSW、分布式、段式写删有真实优势。判据:把规模、QPS、过滤选择率、写入速率四个数摆上桌再下结论。

  5. "向量库 = FAISS,自己包一层就行"
  6. 真相:包 FAISS 要自造持久化、增量更新、过滤、副本、监控——每一样都是 kp-022 级别的工程量。判据:列出你需要的数据系统能力清单,缺项超过两个就别自建。

  7. "托管比自己运维贵,所以自建"
  8. 真相:托管费里含了高可用、备份、升级与 on-call;自建省的是钱,付的是工程时间与故障风险。判据:按团队规模估算每月运维人时再比较。

  9. "论文跑分最高的就是最好的"
  10. 真相:SIFT1B 无过滤静态库上的冠军,未必在你的"5000 万带权限过滤+分钟级更新"场景可用。判据:只信 kp-025 的自建评测,跑分仅用于初筛。

  11. "只测查询,不测写入"
  12. 真相:选型后第一个撞墙的常是导入时长与更新积压(kp-022)。判据:评测必须包含批量导入速率、upsert 延迟、合并窗口影响。

  13. "选型是纯技术问题"
  14. 真相:团队熟悉度、云厂商绑定、社区健康度、许可协议同样决定成败。判据:给非技术因素留正式打分项。

伦理与合规注记:向量数据同样受数据驻留与隐私约束——嵌入可被反推(尤其对低维/微调过的模型),跨境同步向量库前应评估合规义务;选型清单里应有"数据驻留与加密"一项。

公式或模型

总拥有成本的粗账(选型真正的算式):

TCO(年) ≈ 资源费(计算+存储+副本) + 运维人力(人月×月薪) + 迁移风险折价
"更快的系统"只有在 TCO 口径下才有意义

图示

决策红绿灯:
 绿(直接用pgvector/嵌入式): <1000万条, 无低选择率过滤, 团队有PG/无运维
 黄(上专用单机, 认真评测):   1000万~1亿, 或过滤复杂, 或QPS高
 红(分布式/托管, 架构评审):  >1亿, 多租户强隔离, 高可用硬要求
 拿不准 = 黄灯, 用 kp-025 评测说话

实例或案例

两个真实形态的反例:某 20 人团队在 30 万条 FAQ 场景上了分布式专用库 + K8s 全家桶,半年内 40% 工时花在运维,回迁 pgvector 后故障率反降;另一团队用 FAISS 自研"向量服务",在需要权限过滤时手写位图过滤,三个月后过滤需求复杂化,重写为 Qdrant——两次浪费都源于误区 1/3 的决策框架,而非技术本身。

直观类比

选型误区像"买健身房年卡":营销说"专业器械才能练好"(误区 1),但多数人的瓶颈是坚持(运维/数据基础),家用哑铃(pgvector)完成度更高;而真要备战比赛(亿级+硬 SLA),专业场馆(专用库/托管)确有必要——按训练目标买卡,不按广告买。

常见误区(本篇主题,补充元层面两条)

  1. "选型一次定终身"——容量与负载会变,好的选型要写明"何时重新评估"的触发条件(数据量/QPS/延迟预算阈值)。
  2. "新技术先上核心业务"——新引擎先接旁路流量(影子查询对比),稳定一个季度再切主路。

自测题

  1. 用一句话反驳"必须上专用向量库"。
  2. 答:专用库的优势区间是大规模+高负载+复杂过滤的组合;在其区间之外,运维税与迁移成本使总拥有成本反超 pgvector/嵌入式方案。

  3. 为什么第三方跑分不能作为最终依据?
  4. 答:其数据分布、维度、过滤模式、硬件与你的负载不同构,数字不可迁移;它只能用来缩小候选集,结论必须出自自建评测。

  5. 选型评审中应给非技术因素留哪些正式条目?
  6. 答:团队熟悉度、社区与商业支持健康度、云厂商与许可绑定、数据驻留与合规——每项独立打分,防止"纯性能叙事"垄断决策。

与其他知识点的关系

kp-018 提供谱系事实、本篇提供决策纪律、kp-027 提供可执行决策树;kp-025 的评测是终结一切争论的裁判。

延伸阅读

本节不适用:本篇为决策方法论汇编,无单一经典文献对应;谱系事实依据见 kp-018 延伸阅读。

相关知识点