向量数据库

术语表

60 个术语,来自 knowledge-base/99-术语表.md。

基础与度量

嵌入(embedding)
模型把对象编码成的定长高维向量,语义相近则距离近。
语义空间
嵌入向量张成的空间,"距离"被训练为"语义差异"的代理。
维度(dimension)
向量长度;同库内必须一致,且直接乘进内存账。
欧氏距离(L2)
两点直线距离,受模长影响,越小越相似。
内积(IP, inner product)
对应维相乘求和,同时编码方向与模长。
余弦相似度(cosine)
向量夹角余弦,只看方向,值域 [-1,1]。
L2 归一化
向量除以自身模长变为单位向量;归一化后 L2/内积/余弦排序等价。
对比学习(contrastive learning)
拉近正样本对、推远负样本的训练范式,嵌入空间结构的来源。
Matryoshka 表示
向量前缀可独立使用的训练范式,支持无损截断降维。

ANN 与索引

ANN(近似最近邻)
以可控召回损失换取查询加速的检索问题定义。
召回率 recall@k
ANN 返回 top-k 与真实 top-k 的重合比例。
ground truth
由精确(暴力)检索算出的标准答案集,一切评估的裁判。
Flat / 暴力检索
全库逐一计算距离的精确检索,O(N·d),召回 100%。
IVF(倒排文件索引)
k-means 分区 + 倒排表的分区剪枝索引。
nlist
IVF 分区(质心)数,建库时确定。
nprobe
IVF 查询时探查的分区数,在线召回-延迟旋钮。
NSW / HNSW
可导航小世界图及其分层版,当前低延迟检索的事实标准。
M
HNSW 每节点邻居数,内存与召回的核心建库参数。
efConstruction
HNSW 建库时候选队列长度,决定图质量与建库耗时。
efSearch
HNSW 查询时候选队列长度,在线召回旋钮,须 ≥ k。
启发式选边
HNSW 建边时保留方向互相远离的邻居,防止图局部成簇。
Annoy
随机投影森林树形索引,静态只读、多进程 mmap 共享见长。
Vamana
DiskANN 使用的单层近邻图,α 参数控制长边保留。
DiskANN
内存放压缩向量与图、SSD 放原始向量的磁盘优先检索架构。

量化与压缩

标量量化(SQ)
逐维独立降比特(fp16/int8),压缩温和、失真小。
affine 量化
以 min/max 与 scale/zero-point 的线性映射量化。
乘积量化(PQ)
向量切段、每段 256 码字小码本,整向量压至 m 字节。
码本(codebook)
子空间内 256 个质心的查找表。
ADC(非对称距离计算)
查询浮点、库向量码字,查表求和的近似距离。
OPQ
在 PQ 前学正交旋转让子空间方差均衡,降低量化误差。
残差量化管线
低精度粗排 + 高精度精排的组合,量化标准用法。
二进制量化
每维 1 bit,汉明距离 popcount 计算,32 倍压缩。
RaBitQ
带缩放因子与理论误差界的 1-bit 量化方法。
汉明距离(Hamming distance)
二进制串异位个数,popcount 可单指令批量算。

检索质量与过滤

标量过滤
相似度检索之上的结构化条件过滤(租户/类目/时间)。
pre-filter / post-filter
先筛集再检索 / 先检索再过滤的两种执行顺序。
filterable HNSW
图遍历中实时检查条件并动态调 ef 的过滤感知索引。
选择率(selectivity)
满足过滤条件的向量占比,决定过滤执行策略。
稀疏向量
词表维度、非零极少的向量表示(TF-IDF/BM25/SPLADE)。
BM25
带词频饱和与长度归一的概率化词法打分,强基线。
SPLADE
学习型稀疏模型,用 MLM 权重(含扩展词)表示文档与查询。
混合检索(hybrid search)
稠密 + 稀疏/BM25 多路并行召回。
RRF(倒数排名融合)
按排名倒数累加的多路融合,免归一化,k 常取 60。
rerank(重排)
用 cross-encoder 等模型对召回 top-N 精排。
late interaction
token 级向量在打分阶段交互(MaxSim),ColBERT 类方法。
MaxSim
查询每 token 与文档 token 向量最大相似度之和的打分函数。

系统与运维

segment(段)
向量的物理组织单元;分 growing(增量无索引)与 sealed(封存有索引)。
tombstone(墓碑)
删除标记位图;查询过滤,物理回收靠合并。
upsert
存在则更新;实现为新版本写入 + 旧版本打墓碑。
compaction(段合并)
重写段以物理清除墓碑与旧版本。
可见性(visibility)
写入成功到可被检索的延迟,由一致性级别与 flush 决定。
一致性级别
从 Strong 到 Eventually 的可见性语义档位。
log as data(日志即数据)
写入唯一落消息队列、下游异步消费的云原生架构。
分片(sharding)
数据横向切分到多节点,分片键决定查询路由。
副本(replica)
分片完整拷贝,读扩展与高可用,成本与写放大随之翻倍。
scatter-gather
无路由键查询广播全部分片再归并 top-k 的执行模式。
再平衡(resharding)
扩容/去倾斜时搬移分片,代价高,规划时应推迟。
金标准集(golden set)
固定查询 + 预算 GT 的评测集,监控静默劣化的探针。
QPS
每秒查询数;须绑定延迟约束(p99 达标下)才有意义。
p99 延迟
99% 请求快于该值;长尾由合并、IO、GC 等造成,事故发生地。