术语表
60 个术语,来自 knowledge-base/99-术语表.md。
基础与度量
- 嵌入(embedding)
- 模型把对象编码成的定长高维向量,语义相近则距离近。
- 语义空间
- 嵌入向量张成的空间,"距离"被训练为"语义差异"的代理。
- 维度(dimension)
- 向量长度;同库内必须一致,且直接乘进内存账。
- 欧氏距离(L2)
- 两点直线距离,受模长影响,越小越相似。
- 内积(IP, inner product)
- 对应维相乘求和,同时编码方向与模长。
- 余弦相似度(cosine)
- 向量夹角余弦,只看方向,值域 [-1,1]。
- L2 归一化
- 向量除以自身模长变为单位向量;归一化后 L2/内积/余弦排序等价。
- 对比学习(contrastive learning)
- 拉近正样本对、推远负样本的训练范式,嵌入空间结构的来源。
- Matryoshka 表示
- 向量前缀可独立使用的训练范式,支持无损截断降维。
ANN 与索引
- ANN(近似最近邻)
- 以可控召回损失换取查询加速的检索问题定义。
- 召回率 recall@k
- ANN 返回 top-k 与真实 top-k 的重合比例。
- ground truth
- 由精确(暴力)检索算出的标准答案集,一切评估的裁判。
- Flat / 暴力检索
- 全库逐一计算距离的精确检索,O(N·d),召回 100%。
- IVF(倒排文件索引)
- k-means 分区 + 倒排表的分区剪枝索引。
- nlist
- IVF 分区(质心)数,建库时确定。
- nprobe
- IVF 查询时探查的分区数,在线召回-延迟旋钮。
- NSW / HNSW
- 可导航小世界图及其分层版,当前低延迟检索的事实标准。
- M
- HNSW 每节点邻居数,内存与召回的核心建库参数。
- efConstruction
- HNSW 建库时候选队列长度,决定图质量与建库耗时。
- efSearch
- HNSW 查询时候选队列长度,在线召回旋钮,须 ≥ k。
- 启发式选边
- HNSW 建边时保留方向互相远离的邻居,防止图局部成簇。
- Annoy
- 随机投影森林树形索引,静态只读、多进程 mmap 共享见长。
- Vamana
- DiskANN 使用的单层近邻图,α 参数控制长边保留。
- DiskANN
- 内存放压缩向量与图、SSD 放原始向量的磁盘优先检索架构。
量化与压缩
- 标量量化(SQ)
- 逐维独立降比特(fp16/int8),压缩温和、失真小。
- affine 量化
- 以 min/max 与 scale/zero-point 的线性映射量化。
- 乘积量化(PQ)
- 向量切段、每段 256 码字小码本,整向量压至 m 字节。
- 码本(codebook)
- 子空间内 256 个质心的查找表。
- ADC(非对称距离计算)
- 查询浮点、库向量码字,查表求和的近似距离。
- OPQ
- 在 PQ 前学正交旋转让子空间方差均衡,降低量化误差。
- 残差量化管线
- 低精度粗排 + 高精度精排的组合,量化标准用法。
- 二进制量化
- 每维 1 bit,汉明距离 popcount 计算,32 倍压缩。
- RaBitQ
- 带缩放因子与理论误差界的 1-bit 量化方法。
- 汉明距离(Hamming distance)
- 二进制串异位个数,popcount 可单指令批量算。
检索质量与过滤
- 标量过滤
- 相似度检索之上的结构化条件过滤(租户/类目/时间)。
- pre-filter / post-filter
- 先筛集再检索 / 先检索再过滤的两种执行顺序。
- filterable HNSW
- 图遍历中实时检查条件并动态调 ef 的过滤感知索引。
- 选择率(selectivity)
- 满足过滤条件的向量占比,决定过滤执行策略。
- 稀疏向量
- 词表维度、非零极少的向量表示(TF-IDF/BM25/SPLADE)。
- BM25
- 带词频饱和与长度归一的概率化词法打分,强基线。
- SPLADE
- 学习型稀疏模型,用 MLM 权重(含扩展词)表示文档与查询。
- 混合检索(hybrid search)
- 稠密 + 稀疏/BM25 多路并行召回。
- RRF(倒数排名融合)
- 按排名倒数累加的多路融合,免归一化,k 常取 60。
- rerank(重排)
- 用 cross-encoder 等模型对召回 top-N 精排。
- late interaction
- token 级向量在打分阶段交互(MaxSim),ColBERT 类方法。
- MaxSim
- 查询每 token 与文档 token 向量最大相似度之和的打分函数。
系统与运维
- segment(段)
- 向量的物理组织单元;分 growing(增量无索引)与 sealed(封存有索引)。
- tombstone(墓碑)
- 删除标记位图;查询过滤,物理回收靠合并。
- upsert
- 存在则更新;实现为新版本写入 + 旧版本打墓碑。
- compaction(段合并)
- 重写段以物理清除墓碑与旧版本。
- 可见性(visibility)
- 写入成功到可被检索的延迟,由一致性级别与 flush 决定。
- 一致性级别
- 从 Strong 到 Eventually 的可见性语义档位。
- log as data(日志即数据)
- 写入唯一落消息队列、下游异步消费的云原生架构。
- 分片(sharding)
- 数据横向切分到多节点,分片键决定查询路由。
- 副本(replica)
- 分片完整拷贝,读扩展与高可用,成本与写放大随之翻倍。
- scatter-gather
- 无路由键查询广播全部分片再归并 top-k 的执行模式。
- 再平衡(resharding)
- 扩容/去倾斜时搬移分片,代价高,规划时应推迟。
- 金标准集(golden set)
- 固定查询 + 预算 GT 的评测集,监控静默劣化的探针。
- QPS
- 每秒查询数;须绑定延迟约束(p99 达标下)才有意义。
- p99 延迟
- 99% 请求快于该值;长尾由合并、IO、GC 等造成,事故发生地。