AI Search
AI Search 将检索、重排和生成式回答结合,并向用户展示可核验来源。它的由来是:传统关键词搜索只返回文档列表,用户仍需自行阅读和比对;大模型虽能直接组织答案,却容易脱离语料凭空生成。二者结合的思路最早以检索增强生成 (Retrieval-Augmented Generation, RAG) 的形式,在 2020 年由 Lewis 等人系统提出,AI Search 可看作面向「可追溯答案」的 RAG 产品化形态。它先用检索系统从语料中召回候选,再让模型基于证据组织答案,核心是「答案可追溯」,用户能点回原文核实。原始论文见 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks。
快速开始¶
先建立检索质量基线,再生成带引用答案;无充分证据时应明确说明而不是补全。起步顺序如下:
- 先做检索:把文档切块、向量化并建立索引,用查询召回候选片段。检索质量是上限,检索不到的内容模型无法可靠回答。
- 再做重排与选择:用重排器或规则从候选中挑出与问题最相关的片段,控制送入模型的数量和长度,兼顾成本与上下文占用。
- 最后生成:把选中的片段作为上下文交给模型,要求回答标注来源;上下文不足时要求模型明确说「没有找到足够证据」,而不是编造。
检索的核心是给查询与候选片段打分。以向量检索为例,查询向量 \(q\) 与片段向量 \(d\) 的相关性常用余弦相似度度量:
向量化通常由 embedding 模型完成,索引阶段离线计算并存储所有片段的向量,查询阶段只需计算一次查询向量再与索引做近似最近邻 (Approximate Nearest Neighbor, ANN) 检索。重排阶段可用交叉编码器 (Cross-Encoder) 对「查询 + 候选」联合打分,精度更高但更慢,因此通常只对 top-k 候选做。
评测不能只看生成文本是否通顺。先独立评测召回率与命中率,确认检索本身合格,再评测端到端的引用正确性与答案帮助度,否则生成环节会把检索缺陷掩盖掉。
案例¶
企业搜索按权限过滤后检索,回答附文档版本和段落链接。评测同时看召回、引用正确性和答案帮助度。例如员工问「本季度报销政策是否调整」,系统先按该员工的部门与权限过滤可见文档,再在这些文档中检索并重排。
生成答案时,每个关键论断都附上文档版本和段落链接,用户可以点开核对原文。若检索到的都是旧版本政策,或证据相互矛盾,系统应说明「依据当前可见文档无法确认」,而不是给出一个看似确定的结论。
评测时把三类指标分开记录。检索阶段常用 Recall@k 与 Precision@k:
Recall@k 衡量「该找到的有没有找到」,Precision@k 衡量「找到的是不是相关」。生成阶段则看答案中的引用是否真的支持其论断(引用正确性),以及用户能否据此完成任务(帮助度)。这三者分别定位检索、生成与整体体验的问题。检索增强的完整链路见 RAG,评测时可结合 模型能力评测 设计独立测试集。