她差一点为并不存在的问题买一套系统
叶澜是一名独立产品研究顾问。她整理好 164 份研究资料后,准备购买一套向量知识库。她真正想解决的,是自己经常找不到资料里的旧称、相似概念和跨文件证据。可当她把最近两个月卡住的任务逐条摊开,才发现有些问题只是版本没标清,有些是编号没被正确识别,还有些资料里本来就没有答案。
如果这些问题全都被统称为“搜索不够智能”,向量检索会接过一堆不属于它的责任。叶澜先冻结 40 个真实问题,让五条路线在同一批资料上返回可核验的证据:
| 路线 | 最擅长的问题 | 证据门通过题数 | 主要失败 |
|---|---|---|---|
| 全文搜索 | 产品编号、姓名、日期、原句 | 31/40 | 同义表达召回不足 |
| 结构化目录 | 已知主题、项目、版本 | 30/40 | 跨主题探索较慢 |
| 长上下文 | 6—10 份指定材料的整体比较 | 33/40 | 放入过多文件后漏读 |
| 向量检索 | 概念相似、措辞不同的问题 | 32/40 | 精确编号和版本混淆 |
| 全文 + 向量 + 元数据过滤 | 混合问题 | 37/40 | 建设和维护成本最高 |
她最终没有把全部问题交给 RAG:默认使用目录和全文搜索;明确选定少量文件时使用长上下文;只有 11 类概念问题进入混合检索。本文是教学案例,人物、资料和结果用于解释选择方法,不代表通用产品基准。
“证据门通过”不是答案看起来对。全文、向量和混合路线要求金标准证据进入前 5;目录路线要求前 5 个记录含目标文件;长上下文要求预先装配的材料包含全部必要证据。五条路线还必须引用可打开、版本正确、权限无越界,并在无答案时停止。接口不同,因此这里比较的是同一任务有没有获得合格证据,不把分数解释为算法排行榜。
164 份资料先按问题需要盘点,不把文件数当成知识量
164 份资料由 42 份研究报告、56 份访谈转写、29 份决策记录、21 份实验记录和 16 份术语或项目说明组成。叶澜沿用 O08 的文件记录编号、作品编号、版本、日期和权限,不让检索系统重新发明一套身份。
| 资料类型 | 数量 | 常见问题 | 检索必须保留 |
|---|---|---|---|
| 研究报告 | 42 | 结论与限制条件跨章节 | 版本、章节、引用来源 |
| 访谈转写 | 56 | 同义表达多、反证分散 | 发言人、时间戳、项目 |
| 决策记录 | 29 | 当前决定与旧理由冲突 | 决定时间、状态、取代关系 |
| 实验记录 | 21 | 指标、样本、时间窗不可拆 | 指标、单元、群组、日期 |
| 术语与项目说明 | 16 | 旧称、新称和精确编号 | 别名、生效时间、项目编号 |
| 合计 | 164 | 文件数不是片段数 | 全部能回到源记录 |
她还做问题—证据地图:每个真实问题标出期望 记录、允许替代证据、必须出现的反证、无权资料和“资料库没有答案”的边界。这一步在建设任何新索引前完成,否则系统产出的结果会反过来定义什么叫正确。
先分清“找文件、找片段、根据证据回答”
RAG 通常包含检索和生成两步,但很多个人需求只需要前一步。叶澜把目标拆开:
| 目标 | 合格结果 | 是否需要生成 |
|---|---|---|
| 找到最新版报告 | 返回唯一文件与版本 | 不需要 |
| 找到提及某编号的段落 | 返回原文与页码 | 不需要 |
| 比较三份指定报告 | 阅读完整材料后列差异 | 需要 |
| 回答“用户为什么放弃试用” | 检索多种措辞的证据并归纳 | 需要 |
如果只想找文件,先把搜索做好;过早加生成层会把“没有找到”变成一段听起来合理的答案。
先记录现有办法怎样失败,才知道该升级哪一段
叶澜先用原来的网盘搜索、目录和人工阅读完成 40 题,不使用向量或自动生成。每题记录找文件、核版本、读证据和写答案四段时间。40 题中 27 题能在 20 分钟内完成,13 题超过 20 分钟;并非每个慢题都需要向量检索。
| 慢或错的原因 | 题数 | 正确改进层 |
|---|---|---|
| 不知道当前版本 | 4 | 版本清单与目录 |
| 精确编号搜不到 | 2 | OCR、全文索引或术语表 |
| 同一概念有多种说法 | 5 | 同义词、向量或混合试点 |
| 需要通读多个指定文件 | 3 | 受控长上下文 |
| 证据本来不存在 | 2 | 无答案门禁,不是扩召回 |
这些原因会重叠,所以题数不是 13 的互斥拆分。例如一题既用了旧版,又有同义词问题。叶澜以“失败事件”而非“失败题数”排优先级:先修版本和权限硬门,再比较检索路线。若直接上向量库,版本问题只会以语义相似的方式更隐蔽地继续存在。
评估先看证据覆盖,再看排序、答案和硬门
她不只算一个“准确率”。每题可能有 1—4 条必要证据,因此先检查 证据覆盖;对有排名的路线再看首条相关证据的位置和前 5 精度;最后检查答案是否只使用已找回证据。版本、权限和无答案行为作为硬门,任何一项失败整题不通过。
| 层 | 指标 | 为什么需要 |
|---|---|---|
| 范围 | 合格集合 | 目标资料是否因错误权限或版本过滤被排除 |
| 召回 | 必要证据找回数 ÷ 必要证据数 | 防止只找到一条就宣布成功 |
| 排序 | 首条相关排名、前 5 相关数 | 衡量人工要翻多少噪声 |
| 生成 | 主张—证据支持率 | 区分“找到了但没用” |
| 引用 | 文件记录编号与页码可打开率 | 防止正确文字配错来源 |
| 硬门 | 越权、旧版当当前、无答案硬答 | 不能被其他题平均抵消 |
40 题的冻结答案由叶澜逐题确认,并保留第二位复核者对 10 题的独立判断。两人有 2 题对“相关证据”范围不同,回到研究问题重新写边界后再测试。没有稳定的金标准,调参数只是让系统更接近某次主观印象。
全文搜索适合精确词、编号和可解释匹配
全文搜索按实际文字匹配,对错误代码、合同号、产品名、日期和专门术语尤其有效。
| 问题 | 查询 | 为什么适合 |
|---|---|---|
| 哪份报告提到 PX-417? | “PX-417” | 编号必须精确一致 |
| 2026-04-18 谁提出延期? | 日期 + 延期 | 需要精确定位原文 |
| “批量导入”旧称出现在哪里? | 正式名 + 旧称 | 术语表可扩展查询 |
它的局限是用户问题与资料措辞不同。例如问题写“首次价值出现太晚”,原文写“完成第三次配置后才看到效果”,词面可能不重合。解决前先维护同义词和术语,不必立即向量化全部内容。
全文搜索也需要工程判断。PX-417 不能被分词器拆成 PX 与 417 后做宽松匹配;日期要统一 2026-04-18、2026/4/18 和“4 月 18 日”的规范值;OCR 可能把字母 O 识别为数字 0,应该标低置信候选并回到扫描页确认,不能悄悄改原文。
| 查询层 | 原查询 | 扩展或约束 | 失败检查 |
|---|---|---|---|
| 精确 ID | PX-417 | 关键词精确匹配,不做模糊替换 | PX-471 不得进入精确命中 |
| 术语别名 | 批量导入 | 加历史名 批量上传 | 结果显示命中哪个 别名 |
| 日期 | 2026 年 4 月 18 日 | 规范为 日期 字段并保留原词 | 不用文件修改时间代替内容日期 |
| 人名 | 陈宁 | 项目内 精确 + 角色 | 同名跨项目先过滤 |
| OCR 可疑词 | P0-417 | 同时提示可能为 PO-417 | 必须打开原页人工确认 |
她在 8 个精确题上保存 查询计划,而不是只存搜索框文字。这样更换搜索工具后仍能重放 精确、别名、过滤器 和日期规范化规则;全文搜索的优势来自可解释的词面匹配,不是“零配置”。
结构化目录适合边界清楚、维护者知道资料放在哪里
叶澜按项目、资料类型、内容日期和状态建立目录。一个问题若能先缩小到“项目 A / 访谈 / 2026Q2 / 当前”,目录和元数据过滤比全库相似度更可靠。
| 过滤字段 | 允许值 | 防止什么 |
|---|---|---|
| 项目编号 | P-014 | 混入其他客户 |
| 资料类型 | 访谈、报告、决策 | 把草稿当证据 |
| 状态 | 当前、已取代、归档 | 返回旧版 |
| 生效时间 | 日期 | 用过期政策回答当前问题 |
| 敏感性 | 公开、内部、受限 | 越权检索 |
目录不擅长发现维护者未预想到的跨主题联系,但它提供检索前最重要的范围控制。向量搜索也应先应用权限和版本过滤,而不是召回后再删除不该看的内容。
每次过滤都生成范围确认:调用者是谁、查询哪个项目、允许什么敏感级别、问题所指日期是什么、纳入和排除了多少记录。比如 P-014 共有 38 条记录,限定当前版后剩 24,按 2026Q2 剩 17,再按内部权限剩 15;后续全文或向量只在这 15 条及其派生片段中工作。
| 范围 阶段 | 候选数 | 排除理由 |
|---|---|---|
| 项目编号为 P-014 | 38 | 其他项目不进入候选 |
| 状态=当前 | 24 | 14 条 已取代 / 归档 |
| 时期=2026Q2 | 17 | 7 条不在问题时间窗 |
| 呼叫方=叶澜 | 15 | 2 条客户 受限 |
| 解析状态为通过 | 14 | 1 条表格解析待复核 |
若目标证据在某一层消失,评估记录能定位是过滤错而不是召回差。目录字段缺失时默认排除并提示“元数据缺失”;为了提高召回把未知权限或未知版本当成可用,会让后面的任何算法比较失去意义。
长上下文适合少量已选材料的整体关系
当叶澜明确知道要比较哪 8 份访谈时,直接提供完整材料能保留段落顺序、访谈身份和前后限定,比把每份切成孤立片段更自然。
她设置三项上限:只放与任务直接相关的文件;在开头列出文件 ID 和问题;输出必须引用文件与页码。40 题中的 8 个跨文件比较题都使用不超过 10 份指定材料,长上下文 8/8 找到必要证据;把 37 份文件全部加入后,同一题反而漏掉两份关键材料。
容量足够不等于注意力没有成本。若材料需要频繁更新、权限不同或问题每次跨越不同子集,手工装载会逐渐失去可维护性。
长上下文也要有装配清单
“6—10 份”只是案例范围,不是通用文件上限。叶澜按实际解析后的 令牌、结构完整性和问题需要决定装载,并为每次任务生成 上下文清单。页眉页脚、重复目录和被替代附件先排除,但完整定义、限制条件和反证不能为省空间删除。
| 清单字段 | 示例 | 检查 |
|---|---|---|
| 问题编号 | Q-COMPARE-06 | 与评估题对应 |
| 已选记录 | REC-18、REC-31…共 8 份 | 每份说明选择理由 |
| 已排除记录 | REC-12 已废止 | 排除有状态依据 |
| 预计令牌数 | 78,400 | 低于本次模型与输出预算 |
| 必要证据 | EV-06A、06B、06C | 三条都必须被回答使用或解释 |
| 订购 | 术语→报告→访谈→反证 | 不按文件名随机拼接 |
| 输出预留 | 8,000 | 不让输入挤掉完整输出 |
她做一项“丢一份”敏感性检查:先用 8 份材料回答,再逐次去掉每份,观察结论和引用是否变化。若删除一份本不相关文件就大幅改变结论,说明任务受顺序或噪声影响;若删除关键反证却答案不变,说明生成层没有真正使用材料。长上下文免去了检索切片,却没有免除输入选择和证据验收。
向量检索适合概念相似,但不能替代编号和过滤
向量把文本转换为可比较的数值表示,能找到措辞不同但语义相近的片段。叶澜在“为什么用户没有完成首次配置”一题中找到了“设置步骤过多”“缺少示例数据”“邀请同事后才能继续”等不同表达。
它也出现两个危险失败:把 PX-417 与 PX-471 的记录排得很近;把 2024 年旧功能说明放在 2026 年当前说明之前。因此向量结果仍需要精确搜索和元数据过滤。
| 查询类型 | 全文 | 向量 | 推荐 |
|---|---|---|---|
| 唯一编号 | 强 | 弱 | 全文 |
| 同义概念 | 中 | 强 | 向量或混合 |
| 日期和版本 | 强 | 弱 | 过滤 + 全文 |
| 探索性主题 | 中 | 强 | 向量后人工查看证据 |
向量索引是可重建的派生流水线
164 份记录经格式解析、结构分段和上下文补充后形成 1,486 个片段。每个片段保存来源记录编号、页码或时间戳、版本、权限、内容日期、文本摘要校验值、分段器版本和嵌入模型版本。向量只是片段的派生表示,不能脱离原文单独成为证据。
| 流水线阶段 | 输入 | 产物 | 失败处置 |
|---|---|---|---|
| 解析 | 通过治理门的记录 | 保留结构的文本 | 页码或表格丢失则隔离 |
| 分段 | 文本与标题层级 | 1,486 个可定位片段 | 跨主题或断句则改规则重建 |
| 情境化 | 片段与文档摘要 | 简短来源上下文 | 不增加源文没有的事实 |
| 嵌入 | 片段文本 + 上下文 | 向量与模型版本 | 不与其他模型向量混用 |
| 索引 | 文本、向量、过滤字段 | 快照重处理 v1 | 数量和权限对账不平则不发布 |
| 退役 | 已取代或撤权记录 | 停用标记与删除事件 | 搜索、向量、缓存同步撤下 |
她从 1,486 个片段中抽 75 个,占 5.0%,检查源定位、数字、否定词和权限;发现 3 个跨页表格被拆坏、2 个决策记录丢失状态。修正规则后重建对应内容类型,不只手改 5 条结果。新索引以“重处理 v2”影子运行,40 题通过后再切换别名;旧快照只用于短期回退,但权限已撤回内容不能因回退重新出现。
混合检索为什么更强,也为什么不一定先做
混合检索同时运行关键词与向量查询,再合并排序。它能让精确编号与概念相似各自发挥作用,但需要额外维护分段、嵌入、过滤、排序、更新和评估。
| 成本 | 具体工作 |
|---|---|
| 建库 | 解析文件、切片、生成向量、写元数据 |
| 更新 | 文件替换后删除旧片段并重建 |
| 质量 | 维护问题集,检查召回和排序 |
| 安全 | 权限变化同步到每个片段 |
| 运行 | 检索、重排和生成的延迟与费用 |
个人资料只有一两百份、问题边界清楚时,这些成本可能大于收益。叶澜只为全文明显失败且每月重复的 11 类概念问题启用混合路线。
混合不是把两组分数直接相加
全文与向量的原始分数不在同一尺度,不能简单相加。案例用基于排名的融合生成候选列表,再保留“精确命中、向量命中、命中词”等诊断字段。精确编号若只由向量路线召回,会触发警告;同义概念若全文与向量都没有金标准证据,则继续调融合权重也无意义。
| 诊断情形 | 观察 | 正确动作 |
|---|---|---|
| 全文第 1、向量未召回 | 产品编号精确命中 | 保留全文贡献,不降权给平均 |
| 全文未召回、向量第 2 | 不同措辞表达同一障碍 | 人工确认后保留概念命中 |
| 两路都召回同一片段 | 重复候选 | 合并但保留两路来源 |
| 两路召回不同版本 | 当前版与已取代版冲突 | 先按元数据硬过滤 |
| 顶部 10 全是同一访谈 | 单一来源挤占证据 | 限制每份记录的片段数并保留多样性 |
| 相关证据排第 12 | 候选池有、展示层没有 | 调整重排或展示数量,而非重新分段 |
她为 Q-027 保存全文前 20、向量前 20、融合前 10 和重排后前 5。这样失败时可以判断是过滤错误、单路未召回、融合淹没、重排误判,还是生成忽略。若只保存最终五条,任何改进都会退化成凭感觉调参数。
分段错误会让正确文件变成错误证据
她没有按固定字符数盲切,而是保留标题、项目、日期和说话人:
| 内容 | 分段边界 | 必带上下文 |
|---|---|---|
| 访谈 | 一个问答或完整主题段 | 访谈编号、角色、日期、问题 |
| 报告 | 标题下的完整论证 | 报告编号、版本、章节 |
| 决策记录 | 一项决定及理由 | 项目、决定日期、状态 |
| 表格 | 表头加一组相关行 | 单位、字段定义、来源 |
“增长 18%”若离开公司、指标和时间就没有意义。分段后每个片段必须仍能回答它来自哪里、在说谁、何时有效。
她用一份 14 页实验报告做切片回归。固定 800 字切法把第 6 页表头留在 CH-44、数据行留在 CH-45、限制条件留在 CH-46;搜索“留存增长”只返回 18%,却漏掉“样本 42 人、仅新注册桌面端、观察 7 天”。结构切法把标题、指标定义、表头、相关数据行和紧随其后的限制合为一个逻辑片段,超过上限时允许带少量重叠,但每个事实只引用一个主片段。
| 分段验收 | 通过条件 | 本例失败 |
|---|---|---|
| 来源定位 | 打开同一页或表格 | CH-45 无表头位置 |
| 事实完整 | 数值、单位、分母、时间窗同在 | 18% 离开 42 人与 7 天 |
| 否定与限制 | “仅、未、除外”不被切走 | 桌面端限制在下一片 |
| 说话人完整 | 问题、回答和发言人同在 | 两位受访者被拼成一段 |
| 去重 | 重叠只用于召回,不重复计证据 | 相邻片段被当两名用户 |
她为报告、访谈、决策和表格各选 5 份,共 20 份做分段回归。规则改变后对同类型全部重建,并比较片段数量、平均长度、孤立标题、无来源数字和金标准证据的可召回性。片段越小不必然越准,越大也不必然更完整;边界应服从内容结构和评估结果。
40 个问题怎样组成检索评估集
| 类型 | 数量 | 期望结果 |
|---|---|---|
| 精确编号与日期 | 8 | 指定文件和原文 |
| 同义概念 | 10 | 多个相关证据 |
| 跨文件比较 | 8 | 指定正反材料 |
| 版本冲突 | 6 | 当前版优先并说明旧版 |
| 权限边界 | 4 | 不返回受限文件 |
| 无答案 | 4 | 明确没有足够资料 |
每题保存相关文件记录编号、关键片段、允许范围和答案边界。先评估前 5 结果里有没有正确证据,再评估生成答案;否则无法区分检索错与总结错。
把总分拆回六类问题
总数 31、30、33、32、37 容易制造“混合检索全面更好”的错觉。叶澜把每题证据门结果按类型展开;表中每格是通过题数,行末分母是该类型题数:
| 问题类型 | 全文 | 目录 | 长上下文 | 向量 | 混合 |
|---|---|---|---|---|---|
| 精确编号与日期(8) | 8 | 6 | 7 | 4 | 8 |
| 同义概念(10) | 5 | 4 | 8 | 10 | 9 |
| 跨文件比较(8) | 5 | 7 | 8 | 7 | 8 |
| 版本冲突(6) | 6 | 6 | 4 | 4 | 5 |
| 权限边界(4) | 4 | 4 | 3 | 4 | 4 |
| 无答案(4) | 3 | 3 | 3 | 3 | 3 |
| 合计(40) | 31 | 30 | 33 | 32 | 37 |
混合路线仍漏 1 个同义概念、1 个版本冲突和 1 个无答案题。目录在版本题 6/6,不代表目录更“智能”,而是 当前 状态已经明确;向量在概念题 10/10,也不代表答案全部正确,它只说明金标准证据进入工作集。长上下文权限题只有 3/4,是装配者误选了一份受限访谈,证明手工选择也要权限预检。
40 题只能支持案例内决策,不能稳定估计产品总体差异。37/40 与 33/40 相差 4 题,换一组问题可能改变顺序;因此叶澜不把这张表写成市场 基准,也不依据一个总分淘汰简单路线。它的价值是暴露“哪类问题、哪一阶段、以什么代价失败”。
完整走一题:先过滤,再混合,再核验证据
问题是“试用用户在哪一步最容易放弃,原因是什么?”
- 过滤到 P-014、2026Q2、当前、允许内部研究的资料;
- 全文查询“放弃、未完成、退出、卡住”;
- 向量查询同一问题,召回措辞不同片段;
- 合并去重后查看前 10 条;
- 删除没有步骤位置或来自旧版的片段;
- 只根据 7 条有效证据归纳,并写“18 份访谈中的 6 份”,不外推全部用户。
合格输出同时列出首次数据导入 3 份、权限邀请 2 份、配置术语不理解 1 份,并保留另外 12 份未提及放弃原因。检索找到相似证据,不等于可以计算总体比例或因果关系。
她不直接从 7 个命中片段写一段流畅结论,而是先建立主张账本:
| 主张编号 | 可写主张 | 证据 | 不能写成 |
|---|---|---|---|
| C-01 | 18 份访谈中 3 份提及首次数据导入受阻 | INT-03、08、14 的原话与时间戳 | “导入是最大流失原因” |
| C-02 | 2 份提及邀请权限让流程中断 | INT-05、11 | “大多数用户需要管理员” |
| C-03 | 1 份不理解配置术语 | INT-17 | “术语普遍难懂” |
| C-04 | 12 份没有出现明确放弃原因 | 访谈覆盖清单 | “其余用户都顺利完成” |
| C-05 | 放弃发生率与因果影响 | 当前证据不足 | 不得生成百分比或因果结论 |
7 条有效片段来自 6 份访谈:其中一名受访者在两个位置提到导入,只能按一个访谈编号计数。最终答案附证据编号、未覆盖范围和下一步需要的行为日志。若检索层把相似原话找得很全,生成层却把“提及”改成“导致”,整题仍判失败。
试点必须保存检索证据,并为错误召回设置停止条件
叶澜为每次回答保存两层记录。检索层记录查询、过滤、索引版本、返回的片段 ID 和排名;生成层记录实际采用的片段、答案、引用和人工修订。只保存最后答案,下一次无法知道是正确证据没被找回,还是模型忽略了已经找回的证据。
| 字段 | 示例 | 诊断用途 |
|---|---|---|
| 查询编号 | Q-027 | 关联评估问题 |
| 检索方式 | 混合 v1 | 识别全文、向量或混合配置 |
| 过滤器 | P-014 / 当前 / 内部 | 检查范围和权限 |
| 索引快照 | 2026-07-20 | 复现当时资料状态 |
| 前列结果 | CH-184、CH-201… | 检查相关证据排名 |
| 已用证据 | CH-184、CH-233 | 区分召回与生成失败 |
| 答案状态 | 已支持 | 已支持、不足、已阻塞 |
| 人工修改 | 删除旧版结论 | 形成新回归样本 |
她为首批 20 次真实使用规定停止条件:出现一条其他客户受限片段立即关闭索引并调查;连续两次把 已取代 版本写成当前事实,暂停生成只保留搜索;引用无法打开原文或页码不一致时,不发布答案;无答案问题被系统强行回答两次,回退到只显示检索结果;人工核验中位数超过原人工搜索时间,则停止扩大范围。
| 运行结果 | 次数 | 处理 |
|---|---|---|
| 正确证据且答案受支持 | 15 | 保留配置 |
| 证据找到但答案遗漏限制 | 2 | 修改生成规则并加入回归集 |
| 正确证据未进前 5 | 2 | 调整同义词和混合权重 |
| 资料库本身无答案 | 1 | 正确返回 不足 |
调整后必须重跑 40 个冻结问题,而不只重跑失败项。权限、版本和无答案行为是硬门槛,不能用其他题目的高召回率平均掉。
知识库更新也要触发明确动作。新增文件先继承 O08 的 record_id、版本和权限;替换 当前 时同时撤下旧片段;删除授权要清理全文索引、向量、缓存和已生成摘要;更换嵌入模型或分段规则则建立新索引快照,不能与旧向量混用。叶澜每月记录新增文件数、重建片段数、过期内容命中、权限撤回完成时间和 40 题回归结果。若没有人持续完成这些动作,向量库会比普通文件夹更难发现旧数据,因为相似结果看不出原文件已经失效。维护成本必须进入“是否需要 RAG”的决定,而不能只计算第一次建库时间。
她把五条路线的成本按“已有基础上的增量”记录,避免把本来就需要的文件治理算成向量方案的额外投入,也避免忽略每次人工装配长上下文的时间:
| 路线 | 首次增量投入 | 每月维护 | 每题人工核验中位数 | 适用范围 |
|---|---|---|---|---|
| 目录 + 全文 | 4.0 小时 | 0.8 小时 | 12 分钟 | 默认处理精确、版本和已知范围问题 |
| 长上下文清单 | 1.5 小时 | 0.5 小时 | 16 分钟 | 8 份左右已指定材料的比较 |
| 向量试点 | 13.0 小时 | 1.5 小时 | 10 分钟 | 概念措辞不同的问题 |
| 混合与证据日志 | 18.0 小时 | 1.8 小时 | 9 分钟 | 11 类每月重复问题 |
这 11 类问题每月合计约 28 次查询;原目录与全文路线在这些题上平均核验 17 分钟,混合路线为 9 分钟,每月节省 28×8=224 分钟,即 3.73 小时。扣除 1.8 小时增量维护,净节省 1.93 小时,18÷1.93≈9.3 个月才回收首次投入。若实际只有每月 8 次查询,节省 64 分钟还小于维护,混合路线不具备时间收益。
这个回收期只是案例内估算,不含采购、隐私审查和服务中断,也没有给避免越权定价。叶澜把是否继续写成 决策记录:使用量连续两个月低于 15 次、40 题硬门失败或维护超过 3 小时时,缩回全文结果页;连续三个月确有重复概念题并保持硬门通过,才扩大向量覆盖范围。
决策树:从最简单方案开始升级
知道文件或精确词?→ 全文搜索。
知道主题、项目或版本?→ 目录和元数据过滤。
材料少且已经选定,需要整体比较?→ 长上下文。
问题措辞与资料经常不同、概念检索重复出现?→ 向量检索试点。
既需要编号精确又需要概念召回?→ 混合检索。
无论哪条路线:先检查权限、版本、引用和无答案行为。
先用 20—40 个真实问题记录现有方法的失败,再决定升级。RAG 不是个人知识库的同义词;它只是从资料中检索片段并提供给生成模型的一种架构。对很多个人工作,清楚目录、可靠全文搜索和少量完整材料已经足够。只有重复失败能证明语义检索带来额外价值时,向量与混合检索才值得承担维护成本;而且必须保留随时退回文件与全文搜索的路径。检索索引也不能替代原文件和版本清单。
个人试点可以压缩成两周,但不能省掉对照和回退。叶澜没有先接聊天界面,而是先让五条路线对同一冻结输入输出证据记录:
| 时间 | 工作 | 放行证据 |
|---|---|---|
| 第 1—2 天 | 冻结 40 题、金标准、权限调用者和 164 份快照 | 每题的必要与禁止证据完整 |
| 第 3—4 天 | 跑目录与全文基线 | 查询计划、范围确认 可复现 |
| 第 5—6 天 | 为 8 个比较题做长上下文清单 | 删除任一关键材料会改变引用 |
| 第 7—9 天 | 建“重处理 v1”,抽查 75 个片段 | 来源、数字、否定词、权限通过 |
| 第 10—11 天 | 跑向量和混合影子测试 | 保留单路、融合与最终排名 |
| 第 12 天 | 人工核 40 题和三项硬门 | 权限 4/4、版本与无答案无严重失败 |
| 第 13 天 | 处理失败并全量回归 | 不是只重跑失败题 |
| 第 14 天 | 写 决策记录 | 选择、成本、限制、回退目标明确 |
试点不连接自动发送,也不替换原搜索入口。只有证据门和硬门都通过,才让混合路线对那 11 类重复问题开放;其余问题仍走更简单的路径。这样“升级”指增加一个有证据支持的分支,不是把所有工作一次迁入复杂系统。
来源与进一步阅读
以下资料核验于 2026-07-21,用于支持精确搜索、向量相似、混合检索、分段上下文和任务评估:
- Anthropic:Contextual Retrieval:比较关键词与向量检索,并强调片段需要保留来源上下文。
- Microsoft Learn:Hybrid search overview:说明全文与向量查询并行、合并排序,以及精确术语与概念相似的互补。
- Microsoft Learn:Vector search overview:说明向量、过滤和混合场景及其索引要求。