她差一点为并不存在的问题买一套系统

叶澜是一名独立产品研究顾问。她整理好 164 份研究资料后,准备购买一套向量知识库。她真正想解决的,是自己经常找不到资料里的旧称、相似概念和跨文件证据。可当她把最近两个月卡住的任务逐条摊开,才发现有些问题只是版本没标清,有些是编号没被正确识别,还有些资料里本来就没有答案。

如果这些问题全都被统称为“搜索不够智能”,向量检索会接过一堆不属于它的责任。叶澜先冻结 40 个真实问题,让五条路线在同一批资料上返回可核验的证据:

路线 最擅长的问题 证据门通过题数 主要失败
全文搜索 产品编号、姓名、日期、原句 31/40 同义表达召回不足
结构化目录 已知主题、项目、版本 30/40 跨主题探索较慢
长上下文 6—10 份指定材料的整体比较 33/40 放入过多文件后漏读
向量检索 概念相似、措辞不同的问题 32/40 精确编号和版本混淆
全文 + 向量 + 元数据过滤 混合问题 37/40 建设和维护成本最高
40 个问题分别比较全文搜索、结构化目录、长上下文、向量检索和混合路线
40 个问题中,没有一种检索方式单独获胜。精确编号、已知目录、少量完整材料和概念相似问题需要不同路线;总分只能帮助定位问题,不能当成产品排行榜。

她最终没有把全部问题交给 RAG:默认使用目录和全文搜索;明确选定少量文件时使用长上下文;只有 11 类概念问题进入混合检索。本文是教学案例,人物、资料和结果用于解释选择方法,不代表通用产品基准。

“证据门通过”不是答案看起来对。全文、向量和混合路线要求金标准证据进入前 5;目录路线要求前 5 个记录含目标文件;长上下文要求预先装配的材料包含全部必要证据。五条路线还必须引用可打开、版本正确、权限无越界,并在无答案时停止。接口不同,因此这里比较的是同一任务有没有获得合格证据,不把分数解释为算法排行榜。

164 份资料先按问题需要盘点,不把文件数当成知识量

164 份资料由 42 份研究报告、56 份访谈转写、29 份决策记录、21 份实验记录和 16 份术语或项目说明组成。叶澜沿用 O08 的文件记录编号、作品编号、版本、日期和权限,不让检索系统重新发明一套身份。

资料类型 数量 常见问题 检索必须保留
研究报告 42 结论与限制条件跨章节 版本、章节、引用来源
访谈转写 56 同义表达多、反证分散 发言人、时间戳、项目
决策记录 29 当前决定与旧理由冲突 决定时间、状态、取代关系
实验记录 21 指标、样本、时间窗不可拆 指标、单元、群组、日期
术语与项目说明 16 旧称、新称和精确编号 别名、生效时间、项目编号
合计 164 文件数不是片段数 全部能回到源记录

她还做问题—证据地图:每个真实问题标出期望 记录、允许替代证据、必须出现的反证、无权资料和“资料库没有答案”的边界。这一步在建设任何新索引前完成,否则系统产出的结果会反过来定义什么叫正确。

先分清“找文件、找片段、根据证据回答”

RAG 通常包含检索和生成两步,但很多个人需求只需要前一步。叶澜把目标拆开:

目标 合格结果 是否需要生成
找到最新版报告 返回唯一文件与版本 不需要
找到提及某编号的段落 返回原文与页码 不需要
比较三份指定报告 阅读完整材料后列差异 需要
回答“用户为什么放弃试用” 检索多种措辞的证据并归纳 需要

如果只想找文件,先把搜索做好;过早加生成层会把“没有找到”变成一段听起来合理的答案。

先记录现有办法怎样失败,才知道该升级哪一段

叶澜先用原来的网盘搜索、目录和人工阅读完成 40 题,不使用向量或自动生成。每题记录找文件、核版本、读证据和写答案四段时间。40 题中 27 题能在 20 分钟内完成,13 题超过 20 分钟;并非每个慢题都需要向量检索。

慢或错的原因 题数 正确改进层
不知道当前版本 4 版本清单与目录
精确编号搜不到 2 OCR、全文索引或术语表
同一概念有多种说法 5 同义词、向量或混合试点
需要通读多个指定文件 3 受控长上下文
证据本来不存在 2 无答案门禁,不是扩召回
先记录现有办法怎样失败,才知道该升级哪一段:不知道当前版本、精确编号搜不到、同一概念有多种说法、需要通读多个指定文件
先记录现有办法怎样失败,才知道该升级哪一段。叶澜先用原来的网盘搜索、目录和人工阅读完成 40 题,不使用向量或自动生成。 叶澜先用原来的网盘搜索、目录和人工阅读完成 40 题,不使用向量或自动生成。

这些原因会重叠,所以题数不是 13 的互斥拆分。例如一题既用了旧版,又有同义词问题。叶澜以“失败事件”而非“失败题数”排优先级:先修版本和权限硬门,再比较检索路线。若直接上向量库,版本问题只会以语义相似的方式更隐蔽地继续存在。

评估先看证据覆盖,再看排序、答案和硬门

她不只算一个“准确率”。每题可能有 1—4 条必要证据,因此先检查 证据覆盖;对有排名的路线再看首条相关证据的位置和前 5 精度;最后检查答案是否只使用已找回证据。版本、权限和无答案行为作为硬门,任何一项失败整题不通过。

指标 为什么需要
范围 合格集合 目标资料是否因错误权限或版本过滤被排除
召回 必要证据找回数 ÷ 必要证据数 防止只找到一条就宣布成功
排序 首条相关排名、前 5 相关数 衡量人工要翻多少噪声
生成 主张—证据支持率 区分“找到了但没用”
引用 文件记录编号与页码可打开率 防止正确文字配错来源
硬门 越权、旧版当当前、无答案硬答 不能被其他题平均抵消
评估先看证据覆盖,再看排序、答案和硬门:范围、召回、排序、生成
评估先看证据覆盖,再看排序、答案和硬门。她不只算一个“准确率”。 本图只解释这一节的判断关系;放行仍以正文中的证据、权限与验收条件为准。

40 题的冻结答案由叶澜逐题确认,并保留第二位复核者对 10 题的独立判断。两人有 2 题对“相关证据”范围不同,回到研究问题重新写边界后再测试。没有稳定的金标准,调参数只是让系统更接近某次主观印象。

全文搜索适合精确词、编号和可解释匹配

全文搜索按实际文字匹配,对错误代码、合同号、产品名、日期和专门术语尤其有效。

问题 查询 为什么适合
哪份报告提到 PX-417? “PX-417” 编号必须精确一致
2026-04-18 谁提出延期? 日期 + 延期 需要精确定位原文
“批量导入”旧称出现在哪里? 正式名 + 旧称 术语表可扩展查询
全文搜索适合精确词、编号和可解释匹配:哪份报告提到 PX-417?、2026-04-18 谁提出延期?、“批量导入”旧称出现在哪里?
全文搜索适合精确词、编号和可解释匹配。全文搜索按实际文字匹配,对错误代码、合同号、产品名、日期和专门术语尤其有效。 PX-417 不能被分词器拆成 PX 与 417 后做宽松匹配;

它的局限是用户问题与资料措辞不同。例如问题写“首次价值出现太晚”,原文写“完成第三次配置后才看到效果”,词面可能不重合。解决前先维护同义词和术语,不必立即向量化全部内容。

全文搜索也需要工程判断。PX-417 不能被分词器拆成 PX 与 417 后做宽松匹配;日期要统一 2026-04-18、2026/4/18 和“4 月 18 日”的规范值;OCR 可能把字母 O 识别为数字 0,应该标低置信候选并回到扫描页确认,不能悄悄改原文。

查询层 原查询 扩展或约束 失败检查
精确 ID PX-417 关键词精确匹配,不做模糊替换 PX-471 不得进入精确命中
术语别名 批量导入 加历史名 批量上传 结果显示命中哪个 别名
日期 2026 年 4 月 18 日 规范为 日期 字段并保留原词 不用文件修改时间代替内容日期
人名 陈宁 项目内 精确 + 角色 同名跨项目先过滤
OCR 可疑词 P0-417 同时提示可能为 PO-417 必须打开原页人工确认

她在 8 个精确题上保存 查询计划,而不是只存搜索框文字。这样更换搜索工具后仍能重放 精确、别名、过滤器 和日期规范化规则;全文搜索的优势来自可解释的词面匹配,不是“零配置”。

结构化目录适合边界清楚、维护者知道资料放在哪里

叶澜按项目、资料类型、内容日期和状态建立目录。一个问题若能先缩小到“项目 A / 访谈 / 2026Q2 / 当前”,目录和元数据过滤比全库相似度更可靠。

过滤字段 允许值 防止什么
项目编号 P-014 混入其他客户
资料类型 访谈、报告、决策 把草稿当证据
状态 当前、已取代、归档 返回旧版
生效时间 日期 用过期政策回答当前问题
敏感性 公开、内部、受限 越权检索
结构化目录按项目编号、资料类型、状态和生效时间缩小检索范围
目录的价值是先把不该参与的问题排除。项目、资料类型、版本状态、时间和敏感性先形成明确范围,全文或向量检索才不会在错误候选中寻找“最相似”的答案。

目录不擅长发现维护者未预想到的跨主题联系,但它提供检索前最重要的范围控制。向量搜索也应先应用权限和版本过滤,而不是召回后再删除不该看的内容。

每次过滤都生成范围确认:调用者是谁、查询哪个项目、允许什么敏感级别、问题所指日期是什么、纳入和排除了多少记录。比如 P-014 共有 38 条记录,限定当前版后剩 24,按 2026Q2 剩 17,再按内部权限剩 15;后续全文或向量只在这 15 条及其派生片段中工作。

范围 阶段 候选数 排除理由
项目编号为 P-014 38 其他项目不进入候选
状态=当前 24 14 条 已取代 / 归档
时期=2026Q2 17 7 条不在问题时间窗
呼叫方=叶澜 15 2 条客户 受限
解析状态为通过 14 1 条表格解析待复核

若目标证据在某一层消失,评估记录能定位是过滤错而不是召回差。目录字段缺失时默认排除并提示“元数据缺失”;为了提高召回把未知权限或未知版本当成可用,会让后面的任何算法比较失去意义。

长上下文适合少量已选材料的整体关系

当叶澜明确知道要比较哪 8 份访谈时,直接提供完整材料能保留段落顺序、访谈身份和前后限定,比把每份切成孤立片段更自然。

她设置三项上限:只放与任务直接相关的文件;在开头列出文件 ID 和问题;输出必须引用文件与页码。40 题中的 8 个跨文件比较题都使用不超过 10 份指定材料,长上下文 8/8 找到必要证据;把 37 份文件全部加入后,同一题反而漏掉两份关键材料。

容量足够不等于注意力没有成本。若材料需要频繁更新、权限不同或问题每次跨越不同子集,手工装载会逐渐失去可维护性。

长上下文也要有装配清单

“6—10 份”只是案例范围,不是通用文件上限。叶澜按实际解析后的 令牌、结构完整性和问题需要决定装载,并为每次任务生成 上下文清单。页眉页脚、重复目录和被替代附件先排除,但完整定义、限制条件和反证不能为省空间删除。

清单字段 示例 检查
问题编号 Q-COMPARE-06 与评估题对应
已选记录 REC-18、REC-31…共 8 份 每份说明选择理由
已排除记录 REC-12 已废止 排除有状态依据
预计令牌数 78,400 低于本次模型与输出预算
必要证据 EV-06A、06B、06C 三条都必须被回答使用或解释
订购 术语→报告→访谈→反证 不按文件名随机拼接
输出预留 8,000 不让输入挤掉完整输出

她做一项“丢一份”敏感性检查:先用 8 份材料回答,再逐次去掉每份,观察结论和引用是否变化。若删除一份本不相关文件就大幅改变结论,说明任务受顺序或噪声影响;若删除关键反证却答案不变,说明生成层没有真正使用材料。长上下文免去了检索切片,却没有免除输入选择和证据验收。

向量检索适合概念相似,但不能替代编号和过滤

向量把文本转换为可比较的数值表示,能找到措辞不同但语义相近的片段。叶澜在“为什么用户没有完成首次配置”一题中找到了“设置步骤过多”“缺少示例数据”“邀请同事后才能继续”等不同表达。

它也出现两个危险失败:把 PX-417 与 PX-471 的记录排得很近;把 2024 年旧功能说明放在 2026 年当前说明之前。因此向量结果仍需要精确搜索和元数据过滤。

查询类型 全文 向量 推荐
唯一编号 全文
同义概念 向量或混合
日期和版本 过滤 + 全文
探索性主题 向量后人工查看证据

向量索引是可重建的派生流水线

164 份记录经格式解析、结构分段和上下文补充后形成 1,486 个片段。每个片段保存来源记录编号、页码或时间戳、版本、权限、内容日期、文本摘要校验值、分段器版本和嵌入模型版本。向量只是片段的派生表示,不能脱离原文单独成为证据。

流水线阶段 输入 产物 失败处置
解析 通过治理门的记录 保留结构的文本 页码或表格丢失则隔离
分段 文本与标题层级 1,486 个可定位片段 跨主题或断句则改规则重建
情境化 片段与文档摘要 简短来源上下文 不增加源文没有的事实
嵌入 片段文本 + 上下文 向量与模型版本 不与其他模型向量混用
索引 文本、向量、过滤字段 快照重处理 v1 数量和权限对账不平则不发布
退役 已取代或撤权记录 停用标记与删除事件 搜索、向量、缓存同步撤下

她从 1,486 个片段中抽 75 个,占 5.0%,检查源定位、数字、否定词和权限;发现 3 个跨页表格被拆坏、2 个决策记录丢失状态。修正规则后重建对应内容类型,不只手改 5 条结果。新索引以“重处理 v2”影子运行,40 题通过后再切换别名;旧快照只用于短期回退,但权限已撤回内容不能因回退重新出现。

混合检索为什么更强,也为什么不一定先做

混合检索同时运行关键词与向量查询,再合并排序。它能让精确编号与概念相似各自发挥作用,但需要额外维护分段、嵌入、过滤、排序、更新和评估。

成本 具体工作
建库 解析文件、切片、生成向量、写元数据
更新 文件替换后删除旧片段并重建
质量 维护问题集,检查召回和排序
安全 权限变化同步到每个片段
运行 检索、重排和生成的延迟与费用
混合检索为什么更强,也为什么不一定先做:建库、更新、质量、安全
混合检索为什么更强,也为什么不一定先做。混合检索同时运行关键词与向量查询,再合并排序。 本图只解释这一节的判断关系;放行仍以正文中的证据、权限与验收条件为准。

个人资料只有一两百份、问题边界清楚时,这些成本可能大于收益。叶澜只为全文明显失败且每月重复的 11 类概念问题启用混合路线。

混合不是把两组分数直接相加

全文与向量的原始分数不在同一尺度,不能简单相加。案例用基于排名的融合生成候选列表,再保留“精确命中、向量命中、命中词”等诊断字段。精确编号若只由向量路线召回,会触发警告;同义概念若全文与向量都没有金标准证据,则继续调融合权重也无意义。

诊断情形 观察 正确动作
全文第 1、向量未召回 产品编号精确命中 保留全文贡献,不降权给平均
全文未召回、向量第 2 不同措辞表达同一障碍 人工确认后保留概念命中
两路都召回同一片段 重复候选 合并但保留两路来源
两路召回不同版本 当前版与已取代版冲突 先按元数据硬过滤
顶部 10 全是同一访谈 单一来源挤占证据 限制每份记录的片段数并保留多样性
相关证据排第 12 候选池有、展示层没有 调整重排或展示数量,而非重新分段

她为 Q-027 保存全文前 20、向量前 20、融合前 10 和重排后前 5。这样失败时可以判断是过滤错误、单路未召回、融合淹没、重排误判,还是生成忽略。若只保存最终五条,任何改进都会退化成凭感觉调参数。

分段错误会让正确文件变成错误证据

她没有按固定字符数盲切,而是保留标题、项目、日期和说话人:

内容 分段边界 必带上下文
访谈 一个问答或完整主题段 访谈编号、角色、日期、问题
报告 标题下的完整论证 报告编号、版本、章节
决策记录 一项决定及理由 项目、决定日期、状态
表格 表头加一组相关行 单位、字段定义、来源

“增长 18%”若离开公司、指标和时间就没有意义。分段后每个片段必须仍能回答它来自哪里、在说谁、何时有效。

她用一份 14 页实验报告做切片回归。固定 800 字切法把第 6 页表头留在 CH-44、数据行留在 CH-45、限制条件留在 CH-46;搜索“留存增长”只返回 18%,却漏掉“样本 42 人、仅新注册桌面端、观察 7 天”。结构切法把标题、指标定义、表头、相关数据行和紧随其后的限制合为一个逻辑片段,超过上限时允许带少量重叠,但每个事实只引用一个主片段。

分段验收 通过条件 本例失败
来源定位 打开同一页或表格 CH-45 无表头位置
事实完整 数值、单位、分母、时间窗同在 18% 离开 42 人与 7 天
否定与限制 “仅、未、除外”不被切走 桌面端限制在下一片
说话人完整 问题、回答和发言人同在 两位受访者被拼成一段
去重 重叠只用于召回,不重复计证据 相邻片段被当两名用户

她为报告、访谈、决策和表格各选 5 份,共 20 份做分段回归。规则改变后对同类型全部重建,并比较片段数量、平均长度、孤立标题、无来源数字和金标准证据的可召回性。片段越小不必然越准,越大也不必然更完整;边界应服从内容结构和评估结果。

40 个问题怎样组成检索评估集

类型 数量 期望结果
精确编号与日期 8 指定文件和原文
同义概念 10 多个相关证据
跨文件比较 8 指定正反材料
版本冲突 6 当前版优先并说明旧版
权限边界 4 不返回受限文件
无答案 4 明确没有足够资料
40 个问题怎样组成检索评估集:精确编号与日期、同义概念、跨文件比较、版本冲突
40 个问题必须覆盖不同失败方式。每题保存相关文件记录编号、关键片段、允许范围和答案边界;只测容易找到的事实题,会掩盖版本、权限与无答案问题。

每题保存相关文件记录编号、关键片段、允许范围和答案边界。先评估前 5 结果里有没有正确证据,再评估生成答案;否则无法区分检索错与总结错。

把总分拆回六类问题

总数 31、30、33、32、37 容易制造“混合检索全面更好”的错觉。叶澜把每题证据门结果按类型展开;表中每格是通过题数,行末分母是该类型题数:

问题类型 全文 目录 长上下文 向量 混合
精确编号与日期(8) 8 6 7 4 8
同义概念(10) 5 4 8 10 9
跨文件比较(8) 5 7 8 7 8
版本冲突(6) 6 6 4 4 5
权限边界(4) 4 4 3 4 4
无答案(4) 3 3 3 3 3
合计(40) 31 30 33 32 37
把总分拆回六类问题,才看得出每条路线为什么赢或输:精确编号与日期(8)、同义概念(10)、跨文件比较(8)、版本冲突(6)
总分必须拆回题型才有决策价值。31、30、33、32、37 并不表示混合检索全面更好;目录在版本题表现好,是因为当前状态清楚,向量在概念题表现好,是因为措辞相似。

混合路线仍漏 1 个同义概念、1 个版本冲突和 1 个无答案题。目录在版本题 6/6,不代表目录更“智能”,而是 当前 状态已经明确;向量在概念题 10/10,也不代表答案全部正确,它只说明金标准证据进入工作集。长上下文权限题只有 3/4,是装配者误选了一份受限访谈,证明手工选择也要权限预检。

40 题只能支持案例内决策,不能稳定估计产品总体差异。37/40 与 33/40 相差 4 题,换一组问题可能改变顺序;因此叶澜不把这张表写成市场 基准,也不依据一个总分淘汰简单路线。它的价值是暴露“哪类问题、哪一阶段、以什么代价失败”。

完整走一题:先过滤,再混合,再核验证据

问题是“试用用户在哪一步最容易放弃,原因是什么?”

  1. 过滤到 P-014、2026Q2、当前、允许内部研究的资料;
  2. 全文查询“放弃、未完成、退出、卡住”;
  3. 向量查询同一问题,召回措辞不同片段;
  4. 合并去重后查看前 10 条;
  5. 删除没有步骤位置或来自旧版的片段;
  6. 只根据 7 条有效证据归纳,并写“18 份访谈中的 6 份”,不外推全部用户。

合格输出同时列出首次数据导入 3 份、权限邀请 2 份、配置术语不理解 1 份,并保留另外 12 份未提及放弃原因。检索找到相似证据,不等于可以计算总体比例或因果关系。

她不直接从 7 个命中片段写一段流畅结论,而是先建立主张账本:

主张编号 可写主张 证据 不能写成
C-01 18 份访谈中 3 份提及首次数据导入受阻 INT-03、08、14 的原话与时间戳 “导入是最大流失原因”
C-02 2 份提及邀请权限让流程中断 INT-05、11 “大多数用户需要管理员”
C-03 1 份不理解配置术语 INT-17 “术语普遍难懂”
C-04 12 份没有出现明确放弃原因 访谈覆盖清单 “其余用户都顺利完成”
C-05 放弃发生率与因果影响 当前证据不足 不得生成百分比或因果结论

7 条有效片段来自 6 份访谈:其中一名受访者在两个位置提到导入,只能按一个访谈编号计数。最终答案附证据编号、未覆盖范围和下一步需要的行为日志。若检索层把相似原话找得很全,生成层却把“提及”改成“导致”,整题仍判失败。

试点必须保存检索证据,并为错误召回设置停止条件

叶澜为每次回答保存两层记录。检索层记录查询、过滤、索引版本、返回的片段 ID 和排名;生成层记录实际采用的片段、答案、引用和人工修订。只保存最后答案,下一次无法知道是正确证据没被找回,还是模型忽略了已经找回的证据。

字段 示例 诊断用途
查询编号 Q-027 关联评估问题
检索方式 混合 v1 识别全文、向量或混合配置
过滤器 P-014 / 当前 / 内部 检查范围和权限
索引快照 2026-07-20 复现当时资料状态
前列结果 CH-184、CH-201… 检查相关证据排名
已用证据 CH-184、CH-233 区分召回与生成失败
答案状态 已支持 已支持、不足、已阻塞
人工修改 删除旧版结论 形成新回归样本
检索记录包含查询编号、检索方式、过滤器和索引快照,并设置错误召回的停止条件
试点必须保存检索证据,并为错误召回设置停止条件。叶澜为每次回答保存两层记录。 生成层记录实际采用的片段、答案、引用和人工修订。

她为首批 20 次真实使用规定停止条件:出现一条其他客户受限片段立即关闭索引并调查;连续两次把 已取代 版本写成当前事实,暂停生成只保留搜索;引用无法打开原文或页码不一致时,不发布答案;无答案问题被系统强行回答两次,回退到只显示检索结果;人工核验中位数超过原人工搜索时间,则停止扩大范围。

运行结果 次数 处理
正确证据且答案受支持 15 保留配置
证据找到但答案遗漏限制 2 修改生成规则并加入回归集
正确证据未进前 5 2 调整同义词和混合权重
资料库本身无答案 1 正确返回 不足

调整后必须重跑 40 个冻结问题,而不只重跑失败项。权限、版本和无答案行为是硬门槛,不能用其他题目的高召回率平均掉。

知识库更新也要触发明确动作。新增文件先继承 O08 的 record_id、版本和权限;替换 当前 时同时撤下旧片段;删除授权要清理全文索引、向量、缓存和已生成摘要;更换嵌入模型或分段规则则建立新索引快照,不能与旧向量混用。叶澜每月记录新增文件数、重建片段数、过期内容命中、权限撤回完成时间和 40 题回归结果。若没有人持续完成这些动作,向量库会比普通文件夹更难发现旧数据,因为相似结果看不出原文件已经失效。维护成本必须进入“是否需要 RAG”的决定,而不能只计算第一次建库时间。

她把五条路线的成本按“已有基础上的增量”记录,避免把本来就需要的文件治理算成向量方案的额外投入,也避免忽略每次人工装配长上下文的时间:

路线 首次增量投入 每月维护 每题人工核验中位数 适用范围
目录 + 全文 4.0 小时 0.8 小时 12 分钟 默认处理精确、版本和已知范围问题
长上下文清单 1.5 小时 0.5 小时 16 分钟 8 份左右已指定材料的比较
向量试点 13.0 小时 1.5 小时 10 分钟 概念措辞不同的问题
混合与证据日志 18.0 小时 1.8 小时 9 分钟 11 类每月重复问题

这 11 类问题每月合计约 28 次查询;原目录与全文路线在这些题上平均核验 17 分钟,混合路线为 9 分钟,每月节省 28×8=224 分钟,即 3.73 小时。扣除 1.8 小时增量维护,净节省 1.93 小时,18÷1.93≈9.3 个月才回收首次投入。若实际只有每月 8 次查询,节省 64 分钟还小于维护,混合路线不具备时间收益。

这个回收期只是案例内估算,不含采购、隐私审查和服务中断,也没有给避免越权定价。叶澜把是否继续写成 决策记录:使用量连续两个月低于 15 次、40 题硬门失败或维护超过 3 小时时,缩回全文结果页;连续三个月确有重复概念题并保持硬门通过,才扩大向量覆盖范围。

决策树:从最简单方案开始升级

可复制模板
知道文件或精确词?→ 全文搜索。
知道主题、项目或版本?→ 目录和元数据过滤。
材料少且已经选定,需要整体比较?→ 长上下文。
问题措辞与资料经常不同、概念检索重复出现?→ 向量检索试点。
既需要编号精确又需要概念召回?→ 混合检索。
无论哪条路线:先检查权限、版本、引用和无答案行为。

先用 20—40 个真实问题记录现有方法的失败,再决定升级。RAG 不是个人知识库的同义词;它只是从资料中检索片段并提供给生成模型的一种架构。对很多个人工作,清楚目录、可靠全文搜索和少量完整材料已经足够。只有重复失败能证明语义检索带来额外价值时,向量与混合检索才值得承担维护成本;而且必须保留随时退回文件与全文搜索的路径。检索索引也不能替代原文件和版本清单。

个人试点可以压缩成两周,但不能省掉对照和回退。叶澜没有先接聊天界面,而是先让五条路线对同一冻结输入输出证据记录:

时间 工作 放行证据
第 1—2 天 冻结 40 题、金标准、权限调用者和 164 份快照 每题的必要与禁止证据完整
第 3—4 天 跑目录与全文基线 查询计划、范围确认 可复现
第 5—6 天 为 8 个比较题做长上下文清单 删除任一关键材料会改变引用
第 7—9 天 建“重处理 v1”,抽查 75 个片段 来源、数字、否定词、权限通过
第 10—11 天 跑向量和混合影子测试 保留单路、融合与最终排名
第 12 天 人工核 40 题和三项硬门 权限 4/4、版本与无答案无严重失败
第 13 天 处理失败并全量回归 不是只重跑失败题
第 14 天 写 决策记录 选择、成本、限制、回退目标明确
决策树:从最简单方案开始升级:第 1—2 天、第 3—4 天、第 5—6 天、第 7—9 天
决策树:从最简单方案开始升级。先用 20—40 个真实问题记录现有方法的失败,再决定升级。 对很多个人工作,清楚目录、可靠全文搜索和少量完整材料已经足够。

试点不连接自动发送,也不替换原搜索入口。只有证据门和硬门都通过,才让混合路线对那 11 类重复问题开放;其余问题仍走更简单的路径。这样“升级”指增加一个有证据支持的分支,不是把所有工作一次迁入复杂系统。

来源与进一步阅读

以下资料核验于 2026-07-21,用于支持精确搜索、向量相似、混合检索、分段上下文和任务评估: