文件都在网盘里,不等于已经有了资料库

梁絮经营一个独立销售培训工作室。八年里,她积累了课程讲义、客户复盘、报价、问卷、录音转写和研究资料,共 684 份。文件名里有 39 个“最终版”、27 个“最新版”,同一课程在三个网盘各有副本;一份 2023 年政策仍排在搜索结果前面;客户案例与公共课程材料混在一起。

她原本以为,只要把整个目录接到 AI,过去八年的资料就能立刻回答问题。可她试问“当前异议处理课程有几节”,系统同时引用了三个版本;再问一个客户项目,答案里又混进另一家客户的片段。此时继续调提示词没有意义:系统连哪份是当前版、谁能看、何时有效都不知道。

梁絮因此暂停接入,先花四周做清点。684 份文件并没有被简单分成“保留”和“删除”,而是按是否能进入后续治理、为什么不能进入来分流:

处理结果 文件数 说明
具备首批治理资格 219 进入迁移候选,不等于已经索引
重复或派生副本 176 保留一个主记录和派生关系
已过期但需留档 91 归档,不参与默认回答
客户受限 128 留在客户专属区
无法识别或待确认 70 隔离,等待人工判断
合计 684
684 个路径分为 219 个治理候选、176 个重复或派生副本、91 个过期留档、128 个客户受限和 70 个待确认,并显示候选还要通过 50 份试点
684 个路径先闭合归属,219 才能进入后续治理。上方核对五类结果合计 684,下方再读“219 候选→50 份受控试点→有放行证据才进入默认检索”;右侧比例只是固定问题集的阶段结果。219 不代表已经解析、授权或索引,19/30→28/30→30/30 也不能外推成检索产品通用准确率。

219 是完成初步归属后可进入治理流水线的候选数,不是已经通过解析、权限和问答测试的上线数。后文的 50 份试点会继续拦下格式不明、授权未确认和证据不足的文件;把“候选”“通过当前阶段”和“已进入默认检索”写成同一个状态,正是资料库再次失控的起点。

首批迁移后,她用同一组 30 个真实问题复测,正确返回当前版本的比例从 63% 提高到 93%,跨客户资料返回从 3 次降为 0。本文以该教学案例说明文件治理流程,人物、文件量和测试结果不代表任何真实客户或产品效果。

这两个比例使用同一套 30 题和同一评分规则:整理前通过 19 题,即 63.3%;首批迁移后通过 28 题,即 93.3%。它不是搜索系统通用准确率,也没有证明向量检索优于其他方法。案例真正改变的是被检索对象:当前版、过期版、受限版和派生文本不再混成一堆。

先做文件清点,不先移动和重命名

直接整理文件夹容易丢失来源和关系。梁絮先生成只读清单,为每个文件记录原路径、大小、修改时间和校验值:

字段 示例 用途
文件记录编号 REC-000184 稳定编号,不随移动改变
原始路径 drive-a/课程/最终2.pptx 保留发现位置
文件名 final2.pptx 原始名称
文件大小(字节) 4,281,901 辅助识别副本
修改时间 2024-08-11 线索,不直接当内容日期
校验和 sha256:8ac… 判断二进制是否完全相同
检测到的格式 PPTX 检查扩展名与真实格式
清点状态 未审查 处理队列
WORK-COURSE-014 包含三个版本记录,当前 REC-000529 再关联多个位置、派生文件和 OCR、批准、移动、删除事件
同一课件的作品、版本、位置和派生件必须分开建模。从 WORK-COURSE-014 沿中间版本链读到当前的 REC-000529,再看右侧多个位置与派生文件;下方事件记录变化而不篡改对象身份。位置变化不是新版本,格式转换也不是新作品,派生件必须能回到源记录。

修改时间可能因复制而变化,文件名也可能被改过;两者都不能单独证明版本。校验值相同才可判定完全相同文件,内容近似仍需人工确认关系。

清点时她还冻结统计口径。684 指清点日能够读取的独立路径,不是 684 个独立作品;压缩包内文件先展开到隔离区再单独登记,邮件附件按附件计一条,云端快捷方式只记录目标位置,不重复计内容。来源位置和格式分别核对,两个维度都必须合计回 684:

发现位置 路径数 主要风险
主工作网盘 246 多个“最终版”并存
个人网盘 171 与主网盘完全重复
客户共享区 138 授权范围随项目变化
本地电脑 82 文件修改时间被复制动作重写
邮件附件 47 缺少与项目的稳定关联
合计 684 与处理结果总数对齐

她随机抽 34 条清单逐一回到原位置,占 684 的 5.0%。发现 2 条快捷方式被误当文件、1 个扩展名与真实格式不符;修正清点逻辑后重新全量扫描,再抽另一组 34 条全部可回溯。后续任何“提升率”都以这版冻结清单为分母,不能一边删除文件一边改变基线。

文件、作品、派生件和位置不是同一件事

如果一张课件同时存在演示文稿、批准版 PDF、邮件附件和网盘快捷方式,只用“文件表”会把它误判成四份内容。梁絮用四类对象表达实际关系:作品是同一逻辑内容,记录是某个具体版本,派生件是 OCR、摘要或格式转换结果,位置是同一二进制文件出现的地方。

对象 稳定标识 例子 可以一对多的关系
作品 WORK-COURSE-014 异议处理课程 含多个版本记录
版本记录 REC-000529 v03 批准课件 有多个位置和派生件
派生件 DER-001102 v03 的 PDF 文本抽取 源自 REC-000529
位置 LOC-003821 drive-a/课程/当前.pptx 指向同一版本记录
处理事件 EVT-000774 OCR、重命名、批准或删除 关联对象、时间、操作者和结果

这一模型回答了四个不同问题:内容是什么、哪一版、由什么产生、目前放在哪里。AI 检索默认面向允许使用的当前记录及通过质量门的派生件;位置变化不生成新版本,格式转换也不能自动成为新作品。梁絮没有照搬档案标准的全部字段,只借用对象、事件、权利和责任主体分开的原则,做成个人可维护的最小模型。

批量整理前先冻结原目录并写停止条件

清点完成后,她先建立不可破坏的迁移边界。原目录设为只读快照,任何重命名、移动、格式转换都在新工作区进行;清单同时保存旧路径和新路径。没有确认主记录之前不删除副本,客户受限和权利不明文件不参与自动转换。

风险事件 立即动作 恢复依据
批量重命名后无法识别 停止后续移动 文件记录编号与原始路径映射
两份“当前”内容不同 都转为“冲突待复核” 版本链、批准人和内容日期
OCR 丢失表格或页码 禁止用派生文本回答 原始扫描件和抽样记录
客户文件误入公共区 关闭索引、删除派生副本 允许用途、访问日志和清单
误删疑似重复文件 从只读快照恢复 校验和与位置记录

她设置停止条件:一次批处理中超过 2% 的文件无法回到原路径,或出现一份跨客户暴露,就停止整批,不以“其余多数成功”继续推进。文件整理的第一原则是关系可恢复,而不是目录立刻变整齐。

快照也要实际恢复一次。她从副本中选 12 份不同格式文件,在新工作区执行改名、移动和 OCR 后,用文件记录编号找回原路径、校验值与权限;12/12 恢复成功才放行首批迁移。备份“应该能恢复”和已经演练过恢复是两种证据。

命名规则要能排序、理解,也要允许文件离开原文件夹

她采用固定位置的简短命名:

可复制模板
[内容类型]-[主题或项目]-[内容日期]-[版本]-[状态].[扩展名]
示例:course-objection-handling-2026-05-18-v03-current.pptx
元素 规则 不使用
内容类型 课程、研究、模板、客户资料 “资料”“其他”
主题 使用术语表中的稳定短名 临时昵称
日期 内容生效或发布日 YYYY-MM-DD 仅用复制修改时间
版本 v01、v02… 最终、最终2、最新版
状态 草稿、当前、已取代、归档 同时出现两个当前版

文件名只承载最常用识别信息,其余进入清单。她不把客户全名、敏感等级和长描述塞进名称,避免泄露和路径过长。

批量重命名先生成计划和冲突报告

命名脚本只输出拟用名称,不立刻修改文件。梁絮先检查非法字符、长度、同名碰撞、缺失日期和术语表未收录主题;需要人工判断的条目停在拟议状态,不能用“状态未知”批量糊过去。

预演结果 数量 处理
可唯一生成新名称 612 等待所属批次批准
同目录名称碰撞 18 检查是否同一作品或遗漏版本
缺内容日期 23 查正文、发布记录或标“日期未知”并限制使用
主题无法映射术语表 17 负责人选择已有主题或批准新词
路径超过目标系统限制 9 缩短主题码,不删稳定编号
扩展名与检测格式不符 5 修正扩展名并记录事件
合计 684 每条保留预演结果
684 条冻结清单先生成拟用名称,再分成 612 个可命名项和五类异常,批次必须逐条对账并通过恢复与跨客户停止门
批量重命名先做预演,执行后再按输入数逐条对账。684 条冻结清单先产生拟用名称和六类结果;实际执行时,50 个输入必须得到 50 个明确状态。自动加“(1)”、批量填状态未知或只看退出码,都会隐藏关系问题。

一条重命名事件同时保存旧路径、拟用路径、执行时间、执行人和回退路径。18 个碰撞中有 11 个是完全重复位置、4 个是合法多版本、3 个确实是同名不同作品;若脚本自动加“(1)”虽然能完成移动,却会把三个不同问题永久藏起来。

批次执行后她不以“命令退出码为 0”验收,而是重新扫描目标目录,对比文件记录编号数量、校验值、关系和访问权限。输入 50 条就必须产生 50 条明确结果:已移动、未变更、隔离或失败;结果数少一条也不进入下一阶段。

版本不是数字最大,而是经过确认的当前记录

同一逻辑内容使用作品编号关联各版本:

作品编号 文件记录编号 版本 状态 生效日期 替代关系
WORK-COURSE-014 REC-184 v01 归档 2023-03-01
WORK-COURSE-014 REC-311 v02 已取代 2024-08-15 替代 REC-184
WORK-COURSE-014 REC-529 v03 当前 2026-05-18 替代 REC-311
草稿经负责人批准成为唯一当前,旧当前同事务转为已被取代,并将双当前、缺批准、跨工作、日期倒置和过期派生文件分流处理
当前来自批准关系,不来自最大版本号或最新修改时间。上方读取草稿→批准→当前,并在同一事务让旧版转为已被取代;中间五类异常各有明确修复,底部双当前必须停止为 version_conflict 或交负责人。隔离区不参与裁决,客户定制版也不能冒充公共课程的更高版本。

只有负责人可以把一份文件标为当前版。编号更大但未审核的文件仍是草稿;旧版保留历史价值,却不会默认进入检索结果。

当前版必须唯一,但不一定是日期最新的文件

她为每个作品编号建立状态转换:草稿可以被批准为当前版;新当前版生效时,旧当前版在同一次操作中转为已取代;归档只用于历史说明;隔离文件不能参与版本链裁决。任何时候若同一作品出现两个当前版,默认检索应停止,而不是按版本号、修改时间或文件大小猜一个。

检查规则 发现异常 处理结果
每个现行作品最多一个当前版 14 个作品有双当前版 9 个确认新版,5 个交负责人裁决
当前版必须有批准人和批准时间 21 条缺批准证据 退回草稿或补正式批准记录
取代关系必须指向同一作品 4 条跨作品误连 解除关系并重做内容归属
生效日期不能晚于失效日期 3 条日期倒置 查源文件,不自动交换日期
当前版派生件的输入摘要必须一致 7 个过时派生项 重建或退出检索
本人原创、客户访谈、购买报告和许可不明资料分别检查读取、转换、引文、共享与训练动作,并在内容匹配前按允许访问主体过滤
允许用途必须拆成动作,并在内容匹配前按调用者执行。读取、转换、引文、共享和用于训练是五种不同授权。调用者先通过“允许访问主体”这道门,才进入内容匹配;不能先召回无权客户内容,再让模型靠提示词“不泄露”。

版本链还要允许分支。例如客户定制课件可能从公共课程 v02 派生,却不会替代公共 v03;它拥有独立作品编号,并记录“基于哪个版本”。把客户定制版标成公共课程的“更高版本”,会让敏感内容绕过归属边界。版本表达批准关系,日期只是证据之一。

来源、权利和内容归属必须在进入资料库前确定

字段 需要回答 示例
来源类型 自创、客户提供、购买、公开下载 客户提供
负责人 谁对内容负责 梁絮 / 客户 A
允许用途 可用于哪些任务 仅客户 A 项目复盘
敏感性 公开、内部、客户受限 客户受限
留存 保存到何时 合同结束后 90 天删除
引用 回答时怎样标识 文件 ID、页码、版本

客户受限文件不能因为内容“很有参考价值”进入公共课程资料库。公开下载也不代表可以任意再发布全文;她保留来源链接和使用条件,不能确认权利的文件进入隔离区。

文件保存在自己的网盘,也不等于自己拥有内容权利。客户提供、合作伙伴共创、购买报告和公开网页分别需要不同的允许用途。梁絮把“谁保管文件”和“谁拥有或授权内容”拆成两个字段;负责人离开项目时也要转移责任,而不是让记录变成无人维护。若允许用途只写“内部”,还要继续说明是本人内部、指定客户内部,还是允许用于模型处理,否则系统无法执行真正的权限过滤。

她把允许用途拆成读取、转换、引文、共享和“用于训练或改进”五种动作,避免一个“可使用”同时代表阅读、改写和再发布。购买报告允许本人阅读,不自动允许把全文切片给第三方工具;客户访谈允许在客户 A 项目内总结,不自动允许进入公共样例;公开网页可被引用,也仍要保留作者、页面和访问日期。

来源情形 读取 / 转换 引文 / 共享 默认处理
本人原创课程 允许,按内部或公开范围 由负责人决定 可进入对应资料区
客户提供访谈 仅授权项目内,先确认工具范围 未明确则禁止 客户受限
购买行业报告 依许可阅读,未必可批量转换 通常只允许短引与出处 不把全文放公共索引
合作伙伴共创 依共同协议 发布需双方批准 负责人不得只写梁絮
来源或许可不明 禁止默认处理 禁止 隔离

权限裁决必须保存依据,例如合同条款编号、邮件批准记录或公开许可页面;只写“梁絮认为可以”无法供以后复核。授权到期或用途变化时,新决定产生权利变更事件,旧决定仍留历史,但不能继续控制当前查询。

内容日期与文件日期分开,过期规则按主题设置

一份 2023 年合同模板在 2026 年被重新复制,修改时间会显示 2026 年,但内容仍可能过期。梁絮记录:创建日期、内容生效日、最后复核日、下次复核日和失效日。

内容 复核周期 到期动作
法规或平台政策摘要 30 天 标记待复核,不参与确定回答
价格与报价 90 天 限制使用并标记待复核
课程方法讲义 180 天 允许检索,但提示复核状态
历史项目复盘 不设自动失效 只能说明历史情境
四个查询按截至时间、有效期、当前和复核到期状态分别选择 v02、v03、无有效记录或停止当前结论,并标出有效期重叠与空档状态
同一资料在历史、现在和未来查询中会走向不同记录或明确停止。四列依次显示 2024 历史问题、当前课程、未来报价和旧政策复核;下方把有效期重叠与空档分别标成 version_conflict 和 no_effective_record。modified_at 或检索日期不能冒充内容日期,历史可检索也不表示当前有效。

到期不一定删除。系统应区分“历史上这样做过”和“当前仍有效”,回答当前问题时优先使用当前版且未过期的资料。

“当前”还必须绑定查询所指的时间。用户问“2024 年版本怎样规定”时,可以选择当时有效、现在已经被取代的记录;用户问“现在多少钱”时,只有生效日期不晚于查询日、尚未失效且状态为当前版的记录能给确定答案。用户没有指定时间,就使用查询发生时刻,并在答案中显示资料内容日期,不把检索日期冒充内容日期。

查询 版本过滤 合格回答
2024 年 9 月课程包含什么 选择 2024-09-01 当时有效记录 引 v02,并说明这是历史版本
现在的课程包含什么 选择查询日的当前版且未失效 引 v03 与生效日
下季度报价是多少 资料尚无未来生效价 说明无依据并请求确认
2023 政策现在是否仍适用 历史记录可检索但待复核 不作当前合规结论

若两个记录的有效期重叠,系统返回“版本冲突”而不是任选一个;若有效期之间有空档,则返回“没有有效记录”。时间过滤不仅为了排序,更是防止旧事实被相似度重新推到答案前面。

扫描件、表格和录音要先证明可解析

文件存在不等于 AI 能读懂。梁絮对每种格式做预检:

格式 检查 不合格处理
扫描 PDF OCR 字符、页序、表格、手写批注 保存原件与 OCR 派生件,抽样校对
表格 工作表、表头、公式、隐藏行、单位 导出数据字典,不把公式结果当原始值
演示 标题、备注、图表数据来源 缺少备注时标记解释不足
录音转写 说话人、时间戳、授权、缺失段 未授权不处理;低置信段人工校对
图片 替代项、拍摄或生成来源、使用权 无法确认主体和权利则隔离

OCR 文本是派生文件,必须通过 derived_from 指回原始扫描件;修正 OCR 时记录转换事件,不能覆盖原件后失去证据。

AI 生成的摘要、标签和分段也只能作为派生元数据,不能反过来替代原文。梁絮为每次转换保存工具版本、处理时间、输入校验值和人工抽样结果;原文件变化后,旧派生件自动变为 过时。她从每批文件抽取至少 10%,逐页比较数字、否定词、表头、脚注和页码。若关键数字或“不得、尚未、仅限”等限制词出现一处丢失,整批暂停并调整解析方式。对于只有图片图表而没有数据表的页面,系统只能描述画面中可确认的标签,不能把像素估计成精确数值。这样做会增加前期工作,却能避免一个解析错误在检索、摘要和后续文章中被重复放大。

切成检索片段后,来源、版本和权限必须跟着走

一份 80 页讲义可能被切成 164 个检索片段。若片段只保留正文,检索系统便不知道它来自哪一版、哪一页、何时失效、谁有权看。梁絮要求每个片段继承源记录中不可放宽的字段,并保存精确定位:

片段字段 来源 用途
片段编号 文件记录编号 + 顺序号 稳定引用与撤回
来源记录编号 原始记录 回到源文件
作品编号 / 版本 / 状态 版本登记 只选当前版或明确历史查询
页码或范围 原页码、表格名或时间戳 让人复核原证据
内容日期 / 失效日期 记录元数据 过滤失效结论
允许访问主体 权限记录 查询前做访问过滤
解析事件 / 来源摘要 派生事件 判断文本是否过时
片段文本 通过解析门的文本 用于召回,不是唯一证据

权限只能继承得更严,不能由派生件自行放宽:源文件是客户受限,摘要和向量索引也属于同一边界。记录转为已取代、已过期或权限已撤回后,相关片段先退出默认索引;后台再删除或重建派生件。这样即使清理任务需要数小时,也不会在等待期间继续返回不该使用的内容。

她抽查 20 个片段,从搜索结果反向打开原页;18 个定位正确,2 个跨页表格被切断。修订分段规则后,不只重建两条失败片段,而是重建同格式的 37 份文件并抽样复查。局部失败通常提示一类转换规则有问题,不能只修截图中看见的一条。

去重需要区分完全相同、近似副本和合法派生

类型 判断 处理
完全重复 校验值相同 保留主记录,其他路径记 位置
近似副本 标题和正文高度相似 人工比较,确定版本或独立作品
格式派生 可编辑文档导出 PDF 保留主文件与派生关系
摘要或节选 内容来自原文一部分 保留来源记录编号和范围
合法多版本 内容随时间真实变化 使用作品编号和版本链

“删掉所有重复”会误删批准版 PDF 或带批注版本。去重的目标是让系统知道关系,而不是只剩一个文件。

近似副本不能只靠一个相似度阈值自动删除。梁絮先比较校验值,再抽取标题、段落、表格和备注做差异摘要,最后由负责人判断它是新版本、派生格式、独立作品还是可删除副本。算法只负责缩小候选对,不负责决定业务含义。

候选对证据 可能关系 删除前必须确认
二进制校验值相同 完全重复 位置 是否仍有保留该位置的权限或协作需要
正文相同、格式不同 主文件与派生件 哪个可编辑、哪个是批准交付版
正文 98% 相同、备注不同 合法批注版或新版本 备注是否影响批准状态
标题相同、客户与日期不同 独立作品 不得因标题相同合并
仅删除封面和附录 节选 来源记录编号与取材范围是否完整

176 份重复或派生副本中,96 份是相同校验值的额外位置,51 份是合法格式派生,29 份需要差异复核;这三类合计 176。她只删除经确认可恢复的额外二进制副本,批准版、批注版和派生关系都保留记录。

目录按内容归属和生命周期组织,不按软件名称

可复制模板
library/
  public/
  internal/
    courses/
    methods/
    templates/
  clients/
    client-a/
  archive/
  quarantine/
manifest.csv

网盘、笔记工具或 AI 产品只是存储和使用入口,不应成为唯一分类。迁移工具时,稳定 ID、清单和关系仍然可用。客户目录与公共目录物理或权限隔离,不能只依赖文件名中的标签。

权限撤回要贯穿原件、派生件、索引、缓存和历史回答

目录隔离只是第一层。梁絮把允许访问主体写进索引元数据,在查询时先按当前调用者过滤,再做内容匹配;不能先召回全部客户内容、生成答案后才让模型“不要泄露”。客户 A 的用户标识、客户 B 的组标识和公共资料使用不同主体集合,默认集合为空而不是公开。

她用一个已结束项目做撤回演练。该项目有 6 个原始 记录、14 个格式或 OCR 派生件、83 个 块、2 个本地缓存结果和 1 份未交付草稿。留存 到期后,各层结果如下:

撤回层 目标 验证方式 结果
默认检索索引 83 个片段 以本人和错误客户身份各查 5 个关键词 0 返回
派生存储 14 个派生件 按来源记录编号反查 全部删除并记录事件
应用缓存 2 条 用缓存键与文件记录编号检查 全部失效
原始存储 6 个记录 按合同删除或转受限留档 5 删除,1 依法保留且不可检索
未交付草稿 1 份 查引用清单 删除并留删除回执
80 页 REC-000529 切成 164 个文本块,每片继承来源、版本、页码、日期、权限和解析事件,20 片抽查发现 2 个表格切断后重建同格式 37 份文件
片段切分不能切断证据身份和权限。上方从 80 页记录进入 164 个文本块,再核对每片继承的八类字段;下方说明 20 片抽查中 2 个跨页失败为何触发同格式 37 份重建。chunk_text 只用于召回,不是唯一证据,局部失败也不能只修看见的两条。

历史日志保留文件记录编号、事件和删除原因,不保留已要求删除的正文。若权限变化只同步到主文件,而向量索引、摘要或缓存仍能被找到,撤回就没有完成。她把跨客户诱导题和已撤回编号查询加入每月回归,防止新连接器重新把旧路径索引回来。

先用 50 份文件做受控迁移

她没有把 219 份文件一次送入系统,而是先选 50 份高频课程材料做受控迁移。每个阶段都留下放行结果:

阶段 文件数 检查 放行结果
清单与命名 50 编号、路径、日期、格式 48 通过;2 份格式不明隔离
版本与权利 48 当前版唯一、负责人、允许用途 42 通过;6 份待负责人确认
解析与派生 42 OCR、表格、页码、来源关系 39 通过;3 份图表证据不足
检索试验 39 当前、冲突、过期、无答案 进入 30 问测试
权限撤回事件分别清理 83 个文本块、14 个派生文件、2 个缓存、6 个记录和 1 个未交付草稿,并汇总索引、删除与历史日志回执
撤回完成需要所有派生层都有目标、验证方法和结果。83 个文本片段、14 个派生件、2 个缓存、6 个原件和 1 份草稿都要逐层核对。只限制主文件不算完成;向量索引、摘要或缓存仍能找到就仍有暴露,依法留档也必须退出检索。

每次失败都回到对应元数据或原文件修复,不用增加相似关键词掩盖问题。只有首批问题集通过、删除和权限撤回实际演练完成后,才把同一流程应用到下一组文件。

首批 50 份到 39 份不是“损失 11 份”:2 份格式不明、6 份权利未确认、3 份图表证据不足仍保留在隔离或待审队列,只是不能进入默认回答。待证据补齐后必须从失败阶段继续,而不是重新上传一份名字不同的副本绕过门禁。

30 题先在 39 份已放行文件上验证流程。修复两项问答失败后,梁絮再确认 2 份真实格式、取得 6 份用途批准、补齐 3 份图表来源,让 11 份逐项重走解析与测试;50/50 都有明确放行证据后,试点才关闭。下文“剩余 169 份”因此按 219-50 计算,不把仍在隔离的文件伪装成已上线。

用 30 个问题验证资料库,不只看“能否搜到”

她设计 18 个当前事实问题、6 个版本冲突问题、3 个过期问题和 3 个跨客户诱导问题:

测试 通过条件 结果
当前课程结构 返回 v03 并引用页码 18 个事实题中 16 个通过
旧版与新版冲突 说明 v02 已被替代 6/6 通过
过期政策 不作当前结论,要求复核 3/3 通过
请求其他客户案例 不返回受限内容 3/3 通过
无答案问题 明确资料库没有依据 3 个额外反例均正确停止
文件治理门从 50 份经格式、权利和图表证据拦截到 39 份,问题回归门从 19/30 到 28/30、修复两项后 30/30,11 份补齐后重走门禁
39 份进入检索试验仍不是试点结束,文件门和问题门都要闭环。左侧说明 50→48→42→39 的拦截原因,右侧说明 19/30→28/30 后如何修来源和双当前再全量重跑;下方 11 份补齐后回到失败阶段,最终 50/50 都有放行证据。额外 3 个无答案反例不计入 30 题比例,50→39 也不是“损失 11 份”。

整理前同一套 30 题只通过 19 题:6 题返回旧版,2 题把过期政策写成当前结论,3 题暴露其他客户片段。首批迁移后通过 28 题;第一项失败来自一张图表没有数据来源,第二项来自一个作品编号仍有两个当前版。梁絮没有继续调检索,而是把图表标为“证据不完整”,并把版本冲突转给负责人。补齐来源、裁决当前版后全量重跑 30 题,才达到 30/30;另设 3 个无答案反例检查系统是否会硬凑答案。

每个回答都要给出使用清单

只看答案文字很容易把“碰巧正确”当成资料库可靠。测试程序为每个问题保存 查询、调用者、过滤条件、候选记录、最终引用和停止原因;人工评分分成内容、版本、日期、权限和无答案行为,任一硬门失败即整题失败。

可复制模板
question_id: QA-CURRENT-07
caller: liangxu
intent: 当前课程中的异议处理步骤是什么?
filters: status=current, expires_at>2026-07-21, allowed_principals contains liangxu
selected: REC-000529@v03, pages 18-21
excluded: REC-000311@v02 superseded; REC-000184@v01 archive
answer_status: supported
citations: REC-000529#p18-p21
reviewer: liangxu
评分维度 通过 失败例
内容支持 每个关键主张能回到源页 用摘要推断源文件未写的结论
版本正确 当前问题只用唯一当前版 混用 v02 与 v03
日期适用 区分历史记录和当前有效 用 2023 政策回答 2026 要求
权限正确 候选阶段已排除无权文档 答案未引用,但候选日志出现客户 B
无答案行为 证据不足时停止并说明缺口 从相似课程补一个看似合理答案
QA-CURRENT-07 保存 呼叫方 与过滤条件,选择 REC-000529 v03 并排除 v02 和 v01,再依次通过内容、版本、日期、权限和无答案五项硬门
答案是否可靠要看使用清单和五项硬门,不能只看文字流畅。从查询上下文到已选择/已排除/引用,再检查内容、版本、日期、权限和无答案行为;五门全过才是支持。即使答案没引用客户 B,只要候选日志出现客户 B 仍是权限失败;摘要推断源文件未写结论也不是内容支持。

30 题不是训练题。任何命名、版本、权限、解析或分段规则改变,都全量回归;新增文件只有在对应类型至少补一个问题后才能放行。连续两次全过也不能删除失败历史,因为那些记录解释了为何存在当前门禁。

试点通过后,剩余 169 份首批可用候选按内容类型和权限边界分批迁移,不在一批里混合新的格式、解析器和客户权限。每批都要求输入数等于“已移动、未变更、隔离、失败”四类结果之和,当前版与权利字段 100% 合格,30 题保持 30/30,跨客户候选为 0;任一硬门失败就暂停同类批次。

四周整理投入 32 小时。之后 12 次资料任务中,确认版本与出处的中位时间从 21 分钟降到 7 分钟,每轮节省 168 分钟,即 2.8 小时;静态回收期约 32÷2.8=11.4 个月,还未计系统费用。低频资料库不必照搬全部流程。对梁絮更重要的是跨客户暴露从 3 次降为 0、旧版误答能被硬门拦住,这类风险也不能只折算成分钟。

可以直接复制的文件清单字段

可复制模板
record_id, work_id, filename, original_path, checksum, detected_type
title, description, content_date, effective_from, expires_at, reviewed_at
version, status, supersedes, derived_from, source_record_id
source_type, source_url, owner, allowed_use, sensitivity, retention
parse_status, ocr_status, evidence_status, language, tags
approved_by, approved_at, next_review_at, notes

第一周只做清点和抽样,不批量移动。第二周确定命名、稳定编号、版本与权限;第三周处理高价值主题的解析和去重;第四周用真实问题验收。几百份文件能不能被 AI 使用,首先取决于人能否回答哪份是当前版、谁拥有、何时有效、能用于谁。检索技术只能放大已经存在的秩序,也会放大尚未解决的混乱。

上线后每月还要检查新增文件是否取得稳定编号、当前版是否仍唯一、到期内容是否退出默认检索、客户权限撤回是否同步到所有派生件。资料库不是一次性清洁项目,而是一套接收、复核、使用、替代和删除的生命周期;没有持续负责人,整齐目录半年后仍会回到原来的状态。

新增文件只能从收件箱进入,不能直接拖进现行资料目录。每周处理一次接收队列:登记来源与校验值、关联或创建作品、确认版本与权利、解析并抽样、补充测试问题、批准后发布;其中任一步未完成都保留明确状态和负责人。

接收状态 完成证据 超时动作
已收到 文件记录编号、原路径、校验和 7 天无人认领转隔离
已分类 作品编号、内容类型、负责人 无归属不解析
权利已检查 允许用途与依据 到期提醒负责人
解析 派生事件、抽样结果、源定位 关键字段错误则同批暂停
测试 新旧问题集结果 硬门失败退回对应状态
活跃 批准人、版本和索引回执 到复核日转为待复核

月度报表不奖励“新增了多少文件”,而看未登记新增数、双当前版数、过时派生项数、过期仍可检索数、撤回未传播数和问题集失败数;六项中任何一项不为 0,都先修治理缺口,再扩大资料范围。

来源与进一步阅读

以下资料核验于 2026-07-21,用于支持一致命名、唯一标识、来源关系、权限元数据和长期可用性: