最难发现的错误,往往就藏在真实链接旁边

许澄是一名独立运营顾问。她请 AI 为一家 16 人顾问工作室起草“是否试点会议助手 M”的采购备忘录。初稿列出 18 个结论、22 个链接;链接都是真实网页,没有虚构域名,看起来比没有引用的答案可靠得多。

她先随机打开了几条:域名是真的,页面也确实在谈会议助手、效率和数据控制。问题看似已经解决。可当她把“页面谈到同一主题”和“页面支持这句话”分开检查,18 个结论迅速分成了七种不同关系:

审计关系 结论数 典型问题
直接支持 5 原文、范围与措辞一致
部分支持 5 支持方向,但人群、时间或强度更窄
数字或指标错配 3 数字是真的,指标名称或分母错误
来源与结论矛盾 1 原文限制与结论相反
仅主题相关 2 页面讨论同一话题,没有回答该句
来源身份错配 1 厂商委托案例被称为独立研究
当前无法核验 1 原表缺失或定位不可重现
合计 18 22 个链接存在不等于 18 句被支持
18 个带真实链接的结论分为直接支持、部分支持、数字错配、矛盾、仅相关、身份错配和无法核验
22 个链接都能打开,仍只有 5 个结论可以原样保留。链接存在只证明找到了一个页面;身份、版本、定位、语义、范围和强度仍要逐句核对。

最终 5 句原样保留,7 句缩小或重写,4 句降为“状态未知”,2 句删除。备忘录从“建议全面采购”改成“只批准 4 人、6 周、无自动发送的试点”。本文为教学案例,人物、产品代号、数字和来源包均用于说明审计方法,不代表真实产品效果。

一个引用至少要过七道门,链接能打开只是第一道

要问的问题 失败例
可访问 网址或 DOI 能否解析并看到正文 404、登录后仍无正文
身份 是否是声称的作者、标题和资料类型 把厂商博客称为独立研究
版本 当前看到的是否是引用时版本 页面已改,旧结论无快照
来源位置 能否定位到段落、表格、页码 只给首页链接
蕴含 原文是否支持这句话 同主题但没给结论
范围 人群、场景、指标、时间、比较是否一致 企业账户外推个人账户
强度 结论强度是否超过证据 “可能”写成“必然”

DOI 是持久标识,不是质量印章。Crossref 明确说明,DOI 不表示所定位对象具有价值或准确性;Crossref 自身也不评估内容质量。引用检查必须继续进入正文和具体主张。

先把复合句拆成原子主张,避免一个链接掩护三件事

初稿写:“会议助手 M 的准确率达到 92%,能把会后整理时间减少 35%,并符合所有客户的数据要求。”一句含三个可独立为真或假的主张:质量、时间和数据边界。它们需要不同来源和不同验收。

主张编号 原子主张 所需证据
C-03a 某项准确指标为 92% 指标定义、样本、分子分母
C-03b 会后整理时间减少 35% 对照、时间测量、参与者
C-03c 所有客户的数据要求均满足 每份合同、处理设置和批准
先把复合句拆成原子主张,避免一个链接掩护三件事:C-03a、C-03b、C-03c
一个链接不能同时替质量、时间和数据边界作证。把复合句拆成 C-03a、C-03b、C-03c 后,任何一项缺证据都不会被另外两项遮住。

只要 C-03a 有真实数字,整句就容易被误判为“有来源”。许澄规定,主张账本的每一行只能含一个谓词、一个对象和一组适用条件;包含“并且、同时、因此、所有”的句子优先拆分。

拆分后还要保存主张类型,因为描述、比较、因果、预测和规范性建议需要的证据不同:

主张类型 例子 最低检查
描述性 本样本 42/60 人选择自动纪要 样本、题目、分母和时间
比较性 会议助手 M 比手工模板快 35% 同一结果、比较组和测量方式
因果性 会议助手 M 导致交付效率提高 能排除其他变化的设计与不确定性
预测性 全面上线每月节省 500 美元 参数、使用率和敏感性
普遍性 所有客户都允许录音 每个目标客户范围的直接依据
建议 应全面采购 效果、风险、成本、价值与替代项

AI 常把描述性证据升级成因果结论或行动建议。审计先保留原始句型,再决定是补证据,还是把动词降回“观察到”“文档说明”“在本样本中”。

先核对来源身份:谁写的、为什么写、它是什么类型

同一个网址背后,可以是研究论文、新闻稿、产品帮助页、销售案例或转载摘要。来源身份决定它适合支持什么,不是决定一切的总分。

页面自称 实际身份 可以支持 不能单独支持
“研究报告” 厂商委托的客户案例 案例怎样描述流程 独立平均效果
“安全中心” 当前产品控制说明 可配置字段与责任边界 本账户已经正确配置
“行业调查” 60 名自选受访者问卷 该样本的回答 全行业比例
“新闻报道” 对原研究的二手摘要 发现线索 原研究方法与精确数字
“官方指南” 正式规则解释页 解释适用要求 替代具体合同判断

她为每个来源保存作者、出版商、资金来源、资料类型、发布日期、更新日期和来源用途。厂商来源不是自动无效,独立来源也不是自动适用;关键是让利益关系与用途可见。

身份页与正文也可能矛盾。一份 PDF 封面写“独立研究”,致谢页却说明样本由厂商提供、分析费用由厂商支付、厂商可在发布前审阅。许澄把“资金来自供应商”“样本来自供应商客户”“供应商拥有发布前事实核对权”分开记录,而不是只写“有利益冲突”四个字。

身份字段 SRC-12 记录 对结论的影响
作者 第三方咨询机构 不是厂商自行署名
资助方 会议助手 M 的厂商 选择与呈现可能受影响
样本来源 付费客户自愿参加 缺少未采用者
方法负责人 咨询机构 可检查方法附录
发布前审阅 厂商有事实核对权 不等于能否决负面结果,仍需说明

来源身份不直接决定结果真假,但会改变需要寻找的反证和允许的措辞。把“第三方撰写”自动改成“独立证明”是不支持的增强。

当前版本和当时引用要分开

初稿引用一页 2025 年帮助文档,页面在 2026 年改为新的数据保留选项。当前网址能打开,却不再证明作者写稿时看到的旧句子。审计记录引用日期、访问日期、内容版本、存档副本和内容摘要。

状态 正确动作
页面更新且新旧结论相同 引当前版并更新访问日期
页面更新且结论改变 同时保留当时版本与当前版本,重审主张
只有搜索摘要留存 不把摘要当原文,标为“不可验证”
PDF 有版本号、网页无版本 以可定位 PDF 为主要来源
来源已撤回或更正 标状态并评估所有下游结论
版本与日期不匹配时,当前真相和当时引用要分开:页面更新且新旧结论相同、页面更新且结论改变、只有搜索摘要留存、PDF 有版本号、网页无版本
当前页面与当时引用必须分开保存。页面在 2026 年改过,不代表它还能证明写稿人在 2025 年看到的旧规则;没有版本或存档,就只能把历史结论标为无法核验。

版本检查回答“这是谁在何时说的”,蕴含检查才回答“它是否支持这句话”。两步不能合并。

引用必须定位到最小证据单元

许澄要求证据位置精确到 PDF 页码、网页章节、表格行、视频时间戳或数据字段。定位失败有三种不同含义:页面不存在、页面存在但找不到原句、原句存在但不支持主张。

定位质量 示例 审计结果
可复现 SRC-07 第 18 页表格 4 行 “说话者归属” 允许进入语义检查
太宽 80 页报告首页 退回补页码
动态页面 价格配置器,无日期快照 保存输入与结果回执
二手定位 新闻稿称“见研究”但无研究链接 沿引用链找原文
不可访问 只有 AI 摘要 不可验证
引用必须定位到最小证据单元,不只给网站首页:可复现、太宽、动态页面、二手定位
引用必须定位到最小证据单元,不只给网站首页。页码、表格行、章节或时间戳让别人能复核同一处原文;过短摘录则容易删掉“仅限”“可能”“未发现”等限制词。

复制一小段原文可以帮助核对,但证据表还要保存上下文前后句;过短摘录容易删掉“仅限”“可能”“未发现”等限制词。

用五种蕴含关系判断来源到底怎样对待主张

关系 定义 修改动作
直接 原文在同一范围直接表达该主张 可保留,仍检查质量
部分 只支持部分对象、范围或方向 缩小措辞
矛盾 原文给出相反结果或关键限制 删除或并列冲突
相关 同一主题,没有回答该句 不能作支持引用
无关或无法定位 移除引用

判断时做反事实测试:如果原文为假,这句话是否仍可能为真?若可能,来源多半只是“相关”。比如安全认证页存在,并不能推出“所有客户合同都允许录音”;即使认证属实,合同结论仍可能为假。

她再做三步蕴含测试:先只读主张,写出它成立所必需的条件;再只读来源,摘出它能支持的最强表述;最后对比缺口,避免被初稿措辞锚定。

主张 来源最强事实 关系 缺口
数据 24 小时内全部删除 删除请求 24 小时内开始处理 部分 完成时间和备份层
接口可安全自动写任务 API 支持创建任务 相关 权限、幂等、审批和回滚
认证保证不会泄露 通过指定控制审计 相关 认证不保证零事件
所有会议都更快 48 个成功任务首稿更快 部分 7 个失败任务和复核时间
旧政策已不适用 新政策取代旧版 直接 仍需确认生效日期

“没有逐字出现”不一定是不支持,合理的直接推论可以接受;但推论步骤必须显式,不能引入来源没有的人群、因果或保证。

范围要逐格核对人群、场景、比较、结果和时间

许澄建立了一张范围矩阵:

维度 备忘录主张 来源实际范围 差异
总体 16 人顾问工作室 500 人软件企业 规模与流程不同
场景 客户访谈 内部例会 同意和噪声不同
比较 相对现有模板 相对无结构记录 基线不同
结果 总整理时间 首稿生成时间 漏掉复核时间
地平线 持续节省 首两周体验 时间外推
账户 标准套餐 企业套餐 功能与控制不同
范围匹配要逐格核对人群、场景、比较、结果和时间:总体、场景、比较、结果
范围匹配要逐格核对人群、场景、比较、结果和时间。500 人软件企业的内部例会结果,不能不加说明地迁移到 16 人顾问工作室的客户访谈;关键格不同,结论就必须缩小。

只要关键格不一致,结论就不能原样迁移。来源可作为间接证据,但文字必须说“在某个具体场景观察到”,并把本地验证列为待补缺口。

蕴含关系与来源质量必须分开。一篇方法很弱的客户案例可以直接支持“该案例报告 13 分钟”这句描述,但不能高质量支持一般效果;一篇严谨的大型研究可能质量高,却因人群、工具和结果不同而不直接支持本句。

蕴含 源质量 正确处理
直接 可形成较强主张,仍保留适用范围
直接 只报告该来源观察或声称,不外推
部分 缩小人群、结果或时间,不借质量补范围
相关 作为背景或方法,不挂在该句后当支持
矛盾 报告冲突并重审结论
任意 移除该引用

许澄的表里分别保存“支持关系”和“质量警示”,不计算一个综合分把两者抵消。高质量但不相关的来源,仍然是“不支持当前主张”。

引用位置也要对应句界。一个段落末尾放三个链接,读者无法知道分别支持哪一句;她把引用编号绑定到原子主张,并在多句共享来源时明确证据位置。背景来源不能因为离结论很近就被误解成效果证据。

数字是真的也可能被换了指标、分母或方向

第一个错误数字是 92%。原表记录的其实是:100 个已分段说话片段中,有 92 个说话者标签正确;初稿却写成“转写准确率 92%”。数字相同,指标完全不同。

第二个是 35%。来源中整理时间从 20 分钟降到 13 分钟,(20-13)÷20=35%;初稿写“生产率提高 35%”。时间下降不能直接改名为生产率提高,因为交付数量和质量没有测量。

第三个是问卷比例。60 名自选受访者中 42 人偏好自动草稿,42÷60=70%;初稿把“42 人”与另一题的“50 名使用者”混在一起,写成 42÷50=84%。分子和分母各自都真实,组合却不存在。

第四个是相对与绝对变化。错误行动项从每场 5 个降到 3 个,绝对减少 2 个,相对减少 40%;初稿写“准确率提升 40%”。错误数量的相对下降不等于准确率上升,且没有总行动项分母。

数字检查 必须记录
分子 / 分母 92 个正确标签 / 100 个片段
指标定义 说话者归属,不是单词准确率
单元 分钟、百分比、人数、会议
基线 / 比较器 20 分钟的旧流程是什么
时间窗口 两周试用还是全年
缺失 / 排除项 哪些失败会议被排除
不确定性 区间、样本波动或至少说明未知
数字是真的也可能被换了指标、分母或方向:分子 / 分母…、指标定义、单元、基线 / 比较…
算术正确,不代表结论正确。92% 是说话者标签正确率,不是转写准确率;20 分钟降至 13 分钟是首稿时间下降,也不能直接改名为生产率提高。

不能只按计算器验证 35%。算术正确、概念错误仍是不支持。

以“数据 24 小时内全部删除”为例,许澄完整走一遍:隐私页写用户请求在 24 小时内进入处理队列;数据处理协议写活动存储按请求删除;备份说明写轮换最长 30 天;缓存层没有可验证说明。原句把启动、活动存储和全部层混成一个保证。

来源事实 可写结论 仍未知
请求受理 24 小时内进入队列 受理目标为 24 小时 是否完成
活动存储 按已验证请求删除 活动记录可请求删除 实际回执时长
备份 最长 30 天轮换 备份可能继续保留至 30 天 是否提前清除
搜索索引 文档未说明 状态未知 派生片段何时不可检索
应用缓存 文档未说明 状态未知 已生成摘要怎样失效

修订句写成:“文档称删除请求在 24 小时内开始处理,活动存储按请求删除,备份最长 30 天轮换;索引与应用缓存的端到端撤回尚未验证。”这比一句“合规删除”更长,却准确区分了可证实和未知。

她把删除演练列为试点前硬门:创建一个带唯一标记的测试会议,删除后分别查原件、活动记录、搜索、摘要和缓存;任何一层仍能返回内容,C-04 就保持“部分支持”,不得升级为“直接支持”。

图表标题、脚注和坐标轴也在限制结论

AI 从柱状图读出“所有任务都更快”,但图只展示完成的 48 项,脚注说明另有 7 项因音频失败未进入分析。若把失败项排除,速度结论只适用于成功处理的任务。

图表审计保存图表编号、坐标轴、单位、图例、脚注、纳入数和数据来源。像素估读只能写近似值;没有数据表不能创造小数精度。截取图时必须保留标题和脚注,避免一个孤立柱形成为“证据”。

图表错误 例子 修正
截断坐标轴 变化看起来翻倍 报绝对值和轴起点
只见完成样本 失败样本被排除 写纳入和排除数
双轴混读 时间与满意度共图 各按对应轴读取
类别顺序错 图例颜色对应错 回到原图与数据表
平均掩盖分布 均值下降但长尾变差 同时报中位数或范围
图表标题、脚注和坐标轴往往比正文更能限制结论:截断坐标轴、只见完成样本、双轴混读、类别顺序错
图表标题、脚注和坐标轴往往比正文更能限制结论。AI 从柱状图读出“所有任务都更快”,但图只展示完成的 48 项,脚注说明另有 7 项因音频失败未进入分析。 若把失败项排除,速度结论只适用于成功处理的任务。

沿引用链找到原始来源,防止二手摘要逐层增强

一篇博客写“独立研究证明节省 40%”,链接到新闻稿;新闻稿链接到白皮书;白皮书的原表只显示 12 名付费客户自报“约减少四成首稿时间”。每转述一层,独立、证明、总体时间三个词被加上。

许澄为引用链同时保存“直接引用的来源编号”和“底层研究编号”。多篇报道若都来自同一白皮书,只算一个底层证据,不能用链接数量制造共识。无法取得原始材料时,二手来源可说明“某方曾这样声称”,不能支持精确效果。

第一手来源也要问:它直接记录了什么,而不是什么都更可靠。

产品日志可直接证明本账户某设置在某时刻的值;用户访谈可直接证明受访者说过什么;实验原表可证明记录值。它们仍可能有缺失、偏差和错误。

主张 更直接来源 仍需检查
当前保留设置 账户导出或设置回执 导出时间、账户范围
用户觉得复核麻烦 访谈原话 样本与提问方式
时间下降 逐任务计时表 排除、基线和质量
合同允许处理 已签合同条款 适用客户与附件
产品宣称支持功能 当前官方文档 套餐和实际启用

“第一手”是关系描述,不是免检标签。对某个主张更直接,才有意义。

沿链时,每层转述都要保留:原表是“成功任务首稿时间”,白皮书摘要成“会后工作时间”,新闻稿再成“团队生产率”。只有看到三层差异,审阅者才能判断增强发生在哪里;最终引用优先回到原表,同时可把新闻稿作为传播语境,而不是效果证据。

负面证据与没有证据不是一回事

“研究没有发现时间改善”可能表示估计接近零,也可能表示样本太小、区间同时包含有利和不利结果。没有证据支持某效果,也不能自动写成“证明无效果”。

许澄把五种情况分开:没找到资料是“缺失”;结果不确定是“不明确”;结果指向无差异是“空值”;结果方向相反是“负面”;两个合格来源冲突是“矛盾”。每种状态对应不同措辞和下一步。

证据状态 可以写 不能写 下一步
缺失 本轮未找到合格证据 已证明没有效果 扩大来源或保留缺口
不明确 结果同时兼容改善与无改善 没有效果 增样本或报告区间
空值 本研究未观察到重要差异 两方案完全相同 检查精度与适用范围
负面 本样本结果方向更差 所有场景都更差 查机制与复制
矛盾 合格来源结论不一致 选数量多的一方 比较版本、方法与人群

一项 12 场模拟没有观察到节省,可能只是波动很大;一项 400 场记录显示复核更慢,也仍要检查是否因为复杂会议更常启用工具。负面方向同样不能跳过范围与混杂。

更正、撤回和状态更新必须传播到引用它的所有主张

链接今天能开,内容仍可能被更正、撤回或替代。审计要登记更正、撤稿、关注声明、已被取代和当前有效等状态,并记录检查时间。

来源状态变化 下游动作
只改排版 校验内容摘要,无语义变化则更新记录
数字更正 把所有相关主张标为“待复核”
结论撤回 立即停止使用,不删除历史引用
新版替代 比较变化,当前问题优先新版
状态未知 不用于高风险确定结论
更正、撤回和状态更新必须传播到引用它的所有主张:只改排版、数字更正、结论撤回、新版替代
更正、撤回和状态更新必须传播到引用它的所有主张。链接今天能开,内容仍可能被更正、撤回或替代。 稳定定位帮助找到对象,不能代替阅读对象的当前状态。

DOI 持久并不阻止内容状态变化。稳定定位帮助找到对象,不能代替阅读对象的当前状态。

许澄为来源状态事件建立传播表。SRC-14 的表 3 更正了分母后,系统找到 C-06、FIG-02 和执行摘要三处使用位置;先全部标为“待复核”,重新计算 42/60=70%,再发布 MEMO-02@1.2。旧版仍保留“当时使用错误分母”的审计事实,不覆盖历史文件。

状态事件字段 示例
事件编号 SE-04
来源编号 SRC-14
旧 / 新 分母 50 → 60
发现时间 2026-07-21 10:40 +08:00
受影响 C-06、FIG-02、MEMO 摘要
立即动作 全部标为“待复核”,暂停发布
解决版本 C-06@1.2FIG-02@1.1
复核人 许澄

传播完成要验证搜索结果、缓存摘要和导出 PDF 都不再显示 84%,不能只改证据表中的一格。

多来源结论要建立证据组合,不是把三个链接放在句尾

“受限试点值得开展”依赖四类不同证据:内部整理成本、模拟质量、数据边界和可逆退出。任何一类缺失,建议都要缩小。

证据项 证据 状态 对建议的影响
问题 40 场内部计时 已支持 有问题值得测
能力 12 场模拟 混合 只能小规模人工复核
权限 10/16 客户合同已确认 部分 未确认客户默认排除
可逆性 删除演练只过 3/4 层 不足 上线前补缓存撤回
经济效益 盈亏平衡模型 假设 试点记录真实时间

建议不是由“多数来源支持”投票产生,而是看必要条件是否都达到最低门槛。安全边界失败不能被时间收益抵消。

完整审计 18 个结论:从原句到修订动作

主张 原句 关系 处理
C-01 转写准确率 92% 指标不匹配 改为说话人标签 92/100
C-02 生产率提高 35% 部分 改为成功任务首稿时间 20→13 分钟
C-03 所有客户允许录音 矛盾 删除;6 份合同未知
C-04 数据 24 小时内全部删除 部分 区分请求启动与备份 30 天
C-05 独立研究证明效果 身份不匹配 标厂商委托案例
C-06 用户普遍偏好自动纪要 范围不匹配 改为 60 人自选样本 42 人偏好
C-07 认证保证不泄露 相关 删除因果式保证
C-08 能与任务系统安全集成 部分 仅证实接口存在,权限待测
完整审计 18 个结论:从原句到修订动作:C-01、C-02、C-03、C-04
18 个原句必须各自落到明确动作。最终不是简单地分成“有引用”和“无引用”,而是原样保留 5 句、重写 7 句、保持未知 4 句、删除 2 句。
主张 原句 关系 处理
C-09 会议内容不用于模型训练 直接(限定企业设置) 保留套餐与“截至何时”条件
C-10 支持中文和英文术语 部分 改为文档列出两种语言,混合会议待测
C-11 安全中心列出当前控制项目 直接 原样保留,但不升级为零事件保证
C-12 所有录音均在本地区存储 不可验证 降为“状态未知”,等待账户回执
C-13 可随时无损导出全部历史 部分 改为支持指定格式,完整性待演练
C-14 12 名员工一年可节省 9,600 美元 假设不匹配 重算并列采用率敏感性
C-15 客户满意度会提高 相关 删除因果结论,列为试点问题
C-16 说话人标签 92/100 直接 原样保留并注明模拟样本
C-17 已签数据处理协议包含删除条款 直接 原样保留,引用条款号
C-18 自动发送默认关闭 直接 原样保留并附设置回执

处理统计以最终动作而不是引用数量为准:C-09、C-11、C-16、C-17、C-18 共 5 条原样保留;C-01、C-02、C-04、C-05、C-06、C-10、C-13 共 7 条重写;C-03、C-08、C-12、C-14 共 4 条保持“状态未知”;C-07 与 C-15 共 2 条删除,合计 18。

这里暴露一个重要规则:原始“结论数”和拆分后的“原子主张数”不能混用。备忘录有 18 个决策句,拆分后产生 23 个原子主张;处理统计仍按 18 个原句报告,同时账本对 23 个原子项逐一保存支持关系。否则拆得越细,失败数量看起来越多,前后比例失真。

统计口径 数量 用途
原始决策句 18 向读者说明最终怎么处理
原子主张 23 逐项匹配证据
引用链接 22 定位来源,不代表独立证据数
底层来源 16 去除同一研究的转载与落地页
原样保留句 5 所有原子项均有直接支持且范围一致

每次修改都保留原句、对应的原子主张编号、修订句、修改原因和复核人。这样,审计既能展示读者看到的 18 句,也不会漏掉藏在复合句中的子主张。

主张账本是审计产物

可复制模板
claim_id: C-02
original: 使用 M 让生产率提高 35%
revised: 在来源所述的成功处理任务中,首稿整理时间由 20 分钟降至 13 分钟
source: SRC-09, table 2, rows 4-5
relation: partial
scope_gap: no delivery-volume or quality measure
arithmetic: (20-13)/20 = 35%
status: accepted_with_revision
reviewer: 许澄

账本让读者知道改了什么和为什么。最终正文只引用“已接受”或“修订后接受”的主张;“状态未知”进入缺口表,“已拒绝”也保留在历史中,不会被悄悄删除。

AI 可以做候选抽取和一致性检查,不能自己给自己放行

许澄让 AI 执行四类低风险工作:拆复合句、抓取候选段落、对照范围字段、复算明确公式。每项都要输出证据编号和原文位置,不能直接改写主张状态。

人工负责来源身份、隐含语义、适用范围、利益关系、法律边界和最终措辞。尤其是 AI 生成的原句不能由同一次无独立标准的生成自评直接通过;至少要用冻结规则和原文逐项核对。

自动检查 能发现 不能保证
URL 解析器 是否可打开 内容质量
定位符匹配器 原句是否出现 原句是否支持结论
数字解析器 分子分母与算术 指标概念正确
范围差异 字段文字不一致 差异是否可接受
状态查询 页面标注更正 未公开的问题

用反向抽样和改写回归防止审计过程自己出错

第一轮 18 条中,AI 判 11 条“已支持”。许澄逐条人工审计后,只有 5 条得到直接支持。她再从 22 个来源反向抽 8 个,检查是否有原文被错误用于多个主张;结果发现 2 个来源各被过度扩展到第二个结论。

修订后运行三类回归:每个引用都能打开到具体证据位置;每个数字都可复算;每个强限定词“所有、保证、证明、显著”都有直接依据。18/18 通过结构检查,但 4 个“状态未知”仍保持未知,不能为了全绿填入猜测。

她请另一名审阅者在不知道 AI 初判的情况下复核 6 个高影响主张。两人在 4 条上直接一致,2 条有分歧:审阅者把 C-04 判为“仅相关”,许澄判为“部分支持”;审阅者认为 C-10 可获直接支持,许澄认为混合语言场景缺失。回到关系定义后,C-04 保持“部分支持”,因为来源确实支持删除流程的一部分;C-10 也保持“部分支持”,因为列出两种语言不等于验证同一会议混用。

复核维度 通过标准 分歧处理
身份 来源类型与利益关系一致 查封面、方法和资助
蕴含 使用同一五分类定义 各自写最强支持句再比较
范围 六个范围字段逐格核对 不用“差不多”裁决
算术 独立从原表复算 保留计算式
操作 支持关系对应修改动作 直接支持不等于原样保留全部段落
用反向抽样和改写回归防止审计过程自己出错:身份、蕴含、范围、算术
审计过程本身也需要校验。AI 初判 11 条“已支持”,人工逐条复核后只剩 5 条;再从来源反向抽样,才能发现同一段原文是否被扩张去支持第二个结论。

盲审不是为了做形式上的双签,而是检验规则能否让另一人得到可解释结果。分歧记录留在审计日志,最终裁决与理由一并发布。

18 句初审用了 3.6 小时:链接与身份 46 分钟、定位和摘录 58 分钟、范围与数字 72 分钟、改写与回归 40 分钟。后续同结构备忘录可以复用表格与检查顺序,但不能把这次的支持关系直接复制给新来源。

成本情形 审计投入 避免的失败
低风险内部草稿 抽查关键数字和强限定词约 45 分钟 普通表述错误
采购建议 18 句全审 3.6 小时 错误采购、范围与收益承诺
涉及客户数据 全审 + 合同/删除演练 权限和不可逆数据风险
已自动发布内容 先暂停发布,再查传播范围 错误引用继续扩散

审计成本应随决策风险提高。若文章只是个人探索,可优先检查会改变行动的关键主张;涉及采购、法律、医疗、金融或外部发送时,不能用“链接都是真的”降低复核强度。

可以直接复制的引用审计表

可复制模板
claim_id, original_claim, atomic_claim, source_id, source_type
url_or_doi, cited_at, accessed_at, version, locator, archived_copy
verbatim_fact, entailment, population, setting, comparison, outcome, time
numerator, denominator, unit, arithmetic, uncertainty, status_note
conflict_ids, scope_gap, revised_claim, action, reviewer, reviewed_at

审计顺序固定为:拆句→身份→版本→定位→蕴含→范围→数字→状态→改写→复核。不要因为链接来自熟悉机构就跳过中间步骤,也不要因为来源有局限就把其中可直接支持的事实全部丢弃。

时间不足时,先做 15 分钟风险分诊,不等于完成审计:

优先级 先找什么 原因
P0 医疗、法律、金融、权限和自动外部动作 错误可能不可逆
P1 数字、排名、因果、预测和“所有、保证、证明” 最容易被真实链接掩护增强
P2 当前功能、价格、条款和政策 版本变化快
P3 背景描述和低影响例子 可后续抽查

P0 或 P1 只要原文位置、分母、范围或当前状态缺一项,就先撤下结论,不用“可能正确”继续发布。完成分诊后仍要回到 10 步全审;风险排序只决定先后,不降低放行标准。

来源与进一步阅读

以下资料核验于 2026-07-21,用于说明 DOI 的边界、内容质量与标识分离、证据确定性,以及为什么结论不能超过证据: