最难发现的错误,往往就藏在真实链接旁边
许澄是一名独立运营顾问。她请 AI 为一家 16 人顾问工作室起草“是否试点会议助手 M”的采购备忘录。初稿列出 18 个结论、22 个链接;链接都是真实网页,没有虚构域名,看起来比没有引用的答案可靠得多。
她先随机打开了几条:域名是真的,页面也确实在谈会议助手、效率和数据控制。问题看似已经解决。可当她把“页面谈到同一主题”和“页面支持这句话”分开检查,18 个结论迅速分成了七种不同关系:
| 审计关系 | 结论数 | 典型问题 |
|---|---|---|
| 直接支持 | 5 | 原文、范围与措辞一致 |
| 部分支持 | 5 | 支持方向,但人群、时间或强度更窄 |
| 数字或指标错配 | 3 | 数字是真的,指标名称或分母错误 |
| 来源与结论矛盾 | 1 | 原文限制与结论相反 |
| 仅主题相关 | 2 | 页面讨论同一话题,没有回答该句 |
| 来源身份错配 | 1 | 厂商委托案例被称为独立研究 |
| 当前无法核验 | 1 | 原表缺失或定位不可重现 |
| 合计 | 18 | 22 个链接存在不等于 18 句被支持 |
最终 5 句原样保留,7 句缩小或重写,4 句降为“状态未知”,2 句删除。备忘录从“建议全面采购”改成“只批准 4 人、6 周、无自动发送的试点”。本文为教学案例,人物、产品代号、数字和来源包均用于说明审计方法,不代表真实产品效果。
一个引用至少要过七道门,链接能打开只是第一道
| 门 | 要问的问题 | 失败例 |
|---|---|---|
| 可访问 | 网址或 DOI 能否解析并看到正文 | 404、登录后仍无正文 |
| 身份 | 是否是声称的作者、标题和资料类型 | 把厂商博客称为独立研究 |
| 版本 | 当前看到的是否是引用时版本 | 页面已改,旧结论无快照 |
| 来源位置 | 能否定位到段落、表格、页码 | 只给首页链接 |
| 蕴含 | 原文是否支持这句话 | 同主题但没给结论 |
| 范围 | 人群、场景、指标、时间、比较是否一致 | 企业账户外推个人账户 |
| 强度 | 结论强度是否超过证据 | “可能”写成“必然” |
DOI 是持久标识,不是质量印章。Crossref 明确说明,DOI 不表示所定位对象具有价值或准确性;Crossref 自身也不评估内容质量。引用检查必须继续进入正文和具体主张。
先把复合句拆成原子主张,避免一个链接掩护三件事
初稿写:“会议助手 M 的准确率达到 92%,能把会后整理时间减少 35%,并符合所有客户的数据要求。”一句含三个可独立为真或假的主张:质量、时间和数据边界。它们需要不同来源和不同验收。
| 主张编号 | 原子主张 | 所需证据 |
|---|---|---|
| C-03a | 某项准确指标为 92% | 指标定义、样本、分子分母 |
| C-03b | 会后整理时间减少 35% | 对照、时间测量、参与者 |
| C-03c | 所有客户的数据要求均满足 | 每份合同、处理设置和批准 |
只要 C-03a 有真实数字,整句就容易被误判为“有来源”。许澄规定,主张账本的每一行只能含一个谓词、一个对象和一组适用条件;包含“并且、同时、因此、所有”的句子优先拆分。
拆分后还要保存主张类型,因为描述、比较、因果、预测和规范性建议需要的证据不同:
| 主张类型 | 例子 | 最低检查 |
|---|---|---|
| 描述性 | 本样本 42/60 人选择自动纪要 | 样本、题目、分母和时间 |
| 比较性 | 会议助手 M 比手工模板快 35% | 同一结果、比较组和测量方式 |
| 因果性 | 会议助手 M 导致交付效率提高 | 能排除其他变化的设计与不确定性 |
| 预测性 | 全面上线每月节省 500 美元 | 参数、使用率和敏感性 |
| 普遍性 | 所有客户都允许录音 | 每个目标客户范围的直接依据 |
| 建议 | 应全面采购 | 效果、风险、成本、价值与替代项 |
AI 常把描述性证据升级成因果结论或行动建议。审计先保留原始句型,再决定是补证据,还是把动词降回“观察到”“文档说明”“在本样本中”。
先核对来源身份:谁写的、为什么写、它是什么类型
同一个网址背后,可以是研究论文、新闻稿、产品帮助页、销售案例或转载摘要。来源身份决定它适合支持什么,不是决定一切的总分。
| 页面自称 | 实际身份 | 可以支持 | 不能单独支持 |
|---|---|---|---|
| “研究报告” | 厂商委托的客户案例 | 案例怎样描述流程 | 独立平均效果 |
| “安全中心” | 当前产品控制说明 | 可配置字段与责任边界 | 本账户已经正确配置 |
| “行业调查” | 60 名自选受访者问卷 | 该样本的回答 | 全行业比例 |
| “新闻报道” | 对原研究的二手摘要 | 发现线索 | 原研究方法与精确数字 |
| “官方指南” | 正式规则解释页 | 解释适用要求 | 替代具体合同判断 |
她为每个来源保存作者、出版商、资金来源、资料类型、发布日期、更新日期和来源用途。厂商来源不是自动无效,独立来源也不是自动适用;关键是让利益关系与用途可见。
身份页与正文也可能矛盾。一份 PDF 封面写“独立研究”,致谢页却说明样本由厂商提供、分析费用由厂商支付、厂商可在发布前审阅。许澄把“资金来自供应商”“样本来自供应商客户”“供应商拥有发布前事实核对权”分开记录,而不是只写“有利益冲突”四个字。
| 身份字段 | SRC-12 记录 | 对结论的影响 |
|---|---|---|
| 作者 | 第三方咨询机构 | 不是厂商自行署名 |
| 资助方 | 会议助手 M 的厂商 | 选择与呈现可能受影响 |
| 样本来源 | 付费客户自愿参加 | 缺少未采用者 |
| 方法负责人 | 咨询机构 | 可检查方法附录 |
| 发布前审阅 | 厂商有事实核对权 | 不等于能否决负面结果,仍需说明 |
来源身份不直接决定结果真假,但会改变需要寻找的反证和允许的措辞。把“第三方撰写”自动改成“独立证明”是不支持的增强。
当前版本和当时引用要分开
初稿引用一页 2025 年帮助文档,页面在 2026 年改为新的数据保留选项。当前网址能打开,却不再证明作者写稿时看到的旧句子。审计记录引用日期、访问日期、内容版本、存档副本和内容摘要。
| 状态 | 正确动作 |
|---|---|
| 页面更新且新旧结论相同 | 引当前版并更新访问日期 |
| 页面更新且结论改变 | 同时保留当时版本与当前版本,重审主张 |
| 只有搜索摘要留存 | 不把摘要当原文,标为“不可验证” |
| PDF 有版本号、网页无版本 | 以可定位 PDF 为主要来源 |
| 来源已撤回或更正 | 标状态并评估所有下游结论 |
版本检查回答“这是谁在何时说的”,蕴含检查才回答“它是否支持这句话”。两步不能合并。
引用必须定位到最小证据单元
许澄要求证据位置精确到 PDF 页码、网页章节、表格行、视频时间戳或数据字段。定位失败有三种不同含义:页面不存在、页面存在但找不到原句、原句存在但不支持主张。
| 定位质量 | 示例 | 审计结果 |
|---|---|---|
| 可复现 | SRC-07 第 18 页表格 4 行 “说话者归属” | 允许进入语义检查 |
| 太宽 | 80 页报告首页 | 退回补页码 |
| 动态页面 | 价格配置器,无日期快照 | 保存输入与结果回执 |
| 二手定位 | 新闻稿称“见研究”但无研究链接 | 沿引用链找原文 |
| 不可访问 | 只有 AI 摘要 | 不可验证 |
复制一小段原文可以帮助核对,但证据表还要保存上下文前后句;过短摘录容易删掉“仅限”“可能”“未发现”等限制词。
用五种蕴含关系判断来源到底怎样对待主张
| 关系 | 定义 | 修改动作 |
|---|---|---|
| 直接 | 原文在同一范围直接表达该主张 | 可保留,仍检查质量 |
| 部分 | 只支持部分对象、范围或方向 | 缩小措辞 |
| 矛盾 | 原文给出相反结果或关键限制 | 删除或并列冲突 |
| 相关 | 同一主题,没有回答该句 | 不能作支持引用 |
| 无 | 无关或无法定位 | 移除引用 |
判断时做反事实测试:如果原文为假,这句话是否仍可能为真?若可能,来源多半只是“相关”。比如安全认证页存在,并不能推出“所有客户合同都允许录音”;即使认证属实,合同结论仍可能为假。
她再做三步蕴含测试:先只读主张,写出它成立所必需的条件;再只读来源,摘出它能支持的最强表述;最后对比缺口,避免被初稿措辞锚定。
| 主张 | 来源最强事实 | 关系 | 缺口 |
|---|---|---|---|
| 数据 24 小时内全部删除 | 删除请求 24 小时内开始处理 | 部分 | 完成时间和备份层 |
| 接口可安全自动写任务 | API 支持创建任务 | 相关 | 权限、幂等、审批和回滚 |
| 认证保证不会泄露 | 通过指定控制审计 | 相关 | 认证不保证零事件 |
| 所有会议都更快 | 48 个成功任务首稿更快 | 部分 | 7 个失败任务和复核时间 |
| 旧政策已不适用 | 新政策取代旧版 | 直接 | 仍需确认生效日期 |
“没有逐字出现”不一定是不支持,合理的直接推论可以接受;但推论步骤必须显式,不能引入来源没有的人群、因果或保证。
范围要逐格核对人群、场景、比较、结果和时间
许澄建立了一张范围矩阵:
| 维度 | 备忘录主张 | 来源实际范围 | 差异 |
|---|---|---|---|
| 总体 | 16 人顾问工作室 | 500 人软件企业 | 规模与流程不同 |
| 场景 | 客户访谈 | 内部例会 | 同意和噪声不同 |
| 比较 | 相对现有模板 | 相对无结构记录 | 基线不同 |
| 结果 | 总整理时间 | 首稿生成时间 | 漏掉复核时间 |
| 地平线 | 持续节省 | 首两周体验 | 时间外推 |
| 账户 | 标准套餐 | 企业套餐 | 功能与控制不同 |
只要关键格不一致,结论就不能原样迁移。来源可作为间接证据,但文字必须说“在某个具体场景观察到”,并把本地验证列为待补缺口。
蕴含关系与来源质量必须分开。一篇方法很弱的客户案例可以直接支持“该案例报告 13 分钟”这句描述,但不能高质量支持一般效果;一篇严谨的大型研究可能质量高,却因人群、工具和结果不同而不直接支持本句。
| 蕴含 | 源质量 | 正确处理 |
|---|---|---|
| 直接 | 高 | 可形成较强主张,仍保留适用范围 |
| 直接 | 低 | 只报告该来源观察或声称,不外推 |
| 部分 | 高 | 缩小人群、结果或时间,不借质量补范围 |
| 相关 | 高 | 作为背景或方法,不挂在该句后当支持 |
| 矛盾 | 高 | 报告冲突并重审结论 |
| 无 | 任意 | 移除该引用 |
许澄的表里分别保存“支持关系”和“质量警示”,不计算一个综合分把两者抵消。高质量但不相关的来源,仍然是“不支持当前主张”。
引用位置也要对应句界。一个段落末尾放三个链接,读者无法知道分别支持哪一句;她把引用编号绑定到原子主张,并在多句共享来源时明确证据位置。背景来源不能因为离结论很近就被误解成效果证据。
数字是真的也可能被换了指标、分母或方向
第一个错误数字是 92%。原表记录的其实是:100 个已分段说话片段中,有 92 个说话者标签正确;初稿却写成“转写准确率 92%”。数字相同,指标完全不同。
第二个是 35%。来源中整理时间从 20 分钟降到 13 分钟,(20-13)÷20=35%;初稿写“生产率提高 35%”。时间下降不能直接改名为生产率提高,因为交付数量和质量没有测量。
第三个是问卷比例。60 名自选受访者中 42 人偏好自动草稿,42÷60=70%;初稿把“42 人”与另一题的“50 名使用者”混在一起,写成 42÷50=84%。分子和分母各自都真实,组合却不存在。
第四个是相对与绝对变化。错误行动项从每场 5 个降到 3 个,绝对减少 2 个,相对减少 40%;初稿写“准确率提升 40%”。错误数量的相对下降不等于准确率上升,且没有总行动项分母。
| 数字检查 | 必须记录 |
|---|---|
| 分子 / 分母 | 92 个正确标签 / 100 个片段 |
| 指标定义 | 说话者归属,不是单词准确率 |
| 单元 | 分钟、百分比、人数、会议 |
| 基线 / 比较器 | 20 分钟的旧流程是什么 |
| 时间窗口 | 两周试用还是全年 |
| 缺失 / 排除项 | 哪些失败会议被排除 |
| 不确定性 | 区间、样本波动或至少说明未知 |
不能只按计算器验证 35%。算术正确、概念错误仍是不支持。
以“数据 24 小时内全部删除”为例,许澄完整走一遍:隐私页写用户请求在 24 小时内进入处理队列;数据处理协议写活动存储按请求删除;备份说明写轮换最长 30 天;缓存层没有可验证说明。原句把启动、活动存储和全部层混成一个保证。
| 层 | 来源事实 | 可写结论 | 仍未知 |
|---|---|---|---|
| 请求受理 | 24 小时内进入队列 | 受理目标为 24 小时 | 是否完成 |
| 活动存储 | 按已验证请求删除 | 活动记录可请求删除 | 实际回执时长 |
| 备份 | 最长 30 天轮换 | 备份可能继续保留至 30 天 | 是否提前清除 |
| 搜索索引 | 文档未说明 | 状态未知 | 派生片段何时不可检索 |
| 应用缓存 | 文档未说明 | 状态未知 | 已生成摘要怎样失效 |
修订句写成:“文档称删除请求在 24 小时内开始处理,活动存储按请求删除,备份最长 30 天轮换;索引与应用缓存的端到端撤回尚未验证。”这比一句“合规删除”更长,却准确区分了可证实和未知。
她把删除演练列为试点前硬门:创建一个带唯一标记的测试会议,删除后分别查原件、活动记录、搜索、摘要和缓存;任何一层仍能返回内容,C-04 就保持“部分支持”,不得升级为“直接支持”。
图表标题、脚注和坐标轴也在限制结论
AI 从柱状图读出“所有任务都更快”,但图只展示完成的 48 项,脚注说明另有 7 项因音频失败未进入分析。若把失败项排除,速度结论只适用于成功处理的任务。
图表审计保存图表编号、坐标轴、单位、图例、脚注、纳入数和数据来源。像素估读只能写近似值;没有数据表不能创造小数精度。截取图时必须保留标题和脚注,避免一个孤立柱形成为“证据”。
| 图表错误 | 例子 | 修正 |
|---|---|---|
| 截断坐标轴 | 变化看起来翻倍 | 报绝对值和轴起点 |
| 只见完成样本 | 失败样本被排除 | 写纳入和排除数 |
| 双轴混读 | 时间与满意度共图 | 各按对应轴读取 |
| 类别顺序错 | 图例颜色对应错 | 回到原图与数据表 |
| 平均掩盖分布 | 均值下降但长尾变差 | 同时报中位数或范围 |
沿引用链找到原始来源,防止二手摘要逐层增强
一篇博客写“独立研究证明节省 40%”,链接到新闻稿;新闻稿链接到白皮书;白皮书的原表只显示 12 名付费客户自报“约减少四成首稿时间”。每转述一层,独立、证明、总体时间三个词被加上。
许澄为引用链同时保存“直接引用的来源编号”和“底层研究编号”。多篇报道若都来自同一白皮书,只算一个底层证据,不能用链接数量制造共识。无法取得原始材料时,二手来源可说明“某方曾这样声称”,不能支持精确效果。
第一手来源也要问:它直接记录了什么,而不是什么都更可靠。
产品日志可直接证明本账户某设置在某时刻的值;用户访谈可直接证明受访者说过什么;实验原表可证明记录值。它们仍可能有缺失、偏差和错误。
| 主张 | 更直接来源 | 仍需检查 |
|---|---|---|
| 当前保留设置 | 账户导出或设置回执 | 导出时间、账户范围 |
| 用户觉得复核麻烦 | 访谈原话 | 样本与提问方式 |
| 时间下降 | 逐任务计时表 | 排除、基线和质量 |
| 合同允许处理 | 已签合同条款 | 适用客户与附件 |
| 产品宣称支持功能 | 当前官方文档 | 套餐和实际启用 |
“第一手”是关系描述,不是免检标签。对某个主张更直接,才有意义。
沿链时,每层转述都要保留:原表是“成功任务首稿时间”,白皮书摘要成“会后工作时间”,新闻稿再成“团队生产率”。只有看到三层差异,审阅者才能判断增强发生在哪里;最终引用优先回到原表,同时可把新闻稿作为传播语境,而不是效果证据。
负面证据与没有证据不是一回事
“研究没有发现时间改善”可能表示估计接近零,也可能表示样本太小、区间同时包含有利和不利结果。没有证据支持某效果,也不能自动写成“证明无效果”。
许澄把五种情况分开:没找到资料是“缺失”;结果不确定是“不明确”;结果指向无差异是“空值”;结果方向相反是“负面”;两个合格来源冲突是“矛盾”。每种状态对应不同措辞和下一步。
| 证据状态 | 可以写 | 不能写 | 下一步 |
|---|---|---|---|
| 缺失 | 本轮未找到合格证据 | 已证明没有效果 | 扩大来源或保留缺口 |
| 不明确 | 结果同时兼容改善与无改善 | 没有效果 | 增样本或报告区间 |
| 空值 | 本研究未观察到重要差异 | 两方案完全相同 | 检查精度与适用范围 |
| 负面 | 本样本结果方向更差 | 所有场景都更差 | 查机制与复制 |
| 矛盾 | 合格来源结论不一致 | 选数量多的一方 | 比较版本、方法与人群 |
一项 12 场模拟没有观察到节省,可能只是波动很大;一项 400 场记录显示复核更慢,也仍要检查是否因为复杂会议更常启用工具。负面方向同样不能跳过范围与混杂。
更正、撤回和状态更新必须传播到引用它的所有主张
链接今天能开,内容仍可能被更正、撤回或替代。审计要登记更正、撤稿、关注声明、已被取代和当前有效等状态,并记录检查时间。
| 来源状态变化 | 下游动作 |
|---|---|
| 只改排版 | 校验内容摘要,无语义变化则更新记录 |
| 数字更正 | 把所有相关主张标为“待复核” |
| 结论撤回 | 立即停止使用,不删除历史引用 |
| 新版替代 | 比较变化,当前问题优先新版 |
| 状态未知 | 不用于高风险确定结论 |
DOI 持久并不阻止内容状态变化。稳定定位帮助找到对象,不能代替阅读对象的当前状态。
许澄为来源状态事件建立传播表。SRC-14 的表 3 更正了分母后,系统找到 C-06、FIG-02 和执行摘要三处使用位置;先全部标为“待复核”,重新计算 42/60=70%,再发布 MEMO-02@1.2。旧版仍保留“当时使用错误分母”的审计事实,不覆盖历史文件。
| 状态事件字段 | 示例 |
|---|---|
| 事件编号 | SE-04 |
| 来源编号 | SRC-14 |
| 旧 / 新 | 分母 50 → 60 |
| 发现时间 | 2026-07-21 10:40 +08:00 |
| 受影响 | C-06、FIG-02、MEMO 摘要 |
| 立即动作 | 全部标为“待复核”,暂停发布 |
| 解决版本 | C-06@1.2,FIG-02@1.1 |
| 复核人 | 许澄 |
传播完成要验证搜索结果、缓存摘要和导出 PDF 都不再显示 84%,不能只改证据表中的一格。
多来源结论要建立证据组合,不是把三个链接放在句尾
“受限试点值得开展”依赖四类不同证据:内部整理成本、模拟质量、数据边界和可逆退出。任何一类缺失,建议都要缩小。
| 证据项 | 证据 | 状态 | 对建议的影响 |
|---|---|---|---|
| 问题 | 40 场内部计时 | 已支持 | 有问题值得测 |
| 能力 | 12 场模拟 | 混合 | 只能小规模人工复核 |
| 权限 | 10/16 客户合同已确认 | 部分 | 未确认客户默认排除 |
| 可逆性 | 删除演练只过 3/4 层 | 不足 | 上线前补缓存撤回 |
| 经济效益 | 盈亏平衡模型 | 假设 | 试点记录真实时间 |
建议不是由“多数来源支持”投票产生,而是看必要条件是否都达到最低门槛。安全边界失败不能被时间收益抵消。
完整审计 18 个结论:从原句到修订动作
| 主张 | 原句 | 关系 | 处理 |
|---|---|---|---|
| C-01 | 转写准确率 92% | 指标不匹配 | 改为说话人标签 92/100 |
| C-02 | 生产率提高 35% | 部分 | 改为成功任务首稿时间 20→13 分钟 |
| C-03 | 所有客户允许录音 | 矛盾 | 删除;6 份合同未知 |
| C-04 | 数据 24 小时内全部删除 | 部分 | 区分请求启动与备份 30 天 |
| C-05 | 独立研究证明效果 | 身份不匹配 | 标厂商委托案例 |
| C-06 | 用户普遍偏好自动纪要 | 范围不匹配 | 改为 60 人自选样本 42 人偏好 |
| C-07 | 认证保证不泄露 | 相关 | 删除因果式保证 |
| C-08 | 能与任务系统安全集成 | 部分 | 仅证实接口存在,权限待测 |
| 主张 | 原句 | 关系 | 处理 |
|---|---|---|---|
| C-09 | 会议内容不用于模型训练 | 直接(限定企业设置) | 保留套餐与“截至何时”条件 |
| C-10 | 支持中文和英文术语 | 部分 | 改为文档列出两种语言,混合会议待测 |
| C-11 | 安全中心列出当前控制项目 | 直接 | 原样保留,但不升级为零事件保证 |
| C-12 | 所有录音均在本地区存储 | 不可验证 | 降为“状态未知”,等待账户回执 |
| C-13 | 可随时无损导出全部历史 | 部分 | 改为支持指定格式,完整性待演练 |
| C-14 | 12 名员工一年可节省 9,600 美元 | 假设不匹配 | 重算并列采用率敏感性 |
| C-15 | 客户满意度会提高 | 相关 | 删除因果结论,列为试点问题 |
| C-16 | 说话人标签 92/100 | 直接 | 原样保留并注明模拟样本 |
| C-17 | 已签数据处理协议包含删除条款 | 直接 | 原样保留,引用条款号 |
| C-18 | 自动发送默认关闭 | 直接 | 原样保留并附设置回执 |
处理统计以最终动作而不是引用数量为准:C-09、C-11、C-16、C-17、C-18 共 5 条原样保留;C-01、C-02、C-04、C-05、C-06、C-10、C-13 共 7 条重写;C-03、C-08、C-12、C-14 共 4 条保持“状态未知”;C-07 与 C-15 共 2 条删除,合计 18。
这里暴露一个重要规则:原始“结论数”和拆分后的“原子主张数”不能混用。备忘录有 18 个决策句,拆分后产生 23 个原子主张;处理统计仍按 18 个原句报告,同时账本对 23 个原子项逐一保存支持关系。否则拆得越细,失败数量看起来越多,前后比例失真。
| 统计口径 | 数量 | 用途 |
|---|---|---|
| 原始决策句 | 18 | 向读者说明最终怎么处理 |
| 原子主张 | 23 | 逐项匹配证据 |
| 引用链接 | 22 | 定位来源,不代表独立证据数 |
| 底层来源 | 16 | 去除同一研究的转载与落地页 |
| 原样保留句 | 5 | 所有原子项均有直接支持且范围一致 |
每次修改都保留原句、对应的原子主张编号、修订句、修改原因和复核人。这样,审计既能展示读者看到的 18 句,也不会漏掉藏在复合句中的子主张。
主张账本是审计产物
claim_id: C-02
original: 使用 M 让生产率提高 35%
revised: 在来源所述的成功处理任务中,首稿整理时间由 20 分钟降至 13 分钟
source: SRC-09, table 2, rows 4-5
relation: partial
scope_gap: no delivery-volume or quality measure
arithmetic: (20-13)/20 = 35%
status: accepted_with_revision
reviewer: 许澄
账本让读者知道改了什么和为什么。最终正文只引用“已接受”或“修订后接受”的主张;“状态未知”进入缺口表,“已拒绝”也保留在历史中,不会被悄悄删除。
AI 可以做候选抽取和一致性检查,不能自己给自己放行
许澄让 AI 执行四类低风险工作:拆复合句、抓取候选段落、对照范围字段、复算明确公式。每项都要输出证据编号和原文位置,不能直接改写主张状态。
人工负责来源身份、隐含语义、适用范围、利益关系、法律边界和最终措辞。尤其是 AI 生成的原句不能由同一次无独立标准的生成自评直接通过;至少要用冻结规则和原文逐项核对。
| 自动检查 | 能发现 | 不能保证 |
|---|---|---|
| URL 解析器 | 是否可打开 | 内容质量 |
| 定位符匹配器 | 原句是否出现 | 原句是否支持结论 |
| 数字解析器 | 分子分母与算术 | 指标概念正确 |
| 范围差异 | 字段文字不一致 | 差异是否可接受 |
| 状态查询 | 页面标注更正 | 未公开的问题 |
用反向抽样和改写回归防止审计过程自己出错
第一轮 18 条中,AI 判 11 条“已支持”。许澄逐条人工审计后,只有 5 条得到直接支持。她再从 22 个来源反向抽 8 个,检查是否有原文被错误用于多个主张;结果发现 2 个来源各被过度扩展到第二个结论。
修订后运行三类回归:每个引用都能打开到具体证据位置;每个数字都可复算;每个强限定词“所有、保证、证明、显著”都有直接依据。18/18 通过结构检查,但 4 个“状态未知”仍保持未知,不能为了全绿填入猜测。
她请另一名审阅者在不知道 AI 初判的情况下复核 6 个高影响主张。两人在 4 条上直接一致,2 条有分歧:审阅者把 C-04 判为“仅相关”,许澄判为“部分支持”;审阅者认为 C-10 可获直接支持,许澄认为混合语言场景缺失。回到关系定义后,C-04 保持“部分支持”,因为来源确实支持删除流程的一部分;C-10 也保持“部分支持”,因为列出两种语言不等于验证同一会议混用。
| 复核维度 | 通过标准 | 分歧处理 |
|---|---|---|
| 身份 | 来源类型与利益关系一致 | 查封面、方法和资助 |
| 蕴含 | 使用同一五分类定义 | 各自写最强支持句再比较 |
| 范围 | 六个范围字段逐格核对 | 不用“差不多”裁决 |
| 算术 | 独立从原表复算 | 保留计算式 |
| 操作 | 支持关系对应修改动作 | 直接支持不等于原样保留全部段落 |
盲审不是为了做形式上的双签,而是检验规则能否让另一人得到可解释结果。分歧记录留在审计日志,最终裁决与理由一并发布。
18 句初审用了 3.6 小时:链接与身份 46 分钟、定位和摘录 58 分钟、范围与数字 72 分钟、改写与回归 40 分钟。后续同结构备忘录可以复用表格与检查顺序,但不能把这次的支持关系直接复制给新来源。
| 成本情形 | 审计投入 | 避免的失败 |
|---|---|---|
| 低风险内部草稿 | 抽查关键数字和强限定词约 45 分钟 | 普通表述错误 |
| 采购建议 | 18 句全审 3.6 小时 | 错误采购、范围与收益承诺 |
| 涉及客户数据 | 全审 + 合同/删除演练 | 权限和不可逆数据风险 |
| 已自动发布内容 | 先暂停发布,再查传播范围 | 错误引用继续扩散 |
审计成本应随决策风险提高。若文章只是个人探索,可优先检查会改变行动的关键主张;涉及采购、法律、医疗、金融或外部发送时,不能用“链接都是真的”降低复核强度。
可以直接复制的引用审计表
claim_id, original_claim, atomic_claim, source_id, source_type
url_or_doi, cited_at, accessed_at, version, locator, archived_copy
verbatim_fact, entailment, population, setting, comparison, outcome, time
numerator, denominator, unit, arithmetic, uncertainty, status_note
conflict_ids, scope_gap, revised_claim, action, reviewer, reviewed_at
审计顺序固定为:拆句→身份→版本→定位→蕴含→范围→数字→状态→改写→复核。不要因为链接来自熟悉机构就跳过中间步骤,也不要因为来源有局限就把其中可直接支持的事实全部丢弃。
时间不足时,先做 15 分钟风险分诊,不等于完成审计:
| 优先级 | 先找什么 | 原因 |
|---|---|---|
| P0 | 医疗、法律、金融、权限和自动外部动作 | 错误可能不可逆 |
| P1 | 数字、排名、因果、预测和“所有、保证、证明” | 最容易被真实链接掩护增强 |
| P2 | 当前功能、价格、条款和政策 | 版本变化快 |
| P3 | 背景描述和低影响例子 | 可后续抽查 |
P0 或 P1 只要原文位置、分母、范围或当前状态缺一项,就先撤下结论,不用“可能正确”继续发布。完成分诊后仍要回到 10 步全审;风险排序只决定先后,不降低放行标准。
来源与进一步阅读
以下资料核验于 2026-07-21,用于说明 DOI 的边界、内容质量与标识分离、证据确定性,以及为什么结论不能超过证据:
- Crossref:Constructing your DOIs:说明 DOI 用于唯一、持久定位;DOI 本身不表示对象的价值或准确性。
- Crossref:Integrity of the Scholarly Record:Crossref 说明其不评估内容质量或研究过程完整性,而是维护元数据与关系。
- Cochrane Handbook Chapter 14:说明对每个结果透明评估偏差、间接性、不一致、不精确和发表偏差等确定性因素。
- Cochrane Handbook Chapter 15:强调解释效应、不确定性与适用性,避免结论超出证据或把缺乏证据当成无效果证据。