72 条主张中,8 条为什么被挡在正文之外

独立企业研究顾问林颂要交一份行业采用趋势简报。她收集 42 份获准使用的来源,让 AI 生成 6 个章节、72 条可对外陈述的事实主张。初稿每段都有链接,读起来很完整;逐条检查后却发现,只有 41 条被来源直接支持,12 条只得到部分支持,4 条与更权威的资料矛盾,9 条找不到支持,另有 6 条引用了已经过期的数值。

她没有继续修改一句“请勿编造”的提示词,而是把每条主张变成一张主张卡:明确主体、谓词、对象、数量、范围、时间、来源片段和支持状态。撰写人完成第一次证据映射后,由不先读正文文风的验证人重新检查实体、支持关系、时间与计算;所有高影响数字再用独立方法复算。最终账本仍保留 72 个主张编号,但状态变为 52 条直接支持、8 条衍生、4 条有界估算、3 条有争议、5 条状态未知。

最终状态 数量 正文处理
直接支持 52 可写,保留来源位置与限定词
衍生/重新计算 8 可写,给公式、输入和截至
有界估算 4 可写,明确区间/假设,不写成点事实
有争议 3 不选边站,列争议或移出正文
状态未知 5 写缺失/无法确认,不补猜测
合计 72 正文可发布64,扣下8
72条主张分为52条直接支持、8条衍生、4条有界估算、3条争议和5条未知;前64条带限定发布,后8条扣下
52 条直接支持、8 条衍生和 4 条有界估算进入正文,3 条争议与 5 条未知被扣下。图中数量来自本案例账本;它只能说明当前核验规则怎样处理 72 条主张,不能推出来源永远正确或错误率为零。

通过发布门以后,正文中没有已知的不受支持或被反驳主张,但仍不能据此宣称错误率为 0。来源本身可能出错,覆盖可能遗漏,未来事实会变化,核验者也可能判断失误。控制的目标,是让错误更难进入高影响输出,让不确定性可见,让每个结论都能回查,并在来源变化后被撤回。

本文是虚构教学案例,不提供医学、法律、财务或其他专业事实核验意见。高后果领域不能只靠通用模型、引用和个人复核,需要有资质的领域专家、权威数据、独立验证与相应责任流程。

幻觉不只是假事实,还包括假引用、错逻辑和输入矛盾

NIST 的生成式 AI 风险画像把虚构描述为生成系统自信地呈现错误或虚假内容,也包括偏离输入,或者与同一上下文中的先前内容矛盾;日常通常把这类问题称为幻觉。业务上还要把错误继续拆细,否则所有修复最后都会变成“再生成一次”。

失败 例子 为什么危险
虚构事实 编造某机构已采用方案 读者难从流畅文风察觉
伪造引用 不存在的报告/页码 制造权威外观
引用不匹配 链接真实但不支持结论 人只看链接存在就放过
实体混淆 A公司数字写到A同名产品 事实局部真实、归属错误
过时事实 2023比例写成“当前” 来源真、时间结论假
逻辑跳跃 相关性写成因果 来源无法证明推理跨度
计算错误 分母、单位或汇率错 引用数据都真,结论仍错
矛盾 前后章节给两个口径 降低可行动性与信任

“模型知道不知道”不是唯一诊断。检索没拿到正确版本、解析器漏表头、任务范围模糊、撰写人合并实体、引用渲染错位、复核人被文风说服,都可能产生同样的错误输出。证据链要覆盖整个系统,不只评判最后一句话。

用五层控制替代一句“请勿编造”

控制 失败后下一层
防止 限定任务、权威来源集合、结构化输入 仍可能错误检索/推理
发现 主张账本、支持关系、时效和计算检查 仍可能误判
阻断 未知或争议状态、发布放行门槛、权限 防止错误外发或触发行动
纠正 独立复核、裁决、版本修订 保留变更证据
监控 来源变化、读者纠错、新失败评估 发现分布漂移

这像多道筛网:任何一层都不完美,但错误要连续穿过多层才进入交付。增加检索可以减少“无资料硬答”,却可能引入低质量或冲突来源;要求引用能提高可查性,却可能产生真实链接与错误主张的组合;让第二个模型审稿也会共享偏差。因此每层必须有明确作用和局限。

风险决定强度。内部头脑风暴可标注“未核验”;对客报告的关键数字必须复算;会触发付款、合规、健康或安全决定的内容需要专业权威,不因AI附了链接就降级责任。

先登记 42 份来源,再让主张引用它们

42 份来源包括 16 份政府、标准或原始统计,10 份内部批准数据与访谈记录,8 份专业研究,8 份供应商文档。来源等级不等于“官方永远正确”:供应商文档适合证明自身功能,不适合独立证明市场效果;内部访谈适合说明个体经验,不能代表行业比例。

来源字段 示例
来源编号与版本 S-014 / 2026-06 快照
发布者/负责人 统计机构/内部研究负责人
来源类型 主数据、标准、供应商文档、分析
支持范围 定义/数值/产品能力/个案经历
地理范围/人群 北美、样本642家中型企业
期间/截至 2025Q4 / 已访问 2026-07-21
精确定位符 表格 3 行 8 / 段落 ID
访问/许可 可引用摘要,不复制全文
已知限制 自报、样本偏差、未审计

源登记先去重转载链。五篇文章都转述同一份调查时,不算五个独立证据;找到原报告并记录样本和方法。网页不存在日期、作者、数据口径或原始出处时,不能因排名靠前就升级为权威。

来源也有生命周期。访问日期不等于数据期;页面今天可以访问,讲的却可能仍是 2022 年。关键来源要建立更新监控,内容哈希值、发布日期或数据版本变化时,触发关联主张重新核验。

检索过程也要留搜索日志,而不是只保存最后找到的链接。每个关键问题记录查询、来源类型过滤、日期范围、查看过的候选、排除理由和停止条件。停止不是“搜到支持观点为止”,而是已找到适配的一手资料、检查了至少一种反证路径,或达到预设时间/来源预算仍不足并转状态未知。

检索决策 例子
目标 找到2025Q4中型企业采用比例及方法
首选 原始统计/调查方法论,不先用新闻转述
反查询 失败、未采纳、样本限制
排除 无样本说明的营销图、重复转载、旧版摘要
停止 原报告+方法页已定位;独立资料未给同口径
残留差距 不能推广到所有地区/规模

这既避免确认搜索,也避免无限浏览。搜索没找到不等于事实不存在;日志只能证明在声明范围内未取得足够证据,所以输出用“在已查来源中无法确认”,不写“没有任何证据”。

把段落拆成可逐条核验的原子主张

初稿写道:“中型企业采用率在两年内翻倍到 62%,主要由成本下降推动,并将在明年超过大型企业。”这句话至少包含当前比例、两年变化、因果解释和未来预测四条主张;一张调查表可能只支持第一条。林颂把 72 个对外陈述拆成可单独判定的最小单位,修辞与过渡不单独计为主张。

主张编号 原子主张 需要的证据类型
C-021 样本内中型企业采用率为62% 原始表、样本/定义/期次
C-022 相比两年前31%上升一倍 可比口径两期数据+复算
C-023 成本下降是主要原因 因果/受访原因分布,不是猜测
C-024 明年将超过大型企业 预测模型与假设;不能当事实
初稿句子向右拆成C-021当前比例、C-022两年变化、C-023主要原因和C-024未来预测,每条需要不同证据
从左向右拆句:比例、变化、因果和预测是四个独立核验任务。原句中的62%只可能支持C-021的一部分,不能自动替翻倍、成本因果和未来预测背书;图中四张卡对应本节示例,不代表拆分后任何主张已经获准发布。

原子化也保留限定词:样本内、报告口径、约、截至某日、受访者自报。这些不是软化文风,而是主张真值边界。编辑为了“更有力”删掉限定词,会把原本支持的句子变成不支持。

标题、图注、表头、摘要数字和脚注都要进入账本,因为最显眼的错误常常藏在正文之外。最终检查按主张编号生成内容,不允许撰写人脱离账本再加一段“顺手总结”。

主张卡把证据、推导和发布决定放在一起

可复制模板
{
  "主张编号": "C-022",
  "主张": "在可比样本口径下,采用率由31%升至62%",
  "限定词": ["中型企业", "自报", "2023Q4→2025Q4"],
  "来源": ["S-014:表3:第8行", "S-019:方法:第4页"],
  "关系": "可复算推导",
  "计算": "(0.62-0.31)/0.31 = 1.00",
  "不确定性": ["两期样本不是同一组企业"],
  "复核人": "V2",
  "状态": "带限定词发布"
}
卡片字段 作用
标准化主张 稳定核验对象,不随文案变化
限定词 实体、地区、人群、时间、单位
来源定位符 跳到支持片段,不只到首页
关系 直接/衍生/部分/矛盾
计算/假设 重现推导与估计
不确定性 来源、测量、覆盖与推断限制
复核人/状态 谁在何版本作何决定
渲染位置 标题/正文/图表中出现位置
C-022 主张卡左连来源位置、限定词与证据独立性,右连计算、复核决定与正文图表等呈现位置
以C-022为中心读证据图:左侧回答依据,右侧回答怎样计算、谁复核、出现在哪里。下方对比说明来源更新可沿边传播,而全文搜索会漏掉“翻倍”等派生措辞;可追踪性不证明来源本身正确,受限资料也不能因此被完整复制。

一个主张可以关联多个来源,一个来源也可以支持多个主张;这些关系构成证据图。更新 S-014 时可查询所有下游主张,而不是全文搜索旧数字。卡片不保存不必要的完整原文,受限资料只存获准摘录和来源位置。

证据关系还要记录独立性。S-031 新闻稿、S-032 行业文章和 S-033 社交帖如果都引用 S-014,就不能算三条独立支持;证据图要把它们连回同一个来源根节点。真正的交叉验证要求不同的采集过程或数据来源,而且定义必须足够可比。两个彼此独立、但口径不同的数字,也不能简单取平均。

边缘属性 问题
支持范围 支持整个主张还是一个子句
来源 原始、转载、计算或人工访谈
独立性分组 是否来自同一底层数据
方向 支持、削弱、矛盾、中性
强度 直接、部分、仅背景
有效起止 哪个时间窗口成立
访问限制 谁能看原文/可否对外引用

如果公开报告不能展示受限内部来源,正文仍需用可披露证据支持对外主张;不能以“我们内部有资料”制造无法核验的权威。内部来源可以决定不发布或提示进一步调查。

来源相关不等于来源支持

支持复核问:假设来源本身真实,读者只看标记片段,能否合理得到这条主张?需比较主体、指标定义、样本、时间、地域、数量、比较对象、因果/相关、确定/预测和限定词。链接谈同一主题但没有对应事实,只是相关。

关系 判定 正文动作
直接支持 片段直接表达同范围主张 可引用
支持推导 输入直接支持,结论可复算 给公式/假设
部分 只支持主张一部分/更窄范围 缩窄或补来源
无关 同主题但不回答 移除链接,视为无支持
被反驳 权威资料给相反结论/数值 争议/裁决
不足 来源质量/方法不足以承重 降级/状态未知

这部分与O12“链接为什么不支持结论”相接,但本文不重复停在引用审计:支持判定只是整条错误控制链中的一环,后面还要处理计算、不确定性、争议、独立复核和发布阻断。

引用数量不是质量。两个转载同一错误不会超过一份原始数据;五个弱相关链接也不能支持一个强因果主张。高影响主张优先找一手数据和方法,再用独立来源做交叉检查。

重复生成也不是独立事实核验。同一输入让模型回答五次、五次都写62%,只能说明输出较一致;它们可能共同依赖同一错误模式。自洽性适合发现不稳定,不能替代外部来源、公式或真实环境结果。反之,五次措辞不同也不自动表示事实有争议,可能只是生成方差。

让第二个模型“批判第一稿”只有在它获得更好的证据、不同检查目标或受约束的评分员时才增加一层;若只把全文粘过去问“是否正确”,流畅答案仍可能互相背书。

单独检查实体、口径、时间和单位

检查 初稿错误 修正
实体 母公司收入写为某产品收入 换产品披露或标状态未知
分母 62%受访者写成62%所有企业 恢复“样本内受访者”
时期 年度累计与季度值比较 对齐同周期
货币 美元与加元直接相加 固定汇率与日期后换算
名义/实际 名义增长当实际增长 找平减指数或改措辞
存量/流量 在用客户与本年新增混用 分开指标
预测/实际 预测写成已发生 标预测与来源日期
实体、分母、时期、货币、名义实际、存量流量、预测实际七项检查分别给出易混淆边界与修正动作
横向逐项读七个边界:局部真实的数字仍可能因归属、口径或时间而错误。下方区分自动初筛和人工读定义;七项来自本节常见问题,不是事实风险的穷尽清单,也不能替代来源质量、支持关系和用途判断。

自动实体标识、单元和日期验证器可拦截明显问题,但最终仍看来源定义。例如“活跃”可能是30日登录、付费账户或完成一次任务;名称相同不能直接合并。源登记保存指标定义,主张卡引用定义版本。

每个动态主张都有自己的时效策略:价格可能按天更新,产品功能跟随版本,年度统计跟随新发布周期,稳定的历史日期则不必频繁查询。过期不一定等于错误,但不能继续写成“当前”。

推导主张必须能从输入重新算出来

8 条衍生主张包含增长率、加权比例和跨表汇总。撰写人不能在同一段里读取数据、心算并宣布答案;计算产物由独立脚本或表格生成,记录输入单元格与来源、公式、单位、精度和输出哈希值,验证人再用另一种公式或抽样手算复核。

衍生字段 C-022示例
输入 0.31、0.62
来源 S-014两期同指标
公式 相对变化=(新旧)/旧
结果 1.00,即增加100%
措辞 “相对增加100%/约翻倍”
禁用措辞 “增加31个百分点的100%”等混合表述
保留条款 两期横截面样本不同
31%与62%的绝对差是31个百分点,再除以31%得到相对增加100%,最终措辞保留不同样本和不能归因的限制
沿箭头复算:先求31个百分点,再用旧值作分母得到相对增加100%。下方列出禁用措辞和必须保留的计算产物;31%与62%是本案例教学数据,算术成立不能证明因果,也不能消除两期样本不同的限制。

“由31%到62%”是增加31个百分点,也是相对增加100%;两者都可算,但含义不同。报告若写“增长100个百分点”就是单位错。对金额还检查税前/税后、币种、名义/实际和四舍五入顺序。

模型可以生成公式候选,不能同时做唯一计算者与唯一验收者。复算结果不一致时进入冲突,不让撰写人选择更好看的数字。

不确定性要写清来自哪里,以及会怎样影响决定

模型自报“95% 确信”没有经过任务校准时不能当概率。林颂用可行动标签说明不知道在哪里、为什么、对结论有何影响。

不确定性类型 示例 表达/动作
来源 只有供应商自报 写来源角色,寻独立资料
测量 “使用”定义不一致 不直接合并比例
抽样/覆盖 样本偏中型北美企业 限定适用范围
推断 从相关推原因 改为关联或删除因果
新鲜度 最新数据到2025Q4 标截至并设更新
分歧 两权威来源口径冲突 并列,不平均掩盖
缺失 无法取得分母 状态未知,不给点估计

4条有界估算只有在上下界有证据和假设可检查时发布,例如已知最少48、最多61家,而不是“模型感觉约55”。正文显示区间与敏感假设,摘要不偷换成精确55。

林颂为其中一条市场规模估计做三情景,不把单个参数设成“最佳猜测”后隐藏。已知符合条件的组织数在480—610之间,采用比例在18%—26%,因此结果区间为86—159;基准情形用545×22%=120只是中点场景,不比边界更真实。报告将86—159作为可支持范围,并说明两个输入同时向同方向变化时范围如何扩大。

场景 组织 采用 结果
下限 480 18% 86.4,向下取86
基础 545 22% 119.9,约120
上限 610 26% 158.6,向上取159

若决策只在结果高于150时成立,这个估计不能支持确定行动,因为只有上行情景跨过阈值;结论应要求补数据或采用可逆试验。敏感性把“不确定”转为决策条件,而不是在数字后加一个±符号装饰。

不确定性进入结论强度。证据弱时从“导致”降为“与之同时出现”,从“行业”降为“本样本”,从“将会”改为“在假设X下可能”。这不是逃避,而是让语言匹配证据。

状态未知也是一种合格结果

5条状态未知分别来自缺分母2条、无法区分实体1条、来源不可访问1条、两份输入都不完整1条。每条保存已检索来源、未满足条件、可能的下一步和谁能决定;不以“暂无公开信息”暗示穷尽全世界,只写已查范围。

未知代码 含义 可继续条件
缺少来源 未找到足够来源 负责人提供或批准新来源
缺少分母 不能计算比例 获得总体数与定义
实体不明确 无法确定归属 精确标识或披露拆分
不可访问 来源存在但无权读取 合法访问或替代来源
冲突未解决 证据冲突无法裁决 澄清方法或口径
缺少来源、缺少分母、实体不明确、不可访问和冲突未解决五类缺口分别对应继续条件和发布动作
按行读未知代码、缺口和继续条件:停止、缩窄或调查都是明确动作。下方对比“停止也算成功”和四类错误补全;未知只表示在声明的检索与权限范围内无法确认,不等于事实不存在或已穷尽所有来源。

状态未知不会自动变成零、没有、否或平均值。输出模板强制显示“已知/推导/估计/争议/未知”,避免撰写人为了段落顺畅把缺失藏掉。用户可以基于缺口决定延后、缩小范围或人工调查。

DeepMind早期GopherCite工作就把“无法形成有证据答案时说不知道”作为一项策略,同时明确引用只是整体安全可信策略的一部分。本案例沿用的是可验证拒答原则,不声称一个固定句式能消除错误。

矛盾来源不能靠多数票裁决

3 条有争议的主张都保留两侧证据。验证人先检查它们是否其实在讲不同时间、地域、样本或指标;若可以对齐,再按数据直接程度、版本新旧、方法透明度和主张适配性作决定。不能因为三个转载支持 A、一个原始统计支持 B,就按 3:1 投票。

冲突原因 处理
时间不同 各自标期次,必要时写变化
指标定义不同 分成两个主张,不合并
修订版替代旧版 旧版标已取代,保留历史
供应商与独立方 各自限定角色,效果主张优先独立证据
两个高质量研究确有分歧 并列方法与区间,标为有争议
无法看方法 不裁决,降状态未知

裁决记录谁、何时、依据哪条规则作决定,并绑定来源版本。未来新资料到来可重开,不让正文结论与争议账本脱节。

若业务必须现在决定,报告可以给情景分支:在口径A下结论与行动是什么,在口径B下如何;不能把不确定输入平均后假装得到中立真相。

独立复核先看主张和来源,不先看流畅正文

撰写人完成第一次分类后,验证器 V2收到打乱顺序的72张卡片、来源摘录与任务合同,不看到撰写人解释性段落和“这很重要”的文风。V2独立给关系、新鲜度、严重程度和发布决策;分歧交给林颂裁决,高影响数字再由独立计算器复算。

V2与撰写人分歧 数量 裁决
部分被写成直接 4 V2正确,缩窄/补证据
新鲜度判断 3 2项V2、1项撰写人正确
计算/单位 2 1项V2、1项双方都需改
实体归属 2 V2正确
合计 11 V2正确8、撰写人正确2、双方不完整1
11条分歧按部分支持、新鲜度、计算单位和实体归属分类,V2正确8条、撰写人正确2条、双方不完整1条,并显示校准变化
先看11条分歧如何裁决,再看规则校准从9/12一致到11/12一致。分歧集中说明V2确实发现了具体问题,但12张校准卡太少,不能估计复核准确率;两名复核者共享错误来源或检索盲区时仍可能一起错。

独立不只是换一个模型。如果V2共享相同检索错误、同一提示词和同一错误来源集合,相关失败仍会穿透。案例让V2固定查实体/时间/关系清单,并抽查来源原页;关键数由不同计算路径验证;最终发布人承担决定。

审核员疲劳也会出错。72 条分成四批,每批 18 条,顺序混合不同严重程度;批间安排休息,并在每批插入一个已知测试用例检查判断尺度是否漂移。无法解释的判定标为需要裁决,不逼复核人快速给结论。

正式核验前,撰写人与V2用12条校准卡片独立分类,初次一致9条;3条分歧来自“来源给范围上限能否支持点估计”“供应商个案能否支持行业趋势”和“更新日期是否等于数据日期”。规则补上后重标12条一致11条,剩1条明确送裁决,而不是追求表面100%。

校准 一致 分歧 决定
规则 v1 9/12 3 细化范围/来源角色/日期规则
规则 v2 11/12 1 有争议的主张进入人工裁决

12条太少,不能估计复核人准确率;它只证明两人对关键规则有共同理解。每次新增来源类型或主张形态,都重新抽样校准。

C-022:从“翻倍”文案回到证据与计算

初稿主张为“中型企业采用率两年翻倍至62%,证明成本下降驱动普及。”来源 S-014表3确有2025Q4样本62%,旧版S-009有2023Q4 31%;两期问卷定义相同但样本企业不同。另一个访谈只提“成本更可控”,不能证明主要驱动。

检查 结果
62% 直接支持,限定本次样本/自报
31% 直接支持,限定旧样本
翻倍 衍生:(0.62-0.31)/0.31=1.00
同一批企业增长 不支持,两期横截面不同
成本下降驱动 部分轶事,不足以做因果
最终措辞 “在两期可比问卷口径中,自报采用比例由31%升至62%;样本并非同一组企业,不能据此单独归因。”
62%与31%是直接支持,翻倍为可复算推导,最终措辞保留可比口径与不同样本,同时移除同一批企业成长和成本因果
从左向右读C-022:两期直接事实经过复算,收敛为带样本限制的最终措辞。下方红框列出证据不足而移除的两种说法,黄框要求摘要、正文、图表与脚注同步;这条路径不证明真实行业采用率,也不把访谈升级为因果证据。

最终句保留有用变化,也删除因果包装。图表脚注列来源、样本与期次,摘要只用同样限定词。若下一版编辑删掉脚注或把“比例变化”改回“企业实现增长”,渲染位置检查会阻断。

这条追踪显示检索、计算和写作各自的责任;一个“事实核查”按钮很难同时处理。

72 条主张从初审状态收敛到发布状态

初审分布为 41 条直接支持、12 条部分支持、4 条被反驳、9 条无来源、6 条过时,合计 72 条。修订不是把所有问题强行变成绿色:部分支持中有 8 条缩窄后得到直接支持,2 条变为有界估算,2 条进入状态未知;被反驳的主张中,3 条标为有争议,1 条进入状态未知;无来源的 9 条中,3 条找到新的直接支持,2 条改为衍生,2 条因有上下界而变为有界估算,2 条进入状态未知;6 条过时主张全部用当前序列重新计算并标为衍生。

初审→最终 直接 衍生 有界 有争议 状态未知 合计
直接 41 41 0 0 0 0 41
部分 12 8 0 2 0 2 12
被反驳 4 0 0 0 3 1 4
无来源 9 3 2 2 0 2 9
过时 6 0 6 0 0 0 6
最终 52 8 4 3 5 72
初审的41条直接、12条部分、4条被反驳、9条无来源和6条过时,分别流向52直接、8衍生、4有界、3争议和5未知
按行看来源、按列看去向:每一次升级、降级和扣下都保留数量闭合。绿色不等于把旧结论换标题,直接升级必须来自新获准且适配的一手资料;表格只说明本案例72条如何收敛,214分钟核验时间也不能据此宣称节省。

“找到直接支持”必须确实来自新获准来源,不能只是给相关链接换个标题。6 条过时主张之所以成为衍生,是因为从新发布的原始序列按固定公式重算,而不是给旧数字换一个日期。所有路径都要保留修改前后的卡片差异。

本次人工核验与裁决共214分钟;没有可信旧流程对照,因此不声称节省时间。价值证据是8条未解决内容没有进入事实正文、64条发布内容能回查与更新。

用 48 项故障测试攻击“看起来有证据”的错误

系列 案例数 代表测试用例
伪造引用 8 假数字对象标识符、假页码、拼接标题
真实链接/错误支持 10 相关主题、范围更窄、方向相反
陈旧/版本 6 旧价格、已取代报告、无截至
数值/公式/单位 8 分母、百分点、币种、舍入
冲突来源 6 时间/定义差异、真实分歧
不确定/未知 6 缺分母、无法访问、应拒答
实体/跨来源 4 同名公司、母子产品、转载链
合计 48 每项有预期状态与发布决策

测试同时看假阴性与假阳性。把有充分证据的等价措辞判成不受支持,会让系统过度拒答;把合理衍生误判直接,会丢失推导透明度。每次提示词、检索、解析器、来源策略或验证人更新都重跑。

关键测试用例包括错误金额、客户身份、法律/安全类主张时不使用真实生产输出;在沙盒验证阻断,并交领域专家设计/审阅。个人通用控制不能替代专业事实标准。

自动化适合定位和复算,不适合独自裁决真值

自动检查 适合 人工/独立复核仍需
网页地址与来源位置存在 链接、页码或行可达 页面是否支持主张
主张卡结构 字段齐全、状态合法 限定词是否充分
实体/日期/单位 已知标识、格式、范围 隐含口径与同名实体
公式重算 输入/公式/结果 输入选择与因果解释
引用蕴含模型 批量初筛 高风险/不确定分歧
来源哈希值监控 发现版本变化 新版影响分析
呈现位置检查 正文与图表的来源位置一致 结论是否适合发布

评分员只看摘录可能错过来源方法限制,只看全文可能被无关信息干扰;自动判定返回证据与不确定,不给一个无法解释的绿色勾。关键主张不能由生成它的同一运行自评后直接发布。

DeepMind的LongFact/SAFE研究将长回答拆成个体事实并搜索核对支持关系,说明原子事实评估的价值;其研究结果与成本数字属于特定实验,本文不把自动评估员当人类真值替代。

自动检查也要有自己的评估集:48 项测试之外,再保留 20 组“主张—来源”配对,由人标注直接支持、部分支持、被反驳或无关。升级支持关系评分器时,要比较各类混淆,尤其关注把无关或被反驳误放为直接支持的错误放行;不能只看总体一致数,因为大量容易判断的直接支持会掩盖少数危险错误。

解析器也要单独测试 PDF 双栏、扫描页、表格合并单元格、脚注和负号。若提取文本漏掉“不”或表头,后续支持关系评分再强,也只能对错误输入作判断。来源摘录显示原页截图与坐标供人回看,不把文字识别结果当成原始事实。

八道发布门检查证据状态和最终产物

放行门槛 通过条件 不通过动作
主张清单 标题/正文/图表事实都有标识 补卡片,不允许游离主张
证据 直接、推导或有界主张均有来源位置 状态未知或移除
关系 V2/裁决完成 需要复核
计算 独立重算一致 已阻塞
不确定性 限定/区间在最终文案可见 恢复措辞
冲突 有争议的主张不伪装成单一事实 并列或移出
渲染 链接、脚注、表格与主张对应 修产物重验
人工批准 高影响主张与用途获确认 不发布/缩范围
主张清单、证据、关系、计算、不确定性、冲突、最终渲染和人工批准八道门依次给出通过条件与失败动作
任意一道门失败,都会触发补录、复核、阻塞、并列或重新验证。批准与来源快照、账本哈希值和产物哈希值绑定,发布后仍要监控;八道门降低错误传播概率,不代表风险被消除,高后果用途仍需专业责任流程。

发布产物绑定主张账本哈希值与来源快照。正文编辑、摘要重写或图表更新后,差异扫描会寻找新增或变更主张;批准不能从旧版本漂移。PDF 导出后还要重新打开抽查,避免源文档脚注正确、成品页码却发生错位。

发布人不只是点批准。他确认读者、用途、时效、可接受的未知和升级条件;将来把内部探索改成销售承诺,需要重新评估,不因文字曾被核验就自动适用新用途。

同一主张按用途分级。内部探索可保留有界估算与明显水印;客户事实表只接受直接/推导且关键项人工确认;公开营销还要检查披露、许可与易误导表述;会触发高后果行动的内容转专业流程。状态相同不表示所有用途都批准。

用途 允许状态 额外放行门槛
内部探索 直接/推导/有界/争议 状态可见,不自动行动
客户草稿 直接或推导,少量有界 负责人逐条确认
公开报告 直接/推导/严格有界 可披露来源、法律/品牌审阅按需
后果性决策 领域定义 专家、独立数据、责任流程

如果交付渠道会截掉脚注,例如把报告摘要复制到社交媒体,摘要本身要带截至与限定词;不能依赖读者点击原报告才知道数字是估计。

来源更新后,要能找到并更正所有下游表述

42 份来源按各自时效策略巡检。哈希值或版本变化时创建影响任务,查询证据图中的主张与呈现位置。若关键统计发生修订,报告要增加勘误或发布新版本,不能只修改网页,却不通知已经收到旧 PDF 的人。

事件 处理
来源更新 重新判关系/计算,传播受影响主张
来源撤回 立即冻结下游主张,查替代/发更正
读者指出错误 保存原文/证据,先纠正业务,再建测试
新的高质量冲突 重新开启裁决,标为有争议
主张仍状态未知 到期复核或明确关闭,不自动升级
策略/用途变化 重跑风险与发布放行门槛

生产反馈进入O31个人评估:真实新失败去标识后成为回归案例,修复要在旧案例和新案例上同时通过。监控不是证明当初审查失败,而是承认事实世界和系统都会变化。

保留期按客户合同、来源许可和实际需要设置;主张元数据可比受限摘录保留更久,但不能用“审计”无限复制版权或个人数据。

案例模拟了一次真实修订:S-014 在发布后第 12 天把 62% 更正为 59%,并更新方法备注。哈希值监控在 4 小时内创建影响任务,定位 C-021、C-022、图 2、摘要和演示第 6 页;C-021 直接更新,C-022 由相对增加 100% 重算为约 90.3%,两个下游措辞与图表一起失效。林颂发布 v1.1 勘误,并向已经收到 v1.0 的 3 名客户发送人工确认的更正说明。

修正证据 记录
旧/新来源 S-014 v1→v2
受影响主张 C-021、C-022
新旧产物哈希值 报告、幻灯片和图表各自版本
决策 重大,必须更正
接收方 3名已知接收者,由人发送
回归测试 陈旧或修订测试用例加入 48 项套件下一版

更正速度不是文章原始正确性的证明,却能限制旧错误继续传播。若没有主张图,只靠全文搜索“62%”可能漏掉“翻倍”这种派生表述。

先核验一页中的 10 条主张

控制包包括任务与数据协议、来源登记、原子主张清单、主张卡、证据图、支持关系规则、实体、日期与单位检查、计算产物、不确定性分类、未知与争议流程、盲审验证、裁决记录、48 项测试、发布放行门槛、渲染位置图、来源监控和勘误日志。

本案例参考NIST GAI 画像对虚构及其风险的描述;参考Google DeepMind FACTS 接地/基准对给定上下文定位的评估方向、LongFact对长格式输出原子事实核验的研究,以及GopherCite对引用与有证据拒答的探索。这些研究不能替代你的业务来源策略和人工责任。

今天拿一页真实草稿,圈出 10 条读者可能据此采取行动的事实句。逐条写来源位置、直接支持、推导、部分支持或冲突状态,以及事实截至日期;让第二个人只看主张与来源进行复核。任何无法支持的句子,都改成状态未知、缩窄范围或删除。完成这 10 条,比给全文加一句“内容仅供参考”更接近真正的错误控制。