72 条主张中,8 条为什么被挡在正文之外
独立企业研究顾问林颂要交一份行业采用趋势简报。她收集 42 份获准使用的来源,让 AI 生成 6 个章节、72 条可对外陈述的事实主张。初稿每段都有链接,读起来很完整;逐条检查后却发现,只有 41 条被来源直接支持,12 条只得到部分支持,4 条与更权威的资料矛盾,9 条找不到支持,另有 6 条引用了已经过期的数值。
她没有继续修改一句“请勿编造”的提示词,而是把每条主张变成一张主张卡:明确主体、谓词、对象、数量、范围、时间、来源片段和支持状态。撰写人完成第一次证据映射后,由不先读正文文风的验证人重新检查实体、支持关系、时间与计算;所有高影响数字再用独立方法复算。最终账本仍保留 72 个主张编号,但状态变为 52 条直接支持、8 条衍生、4 条有界估算、3 条有争议、5 条状态未知。
| 最终状态 | 数量 | 正文处理 |
|---|---|---|
| 直接支持 | 52 | 可写,保留来源位置与限定词 |
| 衍生/重新计算 | 8 | 可写,给公式、输入和截至 |
| 有界估算 | 4 | 可写,明确区间/假设,不写成点事实 |
| 有争议 | 3 | 不选边站,列争议或移出正文 |
| 状态未知 | 5 | 写缺失/无法确认,不补猜测 |
| 合计 | 72 | 正文可发布64,扣下8 |
通过发布门以后,正文中没有已知的不受支持或被反驳主张,但仍不能据此宣称错误率为 0。来源本身可能出错,覆盖可能遗漏,未来事实会变化,核验者也可能判断失误。控制的目标,是让错误更难进入高影响输出,让不确定性可见,让每个结论都能回查,并在来源变化后被撤回。
本文是虚构教学案例,不提供医学、法律、财务或其他专业事实核验意见。高后果领域不能只靠通用模型、引用和个人复核,需要有资质的领域专家、权威数据、独立验证与相应责任流程。
幻觉不只是假事实,还包括假引用、错逻辑和输入矛盾
NIST 的生成式 AI 风险画像把虚构描述为生成系统自信地呈现错误或虚假内容,也包括偏离输入,或者与同一上下文中的先前内容矛盾;日常通常把这类问题称为幻觉。业务上还要把错误继续拆细,否则所有修复最后都会变成“再生成一次”。
| 失败 | 例子 | 为什么危险 |
|---|---|---|
| 虚构事实 | 编造某机构已采用方案 | 读者难从流畅文风察觉 |
| 伪造引用 | 不存在的报告/页码 | 制造权威外观 |
| 引用不匹配 | 链接真实但不支持结论 | 人只看链接存在就放过 |
| 实体混淆 | A公司数字写到A同名产品 | 事实局部真实、归属错误 |
| 过时事实 | 2023比例写成“当前” | 来源真、时间结论假 |
| 逻辑跳跃 | 相关性写成因果 | 来源无法证明推理跨度 |
| 计算错误 | 分母、单位或汇率错 | 引用数据都真,结论仍错 |
| 矛盾 | 前后章节给两个口径 | 降低可行动性与信任 |
“模型知道不知道”不是唯一诊断。检索没拿到正确版本、解析器漏表头、任务范围模糊、撰写人合并实体、引用渲染错位、复核人被文风说服,都可能产生同样的错误输出。证据链要覆盖整个系统,不只评判最后一句话。
用五层控制替代一句“请勿编造”
| 层 | 控制 | 失败后下一层 |
|---|---|---|
| 防止 | 限定任务、权威来源集合、结构化输入 | 仍可能错误检索/推理 |
| 发现 | 主张账本、支持关系、时效和计算检查 | 仍可能误判 |
| 阻断 | 未知或争议状态、发布放行门槛、权限 | 防止错误外发或触发行动 |
| 纠正 | 独立复核、裁决、版本修订 | 保留变更证据 |
| 监控 | 来源变化、读者纠错、新失败评估 | 发现分布漂移 |
这像多道筛网:任何一层都不完美,但错误要连续穿过多层才进入交付。增加检索可以减少“无资料硬答”,却可能引入低质量或冲突来源;要求引用能提高可查性,却可能产生真实链接与错误主张的组合;让第二个模型审稿也会共享偏差。因此每层必须有明确作用和局限。
风险决定强度。内部头脑风暴可标注“未核验”;对客报告的关键数字必须复算;会触发付款、合规、健康或安全决定的内容需要专业权威,不因AI附了链接就降级责任。
先登记 42 份来源,再让主张引用它们
42 份来源包括 16 份政府、标准或原始统计,10 份内部批准数据与访谈记录,8 份专业研究,8 份供应商文档。来源等级不等于“官方永远正确”:供应商文档适合证明自身功能,不适合独立证明市场效果;内部访谈适合说明个体经验,不能代表行业比例。
| 来源字段 | 示例 |
|---|---|
| 来源编号与版本 | S-014 / 2026-06 快照 |
| 发布者/负责人 | 统计机构/内部研究负责人 |
| 来源类型 | 主数据、标准、供应商文档、分析 |
| 支持范围 | 定义/数值/产品能力/个案经历 |
| 地理范围/人群 | 北美、样本642家中型企业 |
| 期间/截至 | 2025Q4 / 已访问 2026-07-21 |
| 精确定位符 | 表格 3 行 8 / 段落 ID |
| 访问/许可 | 可引用摘要,不复制全文 |
| 已知限制 | 自报、样本偏差、未审计 |
源登记先去重转载链。五篇文章都转述同一份调查时,不算五个独立证据;找到原报告并记录样本和方法。网页不存在日期、作者、数据口径或原始出处时,不能因排名靠前就升级为权威。
来源也有生命周期。访问日期不等于数据期;页面今天可以访问,讲的却可能仍是 2022 年。关键来源要建立更新监控,内容哈希值、发布日期或数据版本变化时,触发关联主张重新核验。
检索过程也要留搜索日志,而不是只保存最后找到的链接。每个关键问题记录查询、来源类型过滤、日期范围、查看过的候选、排除理由和停止条件。停止不是“搜到支持观点为止”,而是已找到适配的一手资料、检查了至少一种反证路径,或达到预设时间/来源预算仍不足并转状态未知。
| 检索决策 | 例子 |
|---|---|
| 目标 | 找到2025Q4中型企业采用比例及方法 |
| 首选 | 原始统计/调查方法论,不先用新闻转述 |
| 反查询 | 失败、未采纳、样本限制 |
| 排除 | 无样本说明的营销图、重复转载、旧版摘要 |
| 停止 | 原报告+方法页已定位;独立资料未给同口径 |
| 残留差距 | 不能推广到所有地区/规模 |
这既避免确认搜索,也避免无限浏览。搜索没找到不等于事实不存在;日志只能证明在声明范围内未取得足够证据,所以输出用“在已查来源中无法确认”,不写“没有任何证据”。
把段落拆成可逐条核验的原子主张
初稿写道:“中型企业采用率在两年内翻倍到 62%,主要由成本下降推动,并将在明年超过大型企业。”这句话至少包含当前比例、两年变化、因果解释和未来预测四条主张;一张调查表可能只支持第一条。林颂把 72 个对外陈述拆成可单独判定的最小单位,修辞与过渡不单独计为主张。
| 主张编号 | 原子主张 | 需要的证据类型 |
|---|---|---|
| C-021 | 样本内中型企业采用率为62% | 原始表、样本/定义/期次 |
| C-022 | 相比两年前31%上升一倍 | 可比口径两期数据+复算 |
| C-023 | 成本下降是主要原因 | 因果/受访原因分布,不是猜测 |
| C-024 | 明年将超过大型企业 | 预测模型与假设;不能当事实 |
原子化也保留限定词:样本内、报告口径、约、截至某日、受访者自报。这些不是软化文风,而是主张真值边界。编辑为了“更有力”删掉限定词,会把原本支持的句子变成不支持。
标题、图注、表头、摘要数字和脚注都要进入账本,因为最显眼的错误常常藏在正文之外。最终检查按主张编号生成内容,不允许撰写人脱离账本再加一段“顺手总结”。
主张卡把证据、推导和发布决定放在一起
{
"主张编号": "C-022",
"主张": "在可比样本口径下,采用率由31%升至62%",
"限定词": ["中型企业", "自报", "2023Q4→2025Q4"],
"来源": ["S-014:表3:第8行", "S-019:方法:第4页"],
"关系": "可复算推导",
"计算": "(0.62-0.31)/0.31 = 1.00",
"不确定性": ["两期样本不是同一组企业"],
"复核人": "V2",
"状态": "带限定词发布"
}
| 卡片字段 | 作用 |
|---|---|
| 标准化主张 | 稳定核验对象,不随文案变化 |
| 限定词 | 实体、地区、人群、时间、单位 |
| 来源定位符 | 跳到支持片段,不只到首页 |
| 关系 | 直接/衍生/部分/矛盾 |
| 计算/假设 | 重现推导与估计 |
| 不确定性 | 来源、测量、覆盖与推断限制 |
| 复核人/状态 | 谁在何版本作何决定 |
| 渲染位置 | 标题/正文/图表中出现位置 |
一个主张可以关联多个来源,一个来源也可以支持多个主张;这些关系构成证据图。更新 S-014 时可查询所有下游主张,而不是全文搜索旧数字。卡片不保存不必要的完整原文,受限资料只存获准摘录和来源位置。
证据关系还要记录独立性。S-031 新闻稿、S-032 行业文章和 S-033 社交帖如果都引用 S-014,就不能算三条独立支持;证据图要把它们连回同一个来源根节点。真正的交叉验证要求不同的采集过程或数据来源,而且定义必须足够可比。两个彼此独立、但口径不同的数字,也不能简单取平均。
| 边缘属性 | 问题 |
|---|---|
| 支持范围 | 支持整个主张还是一个子句 |
| 来源 | 原始、转载、计算或人工访谈 |
| 独立性分组 | 是否来自同一底层数据 |
| 方向 | 支持、削弱、矛盾、中性 |
| 强度 | 直接、部分、仅背景 |
| 有效起止 | 哪个时间窗口成立 |
| 访问限制 | 谁能看原文/可否对外引用 |
如果公开报告不能展示受限内部来源,正文仍需用可披露证据支持对外主张;不能以“我们内部有资料”制造无法核验的权威。内部来源可以决定不发布或提示进一步调查。
来源相关不等于来源支持
支持复核问:假设来源本身真实,读者只看标记片段,能否合理得到这条主张?需比较主体、指标定义、样本、时间、地域、数量、比较对象、因果/相关、确定/预测和限定词。链接谈同一主题但没有对应事实,只是相关。
| 关系 | 判定 | 正文动作 |
|---|---|---|
| 直接支持 | 片段直接表达同范围主张 | 可引用 |
| 支持推导 | 输入直接支持,结论可复算 | 给公式/假设 |
| 部分 | 只支持主张一部分/更窄范围 | 缩窄或补来源 |
| 无关 | 同主题但不回答 | 移除链接,视为无支持 |
| 被反驳 | 权威资料给相反结论/数值 | 争议/裁决 |
| 不足 | 来源质量/方法不足以承重 | 降级/状态未知 |
这部分与O12“链接为什么不支持结论”相接,但本文不重复停在引用审计:支持判定只是整条错误控制链中的一环,后面还要处理计算、不确定性、争议、独立复核和发布阻断。
引用数量不是质量。两个转载同一错误不会超过一份原始数据;五个弱相关链接也不能支持一个强因果主张。高影响主张优先找一手数据和方法,再用独立来源做交叉检查。
重复生成也不是独立事实核验。同一输入让模型回答五次、五次都写62%,只能说明输出较一致;它们可能共同依赖同一错误模式。自洽性适合发现不稳定,不能替代外部来源、公式或真实环境结果。反之,五次措辞不同也不自动表示事实有争议,可能只是生成方差。
让第二个模型“批判第一稿”只有在它获得更好的证据、不同检查目标或受约束的评分员时才增加一层;若只把全文粘过去问“是否正确”,流畅答案仍可能互相背书。
单独检查实体、口径、时间和单位
| 检查 | 初稿错误 | 修正 |
|---|---|---|
| 实体 | 母公司收入写为某产品收入 | 换产品披露或标状态未知 |
| 分母 | 62%受访者写成62%所有企业 | 恢复“样本内受访者” |
| 时期 | 年度累计与季度值比较 | 对齐同周期 |
| 货币 | 美元与加元直接相加 | 固定汇率与日期后换算 |
| 名义/实际 | 名义增长当实际增长 | 找平减指数或改措辞 |
| 存量/流量 | 在用客户与本年新增混用 | 分开指标 |
| 预测/实际 | 预测写成已发生 | 标预测与来源日期 |
自动实体标识、单元和日期验证器可拦截明显问题,但最终仍看来源定义。例如“活跃”可能是30日登录、付费账户或完成一次任务;名称相同不能直接合并。源登记保存指标定义,主张卡引用定义版本。
每个动态主张都有自己的时效策略:价格可能按天更新,产品功能跟随版本,年度统计跟随新发布周期,稳定的历史日期则不必频繁查询。过期不一定等于错误,但不能继续写成“当前”。
推导主张必须能从输入重新算出来
8 条衍生主张包含增长率、加权比例和跨表汇总。撰写人不能在同一段里读取数据、心算并宣布答案;计算产物由独立脚本或表格生成,记录输入单元格与来源、公式、单位、精度和输出哈希值,验证人再用另一种公式或抽样手算复核。
| 衍生字段 | C-022示例 |
|---|---|
| 输入 | 0.31、0.62 |
| 来源 | S-014两期同指标 |
| 公式 | 相对变化=(新旧)/旧 |
| 结果 | 1.00,即增加100% |
| 措辞 | “相对增加100%/约翻倍” |
| 禁用措辞 | “增加31个百分点的100%”等混合表述 |
| 保留条款 | 两期横截面样本不同 |
“由31%到62%”是增加31个百分点,也是相对增加100%;两者都可算,但含义不同。报告若写“增长100个百分点”就是单位错。对金额还检查税前/税后、币种、名义/实际和四舍五入顺序。
模型可以生成公式候选,不能同时做唯一计算者与唯一验收者。复算结果不一致时进入冲突,不让撰写人选择更好看的数字。
不确定性要写清来自哪里,以及会怎样影响决定
模型自报“95% 确信”没有经过任务校准时不能当概率。林颂用可行动标签说明不知道在哪里、为什么、对结论有何影响。
| 不确定性类型 | 示例 | 表达/动作 |
|---|---|---|
| 来源 | 只有供应商自报 | 写来源角色,寻独立资料 |
| 测量 | “使用”定义不一致 | 不直接合并比例 |
| 抽样/覆盖 | 样本偏中型北美企业 | 限定适用范围 |
| 推断 | 从相关推原因 | 改为关联或删除因果 |
| 新鲜度 | 最新数据到2025Q4 | 标截至并设更新 |
| 分歧 | 两权威来源口径冲突 | 并列,不平均掩盖 |
| 缺失 | 无法取得分母 | 状态未知,不给点估计 |
4条有界估算只有在上下界有证据和假设可检查时发布,例如已知最少48、最多61家,而不是“模型感觉约55”。正文显示区间与敏感假设,摘要不偷换成精确55。
林颂为其中一条市场规模估计做三情景,不把单个参数设成“最佳猜测”后隐藏。已知符合条件的组织数在480—610之间,采用比例在18%—26%,因此结果区间为86—159;基准情形用545×22%=120只是中点场景,不比边界更真实。报告将86—159作为可支持范围,并说明两个输入同时向同方向变化时范围如何扩大。
| 场景 | 组织 | 采用 | 结果 |
|---|---|---|---|
| 下限 | 480 | 18% | 86.4,向下取86 |
| 基础 | 545 | 22% | 119.9,约120 |
| 上限 | 610 | 26% | 158.6,向上取159 |
若决策只在结果高于150时成立,这个估计不能支持确定行动,因为只有上行情景跨过阈值;结论应要求补数据或采用可逆试验。敏感性把“不确定”转为决策条件,而不是在数字后加一个±符号装饰。
不确定性进入结论强度。证据弱时从“导致”降为“与之同时出现”,从“行业”降为“本样本”,从“将会”改为“在假设X下可能”。这不是逃避,而是让语言匹配证据。
状态未知也是一种合格结果
5条状态未知分别来自缺分母2条、无法区分实体1条、来源不可访问1条、两份输入都不完整1条。每条保存已检索来源、未满足条件、可能的下一步和谁能决定;不以“暂无公开信息”暗示穷尽全世界,只写已查范围。
| 未知代码 | 含义 | 可继续条件 |
|---|---|---|
| 缺少来源 | 未找到足够来源 | 负责人提供或批准新来源 |
| 缺少分母 | 不能计算比例 | 获得总体数与定义 |
| 实体不明确 | 无法确定归属 | 精确标识或披露拆分 |
| 不可访问 | 来源存在但无权读取 | 合法访问或替代来源 |
| 冲突未解决 | 证据冲突无法裁决 | 澄清方法或口径 |
状态未知不会自动变成零、没有、否或平均值。输出模板强制显示“已知/推导/估计/争议/未知”,避免撰写人为了段落顺畅把缺失藏掉。用户可以基于缺口决定延后、缩小范围或人工调查。
DeepMind早期GopherCite工作就把“无法形成有证据答案时说不知道”作为一项策略,同时明确引用只是整体安全可信策略的一部分。本案例沿用的是可验证拒答原则,不声称一个固定句式能消除错误。
矛盾来源不能靠多数票裁决
3 条有争议的主张都保留两侧证据。验证人先检查它们是否其实在讲不同时间、地域、样本或指标;若可以对齐,再按数据直接程度、版本新旧、方法透明度和主张适配性作决定。不能因为三个转载支持 A、一个原始统计支持 B,就按 3:1 投票。
| 冲突原因 | 处理 |
|---|---|
| 时间不同 | 各自标期次,必要时写变化 |
| 指标定义不同 | 分成两个主张,不合并 |
| 修订版替代旧版 | 旧版标已取代,保留历史 |
| 供应商与独立方 | 各自限定角色,效果主张优先独立证据 |
| 两个高质量研究确有分歧 | 并列方法与区间,标为有争议 |
| 无法看方法 | 不裁决,降状态未知 |
裁决记录谁、何时、依据哪条规则作决定,并绑定来源版本。未来新资料到来可重开,不让正文结论与争议账本脱节。
若业务必须现在决定,报告可以给情景分支:在口径A下结论与行动是什么,在口径B下如何;不能把不确定输入平均后假装得到中立真相。
独立复核先看主张和来源,不先看流畅正文
撰写人完成第一次分类后,验证器 V2收到打乱顺序的72张卡片、来源摘录与任务合同,不看到撰写人解释性段落和“这很重要”的文风。V2独立给关系、新鲜度、严重程度和发布决策;分歧交给林颂裁决,高影响数字再由独立计算器复算。
| V2与撰写人分歧 | 数量 | 裁决 |
|---|---|---|
| 部分被写成直接 | 4 | V2正确,缩窄/补证据 |
| 新鲜度判断 | 3 | 2项V2、1项撰写人正确 |
| 计算/单位 | 2 | 1项V2、1项双方都需改 |
| 实体归属 | 2 | V2正确 |
| 合计 | 11 | V2正确8、撰写人正确2、双方不完整1 |
独立不只是换一个模型。如果V2共享相同检索错误、同一提示词和同一错误来源集合,相关失败仍会穿透。案例让V2固定查实体/时间/关系清单,并抽查来源原页;关键数由不同计算路径验证;最终发布人承担决定。
审核员疲劳也会出错。72 条分成四批,每批 18 条,顺序混合不同严重程度;批间安排休息,并在每批插入一个已知测试用例检查判断尺度是否漂移。无法解释的判定标为需要裁决,不逼复核人快速给结论。
正式核验前,撰写人与V2用12条校准卡片独立分类,初次一致9条;3条分歧来自“来源给范围上限能否支持点估计”“供应商个案能否支持行业趋势”和“更新日期是否等于数据日期”。规则补上后重标12条一致11条,剩1条明确送裁决,而不是追求表面100%。
| 校准 | 一致 | 分歧 | 决定 |
|---|---|---|---|
| 规则 v1 | 9/12 | 3 | 细化范围/来源角色/日期规则 |
| 规则 v2 | 11/12 | 1 | 有争议的主张进入人工裁决 |
12条太少,不能估计复核人准确率;它只证明两人对关键规则有共同理解。每次新增来源类型或主张形态,都重新抽样校准。
C-022:从“翻倍”文案回到证据与计算
初稿主张为“中型企业采用率两年翻倍至62%,证明成本下降驱动普及。”来源 S-014表3确有2025Q4样本62%,旧版S-009有2023Q4 31%;两期问卷定义相同但样本企业不同。另一个访谈只提“成本更可控”,不能证明主要驱动。
| 检查 | 结果 |
|---|---|
| 62% | 直接支持,限定本次样本/自报 |
| 31% | 直接支持,限定旧样本 |
| 翻倍 | 衍生:(0.62-0.31)/0.31=1.00 |
| 同一批企业增长 | 不支持,两期横截面不同 |
| 成本下降驱动 | 部分轶事,不足以做因果 |
| 最终措辞 | “在两期可比问卷口径中,自报采用比例由31%升至62%;样本并非同一组企业,不能据此单独归因。” |
最终句保留有用变化,也删除因果包装。图表脚注列来源、样本与期次,摘要只用同样限定词。若下一版编辑删掉脚注或把“比例变化”改回“企业实现增长”,渲染位置检查会阻断。
这条追踪显示检索、计算和写作各自的责任;一个“事实核查”按钮很难同时处理。
72 条主张从初审状态收敛到发布状态
初审分布为 41 条直接支持、12 条部分支持、4 条被反驳、9 条无来源、6 条过时,合计 72 条。修订不是把所有问题强行变成绿色:部分支持中有 8 条缩窄后得到直接支持,2 条变为有界估算,2 条进入状态未知;被反驳的主张中,3 条标为有争议,1 条进入状态未知;无来源的 9 条中,3 条找到新的直接支持,2 条改为衍生,2 条因有上下界而变为有界估算,2 条进入状态未知;6 条过时主张全部用当前序列重新计算并标为衍生。
| 初审→最终 | 直接 | 衍生 | 有界 | 有争议 | 状态未知 | 合计 |
|---|---|---|---|---|---|---|
| 直接 41 | 41 | 0 | 0 | 0 | 0 | 41 |
| 部分 12 | 8 | 0 | 2 | 0 | 2 | 12 |
| 被反驳 4 | 0 | 0 | 0 | 3 | 1 | 4 |
| 无来源 9 | 3 | 2 | 2 | 0 | 2 | 9 |
| 过时 6 | 0 | 6 | 0 | 0 | 0 | 6 |
| 最终 | 52 | 8 | 4 | 3 | 5 | 72 |
“找到直接支持”必须确实来自新获准来源,不能只是给相关链接换个标题。6 条过时主张之所以成为衍生,是因为从新发布的原始序列按固定公式重算,而不是给旧数字换一个日期。所有路径都要保留修改前后的卡片差异。
本次人工核验与裁决共214分钟;没有可信旧流程对照,因此不声称节省时间。价值证据是8条未解决内容没有进入事实正文、64条发布内容能回查与更新。
用 48 项故障测试攻击“看起来有证据”的错误
| 系列 | 案例数 | 代表测试用例 |
|---|---|---|
| 伪造引用 | 8 | 假数字对象标识符、假页码、拼接标题 |
| 真实链接/错误支持 | 10 | 相关主题、范围更窄、方向相反 |
| 陈旧/版本 | 6 | 旧价格、已取代报告、无截至 |
| 数值/公式/单位 | 8 | 分母、百分点、币种、舍入 |
| 冲突来源 | 6 | 时间/定义差异、真实分歧 |
| 不确定/未知 | 6 | 缺分母、无法访问、应拒答 |
| 实体/跨来源 | 4 | 同名公司、母子产品、转载链 |
| 合计 | 48 | 每项有预期状态与发布决策 |
测试同时看假阴性与假阳性。把有充分证据的等价措辞判成不受支持,会让系统过度拒答;把合理衍生误判直接,会丢失推导透明度。每次提示词、检索、解析器、来源策略或验证人更新都重跑。
关键测试用例包括错误金额、客户身份、法律/安全类主张时不使用真实生产输出;在沙盒验证阻断,并交领域专家设计/审阅。个人通用控制不能替代专业事实标准。
自动化适合定位和复算,不适合独自裁决真值
| 自动检查 | 适合 | 人工/独立复核仍需 |
|---|---|---|
| 网页地址与来源位置存在 | 链接、页码或行可达 | 页面是否支持主张 |
| 主张卡结构 | 字段齐全、状态合法 | 限定词是否充分 |
| 实体/日期/单位 | 已知标识、格式、范围 | 隐含口径与同名实体 |
| 公式重算 | 输入/公式/结果 | 输入选择与因果解释 |
| 引用蕴含模型 | 批量初筛 | 高风险/不确定分歧 |
| 来源哈希值监控 | 发现版本变化 | 新版影响分析 |
| 呈现位置检查 | 正文与图表的来源位置一致 | 结论是否适合发布 |
评分员只看摘录可能错过来源方法限制,只看全文可能被无关信息干扰;自动判定返回证据与不确定,不给一个无法解释的绿色勾。关键主张不能由生成它的同一运行自评后直接发布。
DeepMind的LongFact/SAFE研究将长回答拆成个体事实并搜索核对支持关系,说明原子事实评估的价值;其研究结果与成本数字属于特定实验,本文不把自动评估员当人类真值替代。
自动检查也要有自己的评估集:48 项测试之外,再保留 20 组“主张—来源”配对,由人标注直接支持、部分支持、被反驳或无关。升级支持关系评分器时,要比较各类混淆,尤其关注把无关或被反驳误放为直接支持的错误放行;不能只看总体一致数,因为大量容易判断的直接支持会掩盖少数危险错误。
解析器也要单独测试 PDF 双栏、扫描页、表格合并单元格、脚注和负号。若提取文本漏掉“不”或表头,后续支持关系评分再强,也只能对错误输入作判断。来源摘录显示原页截图与坐标供人回看,不把文字识别结果当成原始事实。
八道发布门检查证据状态和最终产物
| 放行门槛 | 通过条件 | 不通过动作 |
|---|---|---|
| 主张清单 | 标题/正文/图表事实都有标识 | 补卡片,不允许游离主张 |
| 证据 | 直接、推导或有界主张均有来源位置 | 状态未知或移除 |
| 关系 | V2/裁决完成 | 需要复核 |
| 计算 | 独立重算一致 | 已阻塞 |
| 不确定性 | 限定/区间在最终文案可见 | 恢复措辞 |
| 冲突 | 有争议的主张不伪装成单一事实 | 并列或移出 |
| 渲染 | 链接、脚注、表格与主张对应 | 修产物重验 |
| 人工批准 | 高影响主张与用途获确认 | 不发布/缩范围 |
发布产物绑定主张账本哈希值与来源快照。正文编辑、摘要重写或图表更新后,差异扫描会寻找新增或变更主张;批准不能从旧版本漂移。PDF 导出后还要重新打开抽查,避免源文档脚注正确、成品页码却发生错位。
发布人不只是点批准。他确认读者、用途、时效、可接受的未知和升级条件;将来把内部探索改成销售承诺,需要重新评估,不因文字曾被核验就自动适用新用途。
同一主张按用途分级。内部探索可保留有界估算与明显水印;客户事实表只接受直接/推导且关键项人工确认;公开营销还要检查披露、许可与易误导表述;会触发高后果行动的内容转专业流程。状态相同不表示所有用途都批准。
| 用途 | 允许状态 | 额外放行门槛 |
|---|---|---|
| 内部探索 | 直接/推导/有界/争议 | 状态可见,不自动行动 |
| 客户草稿 | 直接或推导,少量有界 | 负责人逐条确认 |
| 公开报告 | 直接/推导/严格有界 | 可披露来源、法律/品牌审阅按需 |
| 后果性决策 | 领域定义 | 专家、独立数据、责任流程 |
如果交付渠道会截掉脚注,例如把报告摘要复制到社交媒体,摘要本身要带截至与限定词;不能依赖读者点击原报告才知道数字是估计。
来源更新后,要能找到并更正所有下游表述
42 份来源按各自时效策略巡检。哈希值或版本变化时创建影响任务,查询证据图中的主张与呈现位置。若关键统计发生修订,报告要增加勘误或发布新版本,不能只修改网页,却不通知已经收到旧 PDF 的人。
| 事件 | 处理 |
|---|---|
| 来源更新 | 重新判关系/计算,传播受影响主张 |
| 来源撤回 | 立即冻结下游主张,查替代/发更正 |
| 读者指出错误 | 保存原文/证据,先纠正业务,再建测试 |
| 新的高质量冲突 | 重新开启裁决,标为有争议 |
| 主张仍状态未知 | 到期复核或明确关闭,不自动升级 |
| 策略/用途变化 | 重跑风险与发布放行门槛 |
生产反馈进入O31个人评估:真实新失败去标识后成为回归案例,修复要在旧案例和新案例上同时通过。监控不是证明当初审查失败,而是承认事实世界和系统都会变化。
保留期按客户合同、来源许可和实际需要设置;主张元数据可比受限摘录保留更久,但不能用“审计”无限复制版权或个人数据。
案例模拟了一次真实修订:S-014 在发布后第 12 天把 62% 更正为 59%,并更新方法备注。哈希值监控在 4 小时内创建影响任务,定位 C-021、C-022、图 2、摘要和演示第 6 页;C-021 直接更新,C-022 由相对增加 100% 重算为约 90.3%,两个下游措辞与图表一起失效。林颂发布 v1.1 勘误,并向已经收到 v1.0 的 3 名客户发送人工确认的更正说明。
| 修正证据 | 记录 |
|---|---|
| 旧/新来源 | S-014 v1→v2 |
| 受影响主张 | C-021、C-022 |
| 新旧产物哈希值 | 报告、幻灯片和图表各自版本 |
| 决策 | 重大,必须更正 |
| 接收方 | 3名已知接收者,由人发送 |
| 回归测试 | 陈旧或修订测试用例加入 48 项套件下一版 |
更正速度不是文章原始正确性的证明,却能限制旧错误继续传播。若没有主张图,只靠全文搜索“62%”可能漏掉“翻倍”这种派生表述。
先核验一页中的 10 条主张
控制包包括任务与数据协议、来源登记、原子主张清单、主张卡、证据图、支持关系规则、实体、日期与单位检查、计算产物、不确定性分类、未知与争议流程、盲审验证、裁决记录、48 项测试、发布放行门槛、渲染位置图、来源监控和勘误日志。
本案例参考NIST GAI 画像对虚构及其风险的描述;参考Google DeepMind FACTS 接地/基准对给定上下文定位的评估方向、LongFact对长格式输出原子事实核验的研究,以及GopherCite对引用与有证据拒答的探索。这些研究不能替代你的业务来源策略和人工责任。
- NIST:AI RMF Generative AI Profile
- Google DeepMind:FACTS Grounding
- Google DeepMind:FACTS Benchmark Suite
- Google DeepMind:Long-form factuality in large language models
- Google DeepMind:GopherCite
今天拿一页真实草稿,圈出 10 条读者可能据此采取行动的事实句。逐条写来源位置、直接支持、推导、部分支持或冲突状态,以及事实截至日期;让第二个人只看主张与来源进行复核。任何无法支持的句子,都改成状态未知、缩窄范围或删除。完成这 10 条,比给全文加一句“内容仅供参考”更接近真正的错误控制。