“值不值得买”听起来具体,其实无法直接研究
凌可是一名独立运营顾问。一家 12 人专业服务工作室问她:“AI 会议助手值不值得买?”这句话已经包含了产品、对象和购买动作,看起来比“研究一下 AI”具体得多。可它没有说明谁来决定、何时决定、要解决哪段工作、哪些会议可以处理,也没有规定什么证据足以支持采购。
如果直接搜索,她会得到功能清单、厂商案例、用户评论、隐私条款和价格比较,却无法知道哪条信息能改变客户决定。研究越做越长,最终往往只剩一份“优点很多、风险也要注意”的材料汇总。
她把任务改成:在 2026-08-15 前,判断是否应为 12 名员工开展 6 周受控试点;范围是内部会议和取得书面同意的客户会议;不自动发送纪要,不训练自有模型,不把研究当法律意见。研究最终包含 34 份纳入来源、57 条证据、9 个关键主张和 6 个未解决缺口。
| 决策维度 | 研究结论 | 能支持到哪一步 |
|---|---|---|
| 当前问题 | 40 场会议的会后整理中位数 14.5 分钟,责任人遗漏 7 次 | 证明存在可测基线,不证明 AI 能改善 |
| 基础能力 | 12 场非客户模拟会议中找回 96 个标准行动项中的 81 个,并产生 9 个错误行动项 | 支持进入小规模验证,不支持全量自动化 |
| 数据边界 | 产品文档说明了处理与保留选项,但客户合同的允许范围未全部确认 | 客户会议默认排除,逐项取得同意 |
| 经济门槛 | 报价假设下,每场至少节省 2.4 分钟才覆盖订阅费 | 作为试点阈值,不写成已实现收益 |
| 最终决定 | 先做 6 周、4 人、仅草稿模式试点 | 未批准 12 人全面采购 |
本文为教学案例,用虚构数据完整展示从问题到证据的路径;人物、会议、报价、检索数量和结果均不代表真实产品效果。
先把话题改成一项有负责人和期限的决定
“AI 会议助手好不好”是话题,不是研究问题。凌可先写 决策简报:谁在什么时间,用研究结果做什么不可逆或有成本的选择。
| 字段 | 本例 | 缺失后的风险 |
|---|---|---|
| 决策负责人 | 工作室负责人 | 研究结束无人批准 |
| 决策 | 全面采购、受限试点或暂不采用 | 结论只剩优缺点列表 |
| 决策日期 | 2026-08-15 | 无限继续搜索新资料 |
| 总体 | 12 名顾问、每月约 160 场会议 | 把大企业案例直接外推 |
| 使用场景 | 内部与客户访谈,纪要只作草稿 | 忽略权限和外部动作 |
| 替代方案 | 现有手工模板、录音后人工整理 | 把“不买某产品”误写成“不解决问题” |
| 风险负责人 | 负责人处理合同与数据决定 | 顾问越权给法律结论 |
研究交付不是“推荐一个工具”,而是比较三个行动选项,并说明什么新证据会改变选择。
问题树的每个分支都要服务同一决定
凌可把总问题拆成五个一级问题和 14 个二级问题。问题树按决策缺口分,不按“功能、价格、案例”这类网页栏目分。
| 一级问题 | 二级问题示例 | 需要的证据 |
|---|---|---|
| 当前工作是否值得改变 | 每场整理多久;错误发生在哪一步 | 内部计时、样本审计 |
| 工具在本场景能做什么 | 行动项找回、错误新增、说话人区分 | 受控模拟、产品文档 |
| 数据与动作边界是什么 | 录音同意、保存、删除、训练、共享 | 合同、政策、官方设置 |
| 怎样进入现有流程 | 谁启动、谁复核、怎样回到任务系统 | 流程走查、连接能力 |
| 经济与退出条件是什么 | 订阅、复核、节省、撤回成本 | 报价、内部工时、试点指标 |
每个二级问题都必须能改变范围、门槛或选项。若答案只满足好奇心,例如“全球市场规模多大”,又不影响 12 人工作室决定,就从本轮删除。
她再做 问题可追溯性,确保每个子问题至少对应一种可取得来源、一个预期输出和一个决策用途:
| 问题编号 | 可取得输入 | 输出 | 改变什么 |
|---|---|---|---|
| Q-B01 | 40 场历史会议计时 | 整理时间分布 | 是否存在值得解决的成本 |
| Q-C02 | 12 场冻结模拟 + 标准答案 | 找回与错误新增 | 是否值得进入真实试点 |
| Q-D03 | 数据处理活动、合同、设置回执 | 数据生命周期图 | 哪类会议可纳入 |
| Q-W02 | 任务系统权限与流程走查 | 人工批准点 | 是否允许连接写入 |
| Q-E01 | 报价、会议量、人工时间 | 盈亏平衡 | 试点经济门槛 |
若问题没有来源,先登记 差距;若有来源却不会改变决定,就删掉问题。问题树不是报告目录,而是证据与行动之间的控制面。
把形容词改成可观察结果和反证
“准确”“省时间”“安全”都不能直接检索或验收。凌可把它们改成场景、单位、方向和反证:
| 模糊词 | 可回答定义 | 必须保留的反证 |
|---|---|---|
| 准确 | 标准行动项找回数、错误新增数、责任人与日期匹配 | 漏项和虚构项分开计 |
| 省时间 | 从会议结束到可审核草稿的人工分钟 | 设置、纠错和失败恢复也计入 |
| 安全 | 已确认的处理、保留、访问、删除和批准边界 | “有认证”不能替代本次授权 |
| 好集成 | 草稿能进入现有任务表且保留来源 | 能连接不等于允许自动写入 |
| 值得 | 达到质量硬门后,净收益覆盖费用和维护 | 时间收益不能抵消数据越界 |
研究问题因此从“准不准”变成:“在中文为主、偶有英文术语的 45—60 分钟会议中,草稿模式能否达到行动项找回不低于 90%、错误新增不高于 3%,且人工复核中位数低于 8 分钟?”这些是试点门槛,不是对产品的既有结论。
先写研究协议,再让 AI 帮忙搜索
协议冻结问题、时间、来源范围、纳入排除和输出。搜索过程中可以修订,但每次修订要记录原因和影响,不能看到结果后悄悄降低门槛。
| 协议项 | 规则 |
|---|---|
| 时间范围 | 产品与政策资料优先 2024-01-01 至 2026-07-21;基础方法不限 |
| 语言 | 中文、英文;其他语言若关键则翻译并标译者 |
| 产品范围 | 能处理会议音频并输出带来源草稿的候选工具 |
| 纳入 | 能回答某个子问题,且来源、日期、版本可识别 |
| 排除 | 无作者转载、仅营销口号、无法定位原文、旧版被替代 |
| 截止 | 搜索 3 个工作日;关键分支达到饱和或明确缺口即停止 |
| 双重检查 | 权限、价格和效果关键主张由本人逐条复核 |
研究不是系统综述,不能冒用医学综述的完整性声明;但仍可借用预先定义标准、记录搜索和保留排除理由的原则,减少只挑支持结论的资料。
协议有 版本 和 修订日志。第 2 天发现客户会议同时包含中文、英文产品名时,她把语言场景从“中文会议”修为“中文为主、允许英文术语”,新增 A-02;这一变化要求回看已经筛掉的英文术语样本。相反,她没有因为行动项找回只有 84.4% 就把试点门槛从 90% 降到 80%。
| 修订 | 变化 | 原因 | 回溯动作 |
|---|---|---|---|
| A-01 | 加入现有手工模板作替代项 | 决策不是只比较买与不买 | 重写 决策选项 |
| A-02 | 扩展到中英术语混合 | 与真实会议场景一致 | 重筛 7 条语言相关资料 |
| A-03 | 把自动发送列为明确排除 | 负责人未批准外部动作 | 更新流程与风险问题 |
协议允许依据新事实修订,但不允许依据想要的结论修订。每次变化都说明哪些旧搜索、筛选和证据需要重跑。
不同子问题要匹配不同来源,不能用一个“权威等级”包打天下
来源强弱取决于主张。厂商官方文档最适合说明当前设置和接口,不适合独立证明节省时间;内部计时最适合描述本工作室基线,不证明其他团队;法律文本能说明正式要求,博客摘要不能替代原文。
| 主张 | 首选来源 | 补充来源 | 不足以单独支持 |
|---|---|---|---|
| 当前功能与限制 | 当前官方文档、版本记录 | 实际界面验证 | 销售演示 |
| 数据处理与保留 | 合同、数据处理活动、隐私文档、设置回执 | 安全说明 | 认证 标志 |
| 本团队时间基线 | 内部观察与任务记录 | 成员访谈 | 行业平均 |
| 本场景质量 | 冻结样本受控测试 | 独立研究 | 厂商案例 |
| 法律要求 | 适用法源与专业意见 | 官方解释 | 搜索摘要、AI 结论 |
| 价格 | 有日期的正式报价和条款 | 公开价格页 | 旧评测文章 |
她为每个问题先指定 源计划,再开始搜索;这样不会因为某类资料容易找到,就让它占满证据表。
搜索词来自问题概念、同义词和排除项
问题树中的每个概念建立 术语映射。比如数据边界分支包括 会议录音、转录、留存、删除、模型训练、子处理者、同意,以及产品正式名和旧名。
| 搜索编号 | 目的 | 查询骨架 | 预期来源 |
|---|---|---|---|
| S-01 | 当前能力 | 产品名 + 待办事项 + 发言人 + 文档 | 官方文档 |
| S-02 | 数据生命周期 | 产品名 + 留存 / 删除 / 培训 | 隐私与 数据处理活动 |
| S-03 | 更新变化 | 产品名 + 发布说明 + 日期 | 版本记录 |
| S-04 | 独立质量 | 会议助手 + 行动项评估 | 研究与方法报告 |
| S-05 | 本地约束 | 客户合同 + 录音 + 已批准工具 | 内部合同与政策 |
| S-06 | 经济 | 报价 + 席位 + 术语 + 取消 | 正式报价 |
每次搜索保存日期、平台、完整查询、过滤、结果数和导出文件。AI 可以扩同义词、总结候选页,但不能在没有保存链接和原文时写入证据。
142 条候选怎样筛到 34 份纳入来源
三天搜索与内部调取共得到 142 条候选:官方产品与合同 52、独立研究或方法资料 44、内部记录 23、监管或法律资料 23。去除 26 个重复报告后剩 116;标题和摘要排除 48;阅读全文排除 34;最终纳入 34。
| 阶段 | 数量 | 主要动作 |
|---|---|---|
| 识别 | 142 | 保存查询和来源类型 |
| 去重后 | 116 | 同一文档不同 统一资源定位符 合并 |
| 全文候选 | 68 | 标题摘要按协议筛选 |
| 纳入 | 34 | 全文能回答至少一个子问题 |
| 全文排除 | 34 | 保存主排除原因 |
34 份纳入来源包括官方产品或合同 7、监管与正式规则 6、独立研究或方法资料 9、内部数据与记录 12,合计 34。排除项保留 EX-001 等 ID;“不支持我想要的结论”不是合法排除理由。
排除日志是研究证据的一部分,不是清理垃圾。
| 排除原因 | 数量 | 示例 |
|---|---|---|
| 已被当前版本替代 | 9 | 2024 保留政策旧页 |
| 只有营销主张,无方法或原始数据 | 8 | “节省 30% 时间”案例 |
| 不符合 12 人工作室场景 | 6 | 强制企业管理员的部署 |
| 无法访问或定位原文 | 4 | 二手文章引用失效报告 |
| 重复报告同一底层研究 | 3 | 新闻稿与研究 PDF |
| 非目标会议或语言场景 | 4 | 仅呼叫中心英文通话 |
| 合计 | 34 | 每份只记一个主要原因 |
若一份资料表面很相关但被排除,日志让审阅者知道它已经被考虑。搜索结束后再出现新资料,也能按同一协议判断,而不是因为“看起来重要”直接加入。
凌可先独立筛 68 份全文候选,再请一名项目成员盲审其中 20 份。两人对 17 份一致,3 份分歧:一份厂商案例缺方法、一份旧政策是否仍适用、一份大型企业案例能否作为背景。根据协议,前两份排除,第三份仅作为 上下文 纳入,不得支持效果主张。
| 分歧 | 争议点 | 协议裁决 | 形成的改进 |
|---|---|---|---|
| SR-07 | 有节省比例但无样本与测量 | 方法不可核 | 排除,保留厂商主张日志 |
| SR-19 | 页面可打开但已被新版替代 | 当前 优先 | 旧页关联 superseded_by |
| SR-31 | 500 人企业与 12 人场景不同 | 直接性 低 | 仅作流程背景 |
她据此回看同类候选,另发现 2 份旧页面漏标 已取代。复核的目的不是追求一个漂亮一致率,而是发现协议是否可操作。最终纳入决定仍由凌可负责,分歧与裁决保存在 审计日志。
证据表一行只支持一个有限主张
一份文档可能产生多行 证据;同一研究的三个网页仍属于同一底层来源。凌可不把整页摘要贴成一行,而是保存原文事实和自己的解释:
| 字段 | 作用 |
|---|---|
| 证据编号 | 稳定引用 |
| 问题编号 | 回答问题树哪一项 |
| 可支持主张 | 这行最多支持什么 |
| 来源编号 / 来源位置 | 文件、页码、段落或表格 |
| 原文事实 | 受限长度的原文事实或数据 |
| 解释 | 凌可怎样理解,不能混进原文 |
| 总体 / 上下文 | 对谁、什么场景成立 |
| 日期 / 版本 | 何时有效 |
| 方向 | 支持、矛盾、混合、上下文 |
| 质量标记 | 偏差、样本、缺失和利益相关 |
| 复核状态 | 提取、已检查、已接受、已拒绝 |
57 条证据按结论方向分为支持 19、矛盾 14、上下文 8、不足 16,合计 57。“不足”不是删除,而是明确这条资料无法支持拟写强度。
证据还有生命周期。提取只表示字段已抄录;已检查表示原文、定位、数字和版本已核;已接受才允许进入主张账本;已拒绝保留原因;过时表示来源更新后需重审。AI 抽取的 57 行中,首轮有 6 行页码错、4 行把解释写进原文事实、3 行遗漏适用账户,共 13 行退回。
| 证据门 | 检查 | 失败例 |
|---|---|---|
| 身份 | 来源编号、版本、日期唯一 | 同一 PDF 的两个网址被当成两项证据 |
| 来源位置 | 页码或段落能直接打开 | 只写“隐私政策” |
| 保真度 | 原文事实未被改写增强 | “可配置”变成“默认关闭” |
| 完整性 | 数字带分母、单位、时间窗 | 只抄 84.4% |
| 适用性 | 人群、套餐、语言和场景明确 | 企业功能外推个人账户 |
| 独立性 | 同一底层研究正确关联 | 新闻稿与报告重复计票 |
修订后由本人再次核对 13 行,并对其余 44 行抽 9 行;9/9 通过。抽样不证明全部无错,但给出了明确的检查范围和剩余风险。
来源强弱要看它是否适合当前主张
她用五个维度评估每条证据:直接性 是否直接回答本问题;方法 是否说明数据怎样产生;货币 是否仍适用;独立性 是否有明显利益相关;可追溯性 是否能回到原位置。
| 证据 | 直接性 | 方法 | 货币 | 独立性 | 用法 |
|---|---|---|---|---|---|
| 当前 数据处理活动 的删除条款 | 高 | 高 | 高 | 厂商文件 | 支持合同字段,不证明实际操作无误 |
| 厂商客户案例 | 中 | 低 | 高 | 低 | 生成假设,不做效果估计 |
| 12 场冻结模拟测试 | 高 | 中 | 高 | 由采购方执行 | 支持本样本,不外推真实客户会议 |
| 40 场历史基线 | 高 | 中 | 高 | 内部数据 | 支持当前流程问题 |
| 独立但 2022 年研究 | 中 | 高 | 低 | 高 | 支持方法背景,谨慎用于当前产品 |
她不计算一个“权威总分”后机械排序。隐私条款和质量测试回答不同问题;一个方法严谨但场景不直接的来源,可以补充机制,却不能覆盖直接场景证据。
主张强度按最弱必要环节校准。一项建议若同时依赖产品设置、合同许可和本地效果,其中任何一环是 差距,就不能用其他两环的强证据补齐。凌可使用四级措辞:已记录 表示来源明确写出;观测 表示本样本观察到;推断 表示由多条证据推导且说明假设;状态未知 表示目前不能回答。
| 证据状态 | 允许写法 | 禁止升级 |
|---|---|---|
| 单一官方设置页 | “文档说明可配置” | “已经安全配置” |
| 12 场模拟观察 | “本样本观察到 81/96” | “真实客户会议准确率 84.4%” |
| 多来源一致且场景相近 | “证据支持进入试点” | “一定能全面采用” |
| 来源冲突可由版本解释 | “当前版本为 X,旧版为 Y” | 删除旧证据假装无冲突 |
| 关键许可未确认 | “未知,默认排除” | “风险较低” |
数字必须同时记录分子、分母、单位和时间窗
“准确率 84%”没有说明评估对象。模拟测试预先定义 96 个行动项,系统找回 81 个,找回率 81÷96=84.4%;另外生成 9 个标准答案中不存在的行动项。两项必须并列,不能只报 84.4%。
| 指标 | 分子 | 分母 | 结果 | 限制 |
|---|---|---|---|---|
| 行动项找回 | 81 | 96 个标准行动项 | 84.4% | 12 场模拟会议 |
| 错误新增 | 9 | 90 个输出行动项 | 10.0% | 不是“错误率 10%”的通用定义 |
| 责任人正确 | 73 | 81 个找回项 | 90.1% | 仅在已经找回的行动项中评价 |
| 日期正确 | 46 | 52 个带日期标准项 | 88.5% | 相对日期由人工规范 |
模拟脚本不含真实客户噪声、多人抢话和敏感数据,结果只能说明值得继续验证。若把 81/96 写成“会议助手准确率”,就把单一字段和有限样本夸成总体能力。
矛盾证据先解释差异来源
有资料说可配置不用于模型改进,另一份旧帮助页又写默认用于改进。凌可检查版本和账户类型,发现两页适用套餐与日期不同;证据表保留两行,当前合同解释优先,但旧账户迁移仍列待确认。
| 冲突类型 | 例子 | 处理 |
|---|---|---|
| 时间变化 | 2024 与 2026 保留设置不同 | 以 as_of 和版本分开 |
| 人群不同 | 企业账户与个人账户 | 不合并成一个结论 |
| 指标不同 | 行动项找回 对比 词错误率 | 各自报告,不比较高低 |
| 方法不同 | 模拟脚本 对比 真实会议回顾 | 解释偏差,不做简单平均 |
| 利益相关 | 厂商案例 对比 独立测试 | 保留来源角色 |
| 真正未知 | 合同未覆盖某客户材料 | 建缺口,不让 AI 裁决 |
证据数量多不代表胜出。五篇转载同一厂商研究仍是一项底层证据;一条直接合同限制可以否决多个模糊正面案例。
从证据行到主张,要经过主张账本
| 主张编号 | 拟写主张 | 支持 | 反证或限制 | 允许措辞 |
|---|---|---|---|---|
| C-01 | 当前整理存在可测成本 | EV-01…08 | 样本仅 40 场 | “本样本中位数 14.5 分钟” |
| C-02 | 工具可找到多数行动项 | EV-21…26 | EV-27…31 漏项与新增 | “模拟样本找回 84.4%” |
| C-03 | 已满足客户会议数据要求 | 合同部分字段 | 6 个合同未确认 | 不得下结论 |
| C-04 | 全面采购能节省成本 | 经济模型 | 真实节省尚未测 | 只能写试点门槛 |
| C-05 | 受限试点可降低未知 | 能力与流程证据 | 需排除无同意会议 | 可建议试点 |
主张账本迫使作者把“不足”留在结论旁边。报告正文引用主张编号,再由主张回到证据,而不是把几十个链接堆在段尾。
完整走一条主张:经济上“可能值得”怎样写才不虚假
正式报价假设为每人每月 24 美元,12 人共 288 美元。内部每月约 160 场会议,人工时间按每小时 45 美元估算。仅覆盖订阅费所需节省为 288÷160÷45×60=2.4 分钟/场。
若试点达到从 14.5 分钟降到 8 分钟,每月毛节省为 160×6.5=1,040 分钟,即约 17.3 小时;按分钟精确换算的假设时值为 1,040÷60×45=780 美元,减订阅 288 美元为 492 美元。但这个结果依赖会议量、时值、实际采用率和复核时间,不能写成“每月一定节省 492 美元”。
| 敏感性情形 | 会议/月 | 每场节省 | 毛小时 | 扣订阅后的时值 |
|---|---|---|---|---|
| 低使用 | 80 | 4 分钟 | 5.3 | -48 美元 |
| 基准试点目标 | 160 | 6.5 分钟 | 17.3 | 492 美元 |
| 高使用但复核慢 | 200 | 3 分钟 | 10.0 | 162 美元 |
建议因此不是“投资回报率为 170%”,而是试点必须同时记录实际会议数、准备、复核、失败恢复和订阅;低使用情形可能不回本。
缺口表决定在哪里停止,而不是继续漫无目的搜索
| 缺口编号 | 缺什么 | 为什么重要 | 获取方式 | 截止前处理 |
|---|---|---|---|---|
| G-01 | 6 份客户合同的录音与处理许可 | 决定能否用于客户会议 | 负责人逐合同确认 | 默认排除 |
| G-02 | 真实多人抢话质量 | 模拟会议覆盖不足 | 经同意的试点样本 | 不作全面结论 |
| G-03 | 删除请求的端到端回执 | 文档说明不等于实操 | 沙箱删除演练 | 试点前完成 |
| G-04 | 任务系统写入的最小权限 | 连接器可能扩大风险 | 只读与草稿权限试验 | 禁止自动写入 |
| G-05 | 退出后的数据导出与清理 | 影响可逆性 | 合同和实际演练 | 写入退出门槛 |
| G-06 | 真实复核时间 | 决定经济结果 | 6 周计时 | 作为继续条件 |
第三个工作日结束时,新增搜索已经连续 12 条没有改变主张账本;剩余问题需要合同确认和试点数据,不是更多网页。她据此停止资料搜索,把缺口带入行动设计。
“没有改变”有明确口径:没有新增问题分支、没有改变主张方向、没有增加新的直接来源类型,也没有解除关键 差距。最后 24 条候选分两组复核:前 12 条只重复已有产品功能与案例,后 12 条仍未补上合同许可或真实复核时间。
| 停止检查 | 观察 | 决定 |
|---|---|---|
| 查询覆盖率 | 14 个二级问题都有搜索记录 | 不再补同义查询 |
| 源多样性 | 官方、规则、独立、内部四类均覆盖 | 不因数量对称继续搜 |
| 声明变更 | 连续 12 条未改变 9 个 主张 | 网页搜索达到本轮饱和 |
| 关键缺口 | G-01、G-06 只能由合同和试点解决 | 转行动,不伪装成搜索不足 |
| 更新风险 | 产品和条款可能变化 | 记录 as_of,决策前复查 |
停止不是宣称“找到了所有资料”,而是说明在当前时间与资源下,继续同类搜索的边际信息已经很低;重要未知已被转成有负责人和取得方式的缺口。
最终建议比较三个选项,不把研究写成单一推荐
| 选项 | 证据支持 | 主要风险 | 决定 |
|---|---|---|---|
| 12 人立即全面采购 | 基础能力与流程潜力 | 质量、合同、退出仍有缺口 | 不批准 |
| 4 人、6 周、草稿模式试点 | 可测基线、模拟样本、可设置硬门 | 仍需同意与删除演练 | 批准 |
| 暂不采用,优化手工模板 | 无数据处理新增风险 | 继续承担整理时间和遗漏 | 作为回退 |
受限试点不是折中态度,而是与证据强度匹配的行动。它只开放内部会议和明确同意的客户会议;输出必须人工复核;不自动发送、不自动写任务系统;任何跨权限、删除失败或错误行动项超过门槛都暂停。
试点把未解决问题变成可测验收和退出条件
| 指标 | 基线或门槛 | 采集 |
|---|---|---|
| 行动项找回 | 不低于 90% | 冻结标准答案双人复核 |
| 错误新增 | 不高于 3% 输出项 | 单独计虚构责任人或日期 |
| 人工复核 | 中位数低于 8 分钟 | 从草稿到批准的计时 |
| 数据边界 | 0 次无同意录音、0 次越权访问 | 会议清单与访问日志 |
| 删除演练 | 指定数据在约定层全部不可检索 | 原件、派生、索引、缓存 |
| 使用率 | 四人中至少三人每周使用 | 实际运行记录,不看注册 |
第 2 周做中期检查,只处理安全与流程故障,不因短期分数低就临时改标准答案;第 6 周全量复核。若质量未过但数据边界完好,可选择改流程后新建试点,而不是宣布产品永久不可用。
发布前逐项反向检查:结论能否回到问题和证据
凌可随机抽 12 条正文主张,逐条反查 claim_id、evidence_id、来源位置和适用边界;12/12 可打开。再从 57 条证据随机抽 10 条,检查是否被正文夸大;发现 1 条官方功能说明被写成实际效果,改回“文档声明可配置”。
| 发布检查 | 通过条件 |
|---|---|
| 问题覆盖率 | 每个结论回答已登记子问题 |
| 声明支持 | 关键主张至少一条直接证据,反证同列 |
| 来源追踪 | 统一资源定位符 / 文件、页码、日期可打开 |
| 数量审计 | 分子、分母、单位、时间窗可复算 |
| 排除项 | 表面相关的排除项有理由 |
| 不确定性 | 未知不被改写成概率或保证 |
| 行动匹配 | 建议强度不超过证据强度 |
| 新鲜度 | 当前产品与条款核对 as_of 日期 |
AI 可以协助生成查询、抽取候选字段、发现矛盾和检查缺项;最终纳入、证据解释、主张强度和决策建议由凌可负责。自动化提高吞吐,不转移研究责任。
她还做一次从零复现测试:给另一工作窗口 决策简报、方案、搜索日志、当时的结果导出和 源登记,但不给报告结论。该窗口能按 6 组查询记录与去重规则重建同一份 116 条记录快照,并按 筛选日志 重建 34 份纳入列表;网页后来更新的 2 项通过 archived_at 和内容摘要定位到研究时版本。
| 复现对象 | 一致结果 | 允许差异 |
|---|---|---|
| 查询 | 平台、查询、过滤、日期齐全 | 搜索平台实时排序变化 |
| 来源集合 | source_id 与内容摘要一致 | 新增网页另开 更新运行 |
| 筛选 | 纳入 34、排除 34 全有理由 | 新证据按 修订 处理 |
| 证据 | 57 行可回源,13 行修订历史保留 | 解释 可提出复核意见 |
| 声明 | 9 个关键主张均有支持与限制 | 建议可因风险偏好不同而变化 |
| 决策 | 三个选项与条件完整 | 决策 负责人 可选择不同选项 |
可复现不要求不同研究者必然给出相同建议,而是能看见同一输入、规则、证据和判断分叉。若别人只能阅读最终 PDF,不能重建来源和排除路径,研究就难以更新。
发布包同时冻结 as_of=2026-07-21。价格、功能、条款或合同变化时,不直接覆盖旧证据;先创建 更新运行,识别受影响 问题 与 主张,只重跑相关搜索后再做全局一致性检查。历史决定仍引用原版本,避免用今天页面解释当时选择。
可以直接复制的研究目录和最小交付包
research/
decision-brief.md
protocol.md
question-tree.csv
term-map.csv
search-log.csv
source-register.csv
screening-log.csv
evidence-table.csv
claim-ledger.csv
gap-register.csv
decision-options.md
audit-log.md
最小版至少保留决策简报、问题树、搜索日志、证据表、主张账本和差异登记簿。研究完成的标志不是“看了很多”,而是能够说明:这个决定需要回答什么、找过哪里、纳入和排除了什么、每条结论由什么支持、哪些仍不知道,以及为什么当前行动没有超过证据。
来源与进一步阅读
以下资料核验于 2026-07-21,用于支持先定义研究问题、按问题选择方法、预设检索与纳入标准、记录筛选和保留排除理由:
- HM Treasury:The Magenta Book:2026 版强调评估应围绕使用者需要、具体问题和适合的方法,并在早期规划。
- HM Treasury:Magenta Book Annex A:说明证据综合方法应服务清楚定义的研究问题,方法随问题类型选择。
- Cochrane Handbook Chapter 4:说明预先规划检索、按资格标准识别资料、记录选择过程,并为表面相关的排除项保留原因。本文借用过程原则,不声称这是一项 Cochrane 系统综述。