“值不值得买”听起来具体,其实无法直接研究

凌可是一名独立运营顾问。一家 12 人专业服务工作室问她:“AI 会议助手值不值得买?”这句话已经包含了产品、对象和购买动作,看起来比“研究一下 AI”具体得多。可它没有说明谁来决定、何时决定、要解决哪段工作、哪些会议可以处理,也没有规定什么证据足以支持采购。

如果直接搜索,她会得到功能清单、厂商案例、用户评论、隐私条款和价格比较,却无法知道哪条信息能改变客户决定。研究越做越长,最终往往只剩一份“优点很多、风险也要注意”的材料汇总。

她把任务改成:在 2026-08-15 前,判断是否应为 12 名员工开展 6 周受控试点;范围是内部会议和取得书面同意的客户会议;不自动发送纪要,不训练自有模型,不把研究当法律意见。研究最终包含 34 份纳入来源、57 条证据、9 个关键主张和 6 个未解决缺口。

决策维度 研究结论 能支持到哪一步
当前问题 40 场会议的会后整理中位数 14.5 分钟,责任人遗漏 7 次 证明存在可测基线,不证明 AI 能改善
基础能力 12 场非客户模拟会议中找回 96 个标准行动项中的 81 个,并产生 9 个错误行动项 支持进入小规模验证,不支持全量自动化
数据边界 产品文档说明了处理与保留选项,但客户合同的允许范围未全部确认 客户会议默认排除,逐项取得同意
经济门槛 报价假设下,每场至少节省 2.4 分钟才覆盖订阅费 作为试点阈值,不写成已实现收益
最终决定 先做 6 周、4 人、仅草稿模式试点 未批准 12 人全面采购
研究按当前问题、基础能力、数据边界和经济门槛判断是否进入受限试点
研究没有回答产品抽象意义上的好坏。它只判断这家 12 人工作室目前是否有足够证据进入 4 人、6 周、仅草稿模式的受控试点。

本文为教学案例,用虚构数据完整展示从问题到证据的路径;人物、会议、报价、检索数量和结果均不代表真实产品效果。

先把话题改成一项有负责人和期限的决定

“AI 会议助手好不好”是话题,不是研究问题。凌可先写 决策简报:谁在什么时间,用研究结果做什么不可逆或有成本的选择。

字段 本例 缺失后的风险
决策负责人 工作室负责人 研究结束无人批准
决策 全面采购、受限试点或暂不采用 结论只剩优缺点列表
决策日期 2026-08-15 无限继续搜索新资料
总体 12 名顾问、每月约 160 场会议 把大企业案例直接外推
使用场景 内部与客户访谈,纪要只作草稿 忽略权限和外部动作
替代方案 现有手工模板、录音后人工整理 把“不买某产品”误写成“不解决问题”
风险负责人 负责人处理合同与数据决定 顾问越权给法律结论

研究交付不是“推荐一个工具”,而是比较三个行动选项,并说明什么新证据会改变选择。

问题树的每个分支都要服务同一决定

凌可把总问题拆成五个一级问题和 14 个二级问题。问题树按决策缺口分,不按“功能、价格、案例”这类网页栏目分。

一级问题 二级问题示例 需要的证据
当前工作是否值得改变 每场整理多久;错误发生在哪一步 内部计时、样本审计
工具在本场景能做什么 行动项找回、错误新增、说话人区分 受控模拟、产品文档
数据与动作边界是什么 录音同意、保存、删除、训练、共享 合同、政策、官方设置
怎样进入现有流程 谁启动、谁复核、怎样回到任务系统 流程走查、连接能力
经济与退出条件是什么 订阅、复核、节省、撤回成本 报价、内部工时、试点指标
先画问题树,确保每个分支共同服务同一决定:当前工作是否值得改变、工具在本场景能做什么、数据与动作边界是什么、怎样进入现有流程
先画问题树,确保每个分支共同服务同一决定。凌可把总问题拆成五个一级问题和 14 个二级问题。 若答案只满足好奇心,例如“全球市场规模多大”,又不影响 12 人工作室决定,就从本轮删除。

每个二级问题都必须能改变范围、门槛或选项。若答案只满足好奇心,例如“全球市场规模多大”,又不影响 12 人工作室决定,就从本轮删除。

她再做 问题可追溯性,确保每个子问题至少对应一种可取得来源、一个预期输出和一个决策用途:

问题编号 可取得输入 输出 改变什么
Q-B01 40 场历史会议计时 整理时间分布 是否存在值得解决的成本
Q-C02 12 场冻结模拟 + 标准答案 找回与错误新增 是否值得进入真实试点
Q-D03 数据处理活动、合同、设置回执 数据生命周期图 哪类会议可纳入
Q-W02 任务系统权限与流程走查 人工批准点 是否允许连接写入
Q-E01 报价、会议量、人工时间 盈亏平衡 试点经济门槛

若问题没有来源,先登记 差距;若有来源却不会改变决定,就删掉问题。问题树不是报告目录,而是证据与行动之间的控制面。

把形容词改成可观察结果和反证

“准确”“省时间”“安全”都不能直接检索或验收。凌可把它们改成场景、单位、方向和反证:

模糊词 可回答定义 必须保留的反证
准确 标准行动项找回数、错误新增数、责任人与日期匹配 漏项和虚构项分开计
省时间 从会议结束到可审核草稿的人工分钟 设置、纠错和失败恢复也计入
安全 已确认的处理、保留、访问、删除和批准边界 “有认证”不能替代本次授权
好集成 草稿能进入现有任务表且保留来源 能连接不等于允许自动写入
值得 达到质量硬门后,净收益覆盖费用和维护 时间收益不能抵消数据越界

研究问题因此从“准不准”变成:“在中文为主、偶有英文术语的 45—60 分钟会议中,草稿模式能否达到行动项找回不低于 90%、错误新增不高于 3%,且人工复核中位数低于 8 分钟?”这些是试点门槛,不是对产品的既有结论。

先写研究协议,再让 AI 帮忙搜索

协议冻结问题、时间、来源范围、纳入排除和输出。搜索过程中可以修订,但每次修订要记录原因和影响,不能看到结果后悄悄降低门槛。

协议项 规则
时间范围 产品与政策资料优先 2024-01-01 至 2026-07-21;基础方法不限
语言 中文、英文;其他语言若关键则翻译并标译者
产品范围 能处理会议音频并输出带来源草稿的候选工具
纳入 能回答某个子问题,且来源、日期、版本可识别
排除 无作者转载、仅营销口号、无法定位原文、旧版被替代
截止 搜索 3 个工作日;关键分支达到饱和或明确缺口即停止
双重检查 权限、价格和效果关键主张由本人逐条复核
先写研究协议,再让 AI 帮忙搜索:时间范围、语言、产品范围、纳入
先写研究协议,再让 AI 帮忙搜索。协议冻结问题、时间、来源范围、纳入排除和输出。 搜索过程中可以修订,但每次修订要记录原因和影响,不能看到结果后悄悄降低门槛。

研究不是系统综述,不能冒用医学综述的完整性声明;但仍可借用预先定义标准、记录搜索和保留排除理由的原则,减少只挑支持结论的资料。

协议有 版本 和 修订日志。第 2 天发现客户会议同时包含中文、英文产品名时,她把语言场景从“中文会议”修为“中文为主、允许英文术语”,新增 A-02;这一变化要求回看已经筛掉的英文术语样本。相反,她没有因为行动项找回只有 84.4% 就把试点门槛从 90% 降到 80%。

修订 变化 原因 回溯动作
A-01 加入现有手工模板作替代项 决策不是只比较买与不买 重写 决策选项
A-02 扩展到中英术语混合 与真实会议场景一致 重筛 7 条语言相关资料
A-03 把自动发送列为明确排除 负责人未批准外部动作 更新流程与风险问题

协议允许依据新事实修订,但不允许依据想要的结论修订。每次变化都说明哪些旧搜索、筛选和证据需要重跑。

不同子问题要匹配不同来源,不能用一个“权威等级”包打天下

来源强弱取决于主张。厂商官方文档最适合说明当前设置和接口,不适合独立证明节省时间;内部计时最适合描述本工作室基线,不证明其他团队;法律文本能说明正式要求,博客摘要不能替代原文。

主张 首选来源 补充来源 不足以单独支持
当前功能与限制 当前官方文档、版本记录 实际界面验证 销售演示
数据处理与保留 合同、数据处理活动、隐私文档、设置回执 安全说明 认证 标志
本团队时间基线 内部观察与任务记录 成员访谈 行业平均
本场景质量 冻结样本受控测试 独立研究 厂商案例
法律要求 适用法源与专业意见 官方解释 搜索摘要、AI 结论
价格 有日期的正式报价和条款 公开价格页 旧评测文章

她为每个问题先指定 源计划,再开始搜索;这样不会因为某类资料容易找到,就让它占满证据表。

搜索词来自问题概念、同义词和排除项

问题树中的每个概念建立 术语映射。比如数据边界分支包括 会议录音、转录、留存、删除、模型训练、子处理者、同意,以及产品正式名和旧名。

搜索编号 目的 查询骨架 预期来源
S-01 当前能力 产品名 + 待办事项 + 发言人 + 文档 官方文档
S-02 数据生命周期 产品名 + 留存 / 删除 / 培训 隐私与 数据处理活动
S-03 更新变化 产品名 + 发布说明 + 日期 版本记录
S-04 独立质量 会议助手 + 行动项评估 研究与方法报告
S-05 本地约束 客户合同 + 录音 + 已批准工具 内部合同与政策
S-06 经济 报价 + 席位 + 术语 + 取消 正式报价

每次搜索保存日期、平台、完整查询、过滤、结果数和导出文件。AI 可以扩同义词、总结候选页,但不能在没有保存链接和原文时写入证据。

142 条候选怎样筛到 34 份纳入来源

三天搜索与内部调取共得到 142 条候选:官方产品与合同 52、独立研究或方法资料 44、内部记录 23、监管或法律资料 23。去除 26 个重复报告后剩 116;标题和摘要排除 48;阅读全文排除 34;最终纳入 34。

阶段 数量 主要动作
识别 142 保存查询和来源类型
去重后 116 同一文档不同 统一资源定位符 合并
全文候选 68 标题摘要按协议筛选
纳入 34 全文能回答至少一个子问题
全文排除 34 保存主排除原因

34 份纳入来源包括官方产品或合同 7、监管与正式规则 6、独立研究或方法资料 9、内部数据与记录 12,合计 34。排除项保留 EX-001 等 ID;“不支持我想要的结论”不是合法排除理由。

排除日志是研究证据的一部分,不是清理垃圾。

排除原因 数量 示例
已被当前版本替代 9 2024 保留政策旧页
只有营销主张,无方法或原始数据 8 “节省 30% 时间”案例
不符合 12 人工作室场景 6 强制企业管理员的部署
无法访问或定位原文 4 二手文章引用失效报告
重复报告同一底层研究 3 新闻稿与研究 PDF
非目标会议或语言场景 4 仅呼叫中心英文通话
合计 34 每份只记一个主要原因

若一份资料表面很相关但被排除,日志让审阅者知道它已经被考虑。搜索结束后再出现新资料,也能按同一协议判断,而不是因为“看起来重要”直接加入。

凌可先独立筛 68 份全文候选,再请一名项目成员盲审其中 20 份。两人对 17 份一致,3 份分歧:一份厂商案例缺方法、一份旧政策是否仍适用、一份大型企业案例能否作为背景。根据协议,前两份排除,第三份仅作为 上下文 纳入,不得支持效果主张。

分歧 争议点 协议裁决 形成的改进
SR-07 有节省比例但无样本与测量 方法不可核 排除,保留厂商主张日志
SR-19 页面可打开但已被新版替代 当前 优先 旧页关联 superseded_by
SR-31 500 人企业与 12 人场景不同 直接性 低 仅作流程背景

她据此回看同类候选,另发现 2 份旧页面漏标 已取代。复核的目的不是追求一个漂亮一致率,而是发现协议是否可操作。最终纳入决定仍由凌可负责,分歧与裁决保存在 审计日志。

证据表一行只支持一个有限主张

一份文档可能产生多行 证据;同一研究的三个网页仍属于同一底层来源。凌可不把整页摘要贴成一行,而是保存原文事实和自己的解释:

字段 作用
证据编号 稳定引用
问题编号 回答问题树哪一项
可支持主张 这行最多支持什么
来源编号 / 来源位置 文件、页码、段落或表格
原文事实 受限长度的原文事实或数据
解释 凌可怎样理解,不能混进原文
总体 / 上下文 对谁、什么场景成立
日期 / 版本 何时有效
方向 支持、矛盾、混合、上下文
质量标记 偏差、样本、缺失和利益相关
复核状态 提取、已检查、已接受、已拒绝
证据表用证据编号、问题编号、可支持主张和来源定位限制每行证据强度
一份文档可以产生多行证据,但一行只支持一个有限主张。原文事实与研究者解释分开保存,才能检查结论有没有在转述时被悄悄增强。

57 条证据按结论方向分为支持 19、矛盾 14、上下文 8、不足 16,合计 57。“不足”不是删除,而是明确这条资料无法支持拟写强度。

证据还有生命周期。提取只表示字段已抄录;已检查表示原文、定位、数字和版本已核;已接受才允许进入主张账本;已拒绝保留原因;过时表示来源更新后需重审。AI 抽取的 57 行中,首轮有 6 行页码错、4 行把解释写进原文事实、3 行遗漏适用账户,共 13 行退回。

证据门 检查 失败例
身份 来源编号、版本、日期唯一 同一 PDF 的两个网址被当成两项证据
来源位置 页码或段落能直接打开 只写“隐私政策”
保真度 原文事实未被改写增强 “可配置”变成“默认关闭”
完整性 数字带分母、单位、时间窗 只抄 84.4%
适用性 人群、套餐、语言和场景明确 企业功能外推个人账户
独立性 同一底层研究正确关联 新闻稿与报告重复计票

修订后由本人再次核对 13 行,并对其余 44 行抽 9 行;9/9 通过。抽样不证明全部无错,但给出了明确的检查范围和剩余风险。

来源强弱要看它是否适合当前主张

她用五个维度评估每条证据:直接性 是否直接回答本问题;方法 是否说明数据怎样产生;货币 是否仍适用;独立性 是否有明显利益相关;可追溯性 是否能回到原位置。

证据 直接性 方法 货币 独立性 用法
当前 数据处理活动 的删除条款 厂商文件 支持合同字段,不证明实际操作无误
厂商客户案例 生成假设,不做效果估计
12 场冻结模拟测试 由采购方执行 支持本样本,不外推真实客户会议
40 场历史基线 内部数据 支持当前流程问题
独立但 2022 年研究 支持方法背景,谨慎用于当前产品

她不计算一个“权威总分”后机械排序。隐私条款和质量测试回答不同问题;一个方法严谨但场景不直接的来源,可以补充机制,却不能覆盖直接场景证据。

主张强度按最弱必要环节校准。一项建议若同时依赖产品设置、合同许可和本地效果,其中任何一环是 差距,就不能用其他两环的强证据补齐。凌可使用四级措辞:已记录 表示来源明确写出;观测 表示本样本观察到;推断 表示由多条证据推导且说明假设;状态未知 表示目前不能回答。

证据状态 允许写法 禁止升级
单一官方设置页 “文档说明可配置” “已经安全配置”
12 场模拟观察 “本样本观察到 81/96” “真实客户会议准确率 84.4%”
多来源一致且场景相近 “证据支持进入试点” “一定能全面采用”
来源冲突可由版本解释 “当前版本为 X,旧版为 Y” 删除旧证据假装无冲突
关键许可未确认 “未知,默认排除” “风险较低”

数字必须同时记录分子、分母、单位和时间窗

“准确率 84%”没有说明评估对象。模拟测试预先定义 96 个行动项,系统找回 81 个,找回率 81÷96=84.4%;另外生成 9 个标准答案中不存在的行动项。两项必须并列,不能只报 84.4%。

指标 分子 分母 结果 限制
行动项找回 81 96 个标准行动项 84.4% 12 场模拟会议
错误新增 9 90 个输出行动项 10.0% 不是“错误率 10%”的通用定义
责任人正确 73 81 个找回项 90.1% 仅在已经找回的行动项中评价
日期正确 46 52 个带日期标准项 88.5% 相对日期由人工规范
抽取时同时记录数字的分子、分母、单位和时间窗:行动项找回、错误新增、责任人正确、日期正确
抽取时同时记录数字的分子、分母、单位和时间窗。“准确率 84%”没有说明评估对象。 两项必须并列,不能只报 84.4%。

模拟脚本不含真实客户噪声、多人抢话和敏感数据,结果只能说明值得继续验证。若把 81/96 写成“会议助手准确率”,就把单一字段和有限样本夸成总体能力。

矛盾证据先解释差异来源

有资料说可配置不用于模型改进,另一份旧帮助页又写默认用于改进。凌可检查版本和账户类型,发现两页适用套餐与日期不同;证据表保留两行,当前合同解释优先,但旧账户迁移仍列待确认。

冲突类型 例子 处理
时间变化 2024 与 2026 保留设置不同 以 as_of 和版本分开
人群不同 企业账户与个人账户 不合并成一个结论
指标不同 行动项找回 对比 词错误率 各自报告,不比较高低
方法不同 模拟脚本 对比 真实会议回顾 解释偏差,不做简单平均
利益相关 厂商案例 对比 独立测试 保留来源角色
真正未知 合同未覆盖某客户材料 建缺口,不让 AI 裁决

证据数量多不代表胜出。五篇转载同一厂商研究仍是一项底层证据;一条直接合同限制可以否决多个模糊正面案例。

从证据行到主张,要经过主张账本

主张编号 拟写主张 支持 反证或限制 允许措辞
C-01 当前整理存在可测成本 EV-01…08 样本仅 40 场 “本样本中位数 14.5 分钟”
C-02 工具可找到多数行动项 EV-21…26 EV-27…31 漏项与新增 “模拟样本找回 84.4%”
C-03 已满足客户会议数据要求 合同部分字段 6 个合同未确认 不得下结论
C-04 全面采购能节省成本 经济模型 真实节省尚未测 只能写试点门槛
C-05 受限试点可降低未知 能力与流程证据 需排除无同意会议 可建议试点
从证据行到主张,要经过主张账本:C-01、C-02、C-03、C-04
从证据行到主张,要经过主张账本。主张账本迫使作者把“不足”留在结论旁边。本图只解释这一节的判断关系;放行仍以正文中的证据、权限与验收条件为准。

主张账本迫使作者把“不足”留在结论旁边。报告正文引用主张编号,再由主张回到证据,而不是把几十个链接堆在段尾。

完整走一条主张:经济上“可能值得”怎样写才不虚假

正式报价假设为每人每月 24 美元,12 人共 288 美元。内部每月约 160 场会议,人工时间按每小时 45 美元估算。仅覆盖订阅费所需节省为 288÷160÷45×60=2.4 分钟/场。

若试点达到从 14.5 分钟降到 8 分钟,每月毛节省为 160×6.5=1,040 分钟,即约 17.3 小时;按分钟精确换算的假设时值为 1,040÷60×45=780 美元,减订阅 288 美元为 492 美元。但这个结果依赖会议量、时值、实际采用率和复核时间,不能写成“每月一定节省 492 美元”。

敏感性情形 会议/月 每场节省 毛小时 扣订阅后的时值
低使用 80 4 分钟 5.3 -48 美元
基准试点目标 160 6.5 分钟 17.3 492 美元
高使用但复核慢 200 3 分钟 10.0 162 美元
完整走一条主张:经济上“可能值得”怎样写才不虚假:低使用、基准试点目标、高使用但复核慢
完整走一条主张:经济上“可能值得”怎样写才不虚假。正式报价假设为每人每月 24 美元,12 人共 288 美元。 内部每月约 160 场会议,人工时间按每小时 45 美元估算。

建议因此不是“投资回报率为 170%”,而是试点必须同时记录实际会议数、准备、复核、失败恢复和订阅;低使用情形可能不回本。

缺口表决定在哪里停止,而不是继续漫无目的搜索

缺口编号 缺什么 为什么重要 获取方式 截止前处理
G-01 6 份客户合同的录音与处理许可 决定能否用于客户会议 负责人逐合同确认 默认排除
G-02 真实多人抢话质量 模拟会议覆盖不足 经同意的试点样本 不作全面结论
G-03 删除请求的端到端回执 文档说明不等于实操 沙箱删除演练 试点前完成
G-04 任务系统写入的最小权限 连接器可能扩大风险 只读与草稿权限试验 禁止自动写入
G-05 退出后的数据导出与清理 影响可逆性 合同和实际演练 写入退出门槛
G-06 真实复核时间 决定经济结果 6 周计时 作为继续条件
缺口表决定在哪里停止,而不是继续漫无目的搜索:G-01、G-02、G-03、G-04
缺口表决定在哪里停止,而不是继续漫无目的搜索。第三个工作日结束时,新增搜索已经连续 12 条没有改变主张账本;本图只解释这一节的判断关系;放行仍以正文中的证据、权限与验收条件为准。

第三个工作日结束时,新增搜索已经连续 12 条没有改变主张账本;剩余问题需要合同确认和试点数据,不是更多网页。她据此停止资料搜索,把缺口带入行动设计。

“没有改变”有明确口径:没有新增问题分支、没有改变主张方向、没有增加新的直接来源类型,也没有解除关键 差距。最后 24 条候选分两组复核:前 12 条只重复已有产品功能与案例,后 12 条仍未补上合同许可或真实复核时间。

停止检查 观察 决定
查询覆盖率 14 个二级问题都有搜索记录 不再补同义查询
源多样性 官方、规则、独立、内部四类均覆盖 不因数量对称继续搜
声明变更 连续 12 条未改变 9 个 主张 网页搜索达到本轮饱和
关键缺口 G-01、G-06 只能由合同和试点解决 转行动,不伪装成搜索不足
更新风险 产品和条款可能变化 记录 as_of,决策前复查

停止不是宣称“找到了所有资料”,而是说明在当前时间与资源下,继续同类搜索的边际信息已经很低;重要未知已被转成有负责人和取得方式的缺口。

最终建议比较三个选项,不把研究写成单一推荐

选项 证据支持 主要风险 决定
12 人立即全面采购 基础能力与流程潜力 质量、合同、退出仍有缺口 不批准
4 人、6 周、草稿模式试点 可测基线、模拟样本、可设置硬门 仍需同意与删除演练 批准
暂不采用,优化手工模板 无数据处理新增风险 继续承担整理时间和遗漏 作为回退

受限试点不是折中态度,而是与证据强度匹配的行动。它只开放内部会议和明确同意的客户会议;输出必须人工复核;不自动发送、不自动写任务系统;任何跨权限、删除失败或错误行动项超过门槛都暂停。

试点把未解决问题变成可测验收和退出条件

指标 基线或门槛 采集
行动项找回 不低于 90% 冻结标准答案双人复核
错误新增 不高于 3% 输出项 单独计虚构责任人或日期
人工复核 中位数低于 8 分钟 从草稿到批准的计时
数据边界 0 次无同意录音、0 次越权访问 会议清单与访问日志
删除演练 指定数据在约定层全部不可检索 原件、派生、索引、缓存
使用率 四人中至少三人每周使用 实际运行记录,不看注册
试点把未解决问题变成可测验收和退出条件:行动项找回、错误新增、人工复核、数据边界
试点把未解决问题变成可测验收和退出条件。第 2 周做中期检查,只处理安全与流程故障,不因短期分数低就临时改标准答案; 本图只解释这一节的判断关系;放行仍以正文中的证据、权限与验收条件为准。

第 2 周做中期检查,只处理安全与流程故障,不因短期分数低就临时改标准答案;第 6 周全量复核。若质量未过但数据边界完好,可选择改流程后新建试点,而不是宣布产品永久不可用。

发布前逐项反向检查:结论能否回到问题和证据

凌可随机抽 12 条正文主张,逐条反查 claim_id、evidence_id、来源位置和适用边界;12/12 可打开。再从 57 条证据随机抽 10 条,检查是否被正文夸大;发现 1 条官方功能说明被写成实际效果,改回“文档声明可配置”。

发布检查 通过条件
问题覆盖率 每个结论回答已登记子问题
声明支持 关键主张至少一条直接证据,反证同列
来源追踪 统一资源定位符 / 文件、页码、日期可打开
数量审计 分子、分母、单位、时间窗可复算
排除项 表面相关的排除项有理由
不确定性 未知不被改写成概率或保证
行动匹配 建议强度不超过证据强度
新鲜度 当前产品与条款核对 as_of 日期
发布前逐项反向检查:结论能否回到问题和证据:问题覆盖率、声明支持、来源追踪、数量审计
发布前逐项反向检查:结论能否回到问题和证据。凌可随机抽 12 条正文主张,逐条反查 claim_id、evidence_id、来源位置和适用边界; 若别人只能阅读最终 PDF,不能重建来源和排除路径,研究就难以更新。

AI 可以协助生成查询、抽取候选字段、发现矛盾和检查缺项;最终纳入、证据解释、主张强度和决策建议由凌可负责。自动化提高吞吐,不转移研究责任。

她还做一次从零复现测试:给另一工作窗口 决策简报、方案、搜索日志、当时的结果导出和 源登记,但不给报告结论。该窗口能按 6 组查询记录与去重规则重建同一份 116 条记录快照,并按 筛选日志 重建 34 份纳入列表;网页后来更新的 2 项通过 archived_at 和内容摘要定位到研究时版本。

复现对象 一致结果 允许差异
查询 平台、查询、过滤、日期齐全 搜索平台实时排序变化
来源集合 source_id 与内容摘要一致 新增网页另开 更新运行
筛选 纳入 34、排除 34 全有理由 新证据按 修订 处理
证据 57 行可回源,13 行修订历史保留 解释 可提出复核意见
声明 9 个关键主张均有支持与限制 建议可因风险偏好不同而变化
决策 三个选项与条件完整 决策 负责人 可选择不同选项

可复现不要求不同研究者必然给出相同建议,而是能看见同一输入、规则、证据和判断分叉。若别人只能阅读最终 PDF,不能重建来源和排除路径,研究就难以更新。

发布包同时冻结 as_of=2026-07-21。价格、功能、条款或合同变化时,不直接覆盖旧证据;先创建 更新运行,识别受影响 问题 与 主张,只重跑相关搜索后再做全局一致性检查。历史决定仍引用原版本,避免用今天页面解释当时选择。

可以直接复制的研究目录和最小交付包

可复制模板
research/
  decision-brief.md
  protocol.md
  question-tree.csv
  term-map.csv
  search-log.csv
  source-register.csv
  screening-log.csv
  evidence-table.csv
  claim-ledger.csv
  gap-register.csv
  decision-options.md
  audit-log.md

最小版至少保留决策简报、问题树、搜索日志、证据表、主张账本和差异登记簿。研究完成的标志不是“看了很多”,而是能够说明:这个决定需要回答什么、找过哪里、纳入和排除了什么、每条结论由什么支持、哪些仍不知道,以及为什么当前行动没有超过证据。

来源与进一步阅读

以下资料核验于 2026-07-21,用于支持先定义研究问题、按问题选择方法、预设检索与纳入标准、记录筛选和保留排除理由:

  • HM Treasury:The Magenta Book:2026 版强调评估应围绕使用者需要、具体问题和适合的方法,并在早期规划。
  • HM Treasury:Magenta Book Annex A:说明证据综合方法应服务清楚定义的研究问题,方法随问题类型选择。
  • Cochrane Handbook Chapter 4:说明预先规划检索、按资格标准识别资料、记录选择过程,并为表面相关的排除项保留原因。本文借用过程原则,不声称这是一项 Cochrane 系统综述。