先看结果:A 得分最高,但最后交付物不是一张 70.1 分的排行榜
独立顾问林澈受一家 15 人研究工作室委托,比较三套 AI 研究助手 A、B、C。第一次让 AI “联网调研并综合打分”,它在没有本地测试的情况下给出 A 8.7、B 9.1、C 8.3,还把“安全、准确、易用、性价比”平均相加。三位负责人各自调整提示词,得到三个不同冠军。
林澈重做评估:先冻结目标和硬门槛,再用 150 个任务、30 次权限测试、30 次导出测试、15 人成本基线和 3 次退出演练建立证据。结果不是“B 综合最好”,而是:
| 方案 | 硬门槛 | 基础加权值 | 决策状态 | 结论 |
|---|---|---|---|---|
| A | 5/5 通过 | 70.1 | 可进入受控试点 | 质量与治理优先时首选 |
| B | 4/5 通过 | 不参与排名 | 暂停 | 客户数据保留边界没有合同证据 |
| C | 5/5 通过 | 53.2 | 可进入受控试点 | 成本权重高或预算收紧时首选 |
基础偏好下 A 比 C 高 16.9 分;当年度总成本的权重从 15% 提高到约 29.8%,其余权重按比例收缩,C 反超 A。最终建议是“先用 A 做 6 周、6 人、60 个任务的可逆试点,同时保留 C 为预算情景备选”,而不是把 70.1 当成产品固有属性。本文人物、产品代号和业务数字均为教学案例,外部资料只用于支持评估方法,不代表任何真实产品表现。
“综合评分”常常把五种不同判断藏进一个小数
一张看似精确的排行榜,至少混合了事实、换算、偏好、约束和不确定性。AI 若不展示这五层,就可能在空白处自动补出合理外观。
| 层 | 要回答什么 | 本案例子 | 能否由 AI 自行决定 |
|---|---|---|---|
| 原始事实 | 实际观察到什么 | 50 个任务中 44 个主张获支持 | 只能抽取,须留证据 |
| 价值换算 | 原始单位怎样映射到共同尺度 | 88% 映射为质量价值 80 | 规则须事先批准 |
| 偏好权重 | 改善哪个结果更重要 | 质量 35%、成本 15% | 决策者表达取舍 |
| 硬约束 | 什么失败不能被别项补偿 | 客户数据条款必须可验证 | 负责人批准 |
| 不确定性 | 哪些数会变化 | 采用率、复核时间、维护工时 | AI 可计算,不能抹平 |
“安全 9 分、易用 8 分”的问题不只是主观。它没有定义 0 和 10,没有说明证据日期,也没有说明从 8 到 9 是否与从 4 到 5 等价。把四个这样的数平均,精确到 8.65,并不会增加信息。
林澈规定,每个数字都要能反向追到观察编号、测量规则、证据文件、负责人和日期;无法反向追踪的数字不进入计算。总分只是一种压缩视图,不能替代这些底层记录。
先写一页决策契约,防止看完产品再修改问题
评估开始前,工作室先冻结一页决策简报。这样不能因为喜欢某个界面,就把“研究结论可核验”换成“生成速度快”;也不能因某方案便宜,临时忽略退出成本。
| 字段 | 冻结内容 |
|---|---|
| 决策编号 | RA-2026-07 |
| 决策问题 | 未来 6 个月是否为研究团队试点一套 AI 研究助手 |
| 使用人群 | 12 名研究员、2 名项目经理、1 名管理员 |
| 目标 | 缩短证据整理时间,同时不降低引用支持率与客户数据控制 |
| 不在范围 | 自动向客户发送、医疗或法律建议、无人复核发布 |
| 备选项 | 保持现状、A、B、C、先试点后再决定 |
| 决策期限 | 2026-07-31 |
| 预算边界 | 首年现金支出不超过 10,000 美元 |
| 决策人 | 工作室负责人;数据负责人有硬门槛否决权 |
必须保留“保持现状”和“延后并收集证据”。如果候选集只有厂商 A、B、C,评分机制会被迫选一个,即使三者都不值得买。试点也应是独立选项,因为它用较小成本购买信息,并限制不可逆承诺。
决策契约还要记录变更控制:截止日前若目标、门槛或权重改变,必须保存旧版、修改人和理由,然后重算全部方案,不能只修改输家的一列。
硬门槛先于加权:不能让低价格抵消不可接受的数据边界
有些条件是不可补偿的。若客户合同禁止相关数据处理,价格便宜或界面顺手都不能把它“平均回来”。林澈把门槛写成可验证的“通过、失败、未知”,而不是 1—10 分。
| 门槛编号 | 门槛 | 通过证据 | 失败或状态未知时的动作 |
|---|---|---|---|
| G1 | 合同明确目标数据类型、处理角色与期限 | 已签条款、数据流图和保留条件一致 | 不得导入客户数据 |
| G2 | 管理员能限制外部发送 | 权限测试 10/10 阻断 | 暂停试点 |
| G3 | 可导出原文、来源和审计记录 | 退出演练重建率 100% | 限制为临时沙盒 |
| G4 | 删除覆盖原件、索引和派生内容 | 四层删除回执 | 保持“状态未知”并补测 |
| G5 | 首年现金支出不超过 10,000 美元 | 成本底稿与报价快照 | 重新议价或排除 |
A 和 C 的 5 项均通过。B 的功能页声称支持保留设置,但合同附件没有明确客户数据的处理期限,数据负责人把 G1 记为“状态未知”。未知不是 0 分,也不是“暂且视为通过”;它表示缺少允许行动的证据。因此 B 即使计算值可能很高,也不能出现在合格方案冠军榜中。
G3 只检查原文、来源和审计记录这 3 类关键资产能否完整退出;后面的 R 则测试模板、标签、权限映射等 10 类扩展资产。因此 C 可以通过 G3,同时因扩展资产只重建 9/10 而在 R 上得到 90,门槛与加权项没有用同一事实重复裁决。
门槛要少而硬。把“最好看”“响应最快”写成门槛会人为清空候选集;真正门槛应能解释失败造成的不可接受后果、验证方式和负责签字的人。
候选集要覆盖真正不同的行动,而不只是三个相似订阅
工作室先构造长名单,再进入短名单。候选方案必须在采购、流程或承诺上有实质差别,否则是在比较包装而非行动。
| 选项 | 行动描述 | 首期承诺 | 可逆性 | 进入短名单 |
|---|---|---|---|---|
| O0 保持现状 | 继续人工检索与证据表 | 0 美元 | 高 | 作为基线保留 |
| O1 A | 6 人受控试点,禁止自动外发 | 2,100 美元上限 | 高 | 是 |
| O2 B | 先补合同,再决定是否试点 | 法务核验 600 美元 | 高 | 门槛待定 |
| O3 C | 6 人受控试点,额外人工质检 | 1,500 美元上限 | 高 | 是 |
| O4 自建 | 自托管检索、引用与日志 | 预计 320 工时 | 中 | 当前资源不足,退出 |
| O5 延后 8 周 | 收集 80 个现状任务基线 | 约 64 工时 | 高 | 证据不足时启用 |
这里的“退出”不等于方案永远差,而是它在当前目标、资源和期限下不进入详细比较。每个退出项都保留原因代码,条件改变后可以重新打开。
英国《绿皮书》的做法对小企业同样有启发:先检查方案是否达到目标和关键成功因素;未达目标的方案不应靠后续汇总指标翻盘。这里借用的是结构化思路,不是在声称一次小型软件采购等同于公共项目评估。
建标准树:一项结果只出现一次,避免“双重计票”
初稿把“准确性、引用正确、研究质量、可靠性”列为四项,它们大部分来自同一批测试,等于让质量结果获得四份权重。林澈把标准整理成五个互不完全重叠的叶节点:
| 标准代号 | 标准 | 直接测量 | 不包括什么 | 基础权重 |
|---|---|---|---|---|
| Q | 证据支持质量 | 50 个原子主张的支持比例 | 生成文风、速度 | 35% |
| W | 工作流时间 | 从任务开始到可交付证据表的中位分钟 | 学习期、异常失败另记 | 20% |
| G | 治理控制 | 10 项权限与日志测试通过数 | 合同硬门槛 | 20% |
| R | 可逆退出 | 10 类资产可重建数 | 迁移后的长期性能 | 10% |
| C | 首年总成本 | 许可、设置、维护和退出演练 | 未证实的收入增长 | 15% |
标准树检查三件事:完整性——重要结果没有漏掉;非重复——同一结果没有换名计两次;偏好独立性——某项权重的含义不会随另一项水平任意改变。
“品牌、功能数量、市场热度”没有进入叶节点,因为它们不是本次决策的最终结果。若品牌影响持续服务风险,应改测财务连续性或出口能力;若功能影响时间,应由任务时间反映。代理变量不能和它所代理的结果同时加分。
标准之间还要做因果路径检查。假设“引用导出功能”会减少人工整理时间,它可以作为 W 的机制证据,却不能既给功能完整度加分、又在 W 中计算已经实现的时间收益。相反,治理日志与引用支持率虽然可能相关,却回答控制过程和输出结果两个不同问题,可以分列,但要分别取证。
林澈让团队对每个标准做一次“移除测试”:删掉这一列,会漏掉哪一种最终后果?如果答案只是“产品看起来不先进”,就不该进入;如果两个标准的答案完全相同,就应合并。最后再做覆盖表,确保目标中的质量、时间、控制、退出与成本各自只落到一个主叶节点。
每个单元格都要有证据账本,空白不能由模型常识填满
对 3 个产品乘 5 个标准,共 15 个评价单元格。每格至少保存指标定义、抽样、观察、来源、数据截止日期、复核人和不确定性。下面是基础证据汇总:
| 方案 | Q 支持主张 | W 中位分钟 | G 测试 | R 可重建 | C 首年总成本 |
|---|---|---|---|---|---|
| A | 44/50=88% | 7.5 | 9/10 | 10/10 | 8,640 美元 |
| B | 45/50=90% | 5.8 | 6/10 | 7/10 | 6,480 美元 |
| C | 41/50=82% | 9.2 | 8/10 | 9/10 | 5,040 美元 |
150 个任务使用同一套冻结题目,其中事实核验 60 个、文档比较 45 个、证据表生成 30 个、冲突来源处理 15 个。顺序采用轮换,避免 A 总在研究员最熟练时测试。失败任务保留在分母中,不允许只计算成功输出。
| 证据编号 | 单元格 | 原始文件 | 复核状态 |
|---|---|---|---|
| EV-Q-A-01 | A / Q | claims-a.csv + 源包-v3 | 双人复核 10 条 |
| EV-W-A-01 | A / W | 任务计时器.ndjson | 含人工返工时间 |
| EV-G-B-04 | B / G | 权限测试-04.webm | 测试 4 未阻断 |
| EV-R-C-01 | C / R | 导出-c.zip + 重建.日志 | 9/10 可重建 |
| EV-C-ALL-01 | A/B/C / C | cost-model-v2.xlsx | 财务复算 |
网页功能表可以帮助设计测试,却不能替代本账户的测试结果。AI 可以抽取候选字段,但没有证据编号的值一律标为“缺失”。
证据账本还要保存数据来路。例如 A/Q 的 88% 不是手工输入,而是 claims-a.csv 中 44 行“已支持”除以冻结任务表的 50 行;任意删除一条任务,摘要校验值会变化并触发重审。截图只用于证明当时界面状态,结构化日志保存设置、输入、输出与时间;两者缺一时,复现等级不能标为“高”。
每份证据设有效期。报价 30 天后过期,产品设置在版本变化时立即过期,任务质量基线在题库或模型改变后重测。过期不会把历史决定变错,却意味着不能把旧值直接用于新采购。
测量协议要在测试前冻结,否则“分数”会追着结果改变
Q 的分母是 50 个预先拆分的原子主张。每条只有“已支持、部分支持、不受支持”三种结果;基础比例只把“已支持”计入分子。若测试后才把“部分支持”算半分,必须作为新模型版本,而不是悄悄改善某产品。
| 测量项 | 冻结规则 | 防止的偏差 |
|---|---|---|
| 题库 | 三方案使用相同 50 个任务与来源包 | 难度不同 |
| 运行顺序 | 研究员与方案按拉丁式轮换 | 学习和疲劳 |
| 时间起止 | 打开任务到证据表通过人工验收 | 只报生成速度 |
| 失败处理 | 超时、拒答、错误均留在样本 | 幸存者偏差 |
| 复核 | 随机 20% 由第二人盲审 | 单人标准漂移 |
| 版本 | 保存模型、套餐、设置和测试日期 | 产品更新混入 |
中位时间适合本案,因为少数权限故障会产生很长尾部;但不能只报中位数。A 的中位数 7.5 分钟、90 分位 14.8 分钟,C 分别为 9.2 和 18.6 分钟。若工作室最怕延误,尾部时间应成为独立限制或情景变量,而不是被中位数遮住。
测试日志还记录人工提示次数、返工原因和是否调用外部检索。否则 A 可能因额外 3 次人工修正取得高质量,表面却被写成“自动完成”。
成本必须来自同一工作分解,不能只比较月费
月费排名是 C、B、A;首年总成本仍是 C、B、A,但差额和风险已改变。林澈用同一套成本分解结构计算:
| 成本项 | A | B | C |
|---|---|---|---|
| 许可:15 人 × 单价 × 12 月 | 6,480 | 5,040 | 3,600 |
| 设置:工时 × 60 美元 | 18×60=1,080 | 12×60=720 | 8×60=480 |
| 维护:年度工时 × 60 美元 | 18×60=1,080 | 12×60=720 | 16×60=960 |
| 首年合计 | 8,640 | 6,480 | 5,040 |
维护工时包括权限变更、模板更新、错误复核和月度抽查,不包括已经计入 W 的日常任务时间。这样避免把同一工时同时计入成本与时间两次。
成本表另列报价截止日期、币种、税费、最低席位、合同期限、涨价假设和退出工时。美国政府问责局的成本指南强调基线、工作分解、假设、数据、敏感性和风险分析;本案把这些原则缩小应用于订阅决策,不照搬大型项目的复杂度。
如果某成本未知,不填 0。B 的法务补充协议费用估计为 400—900 美元,应进入区间和情景,不应因还没收到发票就消失。
价值函数把不同单位换到 0—100,但锚点必须有业务含义
只有在保留原始数据后,才建立价值函数。0 不是“产品一无是处”,100 也不是“完美”;它们分别表示本次决策中可接受区间的低、高锚点。
| 标准 | 0 分锚点 | 100 分锚点 | 换算 | 是否封顶 |
|---|---|---|---|---|
| Q | 80% 支持 | 90% 支持 | (x-80)÷10×100 | 是 |
| W | 12 分钟 | 5 分钟 | (12-x)÷7×100 | 是 |
| G | 0/10 | 10/10 | 通过数÷10×100 | 是 |
| R | 0/10 | 10/10 | 可重建数÷10×100 | 是 |
| C | 9,000 美元 | 4,500 美元 | (9,000-x)÷4,500×100 | 是 |
因此 A:Q=(88-80)÷10×100=80;W=(12-7.5)÷7×100=64.3;G=90;R=100;C=(9,000-8,640)÷4,500×100=8。C:Q=20;W=40;G=80;R=90;C=88。
Q 低于 80% 记 0,而不是负分;高于 90% 封顶 100,避免一个超出当前需要的改进吞掉所有权重。锚点来自工作室最低验收线和历史最佳人工流程,不是为了让 A 赢而反推。
线性函数只是明确假设。若从 80% 到 85% 的价值远高于 85% 到 90%,应在测试前改用分段函数,并记录理由。不能因为线性算起来方便,就假设每一点改善价值恒定。
权重来自“摆动”的价值,不来自让 AI 猜负责人偏好
“质量 35%”不是质量重要性的口号。它表示:从 Q 的 0 锚点改善到 100 锚点,相对于其他标准各自的完整摆动,贡献 35% 的偏好价值。
林澈让负责人先想象所有标准都在 0 锚点,选择最想完整改善哪一项;再给第二项相对于第一项的价值点数。三人先独立作答,再讨论差异,最终归一化为 100:
| 完整摆动 | 负责人原始点 | 数据负责人原始点 | 项目经理原始点 | 协商权重 |
|---|---|---|---|---|
| Q:80%→90% | 100 | 100 | 90 | 35% |
| W:12→5 分钟 | 70 | 50 | 100 | 20% |
| G:0→10 项控制 | 80 | 100 | 60 | 20% |
| R:0→10 类重建 | 40 | 70 | 40 | 10% |
| C:9,000→4,500 美元 | 60 | 40 | 70 | 15% |
协商权重不是三列简单平均,而是一次有记录的决策会议结果。会议纪要保存不同意见:数据负责人认为 G 不应完全可补偿;团队于是把合同条件留在硬门槛,同时只让可分级的治理测试参与加权。
若决策者无法解释“为什么 Q 的完整摆动约是 C 的 2.33 倍”,权重仍未成熟。AI 可以归一化、检查总和与展示影响,但不能把网上常见的 30/20/20/15/15 冒充本组织偏好。
基础计算必须逐项可复算,且只给通过门槛的方案排序
加权值公式为各标准价值乘权重后求和。A 和 C 的基础计算如下:
| 方案 | Q 35% | W 20% | G 20% | R 10% | C 15% | 合计 |
|---|---|---|---|---|---|---|
| A | 80×.35=28.00 | 64.3×.20=12.86 | 90×.20=18.00 | 100×.10=10.00 | 8×.15=1.20 | 70.06≈70.1 |
| C | 20×.35=7.00 | 40×.20=8.00 | 80×.20=16.00 | 90×.10=9.00 | 88×.15=13.20 | 53.20 |
| A-C | 21.00 | 4.86 | 2.00 | 1.00 | -12.00 | 16.86 |
A 的优势主要来自 Q,不是所有维度都更好;C 用成本追回 12 分。这个分解比“70.1 对 53.2”更重要,因为它揭示推荐依赖什么。
B 若忽略门槛,其 Q=100、W=88.6、G=60、R=70、C=56,加权值为 35+17.72+12+7+8.4=80.12。正因它会成为表面冠军,必须在计算前执行 G1,而不是把“合同不明”偷偷扣 3 分。表格可以显示 B 的诊断值帮助找补证方向,但必须标红“不可排名”,不能与合格方案同列冠军。
保留至少两位内部小数,最后展示一位;不得对每项先四舍五入再相加。若两方案只差 0.3 分,应直接报告“在误差内无稳定排序”,不要用第三位小数制造胜负。
缺失证据有四种处理,绝不能默认填 0、50 或行业平均
“缺失”可能表示尚未测试、无法访问、不适用或证据冲突,四种情况的动作不同:
| 状态 | 例子 | 计算动作 | 决策动作 |
|---|---|---|---|
| 尚未收集 | C 的新版本尚未做权限测试 | 不给单点值 | 补测或做区间 |
| 不可访问 | B 合同附件未提供 | 不进入硬门槛排名 | 向供应方索取 |
| 不适用 | 本地部署没有席位月费 | 改用同一总拥有成本口径 | 不能填 0 成本 |
| 冲突 | 文档称可导出,演练缺 1 类资产 | 使用实测并标冲突 | 复核版本与设置 |
有三种可接受策略:排除该方案并说明原因;用明确的上下界做区间;支付成本收集证据。均值插补只适合特定统计任务,不适合用来替供应方获得采购资格。
林澈为每个缺口记录“信息价值”:如果补证后可能改变推荐,就优先补;如果即使取最有利值也无法改变行动,先停止调查。B 的合同证据价值高,因为一旦 G1 通过,它的诊断值可能超过 A;C 的品牌知名度缺口价值为 0,因为品牌不在标准树中。
先做证据不确定性,再做偏好不确定性,两者不能混成一个误差条
Q 的 44/50 只是样本观察,未来任务组合可能不同;W 也会随熟练度改变。林澈为关键值给出审慎区间,不假装单点永久稳定:
| 输入 | A 基础值 | A 审慎区间 | C 基础值 | C 审慎区间 | 区间依据 |
|---|---|---|---|---|---|
| Q 价值 | 80 | 65—90 | 20 | 10—35 | 任务重抽与复核分歧 |
| W 价值 | 64.3 | 50—75 | 40 | 25—55 | 研究员与任务类型 |
| G 价值 | 90 | 80—90 | 80 | 70—80 | 当前版本与设置 |
| R 价值 | 100 | 90—100 | 90 | 80—90 | 第二次退出演练 |
| C 价值 | 8 | 0—16 | 88 | 78—94 | 维护工时与涨价 |
把所有最坏值同时发生、所有最好值同时发生,能给极保守边界,但可能制造不现实组合。更实用的是列出哪些变量相关:采用率低会减少许可利用,同时可能增加每任务人工时间;版本升级可能同时改善 Q 和破坏 G。
证据区间回答“表现可能是多少”,权重区间回答“我们重视什么”。前者需要更多测试,后者需要决策者澄清价值取舍。AI 不能因为二者都表现为范围,就把它们混成一个置信度分数。
区间来源也要分级:重复测试得到的波动、第二审阅者的分类分歧、报价条款形成的上下界,证据强度不同。没有数据时使用专家区间,应同时保存最低值、最高值、给出区间的人和理由,不能让模型输出“通常浮动 10%”后当作经验事实。若区间内包含门槛失败,动作是补证或缩小试点,不是取中点继续采购。
敏感性分析不是把权重随便改一圈,而是寻找推荐的转换值
基础模型中,除成本外四项权重合计 85%。令成本权重为 c,其余权重保持原有比例并缩放到 1-c。A 相对 C 的非成本优势按 85% 权重计为 28.86 分,因此归一到全部非成本权重时是 28.86÷0.85=33.95;C 的成本价值比 A 高 80 分。
两者相等时:
(1-c) × 33.95 = c × 80
c = 33.95 ÷ 113.95 = 29.8%
| 成本权重 | A 加权值 | C 加权值 | 推荐 |
|---|---|---|---|
| 15% | 70.1 | 53.2 | A |
| 25% | 62.8 | 57.3 | A |
| 29.8% | 59.3 | 59.3 | 无稳定差异 |
| 35% | 55.5 | 61.4 | C |
| 45% | 48.2 | 65.5 | C |
29.8% 是切换值:它说明负责人必须把成本完整摆动看得多重,推荐才会改变。它不是“正确权重”。团队判断未来半年质量与治理仍优先,15% 合理;若客户流失使预算进入紧缩情景,成本偏好可能超过 30%,届时 C 应重新进入首选。
还要测试 Q:保持其他四项相对比例时,A 的优势对 Q 权重最敏感。若 Q 权重显著降低,同时 C 的后续质量实测从 82% 提升,排序可能更早翻转。报告应列出最有影响的 3 个变量,而不是生成 100 张无人阅读的图。
敏感性结果必须保留变化规则。若只把成本从 15% 改成 35%,却不说明减少的 20% 从哪些标准拿走,任何人都无法复算。这里按原比例缩放其余四项;另一种合理规则可能只减少 Q。两种规则代表不同偏好变化,不能混用同一个“成本更重要”标签。
情景分析同时改变一组有因果关系的假设
单变量敏感性适合定位杠杆,情景分析则描述一组共同发生的未来。工作室定义四种可辨认、可触发的情景:
| 情景 | 联动假设 | 主要变化 | 行动 |
|---|---|---|---|
| S1 正常增长 | 12 名研究员稳定使用,客户数据边界不变 | 基础权重与成本 | A 试点 |
| S2 预算收紧 | 席位降至 8、人均现金预算下降、成本权重 35% | C 成本优势扩大 | 重新比较 A/C,倾向 C |
| S3 高敏客户增加 | 6 个新项目禁止外部处理 | 可用任务减少,治理权重上升 | 保持现状或本地方案 |
| S4 产品变更 | A 修改保留或导出机制 | G/R 重测,旧证据过期 | 暂停自动导入 |
情景必须有触发器。S2 的触发器是连续两个月收入低于预算 20%;S3 是高敏项目占在手收入超过 30%;S4 是合同、子处理方、保留设置或导出格式发生实质更新。
不能把“乐观、基础、悲观”各自乘 0.8、1.0、1.2 就叫情景。那种做法没有说明哪些变量为何一起变,也可能把质量、时间和成本不合理地同步放大。
归一化和候选集变化会造成排名反转,必须做回归测试
如果 0 和 100 直接取自当前候选的最差、最好值,加入一个极差方案 D 就会改变 A/B/C 的相对距离,即使它们的原始表现完全没变。这叫候选集依赖风险。
本案锚点来自业务门槛与历史流程,加入 D 不会改变 Q 的 80% 和 90% 锚点。林澈还执行四类模型回归:
| 回归 | 操作 | 预期 |
|---|---|---|
| 被支配选项 | 加入各项均不优于 C 的 D | A/C 顺序不应变化 |
| 重复选项 | 复制 A 为 A2 | 不应稀释 A 的权重或改变值 |
| 无关标准 | 加入权重为 0 的颜色偏好 | 合计不变 |
| 单位换算 | 成本从美元改为美分 | 价值与排序不变 |
| 舍入 | 内部精度从 4 位改 6 位 | 展示差异不改变实质推荐 |
若回归失败,优先检查锚点、权重归一化、缺失值填充和重复标准。表格程序常见错误还包括把 35 写成 0.35 后又除以 100、把“越小越好”的时间方向写反、隐藏筛选行仍参与求和。
计算文件必须有自动断言:权重和为 1;所有值在 0—100;硬门槛失败项不参与排名;每个评分单元格都有证据编号;修改任一输入后结果重算;不存在手工覆盖的合计单元格。
推荐要写成条件句、行动和停止规则,而不是宣布“最佳产品”
最终决策备忘录的第一段写:在当前目标、G1—G5 全部通过、基础权重 Q/W/G/R/C=35/20/20/10/15、2026-07-21 的测试版本和首年成本假设下,A 是受控试点首选;这不表示 A 在所有组织或情景中综合最好。
| 决策项 | 已批准内容 |
|---|---|
| 范围 | 6 名用户、6 周、60 个任务 |
| 数据 | 只用获准的内部资料;客户原始数据默认禁止 |
| 人工门 | 所有外部结论逐条核验,禁止自动发送 |
| 预算上限 | 2,100 美元,超出需重新批准 |
| 成功线 | Q≥88%,W 中位≤8 分钟,G=10/10 |
| 停止线 | 数据越权 1 次、不可撤回外发 1 次、G1 状态变化 |
| 转向 C | 成本偏好确认≥29.8%,或预算情景 S2 触发且 C 复测过线 |
试点不是把采购拖延 6 周。它要减少排序最敏感的不确定性:A 的质量能否在真实任务保持、治理缺口能否从 9/10 补到 10/10、实际维护是否超过 18 小时/年。试点结束后按同一指标定义更新证据,不能换成满意度问卷宣布成功。
若 A 与 C 在合理权重和证据区间内频繁互换,正确结论可能是“当前证据不足以稳定排序”。这时选择更可逆或先收集信息,比强行给出冠军更专业。
AI 适合维护计算和找矛盾,但不得生成权重后再证明自己正确
AI 可以执行候选字段抽取、公式生成、单元测试、缺失项扫描、敏感性网格和备忘录草稿;每次输出必须注明使用的模型版本。人工保留目标、硬门槛、偏好权重、证据可接受性和最终授权。
| 工作 | AI 可做 | 人工必须做 |
|---|---|---|
| 证据表 | 从日志抽取数值并链接原文位置 | 判断指标是否真正相同 |
| 价值函数 | 按批准锚点计算 | 决定锚点和函数形状 |
| 权重 | 归一化、展示摆动问题 | 表达和批准取舍 |
| 敏感性 | 网格计算转换值 | 判断哪些变化合理 |
| 推荐 | 按模板写条件句 | 承担决策与停止责任 |
| 回归 | 运行断言与差异报告 | 处理模型逻辑错误 |
禁止把厂商营销页交给 AI 后问“各打几分”;也禁止让同一模型先编原始数据、再设置权重、最后解释冠军。若使用 AI 辅助编程,计算结果仍用独立手算样本复核:A 的 28+12.86+18+10+1.2=70.06,C 的 7+8+16+9+13.2=53.2。
每次重算都生成一份决策差异:哪些输入变了、哪些单元格受影响、排序是否翻转、谁批准。这样产品升级或报价改变时,不需要重新相信一段无状态对话。
可以直接复用的决策包:八个文件、一次盲审和四项发布门禁
林澈交付的不是一个名为“最终比较第 7 版”的孤立表格,而是一套可审计决策包:
01-decision-brief.md
02-options-and-gates.csv
03-criteria-and-value-functions.csv
04-evidence-ledger.csv
05-cost-baseline.xlsx
06-weight-elicitation.md
07-sensitivity-and-scenarios.csv
08-decision-memo.md
其中,证据账本至少包含方案编号、标准编号、原始值、单位、抽样、来源编号、原文位置、数据截止日期、复核人、状态、下限、基础值和上限;模型表则包含放行门槛、价值函数、权重、加权值和模型版本。
发布前由未参与建模的人盲审 8 个单元格:随机 4 个、高影响 2 个、缺失或冲突 2 个。审阅者只拿原始证据和冻结定义,独立复算;若指标方向、分母或原文位置任一不一致,整列回到“待复核”。
| 发布门禁 | 通过条件 |
|---|---|
| 证据放行门槛 | 15/15 单元格有证据或明确的缺失状态 |
| 数学放行门槛 | 权重=100%,A/C 手算与程序差<0.01 |
| 鲁棒性放行门槛 | 至少报告 3 个高影响变量与转换值 |
| 动作放行门槛 | 建议含范围、成功线、停止线、复审日期 |
资料核验于 2026-07-21。方法依据如下:
- HM Treasury:The Green Book 2026:明确指出单一汇总指标不足以完成均衡判断,并要求敏感性分析、转换值、风险与不确定性展示。
- HM Treasury:Green Book supplementary guidance on MCDA:提供多准则决策分析的适用条件、一般步骤、主要考虑和常见陷阱。
- UK Government:Multi-criteria analysis manual:系统说明方案评价、标准、评分、权重和敏感性分析的完整方法。
- U.S. GAO:Cost Estimating and Assessment Guide:把范围、技术基线、工作分解、假设、数据、敏感性、风险、文档与更新列为可靠成本估算的重要步骤。
真正可信的比较不承诺消灭判断,而是把判断放回正确位置:事实有证据,尺度有锚点,权重有主人,风险有门槛,变化有转换值,最终行动有停止规则。只有这样,“综合分”才是可复算的决策视图,而不是 AI 为不确定性画出的精确外壳。