先看结果:A 得分最高,但最后交付物不是一张 70.1 分的排行榜

独立顾问林澈受一家 15 人研究工作室委托,比较三套 AI 研究助手 A、B、C。第一次让 AI “联网调研并综合打分”,它在没有本地测试的情况下给出 A 8.7、B 9.1、C 8.3,还把“安全、准确、易用、性价比”平均相加。三位负责人各自调整提示词,得到三个不同冠军。

林澈重做评估:先冻结目标和硬门槛,再用 150 个任务、30 次权限测试、30 次导出测试、15 人成本基线和 3 次退出演练建立证据。结果不是“B 综合最好”,而是:

方案 硬门槛 基础加权值 决策状态 结论
A 5/5 通过 70.1 可进入受控试点 质量与治理优先时首选
B 4/5 通过 不参与排名 暂停 客户数据保留边界没有合同证据
C 5/5 通过 53.2 可进入受控试点 成本权重高或预算收紧时首选
A 与 C 通过五项硬门槛,B 因合同证据不完整暂停排名;A 在基础偏好下得分较高
得分最高不等于可以直接采购。B 的诊断值可能更高,却因合同证据不完整失去排名资格;A 的 70.1 也只在当前证据和权重下成立。

基础偏好下 A 比 C 高 16.9 分;当年度总成本的权重从 15% 提高到约 29.8%,其余权重按比例收缩,C 反超 A。最终建议是“先用 A 做 6 周、6 人、60 个任务的可逆试点,同时保留 C 为预算情景备选”,而不是把 70.1 当成产品固有属性。本文人物、产品代号和业务数字均为教学案例,外部资料只用于支持评估方法,不代表任何真实产品表现。

“综合评分”常常把五种不同判断藏进一个小数

一张看似精确的排行榜,至少混合了事实、换算、偏好、约束和不确定性。AI 若不展示这五层,就可能在空白处自动补出合理外观。

要回答什么 本案例子 能否由 AI 自行决定
原始事实 实际观察到什么 50 个任务中 44 个主张获支持 只能抽取,须留证据
价值换算 原始单位怎样映射到共同尺度 88% 映射为质量价值 80 规则须事先批准
偏好权重 改善哪个结果更重要 质量 35%、成本 15% 决策者表达取舍
硬约束 什么失败不能被别项补偿 客户数据条款必须可验证 负责人批准
不确定性 哪些数会变化 采用率、复核时间、维护工时 AI 可计算,不能抹平
“综合评分”常常把五种不同判断藏进一个小数:原始事实、价值换算、偏好权重、硬约束
一个小数背后至少藏着五类判断。原始事实、价值换算、偏好权重、硬约束和不确定性必须分别留痕;总分只能作为压缩视图。

“安全 9 分、易用 8 分”的问题不只是主观。它没有定义 0 和 10,没有说明证据日期,也没有说明从 8 到 9 是否与从 4 到 5 等价。把四个这样的数平均,精确到 8.65,并不会增加信息。

林澈规定,每个数字都要能反向追到观察编号、测量规则、证据文件、负责人和日期;无法反向追踪的数字不进入计算。总分只是一种压缩视图,不能替代这些底层记录。

先写一页决策契约,防止看完产品再修改问题

评估开始前,工作室先冻结一页决策简报。这样不能因为喜欢某个界面,就把“研究结论可核验”换成“生成速度快”;也不能因某方案便宜,临时忽略退出成本。

字段 冻结内容
决策编号 RA-2026-07
决策问题 未来 6 个月是否为研究团队试点一套 AI 研究助手
使用人群 12 名研究员、2 名项目经理、1 名管理员
目标 缩短证据整理时间,同时不降低引用支持率与客户数据控制
不在范围 自动向客户发送、医疗或法律建议、无人复核发布
备选项 保持现状、A、B、C、先试点后再决定
决策期限 2026-07-31
预算边界 首年现金支出不超过 10,000 美元
决策人 工作室负责人;数据负责人有硬门槛否决权

必须保留“保持现状”和“延后并收集证据”。如果候选集只有厂商 A、B、C,评分机制会被迫选一个,即使三者都不值得买。试点也应是独立选项,因为它用较小成本购买信息,并限制不可逆承诺。

决策契约还要记录变更控制:截止日前若目标、门槛或权重改变,必须保存旧版、修改人和理由,然后重算全部方案,不能只修改输家的一列。

硬门槛先于加权:不能让低价格抵消不可接受的数据边界

有些条件是不可补偿的。若客户合同禁止相关数据处理,价格便宜或界面顺手都不能把它“平均回来”。林澈把门槛写成可验证的“通过、失败、未知”,而不是 1—10 分。

门槛编号 门槛 通过证据 失败或状态未知时的动作
G1 合同明确目标数据类型、处理角色与期限 已签条款、数据流图和保留条件一致 不得导入客户数据
G2 管理员能限制外部发送 权限测试 10/10 阻断 暂停试点
G3 可导出原文、来源和审计记录 退出演练重建率 100% 限制为临时沙盒
G4 删除覆盖原件、索引和派生内容 四层删除回执 保持“状态未知”并补测
G5 首年现金支出不超过 10,000 美元 成本底稿与报价快照 重新议价或排除
硬门槛先于加权:不能让低价格抵消不可接受的数据边界:G1、G2、G3、G4
先问“能不能做”,再问“哪个更好”。客户数据条款、外发限制、可导出、可删除和预算上限是五项不可补偿门槛,低价格不能抵消其中任何一项失败。

A 和 C 的 5 项均通过。B 的功能页声称支持保留设置,但合同附件没有明确客户数据的处理期限,数据负责人把 G1 记为“状态未知”。未知不是 0 分,也不是“暂且视为通过”;它表示缺少允许行动的证据。因此 B 即使计算值可能很高,也不能出现在合格方案冠军榜中。

G3 只检查原文、来源和审计记录这 3 类关键资产能否完整退出;后面的 R 则测试模板、标签、权限映射等 10 类扩展资产。因此 C 可以通过 G3,同时因扩展资产只重建 9/10 而在 R 上得到 90,门槛与加权项没有用同一事实重复裁决。

门槛要少而硬。把“最好看”“响应最快”写成门槛会人为清空候选集;真正门槛应能解释失败造成的不可接受后果、验证方式和负责签字的人。

候选集要覆盖真正不同的行动,而不只是三个相似订阅

工作室先构造长名单,再进入短名单。候选方案必须在采购、流程或承诺上有实质差别,否则是在比较包装而非行动。

选项 行动描述 首期承诺 可逆性 进入短名单
O0 保持现状 继续人工检索与证据表 0 美元 作为基线保留
O1 A 6 人受控试点,禁止自动外发 2,100 美元上限
O2 B 先补合同,再决定是否试点 法务核验 600 美元 门槛待定
O3 C 6 人受控试点,额外人工质检 1,500 美元上限
O4 自建 自托管检索、引用与日志 预计 320 工时 当前资源不足,退出
O5 延后 8 周 收集 80 个现状任务基线 约 64 工时 证据不足时启用

这里的“退出”不等于方案永远差,而是它在当前目标、资源和期限下不进入详细比较。每个退出项都保留原因代码,条件改变后可以重新打开。

英国《绿皮书》的做法对小企业同样有启发:先检查方案是否达到目标和关键成功因素;未达目标的方案不应靠后续汇总指标翻盘。这里借用的是结构化思路,不是在声称一次小型软件采购等同于公共项目评估。

建标准树:一项结果只出现一次,避免“双重计票”

初稿把“准确性、引用正确、研究质量、可靠性”列为四项,它们大部分来自同一批测试,等于让质量结果获得四份权重。林澈把标准整理成五个互不完全重叠的叶节点:

标准代号 标准 直接测量 不包括什么 基础权重
Q 证据支持质量 50 个原子主张的支持比例 生成文风、速度 35%
W 工作流时间 从任务开始到可交付证据表的中位分钟 学习期、异常失败另记 20%
G 治理控制 10 项权限与日志测试通过数 合同硬门槛 20%
R 可逆退出 10 类资产可重建数 迁移后的长期性能 10%
C 首年总成本 许可、设置、维护和退出演练 未证实的收入增长 15%

标准树检查三件事:完整性——重要结果没有漏掉;非重复——同一结果没有换名计两次;偏好独立性——某项权重的含义不会随另一项水平任意改变。

“品牌、功能数量、市场热度”没有进入叶节点,因为它们不是本次决策的最终结果。若品牌影响持续服务风险,应改测财务连续性或出口能力;若功能影响时间,应由任务时间反映。代理变量不能和它所代理的结果同时加分。

标准之间还要做因果路径检查。假设“引用导出功能”会减少人工整理时间,它可以作为 W 的机制证据,却不能既给功能完整度加分、又在 W 中计算已经实现的时间收益。相反,治理日志与引用支持率虽然可能相关,却回答控制过程和输出结果两个不同问题,可以分列,但要分别取证。

林澈让团队对每个标准做一次“移除测试”:删掉这一列,会漏掉哪一种最终后果?如果答案只是“产品看起来不先进”,就不该进入;如果两个标准的答案完全相同,就应合并。最后再做覆盖表,确保目标中的质量、时间、控制、退出与成本各自只落到一个主叶节点。

每个单元格都要有证据账本,空白不能由模型常识填满

对 3 个产品乘 5 个标准,共 15 个评价单元格。每格至少保存指标定义、抽样、观察、来源、数据截止日期、复核人和不确定性。下面是基础证据汇总:

方案 Q 支持主张 W 中位分钟 G 测试 R 可重建 C 首年总成本
A 44/50=88% 7.5 9/10 10/10 8,640 美元
B 45/50=90% 5.8 6/10 7/10 6,480 美元
C 41/50=82% 9.2 8/10 9/10 5,040 美元
每个单元格都要有证据账本,空白不能由模型常识填满:A、B、C
三套产品、五项标准,形成 15 个独立取证单元。每格都要连接实测文件和复核状态;网页功能表只能帮助设计测试,不能替代本账户的测试结果。

150 个任务使用同一套冻结题目,其中事实核验 60 个、文档比较 45 个、证据表生成 30 个、冲突来源处理 15 个。顺序采用轮换,避免 A 总在研究员最熟练时测试。失败任务保留在分母中,不允许只计算成功输出。

证据编号 单元格 原始文件 复核状态
EV-Q-A-01 A / Q claims-a.csv + 源包-v3 双人复核 10 条
EV-W-A-01 A / W 任务计时器.ndjson 含人工返工时间
EV-G-B-04 B / G 权限测试-04.webm 测试 4 未阻断
EV-R-C-01 C / R 导出-c.zip + 重建.日志 9/10 可重建
EV-C-ALL-01 A/B/C / C cost-model-v2.xlsx 财务复算

网页功能表可以帮助设计测试,却不能替代本账户的测试结果。AI 可以抽取候选字段,但没有证据编号的值一律标为“缺失”。

证据账本还要保存数据来路。例如 A/Q 的 88% 不是手工输入,而是 claims-a.csv 中 44 行“已支持”除以冻结任务表的 50 行;任意删除一条任务,摘要校验值会变化并触发重审。截图只用于证明当时界面状态,结构化日志保存设置、输入、输出与时间;两者缺一时,复现等级不能标为“高”。

每份证据设有效期。报价 30 天后过期,产品设置在版本变化时立即过期,任务质量基线在题库或模型改变后重测。过期不会把历史决定变错,却意味着不能把旧值直接用于新采购。

测量协议要在测试前冻结,否则“分数”会追着结果改变

Q 的分母是 50 个预先拆分的原子主张。每条只有“已支持、部分支持、不受支持”三种结果;基础比例只把“已支持”计入分子。若测试后才把“部分支持”算半分,必须作为新模型版本,而不是悄悄改善某产品。

测量项 冻结规则 防止的偏差
题库 三方案使用相同 50 个任务与来源包 难度不同
运行顺序 研究员与方案按拉丁式轮换 学习和疲劳
时间起止 打开任务到证据表通过人工验收 只报生成速度
失败处理 超时、拒答、错误均留在样本 幸存者偏差
复核 随机 20% 由第二人盲审 单人标准漂移
版本 保存模型、套餐、设置和测试日期 产品更新混入

中位时间适合本案,因为少数权限故障会产生很长尾部;但不能只报中位数。A 的中位数 7.5 分钟、90 分位 14.8 分钟,C 分别为 9.2 和 18.6 分钟。若工作室最怕延误,尾部时间应成为独立限制或情景变量,而不是被中位数遮住。

测试日志还记录人工提示次数、返工原因和是否调用外部检索。否则 A 可能因额外 3 次人工修正取得高质量,表面却被写成“自动完成”。

成本必须来自同一工作分解,不能只比较月费

月费排名是 C、B、A;首年总成本仍是 C、B、A,但差额和风险已改变。林澈用同一套成本分解结构计算:

成本项 A B C
许可:15 人 × 单价 × 12 月 6,480 5,040 3,600
设置:工时 × 60 美元 18×60=1,080 12×60=720 8×60=480
维护:年度工时 × 60 美元 18×60=1,080 12×60=720 16×60=960
首年合计 8,640 6,480 5,040
成本必须来自同一工作分解,不能只比较月费:许可:15 人 × 单价 × 12 月、设置:工时 × 60 美元、维护:年度工时 × 60 美元、首年合计
三套方案必须按同一成本口径比较。许可、设置和维护全部计入首年成本后,A、B、C 分别为 8,640、6,480 和 5,040 美元;未知费用进入区间,不能填成零。

维护工时包括权限变更、模板更新、错误复核和月度抽查,不包括已经计入 W 的日常任务时间。这样避免把同一工时同时计入成本与时间两次。

成本表另列报价截止日期、币种、税费、最低席位、合同期限、涨价假设和退出工时。美国政府问责局的成本指南强调基线、工作分解、假设、数据、敏感性和风险分析;本案把这些原则缩小应用于订阅决策,不照搬大型项目的复杂度。

如果某成本未知,不填 0。B 的法务补充协议费用估计为 400—900 美元,应进入区间和情景,不应因还没收到发票就消失。

价值函数把不同单位换到 0—100,但锚点必须有业务含义

只有在保留原始数据后,才建立价值函数。0 不是“产品一无是处”,100 也不是“完美”;它们分别表示本次决策中可接受区间的低、高锚点。

标准 0 分锚点 100 分锚点 换算 是否封顶
Q 80% 支持 90% 支持 (x-80)÷10×100
W 12 分钟 5 分钟 (12-x)÷7×100
G 0/10 10/10 通过数÷10×100
R 0/10 10/10 可重建数÷10×100
C 9,000 美元 4,500 美元 (9,000-x)÷4,500×100
价值函数把不同单位换到 0—100,但锚点必须有业务含义:Q、W、G、R
0—100 是共同尺度,不是产品的绝对成绩。质量、时间、治理、退出和成本各自用业务验收线与历史流程确定锚点,不能为了让某个方案获胜而倒推。

因此 A:Q=(88-80)÷10×100=80;W=(12-7.5)÷7×100=64.3;G=90;R=100;C=(9,000-8,640)÷4,500×100=8。C:Q=20;W=40;G=80;R=90;C=88。

Q 低于 80% 记 0,而不是负分;高于 90% 封顶 100,避免一个超出当前需要的改进吞掉所有权重。锚点来自工作室最低验收线和历史最佳人工流程,不是为了让 A 赢而反推。

线性函数只是明确假设。若从 80% 到 85% 的价值远高于 85% 到 90%,应在测试前改用分段函数,并记录理由。不能因为线性算起来方便,就假设每一点改善价值恒定。

权重来自“摆动”的价值,不来自让 AI 猜负责人偏好

“质量 35%”不是质量重要性的口号。它表示:从 Q 的 0 锚点改善到 100 锚点,相对于其他标准各自的完整摆动,贡献 35% 的偏好价值。

林澈让负责人先想象所有标准都在 0 锚点,选择最想完整改善哪一项;再给第二项相对于第一项的价值点数。三人先独立作答,再讨论差异,最终归一化为 100:

完整摆动 负责人原始点 数据负责人原始点 项目经理原始点 协商权重
Q:80%→90% 100 100 90 35%
W:12→5 分钟 70 50 100 20%
G:0→10 项控制 80 100 60 20%
R:0→10 类重建 40 70 40 10%
C:9,000→4,500 美元 60 40 70 15%
权重来自“摆动”的价值,不来自让 AI 猜负责人偏好:Q:80%→90%、W:12→5 分钟、G:0→10 项控制、R:0→10 类重建
权重来自一次完整改善值多少钱。“质量 35%”比较的是质量从 80% 提升到 90% 的价值,而不是抽象地说质量重要;AI 可以计算,不能替负责人表达取舍。

协商权重不是三列简单平均,而是一次有记录的决策会议结果。会议纪要保存不同意见:数据负责人认为 G 不应完全可补偿;团队于是把合同条件留在硬门槛,同时只让可分级的治理测试参与加权。

若决策者无法解释“为什么 Q 的完整摆动约是 C 的 2.33 倍”,权重仍未成熟。AI 可以归一化、检查总和与展示影响,但不能把网上常见的 30/20/20/15/15 冒充本组织偏好。

基础计算必须逐项可复算,且只给通过门槛的方案排序

加权值公式为各标准价值乘权重后求和。A 和 C 的基础计算如下:

方案 Q 35% W 20% G 20% R 10% C 15% 合计
A 80×.35=28.00 64.3×.20=12.86 90×.20=18.00 100×.10=10.00 8×.15=1.20 70.06≈70.1
C 20×.35=7.00 40×.20=8.00 80×.20=16.00 90×.10=9.00 88×.15=13.20 53.20
A-C 21.00 4.86 2.00 1.00 -12.00 16.86

A 的优势主要来自 Q,不是所有维度都更好;C 用成本追回 12 分。这个分解比“70.1 对 53.2”更重要,因为它揭示推荐依赖什么。

B 若忽略门槛,其 Q=100、W=88.6、G=60、R=70、C=56,加权值为 35+17.72+12+7+8.4=80.12。正因它会成为表面冠军,必须在计算前执行 G1,而不是把“合同不明”偷偷扣 3 分。表格可以显示 B 的诊断值帮助找补证方向,但必须标红“不可排名”,不能与合格方案同列冠军。

保留至少两位内部小数,最后展示一位;不得对每项先四舍五入再相加。若两方案只差 0.3 分,应直接报告“在误差内无稳定排序”,不要用第三位小数制造胜负。

缺失证据有四种处理,绝不能默认填 0、50 或行业平均

“缺失”可能表示尚未测试、无法访问、不适用或证据冲突,四种情况的动作不同:

状态 例子 计算动作 决策动作
尚未收集 C 的新版本尚未做权限测试 不给单点值 补测或做区间
不可访问 B 合同附件未提供 不进入硬门槛排名 向供应方索取
不适用 本地部署没有席位月费 改用同一总拥有成本口径 不能填 0 成本
冲突 文档称可导出,演练缺 1 类资产 使用实测并标冲突 复核版本与设置

有三种可接受策略:排除该方案并说明原因;用明确的上下界做区间;支付成本收集证据。均值插补只适合特定统计任务,不适合用来替供应方获得采购资格。

林澈为每个缺口记录“信息价值”:如果补证后可能改变推荐,就优先补;如果即使取最有利值也无法改变行动,先停止调查。B 的合同证据价值高,因为一旦 G1 通过,它的诊断值可能超过 A;C 的品牌知名度缺口价值为 0,因为品牌不在标准树中。

先做证据不确定性,再做偏好不确定性,两者不能混成一个误差条

Q 的 44/50 只是样本观察,未来任务组合可能不同;W 也会随熟练度改变。林澈为关键值给出审慎区间,不假装单点永久稳定:

输入 A 基础值 A 审慎区间 C 基础值 C 审慎区间 区间依据
Q 价值 80 65—90 20 10—35 任务重抽与复核分歧
W 价值 64.3 50—75 40 25—55 研究员与任务类型
G 价值 90 80—90 80 70—80 当前版本与设置
R 价值 100 90—100 90 80—90 第二次退出演练
C 价值 8 0—16 88 78—94 维护工时与涨价
先做证据不确定性,再做偏好不确定性,两者不能混成一个误差条:Q 价值、W 价值、G 价值、R 价值
“表现可能是多少”与“我们重视什么”是两类不确定性。前者来自任务抽样、版本和维护成本,后者来自负责人取舍;混成一个置信度分数,会掩盖下一步究竟该补测试还是重开决策会议。

把所有最坏值同时发生、所有最好值同时发生,能给极保守边界,但可能制造不现实组合。更实用的是列出哪些变量相关:采用率低会减少许可利用,同时可能增加每任务人工时间;版本升级可能同时改善 Q 和破坏 G。

证据区间回答“表现可能是多少”,权重区间回答“我们重视什么”。前者需要更多测试,后者需要决策者澄清价值取舍。AI 不能因为二者都表现为范围,就把它们混成一个置信度分数。

区间来源也要分级:重复测试得到的波动、第二审阅者的分类分歧、报价条款形成的上下界,证据强度不同。没有数据时使用专家区间,应同时保存最低值、最高值、给出区间的人和理由,不能让模型输出“通常浮动 10%”后当作经验事实。若区间内包含门槛失败,动作是补证或缩小试点,不是取中点继续采购。

敏感性分析不是把权重随便改一圈,而是寻找推荐的转换值

基础模型中,除成本外四项权重合计 85%。令成本权重为 c,其余权重保持原有比例并缩放到 1-c。A 相对 C 的非成本优势按 85% 权重计为 28.86 分,因此归一到全部非成本权重时是 28.86÷0.85=33.95;C 的成本价值比 A 高 80 分。

两者相等时:

可复制模板
(1-c) × 33.95 = c × 80
c = 33.95 ÷ 113.95 = 29.8%
成本权重 A 加权值 C 加权值 推荐
15% 70.1 53.2 A
25% 62.8 57.3 A
29.8% 59.3 59.3 无稳定差异
35% 55.5 61.4 C
45% 48.2 65.5 C
敏感性分析不是把权重随便改一圈,而是寻找推荐的转换值:15%、25%、29.8%、35%
成本权重达到约 29.8% 时,推荐从 A 切换到 C。这个转换值说明结论在什么偏好下翻转;它不是唯一正确权重,且重分配其余权重的规则必须公开。

29.8% 是切换值:它说明负责人必须把成本完整摆动看得多重,推荐才会改变。它不是“正确权重”。团队判断未来半年质量与治理仍优先,15% 合理;若客户流失使预算进入紧缩情景,成本偏好可能超过 30%,届时 C 应重新进入首选。

还要测试 Q:保持其他四项相对比例时,A 的优势对 Q 权重最敏感。若 Q 权重显著降低,同时 C 的后续质量实测从 82% 提升,排序可能更早翻转。报告应列出最有影响的 3 个变量,而不是生成 100 张无人阅读的图。

敏感性结果必须保留变化规则。若只把成本从 15% 改成 35%,却不说明减少的 20% 从哪些标准拿走,任何人都无法复算。这里按原比例缩放其余四项;另一种合理规则可能只减少 Q。两种规则代表不同偏好变化,不能混用同一个“成本更重要”标签。

情景分析同时改变一组有因果关系的假设

单变量敏感性适合定位杠杆,情景分析则描述一组共同发生的未来。工作室定义四种可辨认、可触发的情景:

情景 联动假设 主要变化 行动
S1 正常增长 12 名研究员稳定使用,客户数据边界不变 基础权重与成本 A 试点
S2 预算收紧 席位降至 8、人均现金预算下降、成本权重 35% C 成本优势扩大 重新比较 A/C,倾向 C
S3 高敏客户增加 6 个新项目禁止外部处理 可用任务减少,治理权重上升 保持现状或本地方案
S4 产品变更 A 修改保留或导出机制 G/R 重测,旧证据过期 暂停自动导入

情景必须有触发器。S2 的触发器是连续两个月收入低于预算 20%;S3 是高敏项目占在手收入超过 30%;S4 是合同、子处理方、保留设置或导出格式发生实质更新。

不能把“乐观、基础、悲观”各自乘 0.8、1.0、1.2 就叫情景。那种做法没有说明哪些变量为何一起变,也可能把质量、时间和成本不合理地同步放大。

归一化和候选集变化会造成排名反转,必须做回归测试

如果 0 和 100 直接取自当前候选的最差、最好值,加入一个极差方案 D 就会改变 A/B/C 的相对距离,即使它们的原始表现完全没变。这叫候选集依赖风险。

本案锚点来自业务门槛与历史流程,加入 D 不会改变 Q 的 80% 和 90% 锚点。林澈还执行四类模型回归:

回归 操作 预期
被支配选项 加入各项均不优于 C 的 D A/C 顺序不应变化
重复选项 复制 A 为 A2 不应稀释 A 的权重或改变值
无关标准 加入权重为 0 的颜色偏好 合计不变
单位换算 成本从美元改为美分 价值与排序不变
舍入 内部精度从 4 位改 6 位 展示差异不改变实质推荐

若回归失败,优先检查锚点、权重归一化、缺失值填充和重复标准。表格程序常见错误还包括把 35 写成 0.35 后又除以 100、把“越小越好”的时间方向写反、隐藏筛选行仍参与求和。

计算文件必须有自动断言:权重和为 1;所有值在 0—100;硬门槛失败项不参与排名;每个评分单元格都有证据编号;修改任一输入后结果重算;不存在手工覆盖的合计单元格。

推荐要写成条件句、行动和停止规则,而不是宣布“最佳产品”

最终决策备忘录的第一段写:在当前目标、G1—G5 全部通过、基础权重 Q/W/G/R/C=35/20/20/10/15、2026-07-21 的测试版本和首年成本假设下,A 是受控试点首选;这不表示 A 在所有组织或情景中综合最好。

决策项 已批准内容
范围 6 名用户、6 周、60 个任务
数据 只用获准的内部资料;客户原始数据默认禁止
人工门 所有外部结论逐条核验,禁止自动发送
预算上限 2,100 美元,超出需重新批准
成功线 Q≥88%,W 中位≤8 分钟,G=10/10
停止线 数据越权 1 次、不可撤回外发 1 次、G1 状态变化
转向 C 成本偏好确认≥29.8%,或预算情景 S2 触发且 C 复测过线

试点不是把采购拖延 6 周。它要减少排序最敏感的不确定性:A 的质量能否在真实任务保持、治理缺口能否从 9/10 补到 10/10、实际维护是否超过 18 小时/年。试点结束后按同一指标定义更新证据,不能换成满意度问卷宣布成功。

若 A 与 C 在合理权重和证据区间内频繁互换,正确结论可能是“当前证据不足以稳定排序”。这时选择更可逆或先收集信息,比强行给出冠军更专业。

AI 适合维护计算和找矛盾,但不得生成权重后再证明自己正确

AI 可以执行候选字段抽取、公式生成、单元测试、缺失项扫描、敏感性网格和备忘录草稿;每次输出必须注明使用的模型版本。人工保留目标、硬门槛、偏好权重、证据可接受性和最终授权。

工作 AI 可做 人工必须做
证据表 从日志抽取数值并链接原文位置 判断指标是否真正相同
价值函数 按批准锚点计算 决定锚点和函数形状
权重 归一化、展示摆动问题 表达和批准取舍
敏感性 网格计算转换值 判断哪些变化合理
推荐 按模板写条件句 承担决策与停止责任
回归 运行断言与差异报告 处理模型逻辑错误

禁止把厂商营销页交给 AI 后问“各打几分”;也禁止让同一模型先编原始数据、再设置权重、最后解释冠军。若使用 AI 辅助编程,计算结果仍用独立手算样本复核:A 的 28+12.86+18+10+1.2=70.06,C 的 7+8+16+9+13.2=53.2。

每次重算都生成一份决策差异:哪些输入变了、哪些单元格受影响、排序是否翻转、谁批准。这样产品升级或报价改变时,不需要重新相信一段无状态对话。

可以直接复用的决策包:八个文件、一次盲审和四项发布门禁

林澈交付的不是一个名为“最终比较第 7 版”的孤立表格,而是一套可审计决策包:

可复制模板
01-decision-brief.md
02-options-and-gates.csv
03-criteria-and-value-functions.csv
04-evidence-ledger.csv
05-cost-baseline.xlsx
06-weight-elicitation.md
07-sensitivity-and-scenarios.csv
08-decision-memo.md

其中,证据账本至少包含方案编号、标准编号、原始值、单位、抽样、来源编号、原文位置、数据截止日期、复核人、状态、下限、基础值和上限;模型表则包含放行门槛、价值函数、权重、加权值和模型版本。

发布前由未参与建模的人盲审 8 个单元格:随机 4 个、高影响 2 个、缺失或冲突 2 个。审阅者只拿原始证据和冻结定义,独立复算;若指标方向、分母或原文位置任一不一致,整列回到“待复核”。

发布门禁 通过条件
证据放行门槛 15/15 单元格有证据或明确的缺失状态
数学放行门槛 权重=100%,A/C 手算与程序差<0.01
鲁棒性放行门槛 至少报告 3 个高影响变量与转换值
动作放行门槛 建议含范围、成功线、停止线、复审日期
可以直接复用的决策包:八个文件、一次盲审和四项发布门禁:证据放行门槛、数学放行门槛、鲁棒性放行门槛、动作放行门槛
可审计的比较结果是一套决策包,不是一张排行榜。八个文件保存问题、门槛、标准、证据、成本、权重、敏感性和建议,再由一次盲审与四项门禁决定能否发布。

资料核验于 2026-07-21。方法依据如下:

真正可信的比较不承诺消灭判断,而是把判断放回正确位置:事实有证据,尺度有锚点,权重有主人,风险有门槛,变化有转换值,最终行动有停止规则。只有这样,“综合分”才是可复算的决策视图,而不是 AI 为不确定性画出的精确外壳。