先看结果:团队自报每个商品省20分钟,事件日志只看到3分钟;加购率高0.1个百分点,却不足以证明内容创造了价值
澜序电商的商品内容部为消费电子新品建立标题、结构化属性、卖点说明、搜索摘要与无障碍替代文本。AI读取已批准的供应商规格、内部产品主数据和写作规则,生成有来源的候选;商品编辑逐字段验证,质量复核人签署后才发布。价格、库存、促销、合规结论与供应商承诺不由AI决定。业务负责人最初准备把“每页节省20分钟×页面数×人工费”写进投资回报率。
团队将800个新库存单位按编辑、品类、价格带和活动批次分块,再在各块内随机分为400个AI组与400个现有模板对照组。主要分析按原分配计算:被分到AI组但没有使用的48个库存单位仍留在AI组。对照组平均人工处理49分钟,AI组为46分钟,实际仅省3分钟;400×3=1,200分钟=20小时。自报节省20分钟,是因为只比较“写初稿21分钟”和“生成1分钟”,遗漏了更长的输入整理、属性核验、编辑与返工。
| 主要结果 | 对照组 | AI组 | 差异 | 解释 |
|---|---|---|---|---|
| 库存单位包 | 400 | 400 | — | 块内随机 |
| 每个库存单位平均人工时间 | 49分钟 | 46分钟 | −3分钟 | 共释放20小时,不是自报推算的约133小时 |
| 复核后重新打开 | 72/400 | 104/400 | +8个百分点 | 返工恶化 |
| 从来源就绪到发布的第90百分位周期 | 4.8天 | 3.6天 | −1.2天 | 长尾周期缩短 |
| 准时活动页 | 342/400 | 366/400 | +6个百分点 | 运营结果改善 |
为了看页面内容是否影响客户行为,团队另选120个高流量库存单位,为同一商品制作经人工签署的人工版与AI 辅助版,访客随机看到其中一版;价格、库存、图片和促销保持相同。AI版120,000次合格会话有9,000次加购,7.50%;人工版118,000次有8,732次,7.40%。差0.10个百分点,但粗略95%区间约为−0.11到+0.31个百分点,仍包含无提升;不能写“转化提升1.35%已验证”。
试点工具、平台、运营和训练的持续成本为¥44,880,20小时按内部规划价¥220/小时只对应¥4,400容量信号;而项目发现、双版本制作与评估投入420小时另列。结果不是“AI无价值”,而是价值形态与原假设不同:周期和按时上线改善,返工变差,转化仍不确定。团队只在结构稳定的配件品类继续,先修主张/来源核验和返工,再收集下一批证据。
这是一个虚构教学案例,所有公司、商品、流量、费用、比例、实验和结果均为教学数据,不是电商行业基准或供应商案例。本文解释怎样测企业AI的价值证据,不提供统计、财务、审计、法律或产品合规结论;显著性、货币化、数据用途和实验伦理应由相应专业人员判断。E36讲90天推进,本文从评估问题出发;E40另讲何时因价值与责任债务退役。
先拆开六个经常被混用的词:采用、产出、效率、效果、价值与投资回报不是同一层
采用回答谁在什么合格任务中实际使用;产出回答生成或签署了什么;效率比较完成同一最终结果所需资源;效果看周期、质量、客户行为与风险是否改变;价值将这些变化放回组织目标和替代用途;投资回报率才把可归因收益与完整投入按明确期间货币化。任一上游指标可以改善,而下游结果不变甚至变差。
| 概念 | 分子或证据 | 有效主张 | 无效捷径 |
|---|---|---|---|
| 采用 | 符合条件的分配中有多少实际使用 | 工作流实际被使用 | 使用等于收益 |
| 输出 | 已签约内容包 | 产出工作成果 | 更多文本等于结果 |
| 效率 | 每个相同业务结果所需资源 | 相同任务消耗更少资源 | 把生成延迟当成人工时间 |
| 效果 | 质量、周期、客户行为和风险变化 | 结果在特定情境中发生变化 | 前后对比直接证明因果 |
| 价值 | 结果的实际用途减去危害与成本 | 与决策相关的贡献 | 把所有分钟都货币化 |
| 投资回报率 | (可归因现金收益−总成本)÷总成本 | 范围限定的财务估算 | 自报节省时间×工资 |
采用率低,可能来自访问、培训、任务不适合或用户作出安全拒绝;采用率高,也可能来自强制默认。产出增加会制造更多复核与库存。只有最终结果、质量、案例组合和测量边界相同时,效率才可以比较。投资回报率若忽略建设、数据、复核、风险、维护和被挤出的工作,只是一个看起来精确的分数。项目先决定要作什么业务决定,再选择需要的指标层级,不以收集所有指标为目标。
六层之间还要防重复计数。同一页提前发布带来的贡献若已进入加购或订单,就不能再把“提前天数×预计日销量”加一次;20小时若已用于120个旧库存单位,其价值先落在积压产出,不能同时按工资当现金节省。团队维护收益标识与父级结果,任何金额标出是否与另一项互斥、包含或尚待验证。汇总表允许保留不同单位,不强迫把风险、时间和客户体验全部换成人民币。
从概念到因果链:先说明AI怎样可能创造价值,再决定该测什么
先画变革理论:AI候选怎样经过人员、流程和市场条件才可能影响业务最终状态
本案例的因果链是:批准来源和规则进入候选生成,编辑验证来源并修改,复核人签署可发布包,页面按时上线,客户看到清楚准确的属性,搜索与选择成本下降,才可能影响加购、退货或咨询。每个箭头都有假设:文件完整、编辑有容量、库存可售、流量不被活动改变、文案确实是行为瓶颈。AI只作用于链的前半段。
| 链环 | 可观测证据 | 关键假设 | 替代原因 |
|---|---|---|---|
| 输入→候选项 | 原文位置与运行记录 | 当前已批准来源 | 过期的供应商数据 |
| 候选项→已签署内容包 | 编辑、拒绝和接受记录 | 复核人有能力验证 | 匆忙的批量审批 |
| 包→准时页面 | 发布时间戳 | 内容是瓶颈 | 库存延迟 |
| 页面→客户行动 | 分配的版本和会话 | 内容确实被看见 | 价格或促销 |
| 行动→业务贡献 | 订单和退货利润 | 库存和归因有效 | 季节与品类组合 |
团队在实施前写出支持与反驳证据。若草稿更快但复核队列未变,第一条成立、第三条未成立;若按时页增加但库存缺货,加购不会随之增长;若退货下降同时供应商换了产品版本,不能全归内容。变革理论不是美化路线图,而是暴露最脆弱的因果接口,并决定哪些中间指标与业务指标必须一起采集。
每条箭头附一张因果声明卡片:主张、机制、受影响群体、必要条件、支持样本、反证、替代解释、可观测窗口和负责人。以“更快页面提高加购”为例,反证包括页面已按时但流量不增、内容变体被看见但客户行为相同,以及库存缺货中断链条。项目在结果出来前写清什么会推翻假设,避免只寻找支持赞助人故事的证据。
价值评估从决策和时间窗开始:要回答继续、修复、扩展还是停止,而不是证明赞助人当初正确
评估章程写三次决策:第4周判断数据和控制能否继续,第8周判断流程试点是否扩大,第12周决定品类范围与下一期投入。不同问题需要不同时间窗:人工时间和返工数周可见,加购需要足够会话,退货可能跨30—60天,品牌与人员能力需要更久。不能因季度汇报截止就把未成熟结果填成零。
| 决策问题 | 证据窗口 | 负责人 | 可行行动 |
|---|---|---|---|
| 工作流是否可用且安全 | 4周 | 内容与控制负责人 | 停止或修复 |
| 流程是否改进 | 8周 | 运营负责人和分析师 | 缩小或扩展 |
| 客户结果是否改善 | 会话加30天 | 商务负责人 | 暂不作主张或延长测试 |
| 成本是否可持续 | 试点期加未来预测 | 财务与服务负责人 | 重新谈判或限制范围 |
| 范围是否应扩大 | 所有指标的分层结果 | 项目发起负责人 | 停止、限制或扩展 |
评估团队独立记录不利结果,赞助人不能在看到加购差异不确定后把主目标改成“员工喜欢”。指标可因学习而更新,但原指标、理由和结果保留。每项结果标为观测、估算、已建模或尚未可观测;尚未到时间窗不等于没有风险或没有价值。决策备忘录可以合法写“证据不足,延长”,不强制二元成功/失败。
证据成熟度也写进时间表:只有完整事件日志和可对账分母是第一级;加入可比对照是第二级;具备预先登记的反事实和不确定性分析是第三级;能够跨时间和品类复现是第四级。本案例的人工时间差达到第二级,加购实验接近第三级,退货与长期毛利仍处于尚不可观测或只有初步记录的阶段。决策者看到的不是一个“数据已收集”勾选,而是每个主张能承受多大范围的资源承诺。
指标树至少有投入、使用、输出、过程、业务、风险和机会七层,并为每项固定分母
指标树从业务最终结果向上反推:商品页要准确、及时地帮助客户选择,而不产生不实主张。页面数只是输出;完整属性、周期、加购、规格咨询和退货才逐步接近业务结果。每个指标登记定义、分子、分母、事件起止、数据源、延迟、负责人、分层维度、护栏与触发决策,防止团队各自算一版采用率。
| 层级 | 已填充指标 | 分母 | 护栏 |
|---|---|---|---|
| 投入 | 工具、平台和人员¥44,880 | 试点期 | 包含复核与运营 |
| 使用 | 352 使用了 AI | 400 已分配合格者 | 报告未使用情况 |
| 输出 | 800个已签署内容包 | 800个已分配库存单位 | 没有未签署内容发布 |
| 流程 | 人工时间、重新打开、第90百分位周期 | 所有已分配库存单位 | 同一最终状态和事件口径 |
| 业务 | 准时发布、加入购物车 | 分配页面与会话 | 库存和价格保持平衡 |
| 风险 | 无依据主张、规格咨询 | 主张与已发布会话 | 严重问题用绝对数 |
| 机会 | 旧积压已完成 | 已验证释放容量 | 无假设分钟数 |
仪表盘先显示分母和缺失,不用只显示百分比。352/400是分配采用率 88%,若只除以“打开工具的人”会变成100%并隐藏48个未使用。风险用绝对严重和速率并列,低流量不能让零事件看起来安全。金额保留币种、期间与现值假设;跨季度比较时注明价格、人员与流量变化。
可复制的指标定义卡片至少要有指标编号、业务问题、公式、单位、分子、分母、符合条件与排除条件、开始与结束事件、来源、延迟、分层维度、负责人、质量检查、护栏和对应决策。例如,“第90百分位周期”的开始事件是来源包就绪,结束事件是匹配的发布回执,排除只允许事先列明的供应商取消;若用“任务创建”或“模型完成”替换任一端,必须新建指标版本,不能覆盖历史。
流程价值要用同一业务结果测量:采用、时间、返工和周期必须放在一起看
采用率要以合格分配为分母,并区分分配、尝试、有效使用、签署和重复使用
400个AI 分配的商品库存单位中352个发起生成,332个进入人工复核,296个最终保留了部分候选;36个在复核后完整拒绝,另20个已尝试但未到复核(10个运行失败、10个任务撤回)。还有48个根本未尝试:18个来源未准备、12个编辑选择人工、10个账号/入口未就绪、8个实际越范围。系统默认生成不算用户主动采用;“接受至少一段”也不代表页面价值。
| 采用状态 | 库存单位 | 比率与 400 | 解释 |
|---|---|---|---|
| 已分配且符合条件 | 400 | 100% | 按原分配分析的分母 |
| 尝试生成 | 352 | 88% | 访问和使用信号 |
| 进入复核 | 332 | 83% | 工作流完成 |
| 部分候选项保留 | 296 | 74% | 非价值证明 |
| 大幅编辑或拒绝 | 190 | 47.5% | 工作量和适配信号 |
| 下一批次再次使用 | 268 | 67% | 持续使用信号 |
主分析仍比较400对400,避免只分析296个成功使用者产生选择偏差。按方案结果可以解释机制,但必须标为次要:愿意使用、来源齐全和简单库存单位本来就可能更快。采用下降若来自系统正确暂停高风险主张,不能作为负面价值;采用上升若因经理要求全部接受,也不能作为正面价值。用户反馈与事件日志一起解释原因。
48个未使用不能简单归为“员工抗拒”。访问检查清单逐项核对账号、来源完整、工具可用、任务合格、培训分配和人工替代;10个账号或入口问题进入访问缺口,18个来源未准备进入流程缺口,12个主动选择人工的案例需要阅读原因,8个实际超出范围的案例应从未来合格定义中修正,但仍留在本次按原分配分析中。另有10个已发起但失败的运行进入可靠性分母。纠正未来分母要形成新版本,不能回溯删除不利案例。
时间测量必须覆盖同一业务最终状态:生成1分钟不是从原来的49分钟直接减20分钟
编辑自报节省来自最显眼的草稿动作:对照组写作21分钟,AI生成约1分钟,表面少20分钟。但AI路径需要用12分钟把来源整理成可引用输入,而对照组只需9分钟;验证需要13分钟而不是8分钟,另外还有8分钟编辑、7分钟复核和平均5分钟重新打开修正。最终46分钟只比49分钟少3分钟。机器等待与人工处理分开,日历周期另算。
| 任务步骤 | 对照均值 | AI 分配均值 | 原因 |
|---|---|---|---|
| 来源与输入准备 | 9分钟 | 12分钟 | AI路径要求更严格的来源绑定 |
| 初稿或生成 | 21分钟 | 1分钟 | 最显眼的名义节省 |
| 属性与主张验证 | 8分钟 | 13分钟 | 候选项必须逐项检查 |
| 编辑与结构整理 | 0分钟 | 8分钟 | 对照组的起草时间已经包含编辑 |
| 正式复核 | 7分钟 | 7分钟 | 两组没有变化 |
| 重新打开后修正 | 4分钟 | 5分钟 | AI组返工更多 |
| 总计 | 49分钟 | 46分钟 | 观测差异为−3分钟 |
计时来自工作流事件,并用20%的分层观察样本校准,不依赖一句“你省了多少”。并行等待不相加,编辑切换任务的空白不随意算作AI成本;但为AI额外查来源、修改主张和报告问题必须计入。中位数和第90百分位要单列,平均数不能掩盖复杂产品。若最终质量不同,时间差先按质量调整,不能把少做检查称为效率。
观察模板每15秒不记录员工屏幕内容,而按预定义任务代码记录开始、暂停、等待、交接和完成;参与者知道用途、可见人、保留期与申诉渠道。速度不是人员绩效排名,慢可能来自复杂来源或正确发现风险。抽样覆盖不同班次、经验与品类;观察者影响、多人协作和后台任务写进备注。日志与观察差异超过20%时先审测量,而不是择取更好看的数字。
返工要追到谁在什么阶段重新打开什么对象,不能只统计最终页面是否发布
控制有72/400在正式复核后重新开启,18%;AI组104/400,26%,多32件/8个百分点。AI返工集中在主张范围 34、属性/来源冲突28、模板语气18、重复/缺字段14、其他10;这些类别互斥合计104。部分返工发生在发布前,是控制成功但仍消耗容量;发布后返工后果更大,要另列。
| 返工类别 | AI 数量 | 已检测 | 负责人/操作 |
|---|---|---|---|
| 主张范围夸大 | 34 | 复核人在发布前发现 | 拒绝并完善来源规则 |
| 属性或来源冲突 | 28 | 编辑与复核人 | 解决来源优先级 |
| 语气或模板不匹配 | 18 | 复核人 | 完善模板约束 |
| 重复或缺失字段 | 14 | 数据结构检查 | 修复解析器或数据结构 |
| 其他受限编辑 | 10 | 复核 | 积压 |
| 总计 | 104 | 发布前或发布后标记 | 不要在最终完成时隐藏 |
“最终都改对”不能把104次返工归零。记录原始候选项、编辑差异、原因、执行者、分钟、检测阶段和已发布影响,才能判断是模型、来源、模式还是策略问题。返工率上升解释了20分钟名义节省为何只剩3分钟,也是限定品类的直接证据。若经理为降低重新开启率要求复核人不要重开,护栏会从指标优化变成风险隐藏。
返工还要按严重度和发现时点计算:发布前的小结构修改、发布前的关键暂停、发布后但尚无流量时修正、已有客户暴露后的纠正,不能等价计为一件。104件中若大多数是5分钟小改,容量影响有限;若一个错误主张影响十万次会话,就应优先看绝对后果。返工记录模板保存曝光开始与结束、受影响会话、回滚、通知与最终状态,让质量改进能追到真实影响,而不是只看工单数量。
周期指标用完整事件和分位数:第90百分位改善1.2天可能有价值,但要排除库存、批次和队列变化
周期从“全部批准来源已经到齐”到“收到已签内容的发布回执”,不从模型运行到草稿。对照组中位数为2.7天、第90百分位为4.8天;AI组中位数为2.3天、第90百分位为3.6天。长尾改善比均值更重要,因为活动页错过活动才有业务后果。团队还要拆分来源等待、编辑队列、领域复核和发布窗口。
| 周期指标 | 控制 | AI | 解释 |
|---|---|---|---|
| 来源就绪→首批候选的中位数 | 0.8天 | 0.6天 | 候选生成有所帮助 |
| 首批候选→完成签署的中位数 | 1.2天 | 1.4天 | 返工拖慢流程 |
| 完成签署→发布回执的中位数 | 0.6天 | 0.5天 | 发布批次调度也有变化 |
| 端到端第90百分位 | 4.8天 | 3.6天 | 多种机制共同作用 |
| 准时活动 | 342/400 | 366/400 | +24 页面 |
各阶段中位数与端到端第90百分位来自不同分布,不能相加推导全程。签署至发布的改善可能来自试点期间增加发布批次,不应全部归因于AI。评估记录两个组使用相同发布窗口的日期,并用流程访谈确认机制;仍无法完全隔离时,应写“AI与流程改造共同贡献”。按时页面多24个是观测结果,但是否创造销量还取决于库存和流量。周期价值不能直接按每小时工资换算。
团队同时报告未完成案例:观察窗结束时仍未发布的库存单位不能删掉,也不能假装在截止日完成,应保留为待定并用一致方法处理。供应商取消与内部延迟分开,对照组和AI组使用同一规则。第90百分位至少要同时给出样本数和分层分布,不能因平均改善就承诺每个库存单位都缩短1.2天。截止日期命中率要绑定原活动日期,事后改期不算按时。
转化评估要建立可比较的反事实:同一商品随机内容版本比拿本月对上月更可信
800个库存单位的流程对照适合测人工时间与返工,但不同产品的加购潜力差异很大。团队从中选120个预计流量足够、库存稳定的库存单位,分别制作人工版与AI辅助版,两个版本都完成人工签署;会话按稳定的访客标识随机分配,价格、图片、库存、促销和页面组件保持相同。机器人、员工、无库存和重复异常会话按预先登记的规则排除。
| 实验字段 | 场景 | 保护 |
|---|---|---|
| 实验单元 | 符合条件的商品详情会话 | 同一访客稳定看到同一版本 |
| 内容版本 | 同一库存单位的人工文案与AI辅助文案 | 两版均经人工批准 |
| 主要指标 | 加购次数÷合格会话 | 在查看结果前固定口径 |
| 护栏 | 规格咨询、跳出、稍后返回 | 不能只追求转化 |
| 样本 | 120,000次与118,000次会话 | 报告品类与库存单位差异 |
| 停止 | 严重误导性声明 | 立即移除变体 |
AI版9,000/120,000=7.50%,人工版8,732/118,000=7.40%,绝对差0.10个百分点、相对差约1.35%。粗略区间包含0,且库存单位内聚类会影响不确定性,正式推断由分析人员按预注册方法完成。报告正确写“未观察到可确认的加购改善”,而非“AI提升1.35%”。观察窗不足的退货不提前货币化。
实验前用历史基准率、最小值得检测差异、库存单位聚类、预计流量与运行期做功率规划,而不是看到第一个正数就停止。每周可以检查安全护栏,主要转化结果要在约定日期统一读取,并按预先写明的方法修正;反复查看结果,再挑最好的一天宣布成功,会放大假阳性。120个库存单位中若某一品类流量过低,合并或延长必须按预先登记的规则执行,不能在看到结果后重新分组寻找显著子群。分析清单保留所有探索指标,并明确标为探索性。
业务结果、风险、机会成本和全成本必须同表出现,不能只货币化好消息
风险不是投资回报率表末尾的备注:既测已发生影响,也测被控制拦下的未遂事件与剩余暴露
AI组在发布前发现12个关键声明候选项,控制发现3个;这不表示AI造成12次客户伤害,因为全部被暂停,也不表示系统安全,因为分母和暴露不同。发布后严重误导主张两个组均为0,但零事件的样本不能证明未来风险为零。规格相关咨询按会话为控制 142/118,000=12.03/万,AI 156/120,000=13.00/万,差异需继续观察。
| 风险信号 | 对照组 | AI组 | 处理 |
|---|---|---|---|
| 发布前关键候选项 | 3 | 12 | 绝对复核放行门槛 |
| 已发布关键声明 | 0 | 0 | 保留停止规则 |
| 每万次会话的规格咨询 | 12.03 | 13.00 | 调查具体品类 |
| 发布后修正 | 11 | 17 | 同时看严重性与暴露面 |
| 因来源未知而保留 | 6 | 22 | 安全停止与容量信号 |
未遂事件进入风险登记册并估计若漏过的影响对象、可撤回性和修复成本,但不随意乘一个巨额“避免损失”制造收益。真正发生的退货、客服、纠正、通知和声誉成本按证据记录。风险负责人可以因一个严重破坏停止,即使平均转化显著提高;财务负责人不能用期望收入覆盖未经授权主张。
风险货币化需要概率、暴露与损失都有依据,并单独展示区间;极低频高影响事项更适合用门槛、场景和残余风险接受,而非塞进期望值后被平均。12个被拦候选项主要说明当前模型/来源的失败模式和复核负荷,不证明12次事故必然发生。若控制成本太高,合法选择是缩小AI 范围,而不是把未遂事件改名为“创造价值”。
机会成本只计算被真实重新分配的稀缺容量:空出的20小时若消失在会议里,价值仍是零
20小时的观测人工时间差是容量信号,不是现金。若没有减少加班、延后招聘、增加高价值产出或降低排队,它不会自动进入利润表。团队为释放时间指定了新的用途:编辑要修复旧目录中的缺失属性,不能默认把时间吸收进“做更多AI实验”。事件记录显示,实际有16小时用于修复120个旧库存单位,另有4小时被临时会议占用。
| 已释放容量路径 | 观测 | 证据 | 价值处理 |
|---|---|---|---|
| 旧属性积压 | 16小时,用于120个库存单位 | 任务回执 | 运营产出 |
| 避免加班 | 0小时 | 薪资 | 无现金收益 |
| 招聘延迟 | 无决策 | 人力规划 | 不计入 |
| 额外活动页面 | 计入准时指标 | 发布回执 | 避免重复计数 |
| 未分配或会议 | 4小时 | 日历与任务缺口 | 零价值 |
120个旧库存单位被修不等于销售提升,需要观察搜索曝光、咨询与转化,并避免与SEO项目重复归因。若组织把AI节省全部填满更多低价值内容,吞吐增加但机会价值可能低于复核成本。负责人在试点前给释放容量排优先级,月底以回执核对;未落地的“理论可节省”只保留为场景,不进入已实现收益。
容量登记给每项释放时间唯一状态:理论、观测、已分配、已使用、现金已实现或已过期。只有减少付费加班、取消外包或延后已批准招聘才可能成为近期现金;转去高价值任务是非现金容量,需另证结果。若员工因监测压力少报返工,时间数据会失真,因此经理不得把个人“节省率”设绩效目标,评估看流程层分布。
全成本按一次性、持续、按量、人员、风险和退出六类登记,不能只看模型账单
持续试点成本¥44,880由工具与供应商¥12,800、平台与可观测性分摊¥18,000、培训与运营64小时×¥220=¥14,080组成。项目发现、数据准备、双版本内容、建设、评估和治理共420小时,是一次性投入,要单列并说明其中多少可以复用;人工处理时间已经进入流程比较,财务模型要避免与64小时运营投入重复计算。
| 成本类别 | 试点金额 | 未来行为 | 负责人 |
|---|---|---|---|
| 供应商与工具 | ¥12,800 | 随使用量与模型变化 | 服务负责人 |
| 平台与可观测性 | ¥18,000 | 部分固定 | 平台财务 |
| 培训与运营 | ¥14,080 | 随队列与变更变化 | 内容运营 |
| 一次性项目 | 420小时 | 沉没投入与可复用资产并存 | 发起人 |
| 事件与风险 | 只记录实际观测 | 不确定且可能有长尾 | 风险负责人 |
| 退出与迁移 | 尚未发生,保留估算 | 依赖使用范围 | 系统负责人 |
20小时×¥220=¥4,400只是按内部规划价估算的容量,不是工资现金流;44,880−4,400=¥40,480的持续成本缺口也不能直接判失败,因为周期、按时发布、风险和学习尚未全部货币化。报告分别列现金、容量、未货币化结果与不确定性,禁止把同一24个按时页面同时算工时、机会收入和转化三次。
未来成本用数量×单元、固定平台、每次变更、周期性评估、人员复核与退出六个驱动因素建基准/下行/上行,而不把试点单价线性外推。规模可能摊薄固定成本,也会增加复杂品类、支持和事件。财务模板列价格日期、合同最小消费、汇率、税、内部率、折现期间与敏感性;无法确认的供应商价格标待核验,不在文章中制造永久报价。
评估设计采用分块随机、意向治疗和嵌套页面实验,并预先写污染与停止规则
流程层的随机单位是库存单位内容包,按编辑、品类、价格区间和活动批次分层后各分配400个;系统路径决定是否提供AI,避免编辑主动挑选简单案例。主分析按原分配计算,用来估计“部署这套可用路径”的整体效果;按实际使用的分析只用于解释机制。编辑同时处理两组会产生学习影响,但也能让两组人员能力保持均衡,因此记录处理顺序并做敏感性检查。
| 设计风险 | 预防 | 剩余限制 | 报告 |
|---|---|---|---|
| 选择偏差 | 分块后随机 | 分配后仍可能排除 | 按原分配分析并报告缺失 |
| 组间影响 | 按库存单位路由并记录工具访问 | 编辑会从另一组学习 | 做敏感性检查 |
| 产品组合 | 分层分配 | 仍有小样本层 | 报告分层与不确定性 |
| 同期变更 | 两组共享发布窗口 | 库存与搜索优化也会变化 | 只作贡献说明 |
| 新鲜感 | 观察12周 | 行为可能随时间衰减 | 持续跟进 |
| 指标挖掘 | 预先登记主要实验和对照组 | 仍会产生探索指标 | 明确标为探索性 |
嵌套120 库存单位实验用于同商品客户行为,不把流程随机结果直接外推转化。若随机化不可行,才选择匹配、差分或基于理论的贡献,并明确更强假设。实验不能为了测价值发布已知不安全版本;两版都过同一质量与权限门槛,严重立即下线。受影响用户、数据收集、隐私和实验治理按组织要求处理。
方案在分配前冻结假设、实验单元、试验组、分层区块、主要结果、护栏、最小时间窗、剔除、缺失、不合规、分析、停止和批准规则。分配失败仍按原分支分析,并另报可靠性;交叉使用与人工绕过都要保留。紧急安全停止可以提前,但商业结果不能随意提前读取。若业务无法接受随机分配,评估负责人应记录原因和次优设计所依赖的假设,而不是把普通前后对比假装成等价实验。
测量数据需要一条从分配到业务结果的最小链,并允许审计分母与缺失
事件数据结构用实验编号、库存单位编号、分配结果、是否合格、是否尝试、来源包、系统与策略版本、人工决策、人工时间、重新打开、发布回执、会话版本、业务结果和风险事件连接全链路。个人层只收集完成评估所需字段,学习用途与绩效用途分开;访问、保留、更正和删除由数据负责人批准。
| 事件 | 最小字段 | 验证 | 失败状态 |
|---|---|---|---|
| 分配 | 库存单位、分层区块、组别、时间戳 | 不可变路由 | 未分配 |
| 运行 | 来源、版本、输出编号 | 来源存在且为当前版本 | 无效输入 |
| 复核 | 选择、差异、原因、分钟 | 操作者与授权方 | 尚未签署 |
| 发布 | 页面、版本、回执 | 匹配已签署内容包 | 不匹配 |
| 会话 | 库存单位、内容版本、资格 | 稳定分配 | 剔除原因 |
| 结果与风险 | 操作、时间窗、严重程度 | 去重并处理迟到数据 | 待处理 |
仪表盘每天对账已分配=已发布 + 手动 + 保留 + 待处理,不能丢掉失败案例;流量分母说明机器人、缺货与异常排除。延迟事件在窗口关闭后进入修订版,不偷偷回填旧报告。若无法从加购追到变体或从页面追到签署包,就降级相应主张;数据链断裂不能用人工Excel补一个漂亮比率。
数据质量检查表每天抽查唯一性、完整性、时序、组别一致、版本匹配和迟到率;每周用10个案例从分配重放到结果。标识符映射由受限服务管理,分析表只使用必要编号。事件结构变更时先并行写入新旧字段并对账,旧字段要有下线日期。缺失按原因分组,若两组缺失不平衡就必须进入主报告;“系统没记录”不是自然零值。
用一个完整案例和平衡账作决策:平均值不能掩盖复杂品类的负面价值
完整走例SKU-E842:一句“IP67防水”省下写作,却增加14分钟核验并被正确暂停
库存单位SKU-E842是一款户外网关。批准输入包括产品主数据第5版、供应商规格S-8和实验附件L-2;供应商营销表另写“IP67防护外壳已测试”。AI把三处文字合成“整机达到IP67防水,可在户外长期使用”,并引用L-2。编辑打开原文位置后发现,L-2只测试实验样机的外壳,产品主数据中的防护等级仍为状态未知,且安装条件没有定义;这项主张不能从原型外壳迁移到量产整机。
| 步骤 | 输入与证据 | 决策 | 价值记录 |
|---|---|---|---|
| 分配 | AI组、来源包第5版 | 符合条件 | 保留在原分配分析中 |
| 候选项 | “设备IP67防水” | 1分钟生成 | 只有输出,没有业务价值 |
| 证据检查 | 主数据未知,对比营销材料 | 来源冲突 | 增加8分钟验证 |
| 实验室范围 | 仅测试原型外壳 | 声明范围不匹配 | 增加6分钟领域咨询 |
| 复核 | 移除IP67,标记状态未知 | 暂存并采用安全措辞 | 未遂事件 |
| 发布 | 无绝对承诺 | 签署收据 | 无重大影响 |
这条案例比人工多14分钟,表面效率为负,但防止未经证据的外部主张。不能把假设中的退货或罚款全算“避免损失”,只记录未遂事件、复核成本和暴露对象;也不能因它拖慢就删除控制。对照是一条标准HDMI线,来源字段一致,AI候选只需小改,实际省11分钟且无重新开启。分层结果因此决定结构稳定配件继续、复杂防护等级品类暂停。
SKU-E842的价值案例表同时留下负面价值:候选项生成只需1分钟,核验与咨询却多花14分钟;已发布关键问题为0,记录未遂事件1件,客户行为没有发生。若只展示安全发布,会遗漏效率成本;若只展示多14分钟,又会遗漏阻断作用。完整工作表让业务、风险和财务在同一对象上看见不同单位的结果,并由有权限的人决定是否让此类来源冲突继续进入AI路径。
把所有结果放入一张平衡账:一项变好、一项变差、两项不确定时,结论应是限定而非平均成绿色
800个内容包的结果可以闭合:对照组400个、AI组400个;AI组采用352/400,人工时间少20小时,重新打开多32个,第90百分位周期快1.2天,按时页面多24个。120个库存单位实验的238,000次合格会话可以闭合为120,000+118,000,加购17,732次可以闭合为9,000+8,732。风险表显示发布前险些出错与发布后修正,不混入转化分母。
| 价值维度 | 结果 | 置信度 | 决策权重 |
|---|---|---|---|
| 采用 | 352/400已尝试 | 高,来自运行记录 | 只解释使用机制 |
| 人工容量 | 每个库存单位−3分钟,共20小时 | 中等,来自已观测样本 | 适度正面 |
| 返工 | 重新打开增加32个,即+8个百分点 | 高 | 负面 |
| 周期与准时 | 第90百分位−1.2天,按时页面+24 | 中等,发布批次同期变化 | 正面贡献 |
| 加入购物车 | +0.10个百分点,区间包含0 | 证据不足 | 不作价值主张 |
| 风险 | 12个关键候选项已暂存,已发布为0 | 未来风险仍有限可见 | 保留放行门槛 |
| 持续成本 | ¥44,880,对比¥4,400容量估算 | 试点期证据较高 | 负现金流或容量缺口 |
用权重求一个总分会隐藏严重边界和不同单位。决策先通过不可协商的风险门槛,再看业务结果与成本;无法货币化的周期改善保留原单位。若管理层仍需要财务场景,就给出基准、下行、上行三种情形和各自假设,不把中间场景冒充已观测投资回报率。当前证据只支持修复后限定继续,不支持全目录扩展。
决策规则先应用三道门:关键影响必须为0且可以恢复;目标分层的流程结果达到预先签署的门槛;持续资源有明确负责人和预算。通过后才比较增量业务证据与替代方案。稳定配件选择以25%流量继续,复杂设备暂停并重做来源管理,转化则继续收集证据。一个项目可以同时有三个不同状态,不需要为了汇报统一成“成功”。
分层看“对谁、什么任务、在何种条件下有效”:总体平均会把配件收益与复杂规格风险互相抵消
按来源一致性分层:220个结构稳定配件的AI组人工时间比对照组少9分钟,重新打开率为14%;180个复杂设备的时间有增有减,平均反而多4分钟,重新打开率为41%。编辑经验、源文件完整度、主张数量和品类共同影响机制。小样本层只作描述,不用过度精确的数字给人员排序。
| 分层 | AI组数量 | 人工时间差异 | 重新打开 | 处理 |
|---|---|---|---|---|
| 稳定配件 | 220 | −9分钟 | 31/220=14.1% | 继续但限制范围 |
| 复杂设备 | 180 | +4分钟 | 73/180=40.6% | 暂停并重新设计 |
| 来源完整 | 318 | −6分钟 | 60/318=18.9% | 继续监控 |
| 来源冲突或状态未知 | 82 | +15分钟 | 44/82=53.7% | 转专家或人工 |
这些行是两套不同的分层,不可横向相加:前两行按品类互斥,合计400;后两行按来源状态重新切分,也合计400。限定范围要写进路由与身份权限,而不是停留在培训口头提醒。若下一期通过来源注册表改善了复杂设备,就重新做随机对照,不能把配件结果直接继承过去。
细分决策卡记录定义、样本、影响、不确定性、风险、容量、负责人、允许操作、过期和重入测试。禁止只选表现最好的事后子群:稳定配件是预先登记的品类层,其他新发现只生成假设。还要检查效果是否集中于少数资深编辑;若新人需要更多核验,扩量先补流程与培训,不把平均收益承诺给所有班次。
归因报告必须列替代解释、数据缺口和能说到哪一级:观察到、贡献、因果与模型推演分开
周期改善与发布批次增加同时发生;按时率也可能受库存到货影响;采用者可能更熟悉工具;高流量库存单位实验虽采用随机分配,但内容版本制作过程仍可能存在不可见差异。报告为每项主张写替代解释与反证。流程层的按原分配随机分析支持较强的工作流差异判断;页面会话随机分配支持估计内容版本对加购的影响;旧库存积压与后续搜索效果只能说存在贡献或尚未验证。
| 声明层级 | E37 示例 | 允许措辞 |
|---|---|---|
| 观测 | AI组人工时间46分钟,对照组49分钟 | “观测到3分钟差异” |
| 因果估计 | 随机内容版本的加购率+0.10个百分点 | “估计仍不确定,区间包含0” |
| 贡献 | 周期在AI和发布批次同时变化时改善 | “两者共同贡献是合理解释” |
| 模型推演 | 未来每月18个库存单位的容量 | “仅在结构持续时成立的情景” |
| 假设 | 避免声誉损失 | 不予商业化 |
如果没有可靠反事实,使用变革理论、过程证据、访谈、版本追踪和替代原因做贡献分析,也不能声称精确因果。分析代码、排除规则、数据集版本和不利结果可复原;小样本、迟到数据与多重探索明确披露。业务负责人签的是基于当前证据的决定,不是对永恒价值的证明。
意外结果进入专门日志:谁受影响、变化方向、发现渠道、是否与AI有关、需要怎样追踪。员工额外认知负荷、供应商内容趋同、客户对语言的信任变化和下游搜索行为,都可能不在原来的业绩指标中。定性访谈不能给出效应量,却能发现指标树缺口;定量没有变化也不能证明体验没有影响。多种证据矛盾时保留冲突,并设计下一次能够区分原因的试验。
交付一套持续价值运营包:指标必须连接负责人、触发器和停止/扩展动作,而不是季度展示后归档
价值仪表盘按周看分配、人工时间、重新打开、周期、风险与成本,按月看业务结果和案例组合,按季度重审变革理论和替代方案。每个指标预先连接动作:出现关键的已发布错误声明就立即停止;复杂设备重新打开率超过30%就转人工;配件的第90百分位周期与来源完整度稳定后才扩;转化证据不足则继续实验,不写收益。指标本身也要被审计,防止分母漂移和为了指标而扭曲行为。
运营节奏包含每周指标质量复核、每月价值决策、每季度独立挑战;放行、源注册表、价格、品类组合或工作流改变触发重新评估。价值负责人不能与产品采用目标只设同一人而没有挑战。过期指标、无负责人收益和无法复原的金额从仪表盘撤下而不是永久累计。运行手册写明数据失败时报告如何降级、谁能暂停以及历史结论何时失效。
| 交付物 | 最低内容 | 接受 |
|---|---|---|
| 价值问题与决策章程 | 负责人、时间范围、可选行动 | 目标不是“证明投资回报率” |
| 变革理论 | 因果连接、假设、替代解释 | 利益相关方能够提出质疑 |
| 指标登记册 | 公式、分母、来源、护栏 | 可以复现 |
| 评估协议 | 实验单元、分配、排除项、分析 | 查看结果前冻结 |
| 平衡账簿 | 结果、风险、成本、机会 | 没有重复计数 |
| 分层决策 | 按条件继续或暂停 | 在路由中强制执行 |
| 监控与变更计划 | 节奏、负责人、触发条件、重新评估 | 交给运营团队持续执行 |
来源边界:英国财政部 2026版紫皮书用于变革理论、反事实、实验/准实验与无法建立反事实时的基于理论的评估;其AI 干预影响指南用于AI结果可能广泛、不可预测、因群体而异以及基线/反事实的重要性,并支持实验与基于理论的方法组合。GOV.UK 服务标准点 10和绩效数据指南用于从开始定义服务目标、分母与跨渠道指标并用数据改进。NIST AI RMF Core用于同时测成本、收益、部署情境、风险、生产监测与指标有效性;GAO AI 问责框架只用于治理、数据、性能、监控四类问责视角。上述政府框架不是澜序企业的适用法规或统一投资回报率标准;本文随机设计、阈值、货币和案例均为教学方法。来源核验于2026-07-22,NIST页面注明AI RMF 1.0正在修订。
- HM Treasury:Guidance on the Impact Evaluation of AI Interventions
- HM Treasury:Magenta Book 2026
- GOV.UK Service Standard:Define what success looks like
- GOV.UK Service Manual:Using performance data to improve your service
- NIST AI RMF Core
- U.S. GAO:AI Accountability Framework
今天不要先向员工收集“AI帮你省了几小时”。选一个有清楚业务最终状态的流程,写下下一次继续或停止决定;把投入、分配、同一最终状态的人工时间、返工、周期、业务结果、风险影响与机会用途,各定义一个带分母的指标,再画出它们之间必须成立的因果箭头。先问哪条箭头最可能断、用什么反事实验证,价值评估才会从投资回报率装饰变成资源决定。