排序结果不是一张1—18名榜单
岚桥物流有1,480名员工、12个运营站点。E01式盘点得到18个AI候选:业务呼声最高的是“自动批准运费发票”,演示效果最好的是“全公司物流知识助手”,客服想生成延误回复,报价团队想检查重量、区域和附加费。季度项目可用建设容量只有12人周,业务专家只能在固定窗口参与。
项目组没有让部门投票,也没有计算“价值25%+风险20%”总分。六道硬性放行门槛先把18项分成9项可比较、3项补基线、3项补数据治理、3项停止或重构。9项再按任务证据分入三类业务结果:客户结果、交易质量和低风险采用;最后选择延误回复草稿5人周、报价一致性检查4人周、会议行动包2人周,保留1人周处理评估缺口和意外。
| 决策输出 | 结果 |
|---|---|
| 候选项 | 18 |
| 通过所有准入门槛 | 9 |
| 准备基线 | 3 |
| 准备数据/权限 | 3 |
| 停止/重构 | 3 |
| 选定试点 | 3 |
| 建设容量 | 12人周 |
| 已承诺的试点工作量 | 11 人周 |
| 风险/未知缓冲 | 1 人周 |
得分最高并不等于最先做,低风险也不等于有价值。第一批组合要同时产生业务结果和组织能力:版本化知识/引用、结构化规则检查、真实使用者的人工确认与反馈。其余场景有负责人、缺口、下一证据和复核日期,不因未入选就从清单消失。
公司、任务、成本、样本和结果均为虚构教学案例。本文不是适用于所有企业的排序公式,也不替代安全、隐私、劳动、行业、采购、法律或财务判断;高后果场景须由相应专业人员与受影响方参与。
现状清单不能直接变成优先级
E01的27个工具或38类工作流只是现状清单,不能直接把“使用人数多”变成试点。一个常用会议助手可能无需新建AI项目,一个少见但昂贵的理赔任务可能值得先补数据;一个热门消费型工具也不代表企业应采购同类产品。
| 阶段 | 问题 | 输出 | 不应做的跳跃 |
|---|---|---|---|
| 盘点 | 谁在何处用什么处理什么 | 服务、工作流与数据映射 | 访问量=价值 |
| 形成候选任务 | 要改善哪个具体结果 | 任务级卡片 | 部门名=场景 |
| 准入 | 是否有条件安全学习 | 通过/准备/停止 | 高价值抵消硬性截止 |
| 比较 | 哪些证据更强、取舍是什么 | 多维记录、支配关系与不确定性 | 任意权重总分 |
| 组合 | 资源下怎样组合 | 选定集合 + 缓冲 | 排名前三自动入选 |
| 试点 | 怎样验证与停止 | 章程、评估与阶段门 | 演示=上线 |
本篇不选择具体模型、供应商或RAG方案;那是在场景任务、输入、评估和边界确定后的后续决定。若候选卡已经写“用某厂模型建智能体”,项目组先去掉解决方案,重新问当前任务与非AI替代方案。
先把“智能客服”拆成一项可判断的任务
“智能客服”可能是搜索政策、草拟回复、判断赔偿、发送邮件或直接创建退款,不能作为一个候选。延误回复被改写为:客服收到国内标准件延误询问后,系统从当前事件、公开追踪状态和有效服务政策生成带来源草稿;专员核对客户/运单/政策后手动发送,不判断赔偿、不承诺时限、不调用退款。
| 场景卡片字段 | 填写示例 |
|---|---|
| 触发者/触发器 | 客服专员收到国内标准件延误询问 |
| 业务结果 | 准确首答、减少重复来信,不是“生成文字” |
| 当前输入 | 客户来信、运单事件、有效政策版本 |
| 当前流程 | 查3个系统→判断状态→写答复→主管抽查 |
| 拟定的 AI 角色 | 检索/归并事实、草拟带引用回复 |
| 输出用途 | 内部草稿;专员手动放行 |
| 禁止 | 赔偿、退款、危险品处置、自动发送 |
| 基线 | 3,200件/月;实际处理时间9.6分钟;14%在七日内再次来信 |
| 负责人/评估者 | 客服运营负责人;3名资深专员 |
| 非 AI 替代方案 | 统一事件视图+模板/规则优化 |
| 故障恢复 | 发送前拦截;已发则更正/事件流程 |
任务合同暴露了一个重要问题:若主要时间花在三个系统切换,非AI统一事件视图可能比生成模型更可靠。试点可同时测试“规则模板+统一输入”和“AI草稿”,不能把所有改善归给模型。
宽场景拆分后数量可能增加,但比较对象更真实。“自动批准运费发票”拆成只读异常提示、证据汇总、审批建议和最终批准;前两项可候选,最后一项本轮停止。拆分不是绕过治理,而是把可逆学习与不可接受动作分开。
项目组还为每张任务卡附一份“最近五件工作”证据。提出人不能只描述理想流程,而要带来五个连续发生、未经挑选的实例,逐件标出谁触发、在哪个系统取数、出现过哪些人工判断、输出被谁消费、发生错误后怎样发现。延误回复的五件里有一件缺少到站扫描、一件客户同时询问赔偿;这立即证明“所有延误都能自动答”是假范围。报价检查的五件里有一份旧版附件、一份把公斤写成磅;这使单位转换、附件版本和人工定价成为明确测试,而不是上线后的意外。
任务合同另存当前非AI路径的成本与改善空间。延误回复可先比较三组:原流程、统一事件视图加固定模板、统一事件视图加AI草稿。若第二组已经把9.6分钟降到7.4分钟,而AI组只到7.2分钟,AI的边际贡献只有0.2分钟,并不拥有全部2.4分钟差值。报价检查也先执行确定性规则;模型只处理附件候选与冲突解释。这样既防止把接口改造功劳记给AI,也让项目在模型不通过时仍能交付可用的流程改善。
没有当前事实的场景只能进入“准备”
| 基线字段 | 延迟回复示例 | 来源/置信度 |
|---|---|---|
| 月度量 | 3,200 案例 | 12周工单日志 / A |
| 开始/结束 | 收到询问→首个有效回复 | 事件定义 / A |
| 实际处理时间 | 中位数9.6分钟 | 120件工单时间样本 / B |
| 队列周期 | 中位数 11.8小时 | CRM 时间戳 / A |
| 重复联系 | 14% 在...范围内 7 天 | 关联工单 / A |
| 事实修正 | 6.5% 抽样回复 | 质检样本 / B |
| 升级 | 18% | 工作流事件 / A |
| 专家容量 | 3 审查员×4每周工时 | 负责人承诺 / A |
A表示直接运行/责任证据,B表示有限样本或可复算估计,C表示工作坊意见;它不是风险或价值分。样本口径、日期与缺失保留。活跃时间的120件不能替代3,200总量,但能用于估计处理时间并做敏感性区间。
三个“准备基线”候选分别缺少翻译返工、销售跟进真实使用与需求报告下游决定记录。项目组给数据负责人两周补齐,不把“大家都浪费很多时间”写成年度百万元价值;若补不到,任务可能不值得为测量而建设。
基线也记录目前正确停止:客服把危险品或赔偿问题升级的比例不应因AI下降得越多越好。项目只追求无必要升级减少,必须分失败类型,不能把升级率当单向效率指标。
时间基线不只报一个中位数。120件样本按普通延误70件、资料缺失25件、赔偿或危险品升级15件、其他边缘10件分层,并保留P50、P80与最大值;3名观察员用统一起止定义,暂停等待客户回复的时间不计活跃处理,却仍计入周期时间。若工具只改善普通70件,项目不能把结果外推到全部3,200件。正式试点用相同分层权重回算总体,同时单列每层结果,防止总体中位数变好却把少数高后果任务拖坏。
返工也要建立事件链。一次客户再次来信可能来自回复错误、物流状态继续变化、客户没读邮件或本来就追问赔偿。160件编码样本由两名专家盲标,先约定“可由首次回复避免”的定义,再报告一致与分歧;无法确定的案例保留状态未知。只有可避免重复联系的比例下降,才支持草稿改善客户结果。把全部448次重复联系都归因于文本质量,会把上游物流波动误算成生成系统收益。
六道硬门决定能否进入试点
| 放行门槛 | 通过证据 | 未通过后的去向 |
|---|---|---|
| 业务负责人 | 能提供专家时间,并承担采用与停止决定 | 找到负责人或停止 |
| 限定任务/备选方案 | 触发、输出、非AI方案、禁止项 | 拆分/重写 |
| 可衡量基线 | 数量、时间/质量/结果有分母 | 准备数据 |
| 数据权属/就绪状态 | 负责人、目的、访问、版本可说明 | 治理/替换 |
| 可评估性 | 专家能对真实样本判通过/编辑/停止 | 建评分表/样本 |
| 遏制/可逆性 | 外部影响前能拦,且有恢复 | 重构只读/停止 |
六门必须同时通过。负责人愿意开会但不给专家时间不算负责人;文件存在但版本/权限不清不算数据就绪;一句“人工复核”若没有复核对象、证据、位置和留痕不算遏制。
放行门槛结果可随证据变化。设备异常编码因为历史标签不一致,先放数据治理;修完分类法与抽查后可重审。自动付款最终批准即使数据完整,仍因直接改变资金且本轮没有安全撤回设计而停止;只能重新定义只读异常提示。
每个放行门槛由证据负责人与质询评审人分别签字。业务负责人不能独自判定自己场景通过:数据门由资料负责人核对权利、版本和访问,遏制门由风险或运营人员实际演练错误输出怎样被拦,可评估性则由未来承担判定的专家确认样本量与评分标准。质询会议不讨论“喜不喜欢AI”,只问哪条证据能推翻通过。若客服界面没有强制展示运单号、事件时间与政策版本,审核者无法在处理量压力下发现错配,遏制就保持准备,而不是因为有人坐在屏幕前自动通过。
通过也带有效期。报价规则在费率季更新后重验数据与评估,人员任务在劳动政策改变后重验影响,资料许可或供应商处理地点变化后重验权利。候选记录写明有效截止日与重审触发器;过期证据不能复制到下一季度继续沿用通过状态。这个机制使优先级成为可更新的决策账本,而不是一次工作坊留下的永久排名。
18项候选都要留下决定理由和下一动作
| 候选任务 | 放行门槛结果 | 最大差距/下一步行动 |
|---|---|---|
| 延误回复草稿 | 通过 | 对比非 AI 模板 |
| 报价规格一致性检查 | 通过 | 产品主数据试点修复 |
| 会议行动包 | 通过 | 同意/负责人确认 |
| 理赔材料摘要 | 通过 | 禁止责任/赔付建议 |
| 供应商文件字段抽取 | 通过 | 许可/附件处理 |
| 异常原因编码建议 | 通过 | 监控分类体系漂移 |
| 维修记录标准化 | 通过 | 保留原始工程师备注 |
| 发票异常只读提示 | 通过 | 无审批/写入 |
| 路线方案解释草稿 | 通过 | 调度员拥有决策权 |
| 多语回复翻译 | 准备基线 | 建事实/术语返工分母 |
| 销售跟进 | 准备基线 | 记录真实发送与结果 |
| 周度需求报告摘要 | 准备基线 | 确认下游决策/使用 |
| 企业知识助手 | 准备数据 | 拆任务、版本、权限 |
| 司机语音摘要 | 准备数据 | 同意/留存/噪声样本 |
| 合同条款比较 | 准备数据 | 权利、专业评分标准、范围 |
| 发票自动批准 | 重构 | 只读异常/证据包 |
| 司机纪律建议 | 停止 | 人员权益/申诉与责任未具备 |
| 动态价格自动发布 | 重构 | 仅限内部建议 |
9+3+3+3=18。停止不是宣称任务永远不能用AI,而是本轮没有可接受上下文。重构产生新候选 ID并保留父子关系,不能把“自动批准”悄悄改名“辅助审批”却维持同一动作。
候选负责人要在决策记录中签收缺口和日期。两周后仍没有负责人或证据的准备项标为暂缓,不长期占据“下一批”制造虚假的候选池。
六个比较维度保留各自的证据单位
| 维度 | 记录 | 本组合中的强/弱含义 |
|---|---|---|
| 频率 | 月度量、峰值、用户 | 足以反复学习 与一次性任务对比 |
| 价值 | 结果链、基线、反事实 | 可测业务结果 对比 空泛潜力 |
| 标准化 | 输入/处理/输出/异常 | 稳定核心与无专家共识 |
| 数据条件 | 权利、覆盖率、质量、版本、访问 | 可操作使用与未知 |
| 可控性 | 错误检测、最终决定权、外部动作 | 发布前拦截与直接损害 |
| 可逆性 | 撤销、正确、补偿、时间窗口 | 影响前低成本与不可逆 |
| 证据置信度 | 按具体结论分A/B/C类 | 直接记录与研讨会观点对比 |
频率不设置跨企业通用的“3,000次=5分”;3,200封回复与290件理赔不能只比数量,因为单位、后果与专家时间不同。价值也分容量、周期、质量、客户、风险,不强行折成人民币;可以合理货币化时保留公式与范围。
标准化高只说明适合定义接口,不保证值得做;数据就绪也不保证允许用途;可逆性高不能抵消资料权利失败。维度是比较语言,不是互相兑换的积分。
为了让两名评审对“强或弱”有同一含义,每个维度附观察锚点。频率记录近12周分布与峰值,不接受年度总量除以12;价值至少连到一个有负责人的业务结果并列出替代解释;标准化要用双人独立标注测关键字段一致;数据条件要求随机样本覆盖、缺失和版本,而不是展示最佳文档;可控性必须用注入错误演练发现率;可逆性要写恢复动作、最长窗口、受影响对象和成本。评审仍可有判断,但分歧会落在可追问事实,而不是“我给4分、你给3分”。
多维对比还要保留表现最差的切片。例如整体资料覆盖92%,但新开站点只有71%,就不能只显示92%;报价附件总体占16%,若某地区达到43%,该地区必须单独限制或补修复。一个场景可以在普通分布上表现良好,却在峰值或特定人群上薄弱。组合选择使用最相关的运营切片,防止平均值把真正部署边界抹平。
价值必须连到业务结果和反事实
延误回复当前3,200件/月、抽样活跃时间 9.6分钟。若统一事件视图+AI草稿将中位数降到7.2分钟,容量差为3,200×2.4/60=128小时/月;低情境2,560件×1.2/60=51.2小时,高情境3,840×3.0/60=192小时。报告展示三种情境,不只展示128。
| 场景 | 基线结果 | 试点目标 | 价值链与保护指标 |
|---|---|---|---|
| 延迟回复 | 14%=448 重复联系 | ≤9%=≤288 | 减少重复联系;正确性不降 |
| 报价一致性 | 1,150×7.8%≈90 更正 | <3%=<35 | ≈55 减少更正循环 |
| 会议行动 | 340×13分钟≈73.7小时 | 7分钟≈39.7小时 | 约释放34小时容量;负责人/截止日期完整 |
| 理赔材料摘要 | 受理中位数42分钟 | 测试30—36分钟 | 不影响赔付或责任决定 |
| 发票异常 | 样本捕获率未知 | 离线基线优先 | 不把发现数当节省 |
报价“少55次返工”不能再乘0.7天宣称省38.5个工作日,因为返工可能并行,延迟也不是劳动时间。试点分别测更正循环、准时报价和客户等待;货币影响需要毛利/流失的额外因果证据。
会议行动约34小时只是释放容量,是否变成业务价值取决于行动完成、会议质量与时间去向。价值卡写负责人计划如何使用释放时间,90天后比较,不把模型生成分钟当收益。
试点经济记录采用“增量成本—可证实容量—结果变化”三栏。增量成本包含5人周建设、48小时客服专家、资料接口、评估运行、培训、支持和后续维护;容量只按实际采用率计算。若12名客服只在40%的合格案例中使用,即使每件节省2.4分钟,也不能按3,200件计算128小时。若处理时间下降但事实修改率从6.5%升到8%,项目先判定质量保护指标失败,不能把节省时间折价后仍宣布净收益为正。不同单位的结果保持并列交给负责人判断,不伪造一个统一投资回报率小数。
反事实由分阶段发布建立。前两周只优化统一输入和模板,取得非AI对照;随后在同类案例中交替显示模板或AI草稿,按站点、人员经验和案例难度分层。由于运营不是随机临床试验,报告明确排班、旺季与学习效应等限制,并检查两组基线是否可比。若无法可靠分组,就用中断时间序列加人工审计,并把因果置信度降级。优先级所需的是足以决定扩大、修改或停止的证据,不是把相关性包装成精确收益。
标准化要看稳定核心和异常分布
| 任务 | 稳定核心 | 异常证据 | 结论 |
|---|---|---|---|
| 延迟回复 | 事件 + 策略→草稿 | 补偿/危险品 | 核心稳定;人工路由 |
| 报价检查 | 单位/区域/附加费规则 | 协商例外 | 规则优先 + 例外复核 |
| 会议行动 | 行动/负责人/截止日期/状态 | 隐含承诺 | 草稿 + 参与者确认 |
| 异常编码 | 事件→原因分类体系 | 标签不一致 18% 抽样 | 通过修复/监控 |
| 知识助手 | “回答问题” | 任务/输出无界 | 非可比场景 |
专家一致性用样本测,不问“流程是否标准”。项目让三名专家独立标30例;若同一关键字段分歧高,先澄清评分标准或允许多个有效,不训练模型学习多数人的偶然习惯。18%的异常标签分歧让编码建议只能保留原事件与候选理由,不可自动写回主记录。
非AI规则也参与比较。报价的单位、区域和附加费校验高度确定,应先用规则引擎;生成模型只解释冲突或从非结构附件提取候选。把所有步骤标AI会增加不可预测性和评估负担。
30例专家一致性测试不只计算一个百分比。关键字段分成事实抽取、规则适用、例外理由和允许输出:三名专家对事实字段29/30一致,但对“协商费率是否覆盖燃油附加费”只有22/30一致,项目便把前者纳入规则检查,后者要求定价专家确认。分歧会议产生可版本化评分标准和反例,不强迫所有合理判断只剩一个标签。下一次规则或产品数据更新后,用原30例加新失败例回归,观察一致性是否因定义漂移而下降。
标准化还区分任务稳定与环境稳定。会议行动字段看似固定,但不同团队对“口头建议是否算承诺”理解不同;延误政策字段稳定,物流事件却可能迟到;维修记录模板固定,设备型号和缩写持续变化。因此卡片分别写稳定接口、允许变化、检测变化的方法与负责人。只有系统能识别超出已知分布并转人工,稳定核心才真正可用。
数据条件不等于“有很多文档”
| 数据问题 | 延迟回复 | 报价检查 |
|---|---|---|
| 负责人 | 客户运营/数据负责人 | 产品/定价负责人 |
| 来源 | 追踪事件、策略、客户消息 | 主数据、报价字段、附件 |
| 版本 | 保单生效日期 | 价格/附加费生效日期 |
| 权利/目的 | 客户服务目的已检查 | 商业数据已授权 |
| 覆盖率 | 92% 样本包含所需事件 | 84% 结构化;16% 附件 |
| 访问 | 按单个案件授予最小权限 | 按角色与区域访问 |
| 质量差距 | 缺失扫描/原因 | 单元别名/旧附件 |
| 回退 | 人工查询/升级 | 阻断 + 人工定价复核 |
92%/84%不是合格率:它们只描述本轮样本中可取到必需输入。缺失案例必须进入回退并计入分母;若产品只展示能检索的92%,会虚构性能。附件修复工作算入4人周,不当作免费前置条件。
数据准备还有时间窗口。今天当前的策略下月可能失效,试点保存输入版本和生效时间;访问权限从源继承,不建立一个全员可见副本。知识助手因任务过宽、版本和权限不清进入准备,而不是靠向量库演示越门。
风险可控与可逆性必须分开
| 场景或动作 | 影响前检测 | 最终决定人 | 恢复 | 当前边界 |
|---|---|---|---|---|
| 回复草稿 | 引用与事实复核 | 客服专员 | 发送前编辑 | 不自动发送,也不承诺赔偿 |
| 报价一致性标记 | 确定性不匹配 | 定价分析师 | 发布前修正 | 只读标记 |
| 会议动作草稿 | 参与者确认 | 会议负责人 | 修订会议纪要 | 无任务系统写入 |
| 理赔材料摘要 | 专家复核 | 理赔负责人 | 更正录入 | 不提出责任或付款建议 |
| 发票异常 | 离线/只读 | 财务审批人 | 调查/忽略 | 不批准/挂起/支付 |
| 司机纪律 | 错误可能影响权限 | 经理流程不足 | 申诉成本高/耗时 | 停止 |
| 动态价格发布 | 直接客户影响 | 定价负责人不在循环中 | 重新定价/通知成本高 | 内部重构 |
“人在回路”只有在审核者看到原始证据、知道检查标准、有时间、有否决权且动作尚未发生时才算控制。若系统一次生成500封回复,主管只抽5封,不能说500封都经过人工批准;若界面默认接受并隐藏状态未知,人工存在也可能只是橡皮图章。
可逆性记录恢复窗口和成本:草稿未发可删除重做;报价已发可更正但影响信任与交易;付款执行后还涉及追回、对账与供应商权益。项目先选择外部影响前可拦的形态,不把“事后能道歉”当高可逆。
不确定性要写进每个结论
| 具体结论 | 当前值 | 置信度 | 敏感因素或下一项证据 |
|---|---|---|---|
| 回复量 | 3,200/月 | A | 按季节峰值 |
| 活跃时间 | 中位数 9.6m | B, n=120 | 扩展至 240 抽样 |
| AI 目标时间 | 7.2m | C 假设 | 影子运行 |
| 重复联系原因 | 缺失事实导致 | B, 编码 n=160 | 盲编码 |
| 报价修正 | 7.8%, n=1,150 | A | 拆分错误类型 |
| 会议行动遗漏 | 9%, n=120 | B | 参与者确认 |
| 试点工作量 | 11人周 | B类估算 | 每周实际消耗 |
项目组不把目标与基线放在同一列称“预计节省”。目标在试点前是可证伪假设;输入量、采用率、人工复核与维护任何一项变化都会改经济结果。置信度C但风险低的任务可用小样本学习;置信度C且高后果的任务先补证据,不以试点替代必要治理。
决策记录保存反证。例如客服专家担心草稿让新人过度信任,会议负责人认为人工确认可能抵消节时;这两项成为评估和采用观察,不在讨论会后删除。排序质量取决于是否看见关键状态未知,而不是所有单元格都填满。
不算加权总分,先否决,再比较支配关系
流程分四步。第一,硬性放行门槛否决;第二,在相同通道比较是否存在支配——A在所有关键维度不差且至少一项证据更强,B就不应先占资源;第三,根据本季度明确目标按顺序看结果、控制、数据与努力;第四,用组合约束处理共同能力与专家容量。
admit(scene) = all(owner, task, baseline, data, eval, containment)
compare within same lane:
reject dominated alternatives
preserve trade-offs and unknowns; do not average them
portfolio constraints:
build <= 12 person-weeks
customer expert <= 60h
pricing expert <= 48h
new external-action pilots = 0
risk/unknown buffer >= 1 person-week
objective order for this quarter:
1) measurable customer/quality result
2) critical failure controllable before impact
3) reusable organizational capability
4) effort and adoption fit
字典序顺序在看候选结论前由指导小组确认。本季度优先客户首答与报价质量;下季度若战略是风险降低,顺序可能改变。公开顺序比任意权重更能解释为什么低分维度没有被高价值抵消,也允许不同管理目标产生不同合理组合。
支配只在相似结果通道使用。会议行动包与报价检查解决不同结果,不能说一个“全面支配”另一个;它们进入组合取舍。非支配前沿也不代表全做,只表示剩余选择需明确价值判断。
四个热门候选为什么走向四种结果
| 标准 | 知识助手 | 延迟回复 | 报价检查 | 发票自动批准 |
|---|---|---|---|---|
| 任务绑定 | 不通过:问题/输出不限 | 通过 | 通过 | 拆分后通过 |
| 基线 | 不通过:无统一任务 | A/B 证据 | A/B 证据 | 支付量 A |
| 数据 | 不通过:版本/访问 | 92% 覆盖范围 + 负责人 | 84% 结构化 + 负责人 | 财务数据就绪 |
| 评估 | 不通过:谁判所有答案 | 3 专家/160 个已规划案例 | 规则 + 定价专家 | 审批结果复杂 |
| 遏制 | 状态未知 | 发送前草稿 | 报价前只读 | 最终审批失败 |
| 处置 | 准备/拆分任务 | 候选项 | 候选项 | 仅重构异常 |
知识助手不是因为技术难而输,而是没有可比较任务;付款自动批准不是因为价值低,而是动作越过本轮风险容忍。延误回复与报价检查均通过,前者建立版本化证据与引用,后者以规则检查创造质量结果,两者可以共存而非争一个总分。
若用旧权重,付款自动批准可能凭2,100笔/月与高财务价值盖过可控性;知识助手可能凭“全员覆盖”得到高频率。硬性放行门槛让这些虚构优势不能进入加权计算。
12人周之外,还要计算专家与评估容量
| 容量 | 可用 | 选定需求 | 缓冲/状态 |
|---|---|---|---|
| 建设与集成 | 12人周 | 11人周 | 1人周缓冲 |
| 客户专家 | 60小时 | 48小时 | 12小时 |
| 定价专家 | 48小时 | 40小时 | 8小时 |
| 会议用户/经理 | 24小时 | 18小时 | 6小时 |
| 安全/隐私审查 | 28小时 | 22小时 | 6小时 |
| 评估运营 | 72小时 | 64小时 | 8小时 |
人周含设计、数据接口、评估、日志、运行手册与修复,不只写代码。报价附件16%非结构化的修复计入4人周;客服策略版本和检索准备计入5人周;会议包2人周也含同意、确认与反馈。把“已有平台”写成零开发会漏掉真正工作。
专家时间按节点预订,不能假设随时可用。若客户专家实际低于48小时,回复试点缩小样本或延长,不从评估删边缘案例;若安全复核出现高严重问题,1人周缓冲优先处置,不拿来加第四个场景。
三套可行组合不能只按候选名次选择
| 组合 | 项目构成 | 建设人周 | 共享能力 | 决定性权衡 |
|---|---|---|---|---|
| 已选 A | 回复 5+引文 4+会议 2+缓冲 1 | 12 | 证据/版本、规则、人工采用 | 平衡项 3 通道 |
| B 类运营 | 异常代码 4+维护 3+路由解释 3+缓冲 2 | 12 | 事件分类法、运营接口 | 标签分歧高 |
| C 类控制 | 理赔材料摘要4+发票异常4+供应商提取3+缓冲1 | 12 | 文档录入、只读控制 | 专家复核稀缺 |
组合B频率高,但异常标签18%的分歧会让首轮大量时间花在分类法修复上,可先保留为数据项目。组合C的风险控制价值强,但理赔与财务专家复核发生在同一月末窗口,专家容量冲突。组合A覆盖客户结果、报价质量与低风险采用,专家群体不同,且两项核心能力可供下一批复用。
A没有填满12人周。1人周是明确工作:未知来源修复、严重评估失败、日志或回滚;若第4周仍未使用,也只可用来扩回归样本/文档,不启动新试点。留缓冲是可交付性设计,不是低效。
三套组合还经过“拿走一个资源”的压力测试。若定价专家容量从48小时降到24小时,A不是让报价试点少评一半,而是把它保持离线、将4人周中的2人周转为主数据修复,并在下个窗口重审;若客服专家降到36小时,回复样本缩小使用范围但保留160件离线评估与20个停止案件。若安全审查发现共同身份控制缺陷,三个项目全部暂停相关实测,缓冲用于修复,不能把缺陷拆成三个低严重度事项。
项目组也记录被选择组合对下一批的真实期权价值。回复试点只有在产出可复用的源版本接口、引用评估集和权限测试时,才为知识类任务创造期权;报价试点只有沉淀规则负责人、变更通知和错误分类法时,才帮助发票异常。所谓公共能力必须列出接口、负责人、维护成本与第二个已确认使用者,不能用“平台化”给当前项目虚增价值。若共享承诺没有落地,季度复盘会下调下一批相关候选的数据条件。
入选三项在组合中承担不同角色
| 试点 | 组合中的角色 | 结果指标 | 共享资产 |
|---|---|---|---|
| 延迟回复草稿 | 客户结果锚点 | 时间、重复联系、事实编辑 | 来源/版本/引用/评估 |
| 报价一致性 | 交易质量锚点 | 更正循环、准时报价 | 主数据规则、问题反馈 |
| 会议行动包 | 采用/控制探测 | 负责人/截止日期、确认、使用 | 培训、放行、反馈 |
会议包价值低于前两项,却用2人周验证用户是否理解草稿、是否真正确认负责人/截止日期、支持是否可承受。若只做两个复杂后台试点,项目可能获得离线准确率却不知道真实工作如何采用。它不自动发送、不创建任务;参与者确认后才放行。
三个项目有独立负责人和停止,不打包成“一体化Copilot”。共同能力通过版本化接口复用;一个试点失败不自动拖停另两个,但跨客户资料或身份控制等共享控制失败会暂停全部相关场景。
开发前先填好延误回复试点章程
| 章程字段 | 承诺值 |
|---|---|
| 范围 | 国内标准件“运输中延误”询问;排除赔偿/危险品/丢失判定 |
| 用户 | 12 智能体;客户运营负责人;3 专家审查员 |
| 基线 | 3,200/月、9.6m 活跃、11.8小时周期、14% 重复、6.5% 事实编辑 |
| 来源 | 追踪事件、当前服务策略、客户消息 |
| AI输出 | 事实陈述与证据对应关系,加上回复草稿;不发送 |
| 评估集 | 160:100 正常、40 边缘、20 停止/升级 |
| 人工复核 | 身份、事件、策略引用、承诺、发送前的语气 |
| 成功 | 关键事实/承诺错误=0;引用支持≥95%;中间评审≤7.2m |
| 护栏 | 重复联系/事实修正不恶化;应升级案例 20/20升级 |
| 停止 | 跨客户数据、错误状态、伪造策略、不安全指令 |
| 恢复 | 禁用草稿、人工处理路径、影响范围发布、事件/变更评审 |
| 扩展 | 2 连续周通过 + 支持容量 + 负责人签字 |
95%是本案例对普通可纠正引用关系的试点门,不允许5%关键错误;20个停止案件必须20/20正确升级。模型草稿缩短时间却提高重复联系或压低正确升级,不通过。评审中位数目标是从9.6降至7.2分钟的假设,不是供应商保证。
样本按最近12周连续案例分层并去标识,不只挑资料完整的问题;缺事件、政策冲突、相似运单和社会工程文本进入边缘组。专家先独立标注,分歧由裁决记录,不把多数票自动当作唯一正确答案。
160件样本在开发前冻结案件 ID与分层规则,100件普通样本覆盖各站点和新人/资深人员常见流程,40件边缘样本覆盖缺扫描、状态倒序、政策切换日、同名客户与附件诱导,20件停止样本覆盖赔偿、危险品、疑似欺诈和跨客户资料。开发者可看训练/调试子集,但最终门禁子集由评估负责人保管;修复失败后新增该失败的邻近反例,不能反复调同一件直到通过。所有比例同时给分子、分母和95%门的具体定义。
人工复核不只计点击“接受”。日志记录专员是否打开原始事件、是否核对政策版本、修改了哪些事实或承诺、用了多长时间、最终发送/升级/放弃以及原因;界面把状态未知与引用缺失置于可见位置,不把AI文本设成无摩擦默认。每周抽取接受未修改、重度修改和放弃三组案例,由专家回看是否出现自动化偏见。培训强调系统是草稿工具,主管不得用接受率考核员工,否则采用指标会被组织激励污染。
八周阶段门允许扩大、限定、修正或停止
| 周 | 通用放行门槛 | 特定回复证据 |
|---|---|---|
| 1 | 锁定基线、任务和数据负责人 | 160件案例抽样计划 |
| 2 | 评分表/关键失败项已批准 | 专家裁决完成 |
| 3 | 离线系统 + 日志 | 来源/版本追踪有效 |
| 4 | 全面评估; 无外部显示 | 20/20 停止案例 + 关键 0 |
| 5 | 在真实分布上的影子 | 缺失数据/回退率 |
| 6 | 向12名用户开放受限界面 | 评审记录、编辑与支持 |
| 7 | 修复后的回退 | 无旧关键返回 |
| 8 | 结果/经济/事件评审 | 扩展/限制/变更/停止 |
报价评估有180份,其中60份带历史错误/边缘单位;会议有60场合成/获准转写,其中20场含隐含负责人或冲突到期。每项都保存正常、边缘、停止与反例,不能用同一“准确率”横比。
项目级结果要看12人周的实际消耗、专家小时、共同控制失败、支持负担与是否得到可复用资产;业务结果仍按各场景分母判断。试点没有达到门槛也可以有序关闭,只要清楚证明哪个假设失败、恢复人工流程、完成资料和访问退出,并更新候选记录。
复用这套排序方法,先写任务卡,再讨论组合
| 产物 | 最低内容 |
|---|---|
| 候选卡片 | 触发/输入/处理/输出/影响/负责人/替代方案 |
| 基线表 | 分母、开始/结束、时间/质量/结果、置信度 |
| 准入记录 | 六道门、证据、通过/准备/停止、下一负责人和日期 |
| 多维对比记录 | 频率、价值、标准化、数据、可控性、可逆性及未知 |
| 价值地图 | 驱动因素→变更→业务结果 + 反事实/敏感性 |
| 支配日志 | 同车道替代方案、为何被支配/未被支配 |
| 容量矩阵 | 建设、数据、专家、风险、变更与支持 |
| 方案选项 | 项、依赖、共享能力、权衡、缓冲 |
| 试点章程 | 范围/评估/人工/停止/恢复/阶段关口 |
| 决策记录 | 选定/拒绝/反证/复核触发 |
NIST AI RMF操作手册的“情境映射”部分建议定义任务、目的、最低功能、收益、预期环境、非AI替代方案、人工监督与潜在影响,也强调更窄的任务更容易映射收益与风险;“风险管理”部分支持根据评估决定是否继续部署,“风险测量”部分强调在社会技术环境中解释测试与指标。官方页面同时说明AI RMF 1.0与操作手册正在更新,本文只借鉴问题结构,不把六道门或12人周当成NIST要求。GOV.UK效益指南支持在早期建立经济模型、做敏感性分析、审查假设与交付成本,并用实际数据决定继续、改变或停止;这里只借鉴测量逻辑。ISO/IEC 42001官方概览用于说明AI管理系统的持续管理背景,本文不声称企业已经取得认证。
- NIST AIRC:AI RMF Playbook — Map
- NIST AIRC:AI RMF Playbook — Measure
- NIST AIRC:AI RMF Playbook — Manage
- NIST:AI Risk Management Framework
- GOV.UK:Measuring the benefits of your service
- ISO:ISO/IEC 42001 AI management systems
今天选一个最受欢迎的候选,删掉解决方案名称,把它写成触发、输入、输出、后续行动和非 AI 替代方案。若负责人、基线、数据权利、专家评估或外部影响前拦截有一项答不出,就把下一动作交给明确负责人,不打分;只有通过六门,才拿它与同一业务通道的候选比较。