排序结果不是一张1—18名榜单

岚桥物流有1,480名员工、12个运营站点。E01式盘点得到18个AI候选:业务呼声最高的是“自动批准运费发票”,演示效果最好的是“全公司物流知识助手”,客服想生成延误回复,报价团队想检查重量、区域和附加费。季度项目可用建设容量只有12人周,业务专家只能在固定窗口参与。

项目组没有让部门投票,也没有计算“价值25%+风险20%”总分。六道硬性放行门槛先把18项分成9项可比较、3项补基线、3项补数据治理、3项停止或重构。9项再按任务证据分入三类业务结果:客户结果、交易质量和低风险采用;最后选择延误回复草稿5人周、报价一致性检查4人周、会议行动包2人周,保留1人周处理评估缺口和意外。

决策输出 结果
候选项 18
通过所有准入门槛 9
准备基线 3
准备数据/权限 3
停止/重构 3
选定试点 3
建设容量 12人周
已承诺的试点工作量 11 人周
风险/未知缓冲 1 人周

得分最高并不等于最先做,低风险也不等于有价值。第一批组合要同时产生业务结果和组织能力:版本化知识/引用、结构化规则检查、真实使用者的人工确认与反馈。其余场景有负责人、缺口、下一证据和复核日期,不因未入选就从清单消失。

公司、任务、成本、样本和结果均为虚构教学案例。本文不是适用于所有企业的排序公式,也不替代安全、隐私、劳动、行业、采购、法律或财务判断;高后果场景须由相应专业人员与受影响方参与。

现状清单不能直接变成优先级

E01的27个工具或38类工作流只是现状清单,不能直接把“使用人数多”变成试点。一个常用会议助手可能无需新建AI项目,一个少见但昂贵的理赔任务可能值得先补数据;一个热门消费型工具也不代表企业应采购同类产品。

阶段 问题 输出 不应做的跳跃
盘点 谁在何处用什么处理什么 服务、工作流与数据映射 访问量=价值
形成候选任务 要改善哪个具体结果 任务级卡片 部门名=场景
准入 是否有条件安全学习 通过/准备/停止 高价值抵消硬性截止
比较 哪些证据更强、取舍是什么 多维记录、支配关系与不确定性 任意权重总分
组合 资源下怎样组合 选定集合 + 缓冲 排名前三自动入选
试点 怎样验证与停止 章程、评估与阶段门 演示=上线

本篇不选择具体模型、供应商或RAG方案;那是在场景任务、输入、评估和边界确定后的后续决定。若候选卡已经写“用某厂模型建智能体”,项目组先去掉解决方案,重新问当前任务与非AI替代方案。

先把“智能客服”拆成一项可判断的任务

“智能客服”可能是搜索政策、草拟回复、判断赔偿、发送邮件或直接创建退款,不能作为一个候选。延误回复被改写为:客服收到国内标准件延误询问后,系统从当前事件、公开追踪状态和有效服务政策生成带来源草稿;专员核对客户/运单/政策后手动发送,不判断赔偿、不承诺时限、不调用退款。

场景卡片字段 填写示例
触发者/触发器 客服专员收到国内标准件延误询问
业务结果 准确首答、减少重复来信,不是“生成文字”
当前输入 客户来信、运单事件、有效政策版本
当前流程 查3个系统→判断状态→写答复→主管抽查
拟定的 AI 角色 检索/归并事实、草拟带引用回复
输出用途 内部草稿;专员手动放行
禁止 赔偿、退款、危险品处置、自动发送
基线 3,200件/月;实际处理时间9.6分钟;14%在七日内再次来信
负责人/评估者 客服运营负责人;3名资深专员
非 AI 替代方案 统一事件视图+模板/规则优化
故障恢复 发送前拦截;已发则更正/事件流程

任务合同暴露了一个重要问题:若主要时间花在三个系统切换,非AI统一事件视图可能比生成模型更可靠。试点可同时测试“规则模板+统一输入”和“AI草稿”,不能把所有改善归给模型。

宽场景拆分后数量可能增加,但比较对象更真实。“自动批准运费发票”拆成只读异常提示、证据汇总、审批建议和最终批准;前两项可候选,最后一项本轮停止。拆分不是绕过治理,而是把可逆学习与不可接受动作分开。

项目组还为每张任务卡附一份“最近五件工作”证据。提出人不能只描述理想流程,而要带来五个连续发生、未经挑选的实例,逐件标出谁触发、在哪个系统取数、出现过哪些人工判断、输出被谁消费、发生错误后怎样发现。延误回复的五件里有一件缺少到站扫描、一件客户同时询问赔偿;这立即证明“所有延误都能自动答”是假范围。报价检查的五件里有一份旧版附件、一份把公斤写成磅;这使单位转换、附件版本和人工定价成为明确测试,而不是上线后的意外。

任务合同另存当前非AI路径的成本与改善空间。延误回复可先比较三组:原流程、统一事件视图加固定模板、统一事件视图加AI草稿。若第二组已经把9.6分钟降到7.4分钟,而AI组只到7.2分钟,AI的边际贡献只有0.2分钟,并不拥有全部2.4分钟差值。报价检查也先执行确定性规则;模型只处理附件候选与冲突解释。这样既防止把接口改造功劳记给AI,也让项目在模型不通过时仍能交付可用的流程改善。

没有当前事实的场景只能进入“准备”

基线字段 延迟回复示例 来源/置信度
月度量 3,200 案例 12周工单日志 / A
开始/结束 收到询问→首个有效回复 事件定义 / A
实际处理时间 中位数9.6分钟 120件工单时间样本 / B
队列周期 中位数 11.8小时 CRM 时间戳 / A
重复联系 14% 在...范围内 7 天 关联工单 / A
事实修正 6.5% 抽样回复 质检样本 / B
升级 18% 工作流事件 / A
专家容量 3 审查员×4每周工时 负责人承诺 / A

A表示直接运行/责任证据,B表示有限样本或可复算估计,C表示工作坊意见;它不是风险或价值分。样本口径、日期与缺失保留。活跃时间的120件不能替代3,200总量,但能用于估计处理时间并做敏感性区间。

三个“准备基线”候选分别缺少翻译返工、销售跟进真实使用与需求报告下游决定记录。项目组给数据负责人两周补齐,不把“大家都浪费很多时间”写成年度百万元价值;若补不到,任务可能不值得为测量而建设。

基线也记录目前正确停止:客服把危险品或赔偿问题升级的比例不应因AI下降得越多越好。项目只追求无必要升级减少,必须分失败类型,不能把升级率当单向效率指标。

时间基线不只报一个中位数。120件样本按普通延误70件、资料缺失25件、赔偿或危险品升级15件、其他边缘10件分层,并保留P50、P80与最大值;3名观察员用统一起止定义,暂停等待客户回复的时间不计活跃处理,却仍计入周期时间。若工具只改善普通70件,项目不能把结果外推到全部3,200件。正式试点用相同分层权重回算总体,同时单列每层结果,防止总体中位数变好却把少数高后果任务拖坏。

返工也要建立事件链。一次客户再次来信可能来自回复错误、物流状态继续变化、客户没读邮件或本来就追问赔偿。160件编码样本由两名专家盲标,先约定“可由首次回复避免”的定义,再报告一致与分歧;无法确定的案例保留状态未知。只有可避免重复联系的比例下降,才支持草稿改善客户结果。把全部448次重复联系都归因于文本质量,会把上游物流波动误算成生成系统收益。

六道硬门决定能否进入试点

放行门槛 通过证据 未通过后的去向
业务负责人 能提供专家时间,并承担采用与停止决定 找到负责人或停止
限定任务/备选方案 触发、输出、非AI方案、禁止项 拆分/重写
可衡量基线 数量、时间/质量/结果有分母 准备数据
数据权属/就绪状态 负责人、目的、访问、版本可说明 治理/替换
可评估性 专家能对真实样本判通过/编辑/停止 建评分表/样本
遏制/可逆性 外部影响前能拦,且有恢复 重构只读/停止

六门必须同时通过。负责人愿意开会但不给专家时间不算负责人;文件存在但版本/权限不清不算数据就绪;一句“人工复核”若没有复核对象、证据、位置和留痕不算遏制。

放行门槛结果可随证据变化。设备异常编码因为历史标签不一致,先放数据治理;修完分类法与抽查后可重审。自动付款最终批准即使数据完整,仍因直接改变资金且本轮没有安全撤回设计而停止;只能重新定义只读异常提示。

每个放行门槛由证据负责人与质询评审人分别签字。业务负责人不能独自判定自己场景通过:数据门由资料负责人核对权利、版本和访问,遏制门由风险或运营人员实际演练错误输出怎样被拦,可评估性则由未来承担判定的专家确认样本量与评分标准。质询会议不讨论“喜不喜欢AI”,只问哪条证据能推翻通过。若客服界面没有强制展示运单号、事件时间与政策版本,审核者无法在处理量压力下发现错配,遏制就保持准备,而不是因为有人坐在屏幕前自动通过。

通过也带有效期。报价规则在费率季更新后重验数据与评估,人员任务在劳动政策改变后重验影响,资料许可或供应商处理地点变化后重验权利。候选记录写明有效截止日与重审触发器;过期证据不能复制到下一季度继续沿用通过状态。这个机制使优先级成为可更新的决策账本,而不是一次工作坊留下的永久排名。

18项候选都要留下决定理由和下一动作

候选任务 放行门槛结果 最大差距/下一步行动
延误回复草稿 通过 对比非 AI 模板
报价规格一致性检查 通过 产品主数据试点修复
会议行动包 通过 同意/负责人确认
理赔材料摘要 通过 禁止责任/赔付建议
供应商文件字段抽取 通过 许可/附件处理
异常原因编码建议 通过 监控分类体系漂移
维修记录标准化 通过 保留原始工程师备注
发票异常只读提示 通过 无审批/写入
路线方案解释草稿 通过 调度员拥有决策权
多语回复翻译 准备基线 建事实/术语返工分母
销售跟进 准备基线 记录真实发送与结果
周度需求报告摘要 准备基线 确认下游决策/使用
企业知识助手 准备数据 拆任务、版本、权限
司机语音摘要 准备数据 同意/留存/噪声样本
合同条款比较 准备数据 权利、专业评分标准、范围
发票自动批准 重构 只读异常/证据包
司机纪律建议 停止 人员权益/申诉与责任未具备
动态价格自动发布 重构 仅限内部建议

9+3+3+3=18。停止不是宣称任务永远不能用AI,而是本轮没有可接受上下文。重构产生新候选 ID并保留父子关系,不能把“自动批准”悄悄改名“辅助审批”却维持同一动作。

候选负责人要在决策记录中签收缺口和日期。两周后仍没有负责人或证据的准备项标为暂缓,不长期占据“下一批”制造虚假的候选池。

六个比较维度保留各自的证据单位

维度 记录 本组合中的强/弱含义
频率 月度量、峰值、用户 足以反复学习 与一次性任务对比
价值 结果链、基线、反事实 可测业务结果 对比 空泛潜力
标准化 输入/处理/输出/异常 稳定核心与无专家共识
数据条件 权利、覆盖率、质量、版本、访问 可操作使用与未知
可控性 错误检测、最终决定权、外部动作 发布前拦截与直接损害
可逆性 撤销、正确、补偿、时间窗口 影响前低成本与不可逆
证据置信度 按具体结论分A/B/C类 直接记录与研讨会观点对比

频率不设置跨企业通用的“3,000次=5分”;3,200封回复与290件理赔不能只比数量,因为单位、后果与专家时间不同。价值也分容量、周期、质量、客户、风险,不强行折成人民币;可以合理货币化时保留公式与范围。

标准化高只说明适合定义接口,不保证值得做;数据就绪也不保证允许用途;可逆性高不能抵消资料权利失败。维度是比较语言,不是互相兑换的积分。

为了让两名评审对“强或弱”有同一含义,每个维度附观察锚点。频率记录近12周分布与峰值,不接受年度总量除以12;价值至少连到一个有负责人的业务结果并列出替代解释;标准化要用双人独立标注测关键字段一致;数据条件要求随机样本覆盖、缺失和版本,而不是展示最佳文档;可控性必须用注入错误演练发现率;可逆性要写恢复动作、最长窗口、受影响对象和成本。评审仍可有判断,但分歧会落在可追问事实,而不是“我给4分、你给3分”。

多维对比还要保留表现最差的切片。例如整体资料覆盖92%,但新开站点只有71%,就不能只显示92%;报价附件总体占16%,若某地区达到43%,该地区必须单独限制或补修复。一个场景可以在普通分布上表现良好,却在峰值或特定人群上薄弱。组合选择使用最相关的运营切片,防止平均值把真正部署边界抹平。

价值必须连到业务结果和反事实

延误回复当前3,200件/月、抽样活跃时间 9.6分钟。若统一事件视图+AI草稿将中位数降到7.2分钟,容量差为3,200×2.4/60=128小时/月;低情境2,560件×1.2/60=51.2小时,高情境3,840×3.0/60=192小时。报告展示三种情境,不只展示128。

场景 基线结果 试点目标 价值链与保护指标
延迟回复 14%=448 重复联系 ≤9%=≤288 减少重复联系;正确性不降
报价一致性 1,150×7.8%≈90 更正 <3%=<35 ≈55 减少更正循环
会议行动 340×13分钟≈73.7小时 7分钟≈39.7小时 约释放34小时容量;负责人/截止日期完整
理赔材料摘要 受理中位数42分钟 测试30—36分钟 不影响赔付或责任决定
发票异常 样本捕获率未知 离线基线优先 不把发现数当节省

报价“少55次返工”不能再乘0.7天宣称省38.5个工作日,因为返工可能并行,延迟也不是劳动时间。试点分别测更正循环、准时报价和客户等待;货币影响需要毛利/流失的额外因果证据。

会议行动约34小时只是释放容量,是否变成业务价值取决于行动完成、会议质量与时间去向。价值卡写负责人计划如何使用释放时间,90天后比较,不把模型生成分钟当收益。

试点经济记录采用“增量成本—可证实容量—结果变化”三栏。增量成本包含5人周建设、48小时客服专家、资料接口、评估运行、培训、支持和后续维护;容量只按实际采用率计算。若12名客服只在40%的合格案例中使用,即使每件节省2.4分钟,也不能按3,200件计算128小时。若处理时间下降但事实修改率从6.5%升到8%,项目先判定质量保护指标失败,不能把节省时间折价后仍宣布净收益为正。不同单位的结果保持并列交给负责人判断,不伪造一个统一投资回报率小数。

反事实由分阶段发布建立。前两周只优化统一输入和模板,取得非AI对照;随后在同类案例中交替显示模板或AI草稿,按站点、人员经验和案例难度分层。由于运营不是随机临床试验,报告明确排班、旺季与学习效应等限制,并检查两组基线是否可比。若无法可靠分组,就用中断时间序列加人工审计,并把因果置信度降级。优先级所需的是足以决定扩大、修改或停止的证据,不是把相关性包装成精确收益。

标准化要看稳定核心和异常分布

任务 稳定核心 异常证据 结论
延迟回复 事件 + 策略→草稿 补偿/危险品 核心稳定;人工路由
报价检查 单位/区域/附加费规则 协商例外 规则优先 + 例外复核
会议行动 行动/负责人/截止日期/状态 隐含承诺 草稿 + 参与者确认
异常编码 事件→原因分类体系 标签不一致 18% 抽样 通过修复/监控
知识助手 “回答问题” 任务/输出无界 非可比场景

专家一致性用样本测,不问“流程是否标准”。项目让三名专家独立标30例;若同一关键字段分歧高,先澄清评分标准或允许多个有效,不训练模型学习多数人的偶然习惯。18%的异常标签分歧让编码建议只能保留原事件与候选理由,不可自动写回主记录。

非AI规则也参与比较。报价的单位、区域和附加费校验高度确定,应先用规则引擎;生成模型只解释冲突或从非结构附件提取候选。把所有步骤标AI会增加不可预测性和评估负担。

30例专家一致性测试不只计算一个百分比。关键字段分成事实抽取、规则适用、例外理由和允许输出:三名专家对事实字段29/30一致,但对“协商费率是否覆盖燃油附加费”只有22/30一致,项目便把前者纳入规则检查,后者要求定价专家确认。分歧会议产生可版本化评分标准和反例,不强迫所有合理判断只剩一个标签。下一次规则或产品数据更新后,用原30例加新失败例回归,观察一致性是否因定义漂移而下降。

标准化还区分任务稳定与环境稳定。会议行动字段看似固定,但不同团队对“口头建议是否算承诺”理解不同;延误政策字段稳定,物流事件却可能迟到;维修记录模板固定,设备型号和缩写持续变化。因此卡片分别写稳定接口、允许变化、检测变化的方法与负责人。只有系统能识别超出已知分布并转人工,稳定核心才真正可用。

数据条件不等于“有很多文档”

数据问题 延迟回复 报价检查
负责人 客户运营/数据负责人 产品/定价负责人
来源 追踪事件、策略、客户消息 主数据、报价字段、附件
版本 保单生效日期 价格/附加费生效日期
权利/目的 客户服务目的已检查 商业数据已授权
覆盖率 92% 样本包含所需事件 84% 结构化;16% 附件
访问 按单个案件授予最小权限 按角色与区域访问
质量差距 缺失扫描/原因 单元别名/旧附件
回退 人工查询/升级 阻断 + 人工定价复核

92%/84%不是合格率:它们只描述本轮样本中可取到必需输入。缺失案例必须进入回退并计入分母;若产品只展示能检索的92%,会虚构性能。附件修复工作算入4人周,不当作免费前置条件。

数据准备还有时间窗口。今天当前的策略下月可能失效,试点保存输入版本和生效时间;访问权限从源继承,不建立一个全员可见副本。知识助手因任务过宽、版本和权限不清进入准备,而不是靠向量库演示越门。

风险可控与可逆性必须分开

场景或动作 影响前检测 最终决定人 恢复 当前边界
回复草稿 引用与事实复核 客服专员 发送前编辑 不自动发送,也不承诺赔偿
报价一致性标记 确定性不匹配 定价分析师 发布前修正 只读标记
会议动作草稿 参与者确认 会议负责人 修订会议纪要 无任务系统写入
理赔材料摘要 专家复核 理赔负责人 更正录入 不提出责任或付款建议
发票异常 离线/只读 财务审批人 调查/忽略 不批准/挂起/支付
司机纪律 错误可能影响权限 经理流程不足 申诉成本高/耗时 停止
动态价格发布 直接客户影响 定价负责人不在循环中 重新定价/通知成本高 内部重构

“人在回路”只有在审核者看到原始证据、知道检查标准、有时间、有否决权且动作尚未发生时才算控制。若系统一次生成500封回复,主管只抽5封,不能说500封都经过人工批准;若界面默认接受并隐藏状态未知,人工存在也可能只是橡皮图章。

可逆性记录恢复窗口和成本:草稿未发可删除重做;报价已发可更正但影响信任与交易;付款执行后还涉及追回、对账与供应商权益。项目先选择外部影响前可拦的形态,不把“事后能道歉”当高可逆。

不确定性要写进每个结论

具体结论 当前值 置信度 敏感因素或下一项证据
回复量 3,200/月 A 按季节峰值
活跃时间 中位数 9.6m B, n=120 扩展至 240 抽样
AI 目标时间 7.2m C 假设 影子运行
重复联系原因 缺失事实导致 B, 编码 n=160 盲编码
报价修正 7.8%, n=1,150 A 拆分错误类型
会议行动遗漏 9%, n=120 B 参与者确认
试点工作量 11人周 B类估算 每周实际消耗

项目组不把目标与基线放在同一列称“预计节省”。目标在试点前是可证伪假设;输入量、采用率、人工复核与维护任何一项变化都会改经济结果。置信度C但风险低的任务可用小样本学习;置信度C且高后果的任务先补证据,不以试点替代必要治理。

决策记录保存反证。例如客服专家担心草稿让新人过度信任,会议负责人认为人工确认可能抵消节时;这两项成为评估和采用观察,不在讨论会后删除。排序质量取决于是否看见关键状态未知,而不是所有单元格都填满。

不算加权总分,先否决,再比较支配关系

流程分四步。第一,硬性放行门槛否决;第二,在相同通道比较是否存在支配——A在所有关键维度不差且至少一项证据更强,B就不应先占资源;第三,根据本季度明确目标按顺序看结果、控制、数据与努力;第四,用组合约束处理共同能力与专家容量。

可复制模板
admit(scene) = all(owner, task, baseline, data, eval, containment)
compare within same lane:
  reject dominated alternatives
  preserve trade-offs and unknowns; do not average them
portfolio constraints:
  build <= 12 person-weeks
  customer expert <= 60h
  pricing expert <= 48h
  new external-action pilots = 0
  risk/unknown buffer >= 1 person-week
objective order for this quarter:
  1) measurable customer/quality result
  2) critical failure controllable before impact
  3) reusable organizational capability
  4) effort and adoption fit

字典序顺序在看候选结论前由指导小组确认。本季度优先客户首答与报价质量;下季度若战略是风险降低,顺序可能改变。公开顺序比任意权重更能解释为什么低分维度没有被高价值抵消,也允许不同管理目标产生不同合理组合。

支配只在相似结果通道使用。会议行动包与报价检查解决不同结果,不能说一个“全面支配”另一个;它们进入组合取舍。非支配前沿也不代表全做,只表示剩余选择需明确价值判断。

四个热门候选为什么走向四种结果

标准 知识助手 延迟回复 报价检查 发票自动批准
任务绑定 不通过:问题/输出不限 通过 通过 拆分后通过
基线 不通过:无统一任务 A/B 证据 A/B 证据 支付量 A
数据 不通过:版本/访问 92% 覆盖范围 + 负责人 84% 结构化 + 负责人 财务数据就绪
评估 不通过:谁判所有答案 3 专家/160 个已规划案例 规则 + 定价专家 审批结果复杂
遏制 状态未知 发送前草稿 报价前只读 最终审批失败
处置 准备/拆分任务 候选项 候选项 仅重构异常

知识助手不是因为技术难而输,而是没有可比较任务;付款自动批准不是因为价值低,而是动作越过本轮风险容忍。延误回复与报价检查均通过,前者建立版本化证据与引用,后者以规则检查创造质量结果,两者可以共存而非争一个总分。

若用旧权重,付款自动批准可能凭2,100笔/月与高财务价值盖过可控性;知识助手可能凭“全员覆盖”得到高频率。硬性放行门槛让这些虚构优势不能进入加权计算。

12人周之外,还要计算专家与评估容量

容量 可用 选定需求 缓冲/状态
建设与集成 12人周 11人周 1人周缓冲
客户专家 60小时 48小时 12小时
定价专家 48小时 40小时 8小时
会议用户/经理 24小时 18小时 6小时
安全/隐私审查 28小时 22小时 6小时
评估运营 72小时 64小时 8小时

人周含设计、数据接口、评估、日志、运行手册与修复,不只写代码。报价附件16%非结构化的修复计入4人周;客服策略版本和检索准备计入5人周;会议包2人周也含同意、确认与反馈。把“已有平台”写成零开发会漏掉真正工作。

专家时间按节点预订,不能假设随时可用。若客户专家实际低于48小时,回复试点缩小样本或延长,不从评估删边缘案例;若安全复核出现高严重问题,1人周缓冲优先处置,不拿来加第四个场景。

三套可行组合不能只按候选名次选择

组合 项目构成 建设人周 共享能力 决定性权衡
已选 A 回复 5+引文 4+会议 2+缓冲 1 12 证据/版本、规则、人工采用 平衡项 3 通道
B 类运营 异常代码 4+维护 3+路由解释 3+缓冲 2 12 事件分类法、运营接口 标签分歧高
C 类控制 理赔材料摘要4+发票异常4+供应商提取3+缓冲1 12 文档录入、只读控制 专家复核稀缺

组合B频率高,但异常标签18%的分歧会让首轮大量时间花在分类法修复上,可先保留为数据项目。组合C的风险控制价值强,但理赔与财务专家复核发生在同一月末窗口,专家容量冲突。组合A覆盖客户结果、报价质量与低风险采用,专家群体不同,且两项核心能力可供下一批复用。

A没有填满12人周。1人周是明确工作:未知来源修复、严重评估失败、日志或回滚;若第4周仍未使用,也只可用来扩回归样本/文档,不启动新试点。留缓冲是可交付性设计,不是低效。

三套组合还经过“拿走一个资源”的压力测试。若定价专家容量从48小时降到24小时,A不是让报价试点少评一半,而是把它保持离线、将4人周中的2人周转为主数据修复,并在下个窗口重审;若客服专家降到36小时,回复样本缩小使用范围但保留160件离线评估与20个停止案件。若安全审查发现共同身份控制缺陷,三个项目全部暂停相关实测,缓冲用于修复,不能把缺陷拆成三个低严重度事项。

项目组也记录被选择组合对下一批的真实期权价值。回复试点只有在产出可复用的源版本接口、引用评估集和权限测试时,才为知识类任务创造期权;报价试点只有沉淀规则负责人、变更通知和错误分类法时,才帮助发票异常。所谓公共能力必须列出接口、负责人、维护成本与第二个已确认使用者,不能用“平台化”给当前项目虚增价值。若共享承诺没有落地,季度复盘会下调下一批相关候选的数据条件。

入选三项在组合中承担不同角色

试点 组合中的角色 结果指标 共享资产
延迟回复草稿 客户结果锚点 时间、重复联系、事实编辑 来源/版本/引用/评估
报价一致性 交易质量锚点 更正循环、准时报价 主数据规则、问题反馈
会议行动包 采用/控制探测 负责人/截止日期、确认、使用 培训、放行、反馈

会议包价值低于前两项,却用2人周验证用户是否理解草稿、是否真正确认负责人/截止日期、支持是否可承受。若只做两个复杂后台试点,项目可能获得离线准确率却不知道真实工作如何采用。它不自动发送、不创建任务;参与者确认后才放行。

三个项目有独立负责人和停止,不打包成“一体化Copilot”。共同能力通过版本化接口复用;一个试点失败不自动拖停另两个,但跨客户资料或身份控制等共享控制失败会暂停全部相关场景。

开发前先填好延误回复试点章程

章程字段 承诺值
范围 国内标准件“运输中延误”询问;排除赔偿/危险品/丢失判定
用户 12 智能体;客户运营负责人;3 专家审查员
基线 3,200/月、9.6m 活跃、11.8小时周期、14% 重复、6.5% 事实编辑
来源 追踪事件、当前服务策略、客户消息
AI输出 事实陈述与证据对应关系,加上回复草稿;不发送
评估集 160:100 正常、40 边缘、20 停止/升级
人工复核 身份、事件、策略引用、承诺、发送前的语气
成功 关键事实/承诺错误=0;引用支持≥95%;中间评审≤7.2m
护栏 重复联系/事实修正不恶化;应升级案例 20/20升级
停止 跨客户数据、错误状态、伪造策略、不安全指令
恢复 禁用草稿、人工处理路径、影响范围发布、事件/变更评审
扩展 2 连续周通过 + 支持容量 + 负责人签字

95%是本案例对普通可纠正引用关系的试点门,不允许5%关键错误;20个停止案件必须20/20正确升级。模型草稿缩短时间却提高重复联系或压低正确升级,不通过。评审中位数目标是从9.6降至7.2分钟的假设,不是供应商保证。

样本按最近12周连续案例分层并去标识,不只挑资料完整的问题;缺事件、政策冲突、相似运单和社会工程文本进入边缘组。专家先独立标注,分歧由裁决记录,不把多数票自动当作唯一正确答案。

160件样本在开发前冻结案件 ID与分层规则,100件普通样本覆盖各站点和新人/资深人员常见流程,40件边缘样本覆盖缺扫描、状态倒序、政策切换日、同名客户与附件诱导,20件停止样本覆盖赔偿、危险品、疑似欺诈和跨客户资料。开发者可看训练/调试子集,但最终门禁子集由评估负责人保管;修复失败后新增该失败的邻近反例,不能反复调同一件直到通过。所有比例同时给分子、分母和95%门的具体定义。

人工复核不只计点击“接受”。日志记录专员是否打开原始事件、是否核对政策版本、修改了哪些事实或承诺、用了多长时间、最终发送/升级/放弃以及原因;界面把状态未知与引用缺失置于可见位置,不把AI文本设成无摩擦默认。每周抽取接受未修改、重度修改和放弃三组案例,由专家回看是否出现自动化偏见。培训强调系统是草稿工具,主管不得用接受率考核员工,否则采用指标会被组织激励污染。

八周阶段门允许扩大、限定、修正或停止

通用放行门槛 特定回复证据
1 锁定基线、任务和数据负责人 160件案例抽样计划
2 评分表/关键失败项已批准 专家裁决完成
3 离线系统 + 日志 来源/版本追踪有效
4 全面评估; 无外部显示 20/20 停止案例 + 关键 0
5 在真实分布上的影子 缺失数据/回退率
6 向12名用户开放受限界面 评审记录、编辑与支持
7 修复后的回退 无旧关键返回
8 结果/经济/事件评审 扩展/限制/变更/停止

报价评估有180份,其中60份带历史错误/边缘单位;会议有60场合成/获准转写,其中20场含隐含负责人或冲突到期。每项都保存正常、边缘、停止与反例,不能用同一“准确率”横比。

项目级结果要看12人周的实际消耗、专家小时、共同控制失败、支持负担与是否得到可复用资产;业务结果仍按各场景分母判断。试点没有达到门槛也可以有序关闭,只要清楚证明哪个假设失败、恢复人工流程、完成资料和访问退出,并更新候选记录。

复用这套排序方法,先写任务卡,再讨论组合

产物 最低内容
候选卡片 触发/输入/处理/输出/影响/负责人/替代方案
基线表 分母、开始/结束、时间/质量/结果、置信度
准入记录 六道门、证据、通过/准备/停止、下一负责人和日期
多维对比记录 频率、价值、标准化、数据、可控性、可逆性及未知
价值地图 驱动因素→变更→业务结果 + 反事实/敏感性
支配日志 同车道替代方案、为何被支配/未被支配
容量矩阵 建设、数据、专家、风险、变更与支持
方案选项 项、依赖、共享能力、权衡、缓冲
试点章程 范围/评估/人工/停止/恢复/阶段关口
决策记录 选定/拒绝/反证/复核触发

NIST AI RMF操作手册的“情境映射”部分建议定义任务、目的、最低功能、收益、预期环境、非AI替代方案、人工监督与潜在影响,也强调更窄的任务更容易映射收益与风险;“风险管理”部分支持根据评估决定是否继续部署,“风险测量”部分强调在社会技术环境中解释测试与指标。官方页面同时说明AI RMF 1.0与操作手册正在更新,本文只借鉴问题结构,不把六道门或12人周当成NIST要求。GOV.UK效益指南支持在早期建立经济模型、做敏感性分析、审查假设与交付成本,并用实际数据决定继续、改变或停止;这里只借鉴测量逻辑。ISO/IEC 42001官方概览用于说明AI管理系统的持续管理背景,本文不声称企业已经取得认证。

今天选一个最受欢迎的候选,删掉解决方案名称,把它写成触发、输入、输出、后续行动和非 AI 替代方案。若负责人、基线、数据权利、专家评估或外部影响前拦截有一项答不出,就把下一动作交给明确负责人,不打分;只有通过六门,才拿它与同一业务通道的候选比较。