结果不是“自动化保修专员”

熙岳设备服务有920名员工,其中46人以不同程度参与保修申请:12名服务协调员、18名保修分析员、8名技术/配件专家、4名授权审批人、4名主管。管理层最初提出“用AI自动化30%的保修岗位”,因为系统每周约有320笔申请,积压620笔,客户不断催问。

六周连续日志覆盖1,920笔申请。项目组发现,每笔活跃处理中位数46分钟,但端到端周期中位数31.5小时;46分钟只占周期约2.4%。真正问题是资料不完整、跨系统检索、队列交接和例外来回。于是第一阶段只辅助“资料完整性检查”和“政策条款候选”,第二阶段把输入、状态、并行取证与异常路由重画,第三阶段才根据实际时间和责任变化调整岗位任务组合,不预设减员。

决策层级 本案例动作 明确不做
任务辅助 完整性清单、带来源政策候选、理由草稿 不自动批准/拒绝
流程重构 单一保修申请对象、并行取证、状态门、异常路由 不用自由智能体控制整条流程
角色重构 协调员转向前置辅导;分析员转向例外判断;主管转向校准 不按节省分钟计算裁员
岗位/人员编制 90天只观察空缺、积压、服务量与能力 不在试点前作人数承诺

公司、角色、工时、申请、错误与结果均为虚构教学案例。真实岗位调整涉及当地劳动规则、合同、集体协商、隐私、无障碍、反歧视、健康安全与行业责任,应由员工代表、人力资源、法务和相应专业人员参与;本文不是就业、法律或财务意见。

先分清任务、流程、角色和人员不是同一层

单元 在案例中的例子 可回答的问题
活动 打开工单、复制序列号 界面动作能否删除
任务 核验资料完整性 有稳定输入/输出和验收吗
工作流 从来件到形成分析包 步骤、状态、例外怎样流转
流程 保修申请到客户得到有效决定 跨角色业务结果是否改善
角色 保修分析员的一组持续责任 哪些判断/关系/能力要保留
职位 某员工与组织的具体工作安排 工作量、地点、合同怎样变化
人员编制 组织在某时点的人数 需求、服务量和人员流动怎样决定

AI在一个活动上生成文字,不等于完成任务;完成几个任务,不等于拥有角色;改变角色的时间构成,也不自动消灭职位。职业研究中的“暴露”通常也不是“这个人可以被替换”:它表示岗位里的部分任务可能被技术影响,实际结果还取决于流程、采用、成本、质量、需求与新任务。

项目记录每个主张的单位。可以说“政策候选任务的人工检索中位数从9分钟降到5.5分钟”,不能跳成“分析员效率提高39%”;可以说“46分钟活跃时间里有13.5分钟目标差”,不能跳成“46人减少13人”。不同分母之间的跳跃必须停止并补证据。

决策表为每次单位转换设置一道门。任务纪要转周容量,必须有合格案例量、使用率、可用输出率与新增复核;容量转业务结果,必须说明释放时间去了哪里、下游是否接得住;业务结果转角色变更,必须证明一组持续任务和责任真的重组;角色变更转岗位/人员编制,则另需未来需求、排班、空缺、技能、合同与正式人员程序。任何一门缺证据,就停在前一个单位报告,不用管理层期望补齐等式。

同样,岗位平均数不能覆盖个人分布。18名分析员中有人每周处理标准件,有人专做安全例外;“平均每人6.7小时政策工作”不会在现实中均匀释放。项目按班次、站点、设备族与授权层画负载热力图,观察释放的是连续可排时间还是每天十几段两分钟碎片。只有可被重新排班且实际未被新复核吞掉的容量,才进入经营计划。

“自动化30%的岗位”为什么无法执行

原方案来自一次厂商演示和部门自报:协调员估计三成时间在复制,分析员估计四成时间在找政策,管理层取整为30%岗位潜力。但问卷没有连续案例、起止定义或峰值;“复制”可能是上游字段缺失,“找政策”可能包含技术判断,删除后还可能增加复核。

原主张 缺失证据 可验证改写
自动化30%岗位 哪些任务、谁的30% 9个任务逐项测分钟/周
AI处理全部标准件 标准件定义/异常率 资格 + 停止路径
准确率95%即可 错误种类/后果 严重=0;字段分项门槛
省下13.8个全职当量 采用、释放、需求 容量小时+实际去向
周期降低一半 31.5小时构成 活跃、队列、外部等待
人工最终负责 看什么、何时、能否拒绝 复核合同 + 权限

项目先撤下人数目标,把季度结果改成:首轮资料完整率从62%提高、无依据政策引用下降、有效决定周期缩短、积压不再增长,同时关键错误为零,员工报告的工作节奏与控制感不恶化。减员不是试点指标;若未来考虑职位变化,必须另有需求预测、能力与劳动流程。

先用1,920笔连续申请还原当前流程

数据来自六周系统事件、240笔分层时间观察、72笔返工追踪、5类角色访谈和12场现场走查。连续申请而非最佳案例显示:62%首次资料完整;38%至少追一次材料;14%使用邮件附件绕过工单上传;6%的序列号需手工查旧系统。240笔质量样本中17笔政策引用需修正,即7.1%。

基线 价值 分母/定义
数量 1,920件/6周 已创建保修申请编号
周流入/完成量 320/310 6周均值
积压 620 未有有效最终状态
首次通过完成 1,190/1,920≈62.0% 创建时所需证据齐全
实际处理时间 中位数46.0分钟 人工实际操作,不含等待
端到端周期 中位数 31.5小时 创建→首个有效决定
重新开启 227/1,920≈11.8% 14日内因原问题重开
政策引用编辑 17/240≈7.1% 专家判引用无效/不适用

当前状态图保留两个看似“不合规”的影子路径。员工用邮件不是因为拒绝流程,而是上传限制无法收视频;技术专家在聊天里答复,是因为工单队列看不到设备停机严重度。重画流程要解决这些约束,不能只封堵渠道再把额外工作归咎于员工。

240笔时间样本按资料完整/缺失、标准/例外、四个地区和设备年龄分层;观察员先用20笔校准起止,再独立记录。46分钟是样本中位数,不与1,920笔系统事件假装同一精度。系统时间戳能可靠给出创建和决定,却不能判断员工是否同时处理另一案例;现场记录能测活跃,却可能受观察影响。两条来源分别标A/B置信度,并用敏感性区间而非一个伪精确均值进入容量模型。

72笔返工也按原因分开:26笔缺资料、18笔政策解释不清、11笔技术原因变化、9笔客户提供新事实、8笔状态/通知错误。只有前两类部分可能由当前设计降低;新事实或故障演化不是模型失败。若把所有重新开启都设成越低越好,员工可能延迟关闭或阻止合理申诉,指标反而伤害客户。

把46分钟拆成9个任务

每笔中位活跃时间的9项合计46分钟。项目没有把所有时间分给一个“保修分析员”,因为任务跨5类角色发生;同一人也有安装协调、客户沟通、技术支持等非保修责任。

任务 每件当前分钟数 每周320件所需工时 主要异常或验收
来件规范化 6.6 35.2 序列号/客户/型号匹配
追缺失证据 8.0 42.7 证据类型随故障变化
检索设备/维修记录 6.0 32.0 同型号、旧系统、权限
匹配政策/生效版本 9.0 48.0 地区、日期、例外条款
技术解释 6.0 32.0 症状不等于失效原因
例外判断 4.0 21.3 安全、重复故障、善意处理
草拟理由 3.5 18.7 事实与条款逐项对应
批准/拒绝 1.5 8.0 授权阈值/职责分离
更新系统/通知 1.4 7.5 状态一致、可恢复
总计 46.0 245.3 不是6.54个可删除岗位

245.3小时÷37.5小时≈6.54个满时当量,只描述这一流程的活跃负载。它分散在46人、不同周、不同技能,并包含未来仍需的人类判断。即使理论上全部消失,也不能据此减少6.54个职位;现实还要乘资格、采用、正确输出、人工复核和需求变化,并加入维护、例外与新控制任务。

六个问题决定改造停在任务、流程还是岗位

诊断 任务辅助 流程重构 角色重构触发
结果能否由一个任务改善 否,依赖多环节 多项持续责任改变
接口是否稳定 输入/输出明确 需统一对象/状态 新能力组合稳定出现
等待/返工来源 任务内部 交接/队列/上游 权责/绩效导致反复
行动后果 人工发布前可拦 需跨系统控制 决策权/申诉改变
瓶颈转移 局部改善不移堵点 会转移到下一队列 某角色负荷/技能结构变
证据范围 数周可验证 端到端周期验证 多周期工作设计/协商

任务辅助适合界面清楚、输出可在影响前检查、局部指标有意义的工作。流程重构适合等待、重复录入、交接返工占主导,或者局部提速只会把堵点推给下游。岗位重构发生在一组持续任务、决策权、关系、能力和绩效方式真实变化后;不能因为模型演示覆盖几项活动就提前改职位说明。

“从任务开始”不是只做小工具。它是先用最小单位建立证据,再沿依赖图判断问题是否跨界;若答案是跨界,就把改造层级升到流程,而不是不断优化一个注定无业务结果的局部助手。

局部助手的上限由等待链决定

31.5小时周期=0.77小时活跃处理 +12.4小时内部队列 +14.8小时客户/经销商补资料+3.53小时批次同步与审批窗口。活跃只占约2.4%;即使魔法般降为零,理论周期仍约30.73小时。只给分析员一个写理由助手,可能省3分钟,却不解决14.8小时补资料。

周期组件 基线 负责人/控制 首次重构调整
活跃工作 0.77小时 5类角色 辅助/规则/界面
内部队列 12.4小时 团队负责人/系统 严重性路由 + 在制品限额
外部证据等待 14.8小时 申请人 + 协调员 受理动态清单
同步与审批窗口 3.53小时 集成系统与审批人 事件更新与排班覆盖
总中位数 31.5小时 流程负责人 端到端指标

项目也检查瓶颈转移。若AI每天多产生80份政策候选,而8名技术专家仍需逐份确认,专家队列会增长;表面上分析员更快,客户周期反而变差。任何任务试点都同时记录下游到达率、进行中工作、复核分钟数和老化,不只记录生成速度。

六次交接和三次重录先于AI处理

步骤 系统/角色 交接/重新录入 观测到故障
1 创建 门户/协调员 邮件→门户重新录入 附件/字段缺失
2 分诊 协调者→分析师 队列交接 1 严重度不可见
3 检索 CRM + 资产 + 维修 系统重新录入 2 序列号别名
4 政策匹配 分析师→专家 交接2/3 版本或地区错误
5 技术 专家→分析师 交接 4 聊天理由未留痕
6 批准 分析师→审批人 交接 5 批次窗口等待
7 通知 审批人→协调者 交接 6/重新录入 3 状态与邮件不同步
8 重新开启 客户→团队 新队列 原证据链丢失

先做三个非AI改变:门户按故障类型动态展示所需证据;设备、维修和政策数据通过保修申请编号关联读取;状态更新以事件同步而非复制。AI只处理剩余歧义:从非结构附件提出字段候选、从有效政策提出条款候选、把事实与条款草拟成可核对理由。

这一步决定了收益归属。动态清单提高首次完整率,接口删除切换,进行中工作规则缩短队列,模型降低非结构理解时间;复盘分别测量,不能把整个31.5→目标18小时写成“AI节省”。

未来流程由保修申请对象和受控状态机承载

统一对象保存原始证据、候选字段、人工确认、政策版本、技术判断、授权与变更历史。原始附件不可被摘要覆盖,衍生字段标明来源、生成方式、置信度或未知状态,以及最后确认人。每次状态变化都有允许角色、前置条件、动作和失败恢复。

可复制模板
RECEIVED
  -> NEEDS_EVIDENCE  [required evidence missing; coordinator owns]
  -> READY_FOR_REVIEW [identity + equipment + evidence confirmed]
READY_FOR_REVIEW
  -> STANDARD_CANDIDATE [rules pass; analyst still reviews]
  -> TECHNICAL_EXCEPTION [safety/repeat/ambiguous cause; specialist owns]
  -> POLICY_EXCEPTION [version/region/goodwill; senior analyst owns]
REVIEWED
  -> PENDING_AUTHORIZATION [human rationale + citations complete]
  -> RETURN_FOR_EVIDENCE
AUTHORIZED
  -> NOTIFIED [approved channel; message and state share decision ID]
any state -> PAUSED / MANUAL / INCIDENT

生成系统可以建议字段和路径,不能自行越过就绪、已审核或已授权门。规则服务决定确定性必填项与授权阈值,人员确认事实、例外和不利决定。系统故障时从最后确认状态恢复,重复事件按保修申请编号与决策版本幂等处理,不重复通知客户。

保修申请对象不是把所有资料复制进新数据库。客户身份、设备记录、政策和维修历史仍由各记录来源负责,统一对象只保存授权引用、最少必要字段、版本与读取时间;敏感附件按角色访问,日志不重复保存全文。衍生字段与已确认字段不可同名覆盖,人工修改生成新版本并保留原因。资料删除、权限撤回或政策失效会使相关候选自动过期,流程回到重新取证,而不是继续引用缓存摘要。

状态机还区分业务失败和技术失败。缺资料是正常需要证据,不计系统错误;政策服务超时进入手动并显示原流程;模型返回无来源候选直接丢弃;通知成功但状态写入失败则用同一决策 ID补偿同步,禁止再发一封。运行手册逐项写检测信号、负责人、客户影响、恢复点与何时升级事件,使“有回滚”成为可演练动作。

两个AI任务需要两份不同合同

完整性助手只读取当前申请、已授权设备主数据和故障类型清单,输出“已找到、缺失、矛盾、无法判断”四类字段及来源位置;不得把模糊附件猜成存在,不得联系客户。政策助手只检索决定日期有效、地区适用的版本,输出候选条款、适用条件、反例和引用;不得判断技术原因、善意例外或最终资格。

合同字段 完整性助手 政策候选助手
触发 保修申请创建或更新 身份与证据已确认
输入 表单、附件、资产记录 已确认事实、生效日期、区域
输出 字段/证据/未知对象 条款/条件/引用/反例
确定性预检 文件/类型/模式/ID 规则 版本/日期/区域筛选
人工复核 协调员确认身份/证据 分析师核查事实及适用性
禁止 补充证据、联系申请人 判定资格、隐藏相悖条款
停止 跨客户数据、不安全附件 无有效版本、政策冲突
恢复 丢弃衍生字段、转人工受理 移除候选、转人工政策查询
日志 源哈希、解析器/模型、确认 查询、版本、引用、编辑/决策

审核合同还规定可见性:人员必须同时看到原始证据、来源时间和状态未知,不能只看流畅摘要;接受按钮不预选,批量确认受限。主管每周抽查“未修改接受”和“系统建议转人工”两类,因为前者容易隐藏自动化偏误,后者容易把困难工作全部倾倒给专家。

三种设计中,端到端智能体不是默认答案

选项 设计 可学习收益 决定性弱点 处置
A 文本助手 分析员粘贴材料→生成理由 2周能测草稿编辑 无版本/权限/状态;复制仍在 驳回为架构
B 受控组合 保修申请对象+规则+2个AI任务+人工门 可分离接口、规则、AI贡献 需跨团队改流程 已选
C 自主智能体 读邮件、查系统、判断并通知 演示看似端到端 越权、状态漂移、恢复与评估困难 本轮不采用

B并不比C“低级”。确定性状态、规则和职责分离处理可预测部分,生成能力只进入非结构歧义;这减少模型需要决定的表面积,也使错误能定位到资料、规则、检索、模型、界面或人工步骤。未来若要扩大动作权限,必须逐项证明工具契约、幂等、审批与补偿,而不是把整条流程一次性交给智能体。

项目还保留人工与非 AI 基准。若动态清单和统一检索已经达到业务门,模型增量不足以覆盖评估、复核和维护成本,就只发布流程改造。技术选择服从业务结果,不以“必须上线AI”作为成功条件。

RACI和决策权限必须随流程一起重画

决策/工作 在 R/A 之前 未来 R 未来 A 已咨询/已告知
证据要求 协调员/主管 流程负责人 + 协调员 服务运营负责人 申请方代表、技术专家
来源/版本规则 分析师/政策负责人 政策数据负责人 保修政策负责人 法务/区域
现场确认 协调员/主管 协调者 服务运营负责人 索赔方
技术原因 专家/技术负责人 专家 授权技术负责人 分析师
标准资格 分析师/保修负责人 分析师 保修负责人 政策负责人
例外/善意 高级分析师/经理 高级分析师 授权经理 按需财务/法务
最终不利决定 审批人/保修负责人 授权审批人 保修负责人 分析师/技术
系统性能 IT/项目 产品 + 评估负责人 流程负责人 用户/风险/安全
投诉/申诉 客户补救团队/经理 独立复核人 服务负责人 受影响客户

AI组件是工具或系统,不被写进最终负责栏。最终负责者必须拥有资源、权限和停止能力;若主管只能在系统决定后背书,RACI只是装饰。不同责任可以由同一人兼任,但高价值例外与最终付款授权仍执行授权阈值和职责分离。

改造后原协调员不为模型准确率负责,分析员不为政策数据负责人的过期版本背锅。每个失败按可控制层归属:资料负责人负责版本发布,产品负责人负责系统门,领域负责人负责评分标准,操作人员负责合同内确认,管理层负责风险容忍与资源。

复核、批准、改判、申诉和停止是五种权限

操作 AI/系统 一线 领域/授权人员 受影响方
提取候选事实 基于来源提出 确认/拒绝 审计规则 修正证据
流转标准/异常 规则提出 质疑流转 判定异常 接收状态
解释技术原因 仅总结 标记未知 判定/记录 提交相反证据
应用政策 检索候选项 核实事实 判定适用性 请求解释
批准权益 无权限 除非授权否则无权 在阈值内签署 申诉
不利决定/恢复 仅草稿 暂缓放行 批准理由/修正 申诉/重新开启
系统停止 触发技术防护 暂停自身案件 暂停通道/试点 报告损害

复核是检查输出,批准是授权动作,改判是推翻系统建议,申诉是受影响方请求重新判断,停止是暂停系统或范围。五项不能共用一个按钮。人员改判不需要通过自由文本为自己辩解,但要选择原因以改进系统;高风险错误可以一键转人工并保全证据。

人工控制要测有效性。项目注入政策过期、客户错配、矛盾序列号、缺少安全证明和提示注入式附件,观察审核者是否看见、拒绝、升级以及用了多久。若批量压力下发现率下降,不能靠再培训宣称解决;应缩小合格范围、降低到达率或重做界面。

岗位重构要看任务、关系、判断和责任

角色 当前主导工作 未来重复包 需要防止的恶化
协调者 复制、追材料、转队列 前置辅导、证据确认、复杂客户沟通 只剩情绪劳动/无决策权
保修分析师 检索、匹配、写理由 证据裁决、政策适用、例外准备 只处理最难案例导致过载
技术专家 零散聊天答疑 有留痕的技术判断、分类法改进 上下文切换/队列爆炸
审批人 批次签字 风险阈值、例外授权、理由质量 盖章(形式审批)
主管 分单、抽样检查 进行中工作控制、校准、能力辅导、漂移/事件响应 变成员工监控员

只有当新组合连续出现并被实际采用,才改角色画像。熙岳先用90天观察窗口:哪些任务每周发生、占时如何、谁真正拥有判断、员工能否在正常工时完成、培训后是否独立胜任。案例内部把“连续4周有超过30%的理赔相关的时间重新分配且责任稳定改变”设为一次角色复核触发器;这不是跨企业裁员阈值,也不直接决定职位。

新任务不是免费出现。评估集维护、失败分类、政策版本、异常分类法、申诉复核、事件响应和员工辅导都要进入容量表与职位说明。若只删除旧任务却不承认新控制劳动,项目会靠无偿加班维持表面效率。

重新计算容量,不能从小时直接跳到人数

任务 当前分钟数 未来状态假设分钟数 变更原因
标准化 6.6 3.2 结构化录入 + 候选项提取
追踪证据 8.0 4.5 动态清单;仍需人际沟通
检索记录 6.0 3.5 统一读取接口
政策匹配 9.0 5.5 版本过滤器 + AI候选项
技术解读 6.0 6.0 不以AI替代专业判断
异常判定 4.0 5.0 异常集中,单件更难
理由草案 3.5 2.5 证据关联草稿
授权 1.5 1.5 人类权限不变
更新/通知 1.4 0.8 事件同步
总计 46.0 32.5 假设减少13.5分钟

320×13.5/60=72小时/周是未来状态假设,不是已实现节省。技术解释不降,例外判断反而由4增至5分钟,说明剩余工作可能更密集。按任务归属,协调类约从77.9降到41.1小时,分析类从120降到88,技术32和授权8不降,更新约从7.5降到4.3;这些小时跨多人且波动。

即使最终得到72小时可用容量,负责人也先写用途:30小时处理积压、16小时前置客户辅导、12小时评估/政策维护、8小时培训与同伴校准、6小时风险缓冲。实际采用率若60%,模型正确可用率若85%,复核新增4分钟,就必须用事件日志重算,不能仍按13.5分钟乘全部320件。

容量模型逐周用公式重算:符合条件的案例×采用率×可用率×总分钟数变化,再减去人工复核、被拒输出的重做、专家升级、支持、回归与政策维护。假设320件中只有240件合格、80%实际使用、85%输出可用、每个已用案例新增3分钟复核,则毛容量约36.7小时,先扣复核9.6小时只剩27.1小时,尚未扣其他成本,不能报告72小时。计算账本同时保存碎片化:40小时分散在46人身上可能无法形成一个可取消班次,却足以让每周310件完成量追上320件来件或减少加班。

职位情境至少比较三套:服务量不变时用容量清积压;保修量随销量增长时避免新增临时人手;需求下降且自然空缺出现时重排岗位并培训转岗。只有最后一种才进入人员数量讨论,而且要把客户等待、例外能力和休假覆盖做压力测试。试点委员会无权用模型结果跳过HR、员工代表或当地正式程序。

员工参与发生在设计阶段,不是上线前宣讲

项目成立12人工作设计小组:每类角色2人、流程负责人、人力资源/员工关系各1人;成员来自不同站点、资历和使用需求。会议工时进入计划,个人意见不交直属主管作绩效材料。小组可以提出停止、要求保留人工处理路径,并在阶段门投票记录异议,但风险接受仍由有授权的管理者负责。

工作质量信号 基线与采集 保护条件与行动
每位分析师的异常分担量 每周案件组合 连续上升则轮换/增援
连续判断时间 日记 + 系统事件 不用更多通知填满释放时间
加班 汇总排班 不因维护/返工增加
感知控制感 匿名脉搏调查, 5-要点 下降需访谈/设计修正
质疑能力 驳回与申诉是否可用 不惩罚有依据的改判
技能广度 季度抽样演练 保留手工判断能力
监控负担 字段/日志目的复核 删除无决策用途的员工追踪
无障碍性 辅助技术/用户测试 等价人工和界面修复

反馈不是多数票替代安全或权益,也不是收集后不回应。决策日志逐条写采纳、试验、拒绝及理由;例如分析员担心只剩高难例外,项目加入案件轮转与每周复杂度上限。协调员指出动态清单措辞会让客户误以为承保,文案改为“评估所需资料”而非“批准所需资料”。

绩效制度也进入设计边界。协调员不按“AI接受率”排名,分析员不会因改判多而被判低效,主管不以每小时关闭数迫使人员忽略未知状态。业务看板把首次完整、有效决定、质量修正、合理升级与工作负荷并列;异常案例按复杂度分层。若管理激励仍奖励速度和默认接受,再好的人工审核界面也会退化成橡皮图章。

参与还包括被流程影响但不操作系统的人。经销商和客户代表测试资料清单、解释、状态与申诉,残障用户测试上传和通知的等价路径;技术专家确认新队列不会隐藏停机严重度。反馈样本与限制被记录,不能用两名“友好用户”代替全部受影响群体。

培训要按未来任务和权限验收

受众 实践 能力达标放行门槛
协调员 身份/证据/未知、客户解释 30例字段确认;关键错配0
分析师 政策版本、反例、引用、改判 40例含10例外;关键适用错误0
专家 技术原因代码、证据留痕 双人校准达到约定字段一致
批准人 授权、理由、职责分离、申诉 20例不利决定完整核验
主管 进行中工作、漂移、事件、工作质量 模拟队列激增/暂停/恢复
产品/支持 任务合同、日志、回滚 故障演练在恢复时间目标内恢复人工

培训先教流程事实和权限,再教系统。人员在普通、边缘、停止和诱导性附件中实作;未通过可以继续人工和辅导,不因一次测验作纪律判断。更新政策、界面、模型或合格范围后只复训受影响能力,但关键门需回归。

还要防技能退化。每月保留一批人工案例和盲测,分析员不先看AI候选完成判断;主管比较独立理由,而不是要求和系统一致。若独立正确率下降或人员无法解释条款,减少辅助强度并增加轮换,不能等事故发生才发现组织已失去核验能力。

12周试点分别计算流程改造与AI增量

阶段 范围 出口证据
观察 1—2 冻结定义;240 时间/质量抽样 当前蓝图已签署
建设与控制 3—4 保修申请对象、规则、日志、人工路径与回滚 安全、数据与任务合同通过
影子 5—6 200 案例;无用户可见输出 关键 0;来源/版本追踪
受控对比 7—10 2 区域;480 合格,240 非 AI/240 AI 辅助 结果 + 控制 + 工作质量
回归/决策 11—12 修复、旧失败、峰值模拟 扩展/限制/重新设计/停止

两组都使用新的保修申请对象、动态清单和状态机;AI组额外看到字段候选、政策候选与理由草稿。案例按地区、设备族、资料完整度和分析员经验交替分配,不宣称严格随机;排班、季节和学习效应写进限制。开发者不看最终门禁子集,修复后加入邻近反例。

对比协议在看结果前冻结资格、排除、主指标、关键故障和分析切片。每笔按实际分组分析,同时另报是否真正看到/使用候选,避免把低采用误称模型无效;但不只挑使用成功案例计算。两组若在设备年龄、资料完整或分析员资历上失衡,就分层报告并降低因果置信度,不用事后删除不利样本换显著结果。

样本量不支持罕见伤害的“安全证明”。0/240个严重错误只说明本轮未观察到,不能把真实发生率写成0;项目用红队注入、历史反例和生产保护措施补充,但仍保留范围、人工门和停止能力。重新开启的4件差异尤其小,决策委员会明确记为未知,下一阶段再收集,而不是用10.4%对12.1%制作胜利图。

评估分三层:任务层检查字段、来源、政策适用、关键故障和评审记录;流程层检查首次资料完整率、周期、重新开启、进行中工作、积压与人工回退;角色层检查异常密度、加班、控制感、改判、培训与支持。任何关键客户不匹配、虚构条款、越权授权或无法恢复的重复通知都停止相关通道。

试点结果只支持有限扩大

指标 匹配当前 n=480 非 AI 重新设计 n=240 AI 辅助 n=240 解释
首次通过完成 298/480=62.1% 186/240=77.5% 189/240=78.8% 主要来自动态清单
实际处理中位数 46.0分钟 41.2分钟 38.4分钟 AI相对非AI再减少2.8分钟
周期中位数 31.5小时 26.8小时 25.6小时 仍远高于18h 目标
政策引用编辑 17/240=7.1% 独立基线 16/240=6.7% 6/240=2.5% 支持扩大政策候选
重新开启 14d 57/480=11.9% 29/240=12.1% 25/240=10.4% 样本不足,不称改善
关键/错误授权 0 观测 0 观测 0 观测 零观察不证明零风险

若全量且分布相同,非AI流程改造相对当前减少的4.8分钟约为25.6小时/周,AI相对非AI再减少的2.8分钟约为14.9小时/周,合计约40.5小时,而不是72小时目标。项目因此只把政策候选扩大到另外两组分析员,保留人工门;完整性候选继续受限,端到端18小时目标进入下一轮队列与外部证据实验。

重新开启差异没有足够的统计或因果把握,严重错误为零也受样本限制。决策委员会没有用漂亮的初稿掩盖25.6小时周期,也不宣称岗位减少。释放容量先投入积压、辅导、回归与支持,8周后用实际来件量、完成量与加班验证去向。

最终交付要把任务、流程、岗位和人员决定分开

产物 最低内容
单元术语表 活动/任务/工作流/流程/角色/职位/人数
当前证据 连续案例、时间、队列、返工、影子路径
任务台账 输入/输出/分钟数/异常/验收/负责人
依赖/循环图 活跃/队列/外部/同步、瓶颈转移
未来蓝图 保修申请对象、状态、交接、人工路径与回滚
任务契约 来源/输出/人工/禁止/停止/日志
决策权限/RACI 评审、批准、改判、申诉、停止与问责
角色包 旧/新任务、技能、关系、工作质量风险
容量模型 资格×采用×可用输出−评审/维护
试点证据 非 AI 与 AI、任务/流程/角色指标、限制
劳动力记录 参与、培训、无障碍性、决策响应
变更决策 扩展/限制/重新设计/停止、复核触发器、职位流程

国际劳工组织(ILO)与波兰国家研究院NASK在2025年更新的生成式AI职业暴露研究,以任务级资料、专家输入和模型预测评估暴露;官方说明强调,更可能发生的是工作转型,而不是完整岗位自动化。本文只借鉴“不能把暴露等同于替代”的结论,不把全球比例套到本公司。OECD《就业展望2023》讨论AI可能自动化部分任务、补充另一些任务并产生新任务,同时影响工作质量;它不证明本案例结果。NIST AI RMF Core的“情境映射2.1、2.2与3.5”和“治理3.2”支持定义具体任务、输出怎样被使用与监督,以及区分人机角色责任;官方页面注明AI RMF 1.0正在修订。GOV.UK服务手册关于政策意图的材料,用于在重画服务前澄清输入、流程、输出、边界与负责人。本文的七个分析层、30%复核触发器、状态机和12周设计均是教学方法,不是这些来源的强制要求。

本周不要问“哪个岗位能被AI替代”。选一条客户结果不佳的流程,抽取至少30个连续案例,把活跃、队列、外部等待与返工分开;再把其中一个任务写成输入、输出、异常、验收和人工权限。若局部改善不会改变端到端结果,就把项目升级为流程重构;只有实际任务组合和责任持续变化后,才启动岗位设计与正式人员程序。