先看填好的边界:12周只学习一个证据包任务,达标后也不自动获得第三厂区或产品放行权
棠岳精密有1,260名员工、3个厂区。来料检验偏差由质检人员把采购订单、供应商报告、当前规格和测量记录组成证据包,再由有授权的质量经理决定接收、隔离、让步或退货。旧方案写“用AI自动审查供应商质量,成功后推广全公司”,没有产品范围、资料、动作、基线或停止条件。
重写后的章程 v1.0只覆盖2个厂区、1个非安全关键机加工支架产品族、8名质检人员、12周、最多160个实际案例。系统只抽取候选字段、比对当前规格并草拟内部偏差证据包;不能决定合格、放行、隔离、让步、供应商评分或外发通知。第三厂区涉及图像测量和安全关键部件,即使本试点达标也须另做发现和新章程。
| 章程上限 | 承诺值 |
|---|---|
| 目的 | 提高证据包完整/可追溯,缩短人工准备与队列 |
| 持续时间 | 12 周;无静默扩展 |
| 人员 | 8名质检人员;3名专家评估员;负责人实名登记 |
| 地点与产品 | 2个厂区;1个非安全关键支架产品族 |
| 离线评估 | 240个冻结案例:140个正常、60个边缘、40个停止 |
| 实时上限 | 160个符合条件的案例:80个非AI、80个AI辅助 |
| 数据上限 | 不超过900份输入文档;仅限已批准租户 |
| 行动上限 | 只读和内部草稿;由授权人员决定与放行 |
| 支出上限 | 42万元;其中包含3万元应急预算 |
| 关闭 | 有限继续、变更、新试点,或停止并退役 |
公司、人员、产品、资料、费用、样本和结果均为虚构教学案例。本文提供章程设计方法,不替代质量体系、安全、供应商、数据、合同、劳动、行业、法律或财务判断;真实高后果产品与正式放行须由获得相应授权的专业人员负责。
v1.0首页还写明生效与失效条件:G0五名负责人完成签署后才可使用资料,第12周周五自动到期。到期后只允许人工处理、证据保全和关闭工作,不允许继续给用户生成。业务发起人对问题、收益和资源负责,质量负责人对任务与授权边界负责,数据与安全负责人对资料及访问负责,评估负责人独立判断是否通过放行门,产品负责人对交付、运行和退役负责。任何人不能同时代表所有责任签完一页。
章程批准的是“在这些限制内收集决定所需证据”,不是某个模型、供应商或预定上线。若第4周发现非AI的版本查询服务已经解决主要问题,团队可更改后续实验比较,但仍受案例、费用和时间上限约束;若业务不再需要,即使技术表现优秀也应提前关闭。可撤回的授权使停止成为正常治理结果,而不是失败羞辱。
先切断试点无限扩张的入口
一句“顺便加上”可能同时改变分布、权利、动作和责任
最常见扩张不是管理层正式批准,而是实施中的合理小请求:既然能读PDF,就顺便读供应商邮件;既然能比规格,就顺便建议放行;既然A厂好用,就给C厂账号;既然模型升级更强,就直接切换。这些请求分别改变资料来源、外部动作、用户/环境和系统版本,旧评估不再充分。
| 请求 | 隐藏变更 | 必要路由 |
|---|---|---|
| 加第三厂区 | 设备/数据/用户分布 | 新发现及章程版本 |
| 加安全关键零件 | 伤害/风险容忍度/授权 | 单独准入; 非 v1 |
| 读取供应商邮箱 | 目的/访问/注入面 | 数据/安全复核及新测试 |
| 自动写入质量管理体系 | 外部/权威副作用 | 工具/批准/回滚设计 |
| 自动给供应商发信 | 外部承诺/隐私 | 新任务及人工发布控制 |
| 换模型/检索器 | 行为/成本/版本 | 回归及变更批准 |
| 多加20名用户 | 支持/培训/容量 | 扩展放行门槛 |
| 延长三个月 | 新承诺/数据保留 | 关闭决策, 无自动回滚 |
章程不是反对学习,而是让每次学习改变有记录。范围账本把请求标为澄清、范围内变更、实质性变更或新试点;提出者、影响门、补充样本、成本、负责人、决定和日期均保存。没有决定的请求保持积压,不由开发者在迭代中悄悄实现。
前线用户不必记住整份章程。界面把当前厂区、产品、来源和行动边界显示在案例页;不符合资格时,给出明确理由、状态代码(NOT_ELIGIBLE)和人工入口。帮助页列出常见“顺便”请求应去哪里。开发积压中的每一项都关联范围编号,代码复核检查是否新增资料、动作、用户或模型行为;采购变更、连接器配置和管理员开关同样进入账簿,不能只管代码。
范围复核每周只处理已填写影响记录的请求。提出人须说明业务问题、为什么现有人工不足、预计案例量和受影响人;技术团队补资料/权限/模型/日志,评估负责人补样本/门,财务补上限,风险负责人给处置。拒绝不是永久封杀,而是“v1没有证据/授权”;记录下一次重审需要什么,防止请求不断换名字绕过。
章程、项目计划、风险评估和设计文档不能互相冒充
| 产物 | 主要问题 | 决策负责人 | 更新触发器 |
|---|---|---|---|
| 试点章程 | 获准学习什么,边界、放行门和结束决定是什么 | 业务及风险发起人 | 实质性范围或承诺变化 |
| 项目计划 | 谁在何时交付哪些工作 | 交付负责人 | 任务或依赖变更 |
| 风险评估 | 哪些影响、控制与剩余风险 | 合格风险负责人 | 上下文/控制/证据变更 |
| 任务与系统设计 | 输入、状态、接口、人工与恢复怎样工作 | 产品与架构负责人 | 设计或发布变更 |
| 评估计划 | 样本、评分标准、门、分析和限制 | 独立评估负责人 | 失败/模型/范围变更 |
| 运行手册/事件计划 | 怎样监控、降级、隔离、恢复 | 服务/事件负责人 | 演练/事件/变更 |
| 关闭记录 | 继续、限制、修改或退役依据 | 决策委员会 | 阶段/过期 |
一页章程不需要塞入全部技术细节,但必须链接到有版本的证据,并写哪份文件拥有真相。架构图改变不能暗改章程的动作边界;项目计划按期完成也不能代替业务/风险门;风险登记册有一行“人工复核”也不能代替具体审核位置和权限。
签署意味着授权一段有限学习,不是承诺“成功就上线”。发起人承诺专家、预算和停止支持;产品负责人承诺范围;评估负责人可独立报告不利结果;风险负责人可暂停;用户能转人工和报告未遂事件。若这些权限没有资源,签字只是装饰。
所有链接文件使用同一个试点编号、范围版本和发布版本。章程v1.0可链接设计1.3与评估1.1,但关闭必须说明实际运行了哪些版本;设计更新若影响行为,变更记录决定是否升级章程。会议纪要或聊天不能成为唯一批准证据。签署、条件、反对意见、到期和已取代状态都要保留,避免事后用新文件覆盖旧决定。
项目计划可能在不改范围时调整日期,例如专家生病导致G3推迟;但12周过期不自动顺延。若剩余时间不足收齐证据,发起人只能缩小尚未开始的活跃队列、接受状态未知并关闭,或提出新的有限授权。进度压力不能把 保留集、事件演练 或删除验收挤掉。
把试点写成一项可以证伪的决策
先分清交付物、中间结果与业务结果
当前驱动因素是证据包不完整、规格版本查错和交接等待,不是“没有生成式AI”。赋能变更包括统一必填清单、当前规格接口、字段候选和证据链接;中间结果是首次证据包更完整、质检复核更短;业务结果才是偏差决定周期缩短且质量不降。
| 假设编号 | 如果发生的变化 | 预期结果与度量 | 证伪证据 |
|---|---|---|---|
| H1 | 动态清单及来源链接 | 首包完整性上升 | 缺失项未变 |
| H2 | 当前版本服务 | 错误/过期规范降级至 0 | 任何错误的当前规范 |
| H3 | AI提取候选项 | 复核时间中位数低于非AI分支 | 编辑与复核时间相等或更高 |
| H4 | 结构化证据包及队列状态 | 周期低于10小时 | 等待只是向后转移 |
| H5 | 未知状态可见,且由人作最终判断 | 关键不匹配被拦截 | 不匹配被抑制或错误接受 |
| H6 | 完成培训并限制到达量 | 工作负载与控制不恶化 | 加班、害怕改判或支持请求激增 |
章程允许AI假设失败而非AI改善成功。H1和H2可能由清单和版本服务实现;若H3没有增量,项目仍可发布非AI流程,而不为保住“AI试点成功”歪曲结果。每条假设有负责人、来源、分母、目标和反证,结项逐条判定通过、失败或未知。
收益图把驱动因素→赋能变更→中间结果→最终结果逐箭头编号。动态清单只能直接影响缺资料,版本服务影响错规格,AI候选影响字段查找/草拟,队列状态影响等待;“供应商质量提高”不在12周可归因范围。若周期下降,分析要说明来自资料等待、活跃、队列哪一段,不能把整个结果挂到模型节点。
每条假设还写替代解释:首次完整率上升可能是供应商同期培训,活跃时间下降可能是只挑简单件,周期下降可能是淡季,返工下降可能来自经理改变关闭口径。项目用连续案例、交替分组、相同定义和切片减弱这些影响,无法排除就降低置信,而不是补更多小数。
资格必须既能由系统检查,也能向一线人员解释
| 资格字段 | 已准入 v1 | 未准入/路由 |
|---|---|---|
| 工厂 | A/B | C→新发现 |
| 产品 | 已命名的支架产品族及版本列表 | 其他产品或安全关键产品→人工 |
| 供应商 | 带活跃合同的批准列表 | 新建/暂停→供应商流程 |
| 文档 | 采购订单、检查报告、规格、测量表 | 邮件/聊天/未知附件→人工 |
| 语言/格式 | 已批准的中文/英文 PDF/CSV 文件 | 手写/仅图像→人工 |
| 决策阶段 | 质量处置前 | 已放行或投诉后→事件或其他流程 |
| 所需身份 | 供应商/采购订单/批次/零件全部匹配 | 冲突/缺失→需要证据 |
| 数据类别 | 已批准的供应商机密/内部信息 | 受限/超出字段范围的个人信息→停止 |
入口先用确定性规则检查厂区、零件系列、供应商状态、文档集和决策状态,再允许模型读取。无法确认时不能以低置信度“继续试试”,而应标记为不符合资格(NOT_ELIGIBLE)或需要证据。用户界面显示为什么不合格、由谁处理和人工路径;资格事件进入分母,不能只统计成功进入的案例。
160个实时案例按案件编号去重,失败重试不能生成新案例来逃避上限。若同一案例新增关键资料,形成新版本但仍计一件;产品或供应商状态在处理中改变,则暂停并重新判断是否符合入口条件。入选名单和规则版本冻结到每周放行,临时口头例外无效。
资格仪表盘同时显示全部到达、已受理、需要证据、不符合资格、人工和错误入场。假设三周到达260件、160件入场、54件缺资料、46件不合范围,只报告160会虚构采用和性能;分母必须保留260。按厂区、供应商、班次和文档格式切片,若B厂NOT_ELIGIBLE异常高,先查资料/规则,不用总体平均掩盖。
入口规则也接受反向测试:20个看似相同但工厂/供应商/零件不同的案例必须拒绝,20个边界内但格式稍差的案例应进入需要证据而非被永久排除。过严会降低价值并把工作藏回人工,过松会扩大风险;二者各有负责人和门。规则改变后重放全部负面与边界样本。
超出范围必须写明具体动作和理由
| 排除项/操作 | 原因 | 安全路径 |
|---|---|---|
| 安全关键/受监管零件 | 后果/风险证据不同 | 现有专家流程 |
| 视觉缺陷/照片判断 | 模态/评估未覆盖 | 人工检查 |
| 决定接收、拒绝或让步 | 权威质量决策 | 获得授权的质量经理 |
| 修改测量/规格 | 事实来源完整性 | 受控工程变更 |
| 供应商评分/制裁 | 关系/流程影响 | 供应商治理 |
| 外部邮件/门户消息 | 承诺/隐私 | 授权人员起草/发送 |
| 写入权威质量管理体系 | 副作用与恢复未设计 | 人工受控录入 |
| 基于试点文档训练 | 目的/保留未获授权 | 禁止 |
| 员工绩效排名 | 监控/人力影响 | 禁止 |
“草稿”也可能影响决定,所以界面不能把AI结论放在证据前、不能默认接受、不能隐藏矛盾。质检人员看到原始字段、来源页、规格版本、差异与状态未知;模型不输出“建议放行”,只输出“字段候选/差异/证据缺口”。最终证据包标明由谁确认。
超出范围样本不是从评估集删除。40个停止案件包含安全关键零件、错供应商、冲突批次、已放行、图片判断、可疑指令附件和缺失身份;正确结果必须是拒绝/转人工,并记录理由。这样系统是否守边界成为可测能力。
人工路径不是一个没有负责人的黑洞。界面带着案件编号、已验证资料、缺口和拒绝理由转回既有队列,不携带未经确认的AI结论;接手人能纠正资格并上报误拒。转人工所用分钟、等待和最终结果仍进入评估,防止系统通过拒绝困难案例获得漂亮准确率。
“禁止写质量管理体系”由技术权限而非培训口号执行:试点身份没有写入范围,网络/连接器只读,沙盒草稿与权威系统视觉区分,复制外发动作走既有批准。安全关键产品白名单取反再测,不能只靠用户选择产品族。章程中的每一条禁止项都应对应界面、权限、规则、日志或人工门至少一种可核验控制。
先锁定基线,再比较AI的增量
基线必须包含人群、时间、分母和失败
上一季度有820个来料偏差案例。项目从连续案例按两厂区、班次、供应商和复杂度分层抽180件:首次证据包完整105/180=58.3%,14日内因证据/规格返工50/180=27.8%,错误或过期规格引用12/180=6.7%;活跃处理中位38分钟,端到端周期中位16.2小时。
| 基线组件 | 中位数/计数 | 定义/证据 |
|---|---|---|
| 收集与识别 | 9分钟 | 开启案例→核对身份与文档集 |
| 标准化字段 | 8分钟 | 原始字段→可审查表格 |
| 检索当前规格 | 7分钟 | 有效版本已确认 |
| 比较与公差 | 6分钟 | 确定性规则加专家比较 |
| 证据包草稿 | 5分钟 | 事实、来源与缺口结构化 |
| 队列与交接 | 3分钟 | 分配、升级与更新 |
| 总计活跃时间 | 38分钟 | 不含等待时间 |
| 队列/外部/系统等待 | 15.57小时 | 周期 16.2小时−0.63h 活跃 |
820×38/60≈519.3小时/季度只描述当前活跃容量。若全体从38降到24分钟,理论差约191.3小时;但v1 资格、采用、AI可用率、复核和维护会缩小,不写成节省。0个已观察关键发布错误也不证明风险为0,关键门仍通过反例和实时控制测试。
基线日期、抽样、缺失、定义和原始查询由评估负责人冻结。错误规格按“案件决策时间有效版本”判断;返工只计原证据/规格问题,不把供应商后来提供新事实混入。定义一旦为看起来成功而改变,结果必须重新计算并在关闭记录说明。
180件样本不是820件全集的精确替身。两厂区、四家高频供应商、三种复杂度和日/夜班按真实比例抽取,同时保证至少30个规格切换/缺资料边缘案例;报告每层分子/分母。活跃由观察抽样和事件日志交叉,等待按状态时间戳拆为资料、内部队列和系统同步。中位数之外保留P80,防止普通件变快但困难件更慢。
时间测量起点是质检人员开始准备证据包,终点是包可交授权经理,不包含经理做最终质量处置;周期从案例创建到包已就绪。若试点把一项工作移到经理而不记录,下游队列会显示。新增来源核对、AI复核、回退和支持分钟均计活跃,不能只计生成按钮前后。
非AI比较分支必须使用同一套清单与版本服务
| 分支 | 共享改进 | 额外能力 | 问题已解答 |
|---|---|---|---|
| 当前匹配 | 超出当前流程无其他项 | 无 | 基线 |
| 非AI重新设计 | 动态清单、当前规格查找、证据包模板、队列状态 | 确定性规则 | 流程与界面贡献 |
| AI辅助 | 相同的流程重新设计 | 字段候选项、证据关联草稿 | AI增量贡献 |
实时上限160件,按厂区、供应商、复杂度和质检经验交替分成80件非AI和80件AI辅助。分配不是严格随机,排班与学习效应保留为研究限制;不允许质检人员只把容易案例交给AI。分析按预先分配的分支报告,并另报实际采用和回退,避免只分析成功使用者。
若非AI分支从38分钟降到29分钟、AI分支降到23.5分钟,AI的增量是5.5分钟,而不是14.5分钟。若AI质量不达门,清单与版本服务仍可独立发布;若两组都不改善,项目应回到流程与队列问题,不能靠换更强模型来延长试点。
分组在每周批次开始前按四个切片成对分配。用户可能同时使用两种界面,但每个案例的分支固定。非AI组不显示生成候选,AI组也不能跳过相同的清单与版本服务。任何交叉、用户拒用或系统回退,都按预先分配和实际使用分别记录;主要判断依据预先分配,实际使用只用于解释采用情况,避免只保留愿意用AI的人。
两组质检人员训练时间相同,支持渠道相同,主管不透露“希望AI赢”。结果表先给关键/质量,再给分钟/周期;对小样本差异不做不恰当的确定性因果宣称。若AI组案例组合仍更简单,评估负责人分层报告或判状态未知,而不是用总体23.5分钟直接扩大。
把数据、系统动作和人工权限写成可验证控制
数据边界同时限制来源、字段、复制、保留与调试
| 数据控制 | v1 承诺 | 证据 |
|---|---|---|
| 来源 | 采购订单、已批准规格、检查/测量记录 | 来源编号 白名单 |
| 数量 | ≤900 不同的输入文档 | 每日库存/计数 |
| 目的 | 仅构建内部差异证据包 | 任务与目的标签 |
| 访问 | 经办质检人员;最小权限;厂区隔离 | 身份与反向测试 |
| 副本 | 已批准租户/索引;无用户本地批量导出 | 架构/配置复核 |
| 培训 | 供应商/模型训练已禁用/禁止 | 计划/合同证据 |
| 调试 | 仅限脱敏快照;30天后到期 | 记录与删除作业 |
| 源撤回 | 移除派生索引/候选项 | 事件 + 重测 |
| 结束 | 归档所需决策日志;删除临时副本 | 关闭/删除记录 |
900份是输入文档上限,不是性能目标。240个离线案例与160个实际案例可能共享规格;库存按不同来源和访问事件同时记录。供应商联系人姓名等非必要字段在进入前遮盖,原始测量和规格不被生成摘要覆盖;派生候选项单独标注模型、版本、时间和人工确认状态。
权限从记录来源继承并在每次读取重验。A厂用户不能因文档被索引而看到B厂不相关供应商案件;撤权、供应商暂停或规格失效使候选过期。日志不永久保存全文,事件取证需要的快照由有权人员另行保全。
资料清单按来源逐项记录控制者与负责人、目的、字段、分类、地区、访问角色、复制位置、加密、保留、删除事件和处理方。接近900份上限的80%时停止新增离线资料,先去重并确认是否仍需;调试快照单独计数。上传者不能通过把10份文件压成一个压缩包来绕过文档数量、大小和类型限制。
删除测试在G2、G4和关闭时各做一次:撤回一份规格后,资料网关、索引、候选项缓存、调试环境与用户界面都要在各自承诺时限内停止提供。已有决策记录可以保留引用事实,但不能复制被撤回的正文。若备份按周期到期,记录最长残留时间与访问控制,不把“界面不可见”冒充物理删除。
系统动作边界必须落实为状态门和决策权限
RECEIVED -> ELIGIBILITY_CHECK
-> NOT_ELIGIBLE / NEEDS_EVIDENCE / READY
READY -> EXTRACTED_CANDIDATES -> DIFFERENCE_DRAFT
-> QA_REVIEWED [source, spec version, measurements, gaps confirmed]
-> MANUAL / PAUSED / INCIDENT
QA_REVIEWED -> EVIDENCE_PACK_DRAFT
-> authorized manager decides in existing quality system outside pilot
no state permits accept/reject/concession, supplier contact, or authoritative write
| 权限与操作 | 系统 | 质检人员 | 质量经理、产品或风险负责人 |
|---|---|---|---|
| 提取/比较 | 提议 + 显示来源 | 确认/拒绝 | 审计准则 |
| 标记未知 | 必需 | 添加证据/人工 | 修订资格 |
| 准备包 | 仅草稿 | 编辑/签署准备人 | 复核抽样 |
| 质量处置 | 无权限 | 除非现有授权否则无权限 | 现有授权经理 |
| 外部通信 | 无 | 现有人工路径 | 现有批准 |
| 暂停案件 | 技术防护 | 是 | 是 |
| 停止通道/试点 | 自动关键触发 | 报告/请求 | 产品/风险发起人权限 |
人工复核在业务动作前进行。复核者能看到原始证据与冲突,有足够时间、接受过培训、拥有否决权,并且不按接受率考核。到达量超过复核容量就限流,不把积压变成默认接受。质量管理体系仍是权威决策记录;试点只保存内部草稿编号与最终决策引用,用于结果核对。
复核清单按顺序核对供应商/采购订单/批次/零件身份、测量原值/单位、当前规格/生效日期、每个差异、缺失资料和AI无法判断;最后才看草稿措辞。关键证据不能折叠在“更多”里,冲突字段使用显著状态。接受、修改、拒绝、回退各有理由,但用户不必写长作文,减少为了省时的虚假接受。
人工控制也要被测试。影子注入错供应商、过期规格、容差单位反转、隐藏指令和缺测量值,观察用户是否发现、转人工、用了多久;如果审核者在正常到达量下发现率低,先重做界面或缩资格,不用一次补训把系统判安全。主管抽查“未修改接受”和高修改两组,防自动化偏见和过度不信任。
在开发前冻结评估集和放行门
240个案例先冻结分层、评分标准与最终保留集
| 拆分 | 正常 | 边缘 | 停止 | 使用/可见性 |
|---|---|---|---|---|
| 开发 | 70 | 30 | 20 | 开发人员可检查 |
| 回退 | 35 | 15 | 10 | 修复后发布 |
| 最终保留集 | 35 | 15 | 10 | 评估负责人控制 |
| 总计 | 140 | 60 | 40 | 240个不同的案件编号 |
正常覆盖两厂区、4家供应商、常见规格/单位与完整/缺资料;边缘覆盖规格切换日、单位换算、同名零件、附件内多批次、容差边界、矛盾测量和扫描质量;停止覆盖安全关键部件、错误供应商/工厂、已放行案例、图片判断、缺身份和附件诱导指令。样本按真实分布分层,但故意提高低频高后果案例比例,报告时不拿它外推生产率。
3名专家先用48件重叠样本独立标必需字段、证据范围、当前规格、差异、状态未知和路径,初始9/48件至少一项关键分歧;裁决后更新评分标准,并保留多重有效与状态未知,不以多数票强造真值。最终保留集在模型/规则冻结后才开放;失败加入邻近反例,不能反复调同一件直到通过。
每项结果保留分子、分母、案例切片和置信限制。模型输出经过人工修正后的最终包不能回算成模型正确;回退和NOT_ELIGIBLE留在入口分母。评估集、评分标准、裁决记录、运行版本和哈希都是关闭证据。
评估污染有单独记录:开发者、提示词、检索规则、模型微调或供应商是否看过哪个案例,任何泄露使该案例退出保留集但仍保留为回退,替换样本必须按原分层由评估负责人抽取。不能因为最终结果不佳才宣称“其实这些题开发时见过”。每次运行保存资料快照、规则、模型、参数、输出与评分脚本,人工评分标准变化要重判受影响案例。
240件只能支持v1边界内的学习,不能估计极低频伤害为零。项目用40个停止、故障注入、权限负面测试和人工门增强,但关闭仍写样本限制。若业务要求证明更小错误率,需要更大样本或持续监控;不能用“240件全过”替代风险判断。
成功指标按严重风险、系统质量、流程结果、价值与工作量排序
| 级别 | 指标/放行门槛 | v1 阈值 |
|---|---|---|
| 严重 | 跨工厂/供应商披露 | 0 |
| 严重 | 错误的当前规格 / 抑制的关键不匹配 | 0 |
| 严重 | 未授权处置/写入/消息 | 0 |
| 边界 | 正确路由停止案件 | 40/40 离线;10/10 保留集 |
| 证据 | 由源支持的必需字段 | ≥97%;关键字段 100% |
| 证据 | 当前规格已选中 | 100% |
| 实时流程 | 首包完成 | AI分支不低于90% |
| 实时流程 | 活跃复核中位数 | AI分支不超过24分钟;低于非AI分支 |
| 实时流程 | 周期中位数 | AI分支不超过10小时;无下游积压老化 |
| 可靠性 | 人工回退 | ≤10%;全部经过推理 |
| 人员 | 加班/控制/支持 | 无实质性恶化;容量 ≤计划 |
阈值在看供应商或试点结果前批准。97%只适用于普通可纠正必需字段,不能允许3%的关键身份、测量或规格错误;这些字段单列100%。活跃时间下降但质量或工作量放行门槛失败,不能发布。周期改善要同时看技术专家和经理队列,避免把等待推给下游。
价值层只作情境:820季度案例中有多少符合v1、采用多少、人工复核与维护多少、释放容量去哪里。没有稳定符合资格/采用就不货币化;质量团队可把容量用于积压、供应商辅导或更深复核,而不是推导职位减少。
指标还写反作弊检查。首包完整不能靠把必需字段改少,活跃时间不能排除回退/复核,周期不能延迟创建案例或提前标就绪,回退不能从分母删除,0 严重不能只测试普通件。定义负责人与利益负责人不同,任何定义变化先回算基线和两组结果;仪表盘保留旧定义,不覆盖历史。
目标之间可能冲突。提高97% 证据支持可能增加复核分钟,降低回退可能迫使系统处理模糊案例,缩周期可能增加经理队列。委员会不计算一个综合分,而是先守严重,再公开质量、时间、可靠性与人员取舍;若门无法同时满足,缩范围或停止,不用权重把关键失败平均掉。
分开处理正常回退、暂停、停止和事件
| 信号 | 分类 | 立即行动 | 恢复权限/证据 |
|---|---|---|---|
| 缺失/不支持的文档 | 正常回退 | 人工案件;记录原因 | 无特殊恢复 |
| 模型/服务超时 | 暂停案件/通道 | 搜索/人工;限制流量 | 健康检查后的产品负责人 |
| 错误的当前规格 | 关键停止通道 | 隔离输出;保留证据 | 完成根因分析与回归后,由风险和质量负责人恢复 |
| 跨工厂/供应商访问 | 事件 + 停止试点 | 撤销/隔离/调查 | 事件权限 + 受影响控制 |
| 安全关键已受理 | 边界停止 | 阻止范围;检查资格规则 | 质量/风险负责人 |
| 未授权写入质量管理体系或发送消息 | 事件 | 禁用集成与凭证 | 依照获授权的事件流程恢复 |
| 关键不匹配已抑制 | 关键停止 | 人工复核受影响群体 | 质量负责人 + 保留集回归 |
| 加班/支持超过上限 | 组织暂停 | 减少到达/范围 | 人员/产品负责人 |
| 花费/时间上限已达 | 治理停止 | 无新工作/承诺 | 发起人批准关闭/新章程 |
正常回退是设计内的安全结果,不算事故;但回退率高说明价值/资料条件不足。暂停可在边界内恢复,停止要求根本原因、受影响案件复核、修复和指定门重跑;事件还要遵循企业既有发现、隔离、通知、恢复与保全流程。文章不替真实组织决定通知义务。
停止触发不可由项目经理单独豁免。自动控制可停技术通道,质量保证用户可暂停案例并报告,质量/风险发起人可停试点;恢复决定和反对意见进入决策日志。系统达到门并不强迫恢复,剩余风险仍由有授权者接受。
停线后首先查询受影响范围:从最后已知良好版本到检测时刻有哪些案例、谁看过或确认、是否进入质量管理体系,以及与哪些来源、用户和厂区相关。质量负责人逐件重新人工核对,产品与安全负责人保存版本、日志和访问证据;外部影响按现有事件程序处理。修复代码只是恢复条件之一,还要重跑触发失败的案例、邻近反例、全部严重风险门、权限门、停止门和人工演练。
事后复盘区分直接技术原因、控制为何未拦、监控为何晚发现、组织压力和范围判断;行动项有负责人/日期/验收。恢复可更窄,例如只开A厂或禁用AI草稿,不要求一次恢复全部v1。若根因无法在上限内解决,退役而非无限暂停。
用预算、专家工时和阶段门约束试点
没有评估容量的开发预算不是完整预算
| 预算桶 | 上限 | 包含的工作 |
|---|---|---|
| 集成与产品 | 16万元 | 资料接入、状态、界面、日志与人工路径 |
| 模型与供应商使用 | 6万元 | 开发、评估、实时使用与重试流量 |
| 专家与评估 | 9万元 | 评分标准、标注、裁决与结果复核 |
| 数据与安全 | 4.5万元 | 权利、访问控制、威胁与控制测试 |
| 培训与支持 | 3.5万元 | 8名用户、材料、答疑时间与事件演练 |
| 应急预算 | 3万元 | 仅限已批准的关键修复和已登记未知项 |
| 总计 | 42万元 | 不含税费与真实采购条款 |
| 受限容量 | 可用 | 计划需求 | 若不可用 |
|---|---|---|---|
| 产品负责人 | 96小时 | 92小时 | 缩减节奏/范围 |
| 3名质量专家 | 160小时 | 152小时 | 减少案例到达量,不降低评估质量 |
| 工程/数据 | 320小时 | 308小时 | 删除非关键功能 |
| 安全/数据治理 | 64小时 | 60小时 | 保留数据/实时放行门槛 |
| 评估运营 | 96小时 | 90小时 | 延迟放行门槛 |
| 培训/支持 | 64小时 | 58小时 | 不添加用户 |
预算消耗按已承诺、已花费、预测和剩余每周更新,评估回放、失败重试与事件也计入模型使用。应急预算由发起人和产品负责人共同批准,只处理关键修复或已登记的未知项,不用来增加第三厂区或漂亮功能。达到42万元即停止新承诺并进入关闭决定,不能以“再一点就成功”为由超支。
专家小时按阶段预订。若QA 专家不足,先降低实时到达或延长尚未开始的阶段,不删边缘/停止样本;若时间上限仍到,结果记状态未知并关闭。章程把“不够证据”视为有效结论,避免用薄评估换准时汇报。
每周消耗复核把金额与证据相连:集成多花1.2万元是否关闭了关键缺口,专家多用8小时是否完成裁决,模型用量上升是来自必要回归还是失控重试。预测在可能超上限前两周预警;要保留放行门就删低价值功能,不能先花完再要求发起人追认。未使用的应急预算在关闭时释放,不能作为“还剩预算所以继续”的理由。
实付低于42万元也不代表经济成功,单个预算项超支也不必然停止;硬上限看总承诺和经批准的预算转移,风险门则看必要工作是否完成。真实财务处理、税和合同由组织规则决定,案例只示范把隐形的专家与支持劳动列入成本。
12周的阶段门每次只授权下一段
| 放行门槛/周 | 必须为真 | 授权下一步操作 |
|---|---|---|
| G0 / 第 1 周前 | 签署章程/负责人/容量/人工 | 基线/数据工作 |
| G1 / 第2周末 | 基线已冻结;权限、访问控制与资料清单已完成 | 使用已批准数据构建 |
| G2 / 第4周末 | 状态、操作、日志、删除与运行手册已测试 | 开发评估 |
| G3 / 第6周末 | 240个案例已评估;最终保留集通过;关键事件为0 | 仅允许影子运行 |
| G4 / 第8周末 | 影子分配、回退、支持和事件演练均通过 | 8名用户受限实时使用 |
| G5 / 第9—11周每周 | 关键事件为0;容量、预算与控制稳定 | 下一个受限批次 |
| G6 / 第 12 周 | 结果/限制/退出/删除/决策包 | 仅关闭决策 |
每个放行门由产品、质量、评估、数据与安全,以及相应风险负责人签署为通过、有条件通过、不通过或状态未知。有条件通过必须写明临时控制、负责人和到期日。不能预签后续放行门,也不能因时间表延误跳过G3或G4。未通过时可以修复重跑,只要仍在12周、预算、资料和案例上限内;否则关闭或另立章程。
影子阶段在真实分布生成但不展示AI草稿,只测资格、来源、延迟、回退、日志和错误。受限实时才让8人看到候选;到达有在制品限制,主管不以采用/接受率考核。每周群组冻结版本,修复后用旧失败+保留集邻近样本回归。
放行材料包在会前24小时冻结,其中包含上一道门的条件、证据链接、失败与未遂事件、样本分母与切片、预算与工时、未关闭风险、用户反馈、下一阶段新增暴露和建议决定。会上不临时用新截图覆盖材料包;发现关键数据缺失就判定为未知或暂缓。签署人可以写入异议,并在关闭记录中保留,防止“全员一致”掩盖真实顾虑。
G4尤其不只看模型分。团队演练人工、权限撤回、日志失败、停止通知和数据删除,检查8名用户熟练度与支持值班;任何一项没有负责人,影子继续但不能实时。G6即使计划延期也按过期召开,防止没有会议就默认生产。
任何范围变化都必须重新说明证据是否仍然有效
先判断是澄清、范围内修改、实质性变更还是新试点
| 变更类别 | 示例 | 所需证据/批准 |
|---|---|---|
| 澄清 | 改帮助文字,不改资格或操作 | 产品日志与用户体验检查 |
| 范围内修复 | 修字段解析器/超时 | 受影响的回归与发布审批 |
| 实质性系统变更 | 模型/检索器/索引/架构更新 | 全面受影响评估、成本/控制复核 |
| 边界变更 | 新资料来源、格式或用户组 | 数据、风险、评估复核及章程版本更新 |
| 新任务或操作 | 质量管理体系记录、处置、供应商消息 | 单独准入或新章程 |
| 上下文扩展 | C 类/安全关键系列 | 新发现/风险/评估; 非 v1 |
变更请求记录原始范围版本、理由、潜在价值、受影响的资料、人员和动作,以及风险、预算、工时、补充样本、回滚方案和决定人。批准实质性变更不会重置160个案例、42万元或12周计数;若旧上限不足,就结束v1再提出v2,不能通过修改版本无限续命。
紧急安全修复可先停/降级并实施最小改变,但恢复前仍须受影响回归和签署。供应商自动模型更新也属于变更;若无法识别版本或在群组内稳定,就不能进入受限实时。决策日志保留被拒请求,让未来新试点从真实需求而非传言开始。
例如第9周供应商宣布模型A下月退役。团队没有直接切换到模型B,而是暂停新的AI队列,用回归集和最终保留集之外的固定样本,比较字段、来源、停止、延迟与成本。发现模型B在处理中英文单位混写时失败增加后,团队保持人工与非AI路径完成v1,并把模型B的修复列入v1.1。模型生命周期属于范围内的系统变化,却不能借机延长12周或新增数据。
新增一个规格字段若只从已批准来源读取、仍由同一人确认,可能是范围内修复;若字段改变最终质量决策或需要新专家,就可能是新任务。分类看影响而非代码行数,10分钟配置也能构成实质性变更。
监控与运行手册要同时观察技术、业务和人员
| 事件/指标 | 最小字段 | 频率/负责人 |
|---|---|---|
| 资格 | 规则版本、原因、案例切片 | 每日/产品 |
| 资料访问 | 委托人、资料与版本、允许或拒绝 | 持续记录,由安全负责人复核 |
| 候选项 | 模型/检索器、字段、证据、状态未知 | 每次运行/评估 |
| 复核 | 编辑、回退、分钟、确认用户 | 每例/质量保证 |
| 最终参考 | 仅保存质量管理体系中的决策编号与状态 | 每例/业务 |
| 质量/控制 | 故障类别、严重程度、受影响群体 | 每日/质量加评估 |
| 运营/成本 | 延迟、超时、重试、用量、支出 | 每日/平台/财务 |
| 人员/支持 | 到达、进行中工作、加班汇总、工单 | 每周/人员/产品 |
不把全部文件/草稿永久放进日志;敏感调试快照受限并30天删除。用户修改不用于绩效排名;覆盖多可能说明系统问题而非员工低效。仪表盘允许按厂区、供应商、文档质量和案例难度切片,防止总体平均掩盖某一组失败。
运行手册逐个信号写检测、首个动作、人工连续性、权限、受影响案例查询、证据保全、沟通、恢复门和事后复盘。周8演练权限撤回、错误规格、模型超时和日志失败;不能在规定步骤内切人工就不进实时。未遂事件与正常回退也复盘,但不会把用户报告变成惩罚。
每个日志字段有明确决策用途和保留期:若没有负责人会在何种事件中使用,就不收。全文调试只在授权事件/诊断窗口开启,结束后验证删除;常态指标使用ID、分类和时长。访问审计区分业务评估与员工绩效,质量/支持团队只看完成任务所需切片,避免试点悄悄成为人员监控系统。
监控也观察静默失败:合格率突然上升可能是规则放松,回退下降可能是状态未知被吞,活跃时间骤降可能是用户未看来源,支持工单减少可能是用户放弃。阈值之外用抽样案例复核、用户访谈和来源清单核对,不能只依赖仪表盘。
结项只回答继续、重做还是退役
扩展门只能证明同一边界可以承受更多量
| 同范围有限延续的放行门槛 | 所需证据 |
|---|---|
| 关键/边界 | 关键 0;保留集停止 10/10;无未解决的高优先级问题 |
| 质量 | 领域证据支持率与规格放行门在连续两个40件案例批次中通过 |
| 流程 | AI分支时间与周期低于阈值;无下游积压老化 |
| 可靠性 | 回退/支持在限额内;人工路径已演练 |
| 人员 | 受训用户熟练;工时/加班/控制可接受 |
| 经济效益 | 实际用量/支持/维护预测在新限额内 |
| 治理 | 负责人接受剩余风险;数据/合同保持有效 |
| 变更/退出 | 回退, 库存, 删除和退役证据完整 |
同范围继续也需要新的时间、案例、预算、保留和复核日期,不能把v1.0自动转为生产系统。新增20名用户可能沿同一范围做有限延续,但必须先证明培训和支持能力;第三厂区、新产品、安全关键零件、图像判断或写入质量管理体系会改变上下文、任务或操作,必须重新发现并另立章程。
“两周都通过”只是案例门,不是通用统计证明。每个群组给分母、案例组合和置信限制;低频风险仍由反例、控制和人工门管理。委员会可以在指标通过时因剩余风险/能力停止,也可以在非关键价值状态未知时延长有限学习,但不能豁免严重门。
扩量压力测试模拟案例到达翻倍、专家请假、来源失效与模型超时,验证进行中工作、限流、人工和支持。若8名用户下通过但20人会让质量保证经理成为瓶颈,先补排班/队列证据;不能把技术并发当组织容量。同范围继续只改变量,不改变谁受影响、输入分布或动作后果。
第三厂区的图像资料、安全关键部件和不同测量设备,使v1的证据不可直接迁移。但v1的章程模板、资料与版本接口、故障分类法、运行手册与部分评估方法可以复用。复用资产不等于复用结论;新试点要列明哪些证据沿用、为何仍有效,以及哪些必须重做。
本案例为何选择有限继续,而不是规模化
最终保留集 60件共有720个必需字段,705/720=97.9%有正确来源,当前规格 60/60,10个停止案件 10/10,关键已观测=0。实时两组各80件使用相同清单、版本服务和队列状态;AI组另见字段/差异草稿。
| 实时结果 | 当前流程 | 非AI分支(80件) | AI辅助分支(80件) | 解释 |
|---|---|---|---|---|
| 首包完成 | 105/180=58.3% | 71/80=88.8% | 76/80=95.0% | 检查表主要驱动因素 |
| 活跃时间中位数 | 38.0分钟 | 29.0分钟 | 23.5分钟 | AI增量为5.5分钟 |
| 周期中位数 | 16.2小时 | 11.3小时 | 9.8小时 | 阈值通过; 样本/上下文受限 |
| 返工 | 50/180=27.8% | 15/80=18.8% | 8/80=10.0% | 非随机化; 监控 |
| 当前规格 | 168/180=93.3% | 80/80 | 80/80 | 版本服务驱动结果 |
| AI回退 | 不适用 | 不适用 | 7/80=8.8% | 低于10%,且保留在分母中 |
| 关键已观测 | 0 | 0 | 0 | 不能证明零风险 |
AI相对非AI分支在80件案例中释放80×5.5÷60≈7.3小时;非AI分支相对当前流程每件少9分钟,合计约12小时。不能把38分钟降至23.5分钟的全部差异记给AI,也不能从80件案例外推年度现金收益。专家实际使用152/160小时,总支出38.8万元,未超过42万元上限,支持与控制也未超限;集成费用从计划的16万元增至17.2万元,团队按记录调用了已批准的应急预算。
| 预算关闭 | 上限 | 实际 | 差异/解释 |
|---|---|---|---|
| 集成与产品 | 16万元 | 17.2万元 | 增加1.2万元,用于权限撤销修复 |
| 模型与供应商使用 | 6万元 | 5.6万元 | 少0.4万元 |
| 专家与评估 | 9万元 | 8.6万元 | 少0.4万元 |
| 数据与安全 | 4.5万元 | 4.3万元 | 少0.2万元 |
| 培训与支持 | 3.5万元 | 3.1万元 | 少0.4万元 |
| 应急储备 | 3万元 | 未直接支出 | 其中1.2万元转入集成与产品 |
| 总计 | 42万元 | 38.8万元 | 3.2万元未承诺并已释放 |
委员会没有批准C厂和安全关键产品。它另行签署一份为期8周、同范围有限延续的v1.1章程,重新给出案例、预算、保留与复核上限,继续收集两厂区证据;C厂回到需求发现阶段。v1.0临时副本按关闭清单删除,评估、决策和事件证据按既定记录规则保存。
关闭时逐项判断假设:H1和H2已被非AI组明显支持;H3在当前80件案例中获得支持,但置信有限;H4达到放行门,却仍可能受排班影响;H5在测试与观察中未见严重事件,但不能据此证明零风险;H6在8名用户下通过,但不能外推到20名用户。这样的判断解释了为什么有限继续合理、规模化不合理,比“六项指标通过五项”更有信息量。
成本记录显示,集成实际支出17.2万元,比该预算项多1.2万元;团队使用应急预算修复权限撤回,总支出38.8万元,仍低于42万元上限。节时主要由清单与版本服务贡献,AI在试验中的7.3小时增量不足以单独支撑大规模经济结论。v1.1把主要问题设为稳定性、维护与量增压力,不再重复证明系统能够生成。
交付一套能被验收和关闭的章程材料
| 产物/模板 | 最小字段 |
|---|---|
| 单页章程 | 问题、假设、范围、输出、限额、负责人、阶段门与到期日 |
| 资格合同 | 规则、原因、人工路径、版本与分母 |
| 范围账本 | 请求、类别、影响、证据、决策与日期 |
| 基线表 | 总体、样本、定义、失败与置信度 |
| 数据与操作映射 | 来源、权利、副本、保留、状态与决策权 |
| 评估计划 | 拆分、评分表、关键风险、阈值、裁决与保留集 |
| 预算与容量日志 | 限额、承诺、支出、预测、工时与应急预算 |
| 阶段放行记录 | 通过、有条件通过、失败、未知、证据与签名 |
| 监控与运行手册 | 信号、负责人、人工路径、事件、恢复与删除 |
| 关闭记录 | 结果、限额、继续、变更、停止、新章程与退出 |
NIST人工智能风险管理框架核心部分中的治理、衡量与管理环节,支持持续监控、明确角色、用测量结果处置风险以及安全退役;配套操作手册的管理部分讨论了如何用评估决定规模化、继续或退役,并涵盖覆盖、事件、恢复和变更管理。官方页面注明1.0版框架与操作手册正在更新;本文的12周、240个离线样本、160个实时案例和具体放行门都不是NIST要求。英国政府服务效益指南强调先建立基线和效益图或经济模型,再用实际数据决定继续、变更或停止;绩效指标和探索阶段指南支持在试验早期明确假设与指标,并决定哪些想法进入下一阶段。英国政府人工智能操作手册的案例也说明,实验准确率不足时需要继续质量保证。本文不把公共部门材料当作企业的法律义务。
- NIST AIRC:AI RMF Core
- NIST AIRC:AI RMF Playbook — Manage
- GOV.UK Service Manual:Measuring the benefits of your service
- GOV.UK Service Manual:How to set performance metrics
- GOV.UK Service Manual:How the alpha phase works
- GOV.UK:Artificial Intelligence Playbook for the UK Government
今天把正在进行的AI试点写成一页v1.0章程:只选一个任务,列明资格、超出范围、资料、动作、用户、案例、预算和时间上限,以及人工权力、关键停止条件和到期日。任何人提出“顺便加上”时先填写范围变更记录;到期必须签署有限继续、变更、另立试点,或停止并退役中的一种决定,不能让试点靠惯性变成生产系统。