先看填好的边界:12周只学习一个证据包任务,达标后也不自动获得第三厂区或产品放行权

棠岳精密有1,260名员工、3个厂区。来料检验偏差由质检人员把采购订单、供应商报告、当前规格和测量记录组成证据包,再由有授权的质量经理决定接收、隔离、让步或退货。旧方案写“用AI自动审查供应商质量,成功后推广全公司”,没有产品范围、资料、动作、基线或停止条件。

重写后的章程 v1.0只覆盖2个厂区、1个非安全关键机加工支架产品族、8名质检人员、12周、最多160个实际案例。系统只抽取候选字段、比对当前规格并草拟内部偏差证据包;不能决定合格、放行、隔离、让步、供应商评分或外发通知。第三厂区涉及图像测量和安全关键部件,即使本试点达标也须另做发现和新章程。

章程上限 承诺值
目的 提高证据包完整/可追溯,缩短人工准备与队列
持续时间 12 周;无静默扩展
人员 8名质检人员;3名专家评估员;负责人实名登记
地点与产品 2个厂区;1个非安全关键支架产品族
离线评估 240个冻结案例:140个正常、60个边缘、40个停止
实时上限 160个符合条件的案例:80个非AI、80个AI辅助
数据上限 不超过900份输入文档;仅限已批准租户
行动上限 只读和内部草稿;由授权人员决定与放行
支出上限 42万元;其中包含3万元应急预算
关闭 有限继续、变更、新试点,或停止并退役

公司、人员、产品、资料、费用、样本和结果均为虚构教学案例。本文提供章程设计方法,不替代质量体系、安全、供应商、数据、合同、劳动、行业、法律或财务判断;真实高后果产品与正式放行须由获得相应授权的专业人员负责。

v1.0首页还写明生效与失效条件:G0五名负责人完成签署后才可使用资料,第12周周五自动到期。到期后只允许人工处理、证据保全和关闭工作,不允许继续给用户生成。业务发起人对问题、收益和资源负责,质量负责人对任务与授权边界负责,数据与安全负责人对资料及访问负责,评估负责人独立判断是否通过放行门,产品负责人对交付、运行和退役负责。任何人不能同时代表所有责任签完一页。

章程批准的是“在这些限制内收集决定所需证据”,不是某个模型、供应商或预定上线。若第4周发现非AI的版本查询服务已经解决主要问题,团队可更改后续实验比较,但仍受案例、费用和时间上限约束;若业务不再需要,即使技术表现优秀也应提前关闭。可撤回的授权使停止成为正常治理结果,而不是失败羞辱。

先切断试点无限扩张的入口

一句“顺便加上”可能同时改变分布、权利、动作和责任

最常见扩张不是管理层正式批准,而是实施中的合理小请求:既然能读PDF,就顺便读供应商邮件;既然能比规格,就顺便建议放行;既然A厂好用,就给C厂账号;既然模型升级更强,就直接切换。这些请求分别改变资料来源、外部动作、用户/环境和系统版本,旧评估不再充分。

请求 隐藏变更 必要路由
加第三厂区 设备/数据/用户分布 新发现及章程版本
加安全关键零件 伤害/风险容忍度/授权 单独准入; 非 v1
读取供应商邮箱 目的/访问/注入面 数据/安全复核及新测试
自动写入质量管理体系 外部/权威副作用 工具/批准/回滚设计
自动给供应商发信 外部承诺/隐私 新任务及人工发布控制
换模型/检索器 行为/成本/版本 回归及变更批准
多加20名用户 支持/培训/容量 扩展放行门槛
延长三个月 新承诺/数据保留 关闭决策, 无自动回滚

章程不是反对学习,而是让每次学习改变有记录。范围账本把请求标为澄清、范围内变更、实质性变更或新试点;提出者、影响门、补充样本、成本、负责人、决定和日期均保存。没有决定的请求保持积压,不由开发者在迭代中悄悄实现。

前线用户不必记住整份章程。界面把当前厂区、产品、来源和行动边界显示在案例页;不符合资格时,给出明确理由、状态代码(NOT_ELIGIBLE)和人工入口。帮助页列出常见“顺便”请求应去哪里。开发积压中的每一项都关联范围编号,代码复核检查是否新增资料、动作、用户或模型行为;采购变更、连接器配置和管理员开关同样进入账簿,不能只管代码。

范围复核每周只处理已填写影响记录的请求。提出人须说明业务问题、为什么现有人工不足、预计案例量和受影响人;技术团队补资料/权限/模型/日志,评估负责人补样本/门,财务补上限,风险负责人给处置。拒绝不是永久封杀,而是“v1没有证据/授权”;记录下一次重审需要什么,防止请求不断换名字绕过。

章程、项目计划、风险评估和设计文档不能互相冒充

产物 主要问题 决策负责人 更新触发器
试点章程 获准学习什么,边界、放行门和结束决定是什么 业务及风险发起人 实质性范围或承诺变化
项目计划 谁在何时交付哪些工作 交付负责人 任务或依赖变更
风险评估 哪些影响、控制与剩余风险 合格风险负责人 上下文/控制/证据变更
任务与系统设计 输入、状态、接口、人工与恢复怎样工作 产品与架构负责人 设计或发布变更
评估计划 样本、评分标准、门、分析和限制 独立评估负责人 失败/模型/范围变更
运行手册/事件计划 怎样监控、降级、隔离、恢复 服务/事件负责人 演练/事件/变更
关闭记录 继续、限制、修改或退役依据 决策委员会 阶段/过期

一页章程不需要塞入全部技术细节,但必须链接到有版本的证据,并写哪份文件拥有真相。架构图改变不能暗改章程的动作边界;项目计划按期完成也不能代替业务/风险门;风险登记册有一行“人工复核”也不能代替具体审核位置和权限。

签署意味着授权一段有限学习,不是承诺“成功就上线”。发起人承诺专家、预算和停止支持;产品负责人承诺范围;评估负责人可独立报告不利结果;风险负责人可暂停;用户能转人工和报告未遂事件。若这些权限没有资源,签字只是装饰。

所有链接文件使用同一个试点编号、范围版本和发布版本。章程v1.0可链接设计1.3与评估1.1,但关闭必须说明实际运行了哪些版本;设计更新若影响行为,变更记录决定是否升级章程。会议纪要或聊天不能成为唯一批准证据。签署、条件、反对意见、到期和已取代状态都要保留,避免事后用新文件覆盖旧决定。

项目计划可能在不改范围时调整日期,例如专家生病导致G3推迟;但12周过期不自动顺延。若剩余时间不足收齐证据,发起人只能缩小尚未开始的活跃队列、接受状态未知并关闭,或提出新的有限授权。进度压力不能把 保留集、事件演练 或删除验收挤掉。

把试点写成一项可以证伪的决策

先分清交付物、中间结果与业务结果

当前驱动因素是证据包不完整、规格版本查错和交接等待,不是“没有生成式AI”。赋能变更包括统一必填清单、当前规格接口、字段候选和证据链接;中间结果是首次证据包更完整、质检复核更短;业务结果才是偏差决定周期缩短且质量不降。

假设编号 如果发生的变化 预期结果与度量 证伪证据
H1 动态清单及来源链接 首包完整性上升 缺失项未变
H2 当前版本服务 错误/过期规范降级至 0 任何错误的当前规范
H3 AI提取候选项 复核时间中位数低于非AI分支 编辑与复核时间相等或更高
H4 结构化证据包及队列状态 周期低于10小时 等待只是向后转移
H5 未知状态可见,且由人作最终判断 关键不匹配被拦截 不匹配被抑制或错误接受
H6 完成培训并限制到达量 工作负载与控制不恶化 加班、害怕改判或支持请求激增

章程允许AI假设失败而非AI改善成功。H1和H2可能由清单和版本服务实现;若H3没有增量,项目仍可发布非AI流程,而不为保住“AI试点成功”歪曲结果。每条假设有负责人、来源、分母、目标和反证,结项逐条判定通过、失败或未知。

收益图把驱动因素→赋能变更→中间结果→最终结果逐箭头编号。动态清单只能直接影响缺资料,版本服务影响错规格,AI候选影响字段查找/草拟,队列状态影响等待;“供应商质量提高”不在12周可归因范围。若周期下降,分析要说明来自资料等待、活跃、队列哪一段,不能把整个结果挂到模型节点。

每条假设还写替代解释:首次完整率上升可能是供应商同期培训,活跃时间下降可能是只挑简单件,周期下降可能是淡季,返工下降可能来自经理改变关闭口径。项目用连续案例、交替分组、相同定义和切片减弱这些影响,无法排除就降低置信,而不是补更多小数。

资格必须既能由系统检查,也能向一线人员解释

资格字段 已准入 v1 未准入/路由
工厂 A/B C→新发现
产品 已命名的支架产品族及版本列表 其他产品或安全关键产品→人工
供应商 带活跃合同的批准列表 新建/暂停→供应商流程
文档 采购订单、检查报告、规格、测量表 邮件/聊天/未知附件→人工
语言/格式 已批准的中文/英文 PDF/CSV 文件 手写/仅图像→人工
决策阶段 质量处置前 已放行或投诉后→事件或其他流程
所需身份 供应商/采购订单/批次/零件全部匹配 冲突/缺失→需要证据
数据类别 已批准的供应商机密/内部信息 受限/超出字段范围的个人信息→停止

入口先用确定性规则检查厂区、零件系列、供应商状态、文档集和决策状态,再允许模型读取。无法确认时不能以低置信度“继续试试”,而应标记为不符合资格(NOT_ELIGIBLE)或需要证据。用户界面显示为什么不合格、由谁处理和人工路径;资格事件进入分母,不能只统计成功进入的案例。

160个实时案例按案件编号去重,失败重试不能生成新案例来逃避上限。若同一案例新增关键资料,形成新版本但仍计一件;产品或供应商状态在处理中改变,则暂停并重新判断是否符合入口条件。入选名单和规则版本冻结到每周放行,临时口头例外无效。

资格仪表盘同时显示全部到达、已受理、需要证据、不符合资格、人工和错误入场。假设三周到达260件、160件入场、54件缺资料、46件不合范围,只报告160会虚构采用和性能;分母必须保留260。按厂区、供应商、班次和文档格式切片,若B厂NOT_ELIGIBLE异常高,先查资料/规则,不用总体平均掩盖。

入口规则也接受反向测试:20个看似相同但工厂/供应商/零件不同的案例必须拒绝,20个边界内但格式稍差的案例应进入需要证据而非被永久排除。过严会降低价值并把工作藏回人工,过松会扩大风险;二者各有负责人和门。规则改变后重放全部负面与边界样本。

超出范围必须写明具体动作和理由

排除项/操作 原因 安全路径
安全关键/受监管零件 后果/风险证据不同 现有专家流程
视觉缺陷/照片判断 模态/评估未覆盖 人工检查
决定接收、拒绝或让步 权威质量决策 获得授权的质量经理
修改测量/规格 事实来源完整性 受控工程变更
供应商评分/制裁 关系/流程影响 供应商治理
外部邮件/门户消息 承诺/隐私 授权人员起草/发送
写入权威质量管理体系 副作用与恢复未设计 人工受控录入
基于试点文档训练 目的/保留未获授权 禁止
员工绩效排名 监控/人力影响 禁止

“草稿”也可能影响决定,所以界面不能把AI结论放在证据前、不能默认接受、不能隐藏矛盾。质检人员看到原始字段、来源页、规格版本、差异与状态未知;模型不输出“建议放行”,只输出“字段候选/差异/证据缺口”。最终证据包标明由谁确认。

超出范围样本不是从评估集删除。40个停止案件包含安全关键零件、错供应商、冲突批次、已放行、图片判断、可疑指令附件和缺失身份;正确结果必须是拒绝/转人工,并记录理由。这样系统是否守边界成为可测能力。

人工路径不是一个没有负责人的黑洞。界面带着案件编号、已验证资料、缺口和拒绝理由转回既有队列,不携带未经确认的AI结论;接手人能纠正资格并上报误拒。转人工所用分钟、等待和最终结果仍进入评估,防止系统通过拒绝困难案例获得漂亮准确率。

“禁止写质量管理体系”由技术权限而非培训口号执行:试点身份没有写入范围,网络/连接器只读,沙盒草稿与权威系统视觉区分,复制外发动作走既有批准。安全关键产品白名单取反再测,不能只靠用户选择产品族。章程中的每一条禁止项都应对应界面、权限、规则、日志或人工门至少一种可核验控制。

先锁定基线,再比较AI的增量

基线必须包含人群、时间、分母和失败

上一季度有820个来料偏差案例。项目从连续案例按两厂区、班次、供应商和复杂度分层抽180件:首次证据包完整105/180=58.3%,14日内因证据/规格返工50/180=27.8%,错误或过期规格引用12/180=6.7%;活跃处理中位38分钟,端到端周期中位16.2小时。

基线组件 中位数/计数 定义/证据
收集与识别 9分钟 开启案例→核对身份与文档集
标准化字段 8分钟 原始字段→可审查表格
检索当前规格 7分钟 有效版本已确认
比较与公差 6分钟 确定性规则加专家比较
证据包草稿 5分钟 事实、来源与缺口结构化
队列与交接 3分钟 分配、升级与更新
总计活跃时间 38分钟 不含等待时间
队列/外部/系统等待 15.57小时 周期 16.2小时−0.63h 活跃

820×38/60≈519.3小时/季度只描述当前活跃容量。若全体从38降到24分钟,理论差约191.3小时;但v1 资格、采用、AI可用率、复核和维护会缩小,不写成节省。0个已观察关键发布错误也不证明风险为0,关键门仍通过反例和实时控制测试。

基线日期、抽样、缺失、定义和原始查询由评估负责人冻结。错误规格按“案件决策时间有效版本”判断;返工只计原证据/规格问题,不把供应商后来提供新事实混入。定义一旦为看起来成功而改变,结果必须重新计算并在关闭记录说明。

180件样本不是820件全集的精确替身。两厂区、四家高频供应商、三种复杂度和日/夜班按真实比例抽取,同时保证至少30个规格切换/缺资料边缘案例;报告每层分子/分母。活跃由观察抽样和事件日志交叉,等待按状态时间戳拆为资料、内部队列和系统同步。中位数之外保留P80,防止普通件变快但困难件更慢。

时间测量起点是质检人员开始准备证据包,终点是包可交授权经理,不包含经理做最终质量处置;周期从案例创建到包已就绪。若试点把一项工作移到经理而不记录,下游队列会显示。新增来源核对、AI复核、回退和支持分钟均计活跃,不能只计生成按钮前后。

非AI比较分支必须使用同一套清单与版本服务

分支 共享改进 额外能力 问题已解答
当前匹配 超出当前流程无其他项 基线
非AI重新设计 动态清单、当前规格查找、证据包模板、队列状态 确定性规则 流程与界面贡献
AI辅助 相同的流程重新设计 字段候选项、证据关联草稿 AI增量贡献

实时上限160件,按厂区、供应商、复杂度和质检经验交替分成80件非AI和80件AI辅助。分配不是严格随机,排班与学习效应保留为研究限制;不允许质检人员只把容易案例交给AI。分析按预先分配的分支报告,并另报实际采用和回退,避免只分析成功使用者。

若非AI分支从38分钟降到29分钟、AI分支降到23.5分钟,AI的增量是5.5分钟,而不是14.5分钟。若AI质量不达门,清单与版本服务仍可独立发布;若两组都不改善,项目应回到流程与队列问题,不能靠换更强模型来延长试点。

分组在每周批次开始前按四个切片成对分配。用户可能同时使用两种界面,但每个案例的分支固定。非AI组不显示生成候选,AI组也不能跳过相同的清单与版本服务。任何交叉、用户拒用或系统回退,都按预先分配和实际使用分别记录;主要判断依据预先分配,实际使用只用于解释采用情况,避免只保留愿意用AI的人。

两组质检人员训练时间相同,支持渠道相同,主管不透露“希望AI赢”。结果表先给关键/质量,再给分钟/周期;对小样本差异不做不恰当的确定性因果宣称。若AI组案例组合仍更简单,评估负责人分层报告或判状态未知,而不是用总体23.5分钟直接扩大。

把数据、系统动作和人工权限写成可验证控制

数据边界同时限制来源、字段、复制、保留与调试

数据控制 v1 承诺 证据
来源 采购订单、已批准规格、检查/测量记录 来源编号 白名单
数量 ≤900 不同的输入文档 每日库存/计数
目的 仅构建内部差异证据包 任务与目的标签
访问 经办质检人员;最小权限;厂区隔离 身份与反向测试
副本 已批准租户/索引;无用户本地批量导出 架构/配置复核
培训 供应商/模型训练已禁用/禁止 计划/合同证据
调试 仅限脱敏快照;30天后到期 记录与删除作业
源撤回 移除派生索引/候选项 事件 + 重测
结束 归档所需决策日志;删除临时副本 关闭/删除记录

900份是输入文档上限,不是性能目标。240个离线案例与160个实际案例可能共享规格;库存按不同来源和访问事件同时记录。供应商联系人姓名等非必要字段在进入前遮盖,原始测量和规格不被生成摘要覆盖;派生候选项单独标注模型、版本、时间和人工确认状态。

权限从记录来源继承并在每次读取重验。A厂用户不能因文档被索引而看到B厂不相关供应商案件;撤权、供应商暂停或规格失效使候选过期。日志不永久保存全文,事件取证需要的快照由有权人员另行保全。

资料清单按来源逐项记录控制者与负责人、目的、字段、分类、地区、访问角色、复制位置、加密、保留、删除事件和处理方。接近900份上限的80%时停止新增离线资料,先去重并确认是否仍需;调试快照单独计数。上传者不能通过把10份文件压成一个压缩包来绕过文档数量、大小和类型限制。

删除测试在G2、G4和关闭时各做一次:撤回一份规格后,资料网关、索引、候选项缓存、调试环境与用户界面都要在各自承诺时限内停止提供。已有决策记录可以保留引用事实,但不能复制被撤回的正文。若备份按周期到期,记录最长残留时间与访问控制,不把“界面不可见”冒充物理删除。

系统动作边界必须落实为状态门和决策权限

可复制模板
RECEIVED -> ELIGIBILITY_CHECK
  -> NOT_ELIGIBLE / NEEDS_EVIDENCE / READY
READY -> EXTRACTED_CANDIDATES -> DIFFERENCE_DRAFT
  -> QA_REVIEWED [source, spec version, measurements, gaps confirmed]
  -> MANUAL / PAUSED / INCIDENT
QA_REVIEWED -> EVIDENCE_PACK_DRAFT
  -> authorized manager decides in existing quality system outside pilot
no state permits accept/reject/concession, supplier contact, or authoritative write
权限与操作 系统 质检人员 质量经理、产品或风险负责人
提取/比较 提议 + 显示来源 确认/拒绝 审计准则
标记未知 必需 添加证据/人工 修订资格
准备包 仅草稿 编辑/签署准备人 复核抽样
质量处置 无权限 除非现有授权否则无权限 现有授权经理
外部通信 现有人工路径 现有批准
暂停案件 技术防护
停止通道/试点 自动关键触发 报告/请求 产品/风险发起人权限

人工复核在业务动作前进行。复核者能看到原始证据与冲突,有足够时间、接受过培训、拥有否决权,并且不按接受率考核。到达量超过复核容量就限流,不把积压变成默认接受。质量管理体系仍是权威决策记录;试点只保存内部草稿编号与最终决策引用,用于结果核对。

复核清单按顺序核对供应商/采购订单/批次/零件身份、测量原值/单位、当前规格/生效日期、每个差异、缺失资料和AI无法判断;最后才看草稿措辞。关键证据不能折叠在“更多”里,冲突字段使用显著状态。接受、修改、拒绝、回退各有理由,但用户不必写长作文,减少为了省时的虚假接受。

人工控制也要被测试。影子注入错供应商、过期规格、容差单位反转、隐藏指令和缺测量值,观察用户是否发现、转人工、用了多久;如果审核者在正常到达量下发现率低,先重做界面或缩资格,不用一次补训把系统判安全。主管抽查“未修改接受”和高修改两组,防自动化偏见和过度不信任。

在开发前冻结评估集和放行门

240个案例先冻结分层、评分标准与最终保留集

拆分 正常 边缘 停止 使用/可见性
开发 70 30 20 开发人员可检查
回退 35 15 10 修复后发布
最终保留集 35 15 10 评估负责人控制
总计 140 60 40 240个不同的案件编号

正常覆盖两厂区、4家供应商、常见规格/单位与完整/缺资料;边缘覆盖规格切换日、单位换算、同名零件、附件内多批次、容差边界、矛盾测量和扫描质量;停止覆盖安全关键部件、错误供应商/工厂、已放行案例、图片判断、缺身份和附件诱导指令。样本按真实分布分层,但故意提高低频高后果案例比例,报告时不拿它外推生产率。

3名专家先用48件重叠样本独立标必需字段、证据范围、当前规格、差异、状态未知和路径,初始9/48件至少一项关键分歧;裁决后更新评分标准,并保留多重有效与状态未知,不以多数票强造真值。最终保留集在模型/规则冻结后才开放;失败加入邻近反例,不能反复调同一件直到通过。

每项结果保留分子、分母、案例切片和置信限制。模型输出经过人工修正后的最终包不能回算成模型正确;回退和NOT_ELIGIBLE留在入口分母。评估集、评分标准、裁决记录、运行版本和哈希都是关闭证据。

评估污染有单独记录:开发者、提示词、检索规则、模型微调或供应商是否看过哪个案例,任何泄露使该案例退出保留集但仍保留为回退,替换样本必须按原分层由评估负责人抽取。不能因为最终结果不佳才宣称“其实这些题开发时见过”。每次运行保存资料快照、规则、模型、参数、输出与评分脚本,人工评分标准变化要重判受影响案例。

240件只能支持v1边界内的学习,不能估计极低频伤害为零。项目用40个停止、故障注入、权限负面测试和人工门增强,但关闭仍写样本限制。若业务要求证明更小错误率,需要更大样本或持续监控;不能用“240件全过”替代风险判断。

成功指标按严重风险、系统质量、流程结果、价值与工作量排序

级别 指标/放行门槛 v1 阈值
严重 跨工厂/供应商披露 0
严重 错误的当前规格 / 抑制的关键不匹配 0
严重 未授权处置/写入/消息 0
边界 正确路由停止案件 40/40 离线;10/10 保留集
证据 由源支持的必需字段 ≥97%;关键字段 100%
证据 当前规格已选中 100%
实时流程 首包完成 AI分支不低于90%
实时流程 活跃复核中位数 AI分支不超过24分钟;低于非AI分支
实时流程 周期中位数 AI分支不超过10小时;无下游积压老化
可靠性 人工回退 ≤10%;全部经过推理
人员 加班/控制/支持 无实质性恶化;容量 ≤计划

阈值在看供应商或试点结果前批准。97%只适用于普通可纠正必需字段,不能允许3%的关键身份、测量或规格错误;这些字段单列100%。活跃时间下降但质量或工作量放行门槛失败,不能发布。周期改善要同时看技术专家和经理队列,避免把等待推给下游。

价值层只作情境:820季度案例中有多少符合v1、采用多少、人工复核与维护多少、释放容量去哪里。没有稳定符合资格/采用就不货币化;质量团队可把容量用于积压、供应商辅导或更深复核,而不是推导职位减少。

指标还写反作弊检查。首包完整不能靠把必需字段改少,活跃时间不能排除回退/复核,周期不能延迟创建案例或提前标就绪,回退不能从分母删除,0 严重不能只测试普通件。定义负责人与利益负责人不同,任何定义变化先回算基线和两组结果;仪表盘保留旧定义,不覆盖历史。

目标之间可能冲突。提高97% 证据支持可能增加复核分钟,降低回退可能迫使系统处理模糊案例,缩周期可能增加经理队列。委员会不计算一个综合分,而是先守严重,再公开质量、时间、可靠性与人员取舍;若门无法同时满足,缩范围或停止,不用权重把关键失败平均掉。

分开处理正常回退、暂停、停止和事件

信号 分类 立即行动 恢复权限/证据
缺失/不支持的文档 正常回退 人工案件;记录原因 无特殊恢复
模型/服务超时 暂停案件/通道 搜索/人工;限制流量 健康检查后的产品负责人
错误的当前规格 关键停止通道 隔离输出;保留证据 完成根因分析与回归后,由风险和质量负责人恢复
跨工厂/供应商访问 事件 + 停止试点 撤销/隔离/调查 事件权限 + 受影响控制
安全关键已受理 边界停止 阻止范围;检查资格规则 质量/风险负责人
未授权写入质量管理体系或发送消息 事件 禁用集成与凭证 依照获授权的事件流程恢复
关键不匹配已抑制 关键停止 人工复核受影响群体 质量负责人 + 保留集回归
加班/支持超过上限 组织暂停 减少到达/范围 人员/产品负责人
花费/时间上限已达 治理停止 无新工作/承诺 发起人批准关闭/新章程

正常回退是设计内的安全结果,不算事故;但回退率高说明价值/资料条件不足。暂停可在边界内恢复,停止要求根本原因、受影响案件复核、修复和指定门重跑;事件还要遵循企业既有发现、隔离、通知、恢复与保全流程。文章不替真实组织决定通知义务。

停止触发不可由项目经理单独豁免。自动控制可停技术通道,质量保证用户可暂停案例并报告,质量/风险发起人可停试点;恢复决定和反对意见进入决策日志。系统达到门并不强迫恢复,剩余风险仍由有授权者接受。

停线后首先查询受影响范围:从最后已知良好版本到检测时刻有哪些案例、谁看过或确认、是否进入质量管理体系,以及与哪些来源、用户和厂区相关。质量负责人逐件重新人工核对,产品与安全负责人保存版本、日志和访问证据;外部影响按现有事件程序处理。修复代码只是恢复条件之一,还要重跑触发失败的案例、邻近反例、全部严重风险门、权限门、停止门和人工演练。

事后复盘区分直接技术原因、控制为何未拦、监控为何晚发现、组织压力和范围判断;行动项有负责人/日期/验收。恢复可更窄,例如只开A厂或禁用AI草稿,不要求一次恢复全部v1。若根因无法在上限内解决,退役而非无限暂停。

用预算、专家工时和阶段门约束试点

没有评估容量的开发预算不是完整预算

预算桶 上限 包含的工作
集成与产品 16万元 资料接入、状态、界面、日志与人工路径
模型与供应商使用 6万元 开发、评估、实时使用与重试流量
专家与评估 9万元 评分标准、标注、裁决与结果复核
数据与安全 4.5万元 权利、访问控制、威胁与控制测试
培训与支持 3.5万元 8名用户、材料、答疑时间与事件演练
应急预算 3万元 仅限已批准的关键修复和已登记未知项
总计 42万元 不含税费与真实采购条款
受限容量 可用 计划需求 若不可用
产品负责人 96小时 92小时 缩减节奏/范围
3名质量专家 160小时 152小时 减少案例到达量,不降低评估质量
工程/数据 320小时 308小时 删除非关键功能
安全/数据治理 64小时 60小时 保留数据/实时放行门槛
评估运营 96小时 90小时 延迟放行门槛
培训/支持 64小时 58小时 不添加用户

预算消耗按已承诺、已花费、预测和剩余每周更新,评估回放、失败重试与事件也计入模型使用。应急预算由发起人和产品负责人共同批准,只处理关键修复或已登记的未知项,不用来增加第三厂区或漂亮功能。达到42万元即停止新承诺并进入关闭决定,不能以“再一点就成功”为由超支。

专家小时按阶段预订。若QA 专家不足,先降低实时到达或延长尚未开始的阶段,不删边缘/停止样本;若时间上限仍到,结果记状态未知并关闭。章程把“不够证据”视为有效结论,避免用薄评估换准时汇报。

每周消耗复核把金额与证据相连:集成多花1.2万元是否关闭了关键缺口,专家多用8小时是否完成裁决,模型用量上升是来自必要回归还是失控重试。预测在可能超上限前两周预警;要保留放行门就删低价值功能,不能先花完再要求发起人追认。未使用的应急预算在关闭时释放,不能作为“还剩预算所以继续”的理由。

实付低于42万元也不代表经济成功,单个预算项超支也不必然停止;硬上限看总承诺和经批准的预算转移,风险门则看必要工作是否完成。真实财务处理、税和合同由组织规则决定,案例只示范把隐形的专家与支持劳动列入成本。

12周的阶段门每次只授权下一段

放行门槛/周 必须为真 授权下一步操作
G0 / 第 1 周前 签署章程/负责人/容量/人工 基线/数据工作
G1 / 第2周末 基线已冻结;权限、访问控制与资料清单已完成 使用已批准数据构建
G2 / 第4周末 状态、操作、日志、删除与运行手册已测试 开发评估
G3 / 第6周末 240个案例已评估;最终保留集通过;关键事件为0 仅允许影子运行
G4 / 第8周末 影子分配、回退、支持和事件演练均通过 8名用户受限实时使用
G5 / 第9—11周每周 关键事件为0;容量、预算与控制稳定 下一个受限批次
G6 / 第 12 周 结果/限制/退出/删除/决策包 仅关闭决策

每个放行门由产品、质量、评估、数据与安全,以及相应风险负责人签署为通过、有条件通过、不通过或状态未知。有条件通过必须写明临时控制、负责人和到期日。不能预签后续放行门,也不能因时间表延误跳过G3或G4。未通过时可以修复重跑,只要仍在12周、预算、资料和案例上限内;否则关闭或另立章程。

影子阶段在真实分布生成但不展示AI草稿,只测资格、来源、延迟、回退、日志和错误。受限实时才让8人看到候选;到达有在制品限制,主管不以采用/接受率考核。每周群组冻结版本,修复后用旧失败+保留集邻近样本回归。

放行材料包在会前24小时冻结,其中包含上一道门的条件、证据链接、失败与未遂事件、样本分母与切片、预算与工时、未关闭风险、用户反馈、下一阶段新增暴露和建议决定。会上不临时用新截图覆盖材料包;发现关键数据缺失就判定为未知或暂缓。签署人可以写入异议,并在关闭记录中保留,防止“全员一致”掩盖真实顾虑。

G4尤其不只看模型分。团队演练人工、权限撤回、日志失败、停止通知和数据删除,检查8名用户熟练度与支持值班;任何一项没有负责人,影子继续但不能实时。G6即使计划延期也按过期召开,防止没有会议就默认生产。

任何范围变化都必须重新说明证据是否仍然有效

先判断是澄清、范围内修改、实质性变更还是新试点

变更类别 示例 所需证据/批准
澄清 改帮助文字,不改资格或操作 产品日志与用户体验检查
范围内修复 修字段解析器/超时 受影响的回归与发布审批
实质性系统变更 模型/检索器/索引/架构更新 全面受影响评估、成本/控制复核
边界变更 新资料来源、格式或用户组 数据、风险、评估复核及章程版本更新
新任务或操作 质量管理体系记录、处置、供应商消息 单独准入或新章程
上下文扩展 C 类/安全关键系列 新发现/风险/评估; 非 v1

变更请求记录原始范围版本、理由、潜在价值、受影响的资料、人员和动作,以及风险、预算、工时、补充样本、回滚方案和决定人。批准实质性变更不会重置160个案例、42万元或12周计数;若旧上限不足,就结束v1再提出v2,不能通过修改版本无限续命。

紧急安全修复可先停/降级并实施最小改变,但恢复前仍须受影响回归和签署。供应商自动模型更新也属于变更;若无法识别版本或在群组内稳定,就不能进入受限实时。决策日志保留被拒请求,让未来新试点从真实需求而非传言开始。

例如第9周供应商宣布模型A下月退役。团队没有直接切换到模型B,而是暂停新的AI队列,用回归集和最终保留集之外的固定样本,比较字段、来源、停止、延迟与成本。发现模型B在处理中英文单位混写时失败增加后,团队保持人工与非AI路径完成v1,并把模型B的修复列入v1.1。模型生命周期属于范围内的系统变化,却不能借机延长12周或新增数据。

新增一个规格字段若只从已批准来源读取、仍由同一人确认,可能是范围内修复;若字段改变最终质量决策或需要新专家,就可能是新任务。分类看影响而非代码行数,10分钟配置也能构成实质性变更。

监控与运行手册要同时观察技术、业务和人员

事件/指标 最小字段 频率/负责人
资格 规则版本、原因、案例切片 每日/产品
资料访问 委托人、资料与版本、允许或拒绝 持续记录,由安全负责人复核
候选项 模型/检索器、字段、证据、状态未知 每次运行/评估
复核 编辑、回退、分钟、确认用户 每例/质量保证
最终参考 仅保存质量管理体系中的决策编号与状态 每例/业务
质量/控制 故障类别、严重程度、受影响群体 每日/质量加评估
运营/成本 延迟、超时、重试、用量、支出 每日/平台/财务
人员/支持 到达、进行中工作、加班汇总、工单 每周/人员/产品

不把全部文件/草稿永久放进日志;敏感调试快照受限并30天删除。用户修改不用于绩效排名;覆盖多可能说明系统问题而非员工低效。仪表盘允许按厂区、供应商、文档质量和案例难度切片,防止总体平均掩盖某一组失败。

运行手册逐个信号写检测、首个动作、人工连续性、权限、受影响案例查询、证据保全、沟通、恢复门和事后复盘。周8演练权限撤回、错误规格、模型超时和日志失败;不能在规定步骤内切人工就不进实时。未遂事件与正常回退也复盘,但不会把用户报告变成惩罚。

每个日志字段有明确决策用途和保留期:若没有负责人会在何种事件中使用,就不收。全文调试只在授权事件/诊断窗口开启,结束后验证删除;常态指标使用ID、分类和时长。访问审计区分业务评估与员工绩效,质量/支持团队只看完成任务所需切片,避免试点悄悄成为人员监控系统。

监控也观察静默失败:合格率突然上升可能是规则放松,回退下降可能是状态未知被吞,活跃时间骤降可能是用户未看来源,支持工单减少可能是用户放弃。阈值之外用抽样案例复核、用户访谈和来源清单核对,不能只依赖仪表盘。

结项只回答继续、重做还是退役

扩展门只能证明同一边界可以承受更多量

同范围有限延续的放行门槛 所需证据
关键/边界 关键 0;保留集停止 10/10;无未解决的高优先级问题
质量 领域证据支持率与规格放行门在连续两个40件案例批次中通过
流程 AI分支时间与周期低于阈值;无下游积压老化
可靠性 回退/支持在限额内;人工路径已演练
人员 受训用户熟练;工时/加班/控制可接受
经济效益 实际用量/支持/维护预测在新限额内
治理 负责人接受剩余风险;数据/合同保持有效
变更/退出 回退, 库存, 删除和退役证据完整

同范围继续也需要新的时间、案例、预算、保留和复核日期,不能把v1.0自动转为生产系统。新增20名用户可能沿同一范围做有限延续,但必须先证明培训和支持能力;第三厂区、新产品、安全关键零件、图像判断或写入质量管理体系会改变上下文、任务或操作,必须重新发现并另立章程。

“两周都通过”只是案例门,不是通用统计证明。每个群组给分母、案例组合和置信限制;低频风险仍由反例、控制和人工门管理。委员会可以在指标通过时因剩余风险/能力停止,也可以在非关键价值状态未知时延长有限学习,但不能豁免严重门。

扩量压力测试模拟案例到达翻倍、专家请假、来源失效与模型超时,验证进行中工作、限流、人工和支持。若8名用户下通过但20人会让质量保证经理成为瓶颈,先补排班/队列证据;不能把技术并发当组织容量。同范围继续只改变量,不改变谁受影响、输入分布或动作后果。

第三厂区的图像资料、安全关键部件和不同测量设备,使v1的证据不可直接迁移。但v1的章程模板、资料与版本接口、故障分类法、运行手册与部分评估方法可以复用。复用资产不等于复用结论;新试点要列明哪些证据沿用、为何仍有效,以及哪些必须重做。

本案例为何选择有限继续,而不是规模化

最终保留集 60件共有720个必需字段,705/720=97.9%有正确来源,当前规格 60/60,10个停止案件 10/10,关键已观测=0。实时两组各80件使用相同清单、版本服务和队列状态;AI组另见字段/差异草稿。

实时结果 当前流程 非AI分支(80件) AI辅助分支(80件) 解释
首包完成 105/180=58.3% 71/80=88.8% 76/80=95.0% 检查表主要驱动因素
活跃时间中位数 38.0分钟 29.0分钟 23.5分钟 AI增量为5.5分钟
周期中位数 16.2小时 11.3小时 9.8小时 阈值通过; 样本/上下文受限
返工 50/180=27.8% 15/80=18.8% 8/80=10.0% 非随机化; 监控
当前规格 168/180=93.3% 80/80 80/80 版本服务驱动结果
AI回退 不适用 不适用 7/80=8.8% 低于10%,且保留在分母中
关键已观测 0 0 0 不能证明零风险

AI相对非AI分支在80件案例中释放80×5.5÷60≈7.3小时;非AI分支相对当前流程每件少9分钟,合计约12小时。不能把38分钟降至23.5分钟的全部差异记给AI,也不能从80件案例外推年度现金收益。专家实际使用152/160小时,总支出38.8万元,未超过42万元上限,支持与控制也未超限;集成费用从计划的16万元增至17.2万元,团队按记录调用了已批准的应急预算。

预算关闭 上限 实际 差异/解释
集成与产品 16万元 17.2万元 增加1.2万元,用于权限撤销修复
模型与供应商使用 6万元 5.6万元 少0.4万元
专家与评估 9万元 8.6万元 少0.4万元
数据与安全 4.5万元 4.3万元 少0.2万元
培训与支持 3.5万元 3.1万元 少0.4万元
应急储备 3万元 未直接支出 其中1.2万元转入集成与产品
总计 42万元 38.8万元 3.2万元未承诺并已释放

委员会没有批准C厂和安全关键产品。它另行签署一份为期8周、同范围有限延续的v1.1章程,重新给出案例、预算、保留与复核上限,继续收集两厂区证据;C厂回到需求发现阶段。v1.0临时副本按关闭清单删除,评估、决策和事件证据按既定记录规则保存。

关闭时逐项判断假设:H1和H2已被非AI组明显支持;H3在当前80件案例中获得支持,但置信有限;H4达到放行门,却仍可能受排班影响;H5在测试与观察中未见严重事件,但不能据此证明零风险;H6在8名用户下通过,但不能外推到20名用户。这样的判断解释了为什么有限继续合理、规模化不合理,比“六项指标通过五项”更有信息量。

成本记录显示,集成实际支出17.2万元,比该预算项多1.2万元;团队使用应急预算修复权限撤回,总支出38.8万元,仍低于42万元上限。节时主要由清单与版本服务贡献,AI在试验中的7.3小时增量不足以单独支撑大规模经济结论。v1.1把主要问题设为稳定性、维护与量增压力,不再重复证明系统能够生成。

交付一套能被验收和关闭的章程材料

产物/模板 最小字段
单页章程 问题、假设、范围、输出、限额、负责人、阶段门与到期日
资格合同 规则、原因、人工路径、版本与分母
范围账本 请求、类别、影响、证据、决策与日期
基线表 总体、样本、定义、失败与置信度
数据与操作映射 来源、权利、副本、保留、状态与决策权
评估计划 拆分、评分表、关键风险、阈值、裁决与保留集
预算与容量日志 限额、承诺、支出、预测、工时与应急预算
阶段放行记录 通过、有条件通过、失败、未知、证据与签名
监控与运行手册 信号、负责人、人工路径、事件、恢复与删除
关闭记录 结果、限额、继续、变更、停止、新章程与退出

NIST人工智能风险管理框架核心部分中的治理、衡量与管理环节,支持持续监控、明确角色、用测量结果处置风险以及安全退役;配套操作手册的管理部分讨论了如何用评估决定规模化、继续或退役,并涵盖覆盖、事件、恢复和变更管理。官方页面注明1.0版框架与操作手册正在更新;本文的12周、240个离线样本、160个实时案例和具体放行门都不是NIST要求。英国政府服务效益指南强调先建立基线和效益图或经济模型,再用实际数据决定继续、变更或停止;绩效指标和探索阶段指南支持在试验早期明确假设与指标,并决定哪些想法进入下一阶段。英国政府人工智能操作手册的案例也说明,实验准确率不足时需要继续质量保证。本文不把公共部门材料当作企业的法律义务。

今天把正在进行的AI试点写成一页v1.0章程:只选一个任务,列明资格、超出范围、资料、动作、用户、案例、预算和时间上限,以及人工权力、关键停止条件和到期日。任何人提出“顺便加上”时先填写范围变更记录;到期必须签署有限继续、变更、另立试点,或停止并退役中的一种决定,不能让试点靠惯性变成生产系统。