先看结果:72个用例不再都交14项材料,但高风险自动营销反而从“低风险文案”升到最高级
岱岭零售登记了72个AI候选用例。旧流程不区分内部会议摘要与付款决策:所有团队都填写相同的14项材料,再等待中央委员会审批。统一格式看似公平,结果却是低风险的员工工具被长时间排队,高风险团队则试图把系统描述成“仅供参考”,以此绕过实质审查。委员会每月最多处理12例,旧队列的中位等待时间达到63天,部分业务部门已经开始采购未登记的工具。
新方案按具体使用情境分成四级:G1内部辅助、G2受控外部内容、G3可逆业务动作、G4重大影响或难以逆转的决策。另设“停止或重新设计”的否决路径,不把不可接受的用途硬塞进最高级后继续审批。72例最终分为G1 24例、G2 20例、G3 16例、G4 12例。各级分别提交4、7、10、14项证据,总量为96+140+160+168=564项,比统一流程的1,008项减少444项,即44.05%。
| 治理路径 | 用例数 | 每例证据项 | 总项数 | 排队与复核中位时间 |
|---|---|---|---|---|
| G1 内部协助 | 24 | 4 | 96 | 4 天 |
| G2 受控外部内容 | 20 | 7 | 140 | 11 天 |
| G3 可逆操作动作 | 16 | 10 | 160 | 23 天 |
| G4 后果严重/难以逆转 | 12 | 14 | 168 | 41 天 |
| 合计 | 72 | 按级别变化 | 564 | 原单一路径为63天 |
分级并不是普遍放松治理。一个原本登记为G1“营销文案助手”的用例,实际上会读取客户分群、自动生成价格主张、调用活动发布能力,并向12万名订阅者发送。它在六个维度上得到16/20分,同时触发大规模、不可撤回外发的否决项,因此被提升到G4。业务团队评估控制成本后,没有要求“特批”,而是拆除客户数据和发送能力,只允许基于公共目录生成内部草稿。直到实际风险随架构一起下降,才重新评为G1。
90天内,72例中有52例按相应路径继续或进入受控试点,12例先重新设计,6例停止,2例与已有能力合并;这里的“继续”不等于全量生产。专家工时从统一流程假设的72×12=864小时,降为24×2+20×5+16×9+12×18=508小时,节省的356小时被集中投入G3和G4验证。52例继续项中,包括G1小组使用、G2受控发布、G3有限试点和G4最小授权测试,不能横向解释为同一种成熟度。
这是一个虚构教学案例。公司、用例、分数、工时、期限和结果都不是行业基准。12例重新设计的项目仍在治理队列,6例因价值不足或控制不可行而停止,2例合并则是为了避免建设重复系统。组合报告必须同时保留这些没有上线的结果,不能只展示通过案例,制造虚假的治理成功率。
分级后的效率,来自减少无关材料和改变审查路线,而不是把责任下放之后任其消失。G1仍然有登记、抽样和暂停机制;G4每例投入反而从旧流程假设的12小时增加到18小时,并加入独立验证。若统计只看全体项目的平均审批时间,就会掩盖高风险审查是否拥有足够容量,因此管理看板必须按层级分别报告等待、返工、证据缺口和事件。
分级治理的目的不是给低风险项目免检,而是让控制强度与实际后果、权限和不确定性相称
统一重流程的问题不仅是慢。低风险团队花时间写无关的灾难恢复文档,高风险团队在同一表格里用漂亮文字换通过,审核者被大量低价值材料淹没。分级要让每个用例都有最低登记、负责人、允许数据/工具、用户边界和事件入口,同时把独立评估、严格审批和持续监测资源投向后果更重的用例。
| 原则 | 实施 | 反模式 |
|---|---|---|
| 比例性 | 控制随影响/风险提升 | G1 无治理 |
| 一致性 | 一套准则/锚点覆盖整个组合 | 各部门自行定义层级 |
| 否决保护 | 关键条件覆盖评分 | 平均化导致安全/权利丧失 |
| 生命周期 | 层级随系统/使用变化 | 一次批准永久有效 |
| 证据 | 观测到的控制/测试 | 团队承诺 |
| 重新设计 | 降低实际数据/权限/范围 | 重命名为助手 |
等级不是“好/坏AI”标签,也不是模型能力分。一个强模型在隔离环境整理公开资料可以是G1,同一模型连接付款并自主执行可以是G4。治理对象是社会技术系统:用户、流程、数据、模型、工具、接收者、人工控制、规模、环境和失败后果的组合。
组织内部级别不替代法律、合同、行业或地区分类。欧盟人工智能法案等制度也采用风险导向,但其法定类别、适用角色、日期和义务有自己的定义;企业不能用本文G1—G4证明合规,也不能因内部评低就跳过专业判断。法律/监管叠加作为独立字段,命中时至少升级复核或直接停止。
独立覆盖项记录适用地区、行业、合同、员工或消费者关系、数据类型、系统角色和专业判断版本。法律页面或规则更新会触发所有相关用例重新筛查,但不会直接批量修改内部层级;某项义务可能要求透明度或记录留存,却不改变技术风险分,也可能直接禁止一个内部评分很低的用途。内部评分和适用义务要分开展示,避免把两者错误压缩成一个颜色。
组织还定义风险承受度:哪些损失可由业务负责人接受,哪些必须由更高权限,哪些不接受。容忍度不能由项目预算或高管兴趣临时决定;同类影响在不同部门应得到一致基线。需要例外时写范围、补偿控制、期限和退出,不永久修改全组织阈值迁就一个项目。
分类单位是一个可部署使用场景:同一产品按人群、目的、数据、工具和接收方拆成多条记录
“公司使用某聊天机器人”太宽,“一次提示词”又太窄。记录单位应能回答谁在何流程、为谁、用什么输入、生成什么、谁接收、能调用哪些系统、最终决定由谁做、部署到多大规模。只要这些边界显著不同,就建不同用例记录和层级。
| 维度 | 内部活动草稿 | 自动活动发送 |
|---|---|---|
| 目的 | 为营销人员准备文案 | 优化并发送活动 |
| 输入 | 公开目录/简报 | 客户细分 + 合同价格 |
| 用户/受影响者 | 营销人员 | 120,000 客户 |
| 输出 | 内部草稿 | 外部消息/报价 |
| 工具/效果 | 不发布/不发送 | 发布 + 发送连接器 |
| 人工决策 | 营销人员编辑/发布 | 仅在发送开始后采样 |
| 可逆性 | 轻松弃用 | 无法召回 |
记录不能把未来能力都写成“可能”。先评当前最小可部署版本,同时列请求的扩展;若团队确实要两种模式,运行时用独立身份、路径和功能开关证明G1模式拿不到G4能力。只靠用户培训说“暂时不要点击发送”不构成边界。
每条记录都要有用例编号、业务负责人、系统负责人、受影响群体、使用目的与禁止用途、输入输出、模型与供应商、工具与操作、人工决策、部署范围与受众、依赖、回退路径、适用地区、当前层级、证据有效期和变更触发器。没有负责人,或者边界无法写清的用例,先返回补充调查,不能急着给出一个看似精确的分数。
回退也属于同一上下文。生产路径失败后若自动切到保留更久数据的供应商、较弱模型、旧提示词或人工外包,风险可能比主路径更高;不能只评正常路径。每个用例列主要、回退、人工、降级模式,并按最高实际能力设置下限,除非技术上证明各模式隔离且切换受放行门槛控制。
多个小组件共同形成一个业务影响时,要按端到端系统评估。摘要器可能是G1,接收方选择器可能是G2,发送服务可能是G3;三者连起来之后,整体却可能达到G4。团队可以分别登记组件并复用证据,但业务用例必须覆盖所有下游。只给模型组件评一个低层级,再声称“发送属于另一个系统”,正是最常见的拆分边界、规避审查。
先检查否决项和停止条件:某些用途不是“多交几张表”就应获准
评分前检查禁止或需专门权限的情形。组织根据价值、法律、伦理、安全和能力定义自己的列表,例如隐蔽操纵、未经授权的生物识别/敏感推断、无申诉的重大权益决定、模型直接持有不受限管理员/付款能力、无法证明数据来源、对生命安全的无验证控制、无法停止或无法确定影响范围。
| 否决/停止信号 | 默认处置 | 谁可以修改 |
|---|---|---|
| 法律/政策禁止使用 | 停止 | 适用的法律/政策权威机构 |
| 无确证控制的生命/安全影响 | 重新设计/停止 | 安全权威机构 + 高管 |
| 权利/资格完全自动化, 无争议 | 重新设计 | 领域/法律/风险权威机构 |
| 跨租户或无限制管理/支付 | 移除能力 | 安全/系统负责人 |
| 未知数据源/接收者/保留 | 暂停数据使用 | 数据隐私负责人 |
| 不可逆操作无法停止或对账 | 仅允许草稿 | 运营与有权业务负责人 |
否决项也要可测试。团队声称“有人审核”,就展示审核发生在影响之前、看到实际对象/差异、能拒绝且有记录;声称“可撤销”,就演练撤销所有下游影响并说明残余。无法证明时按较高风险,不因项目重要而降低标准。
停止并不等于永久封杀创新。记录中要写清哪个条件不可接受,以及能否通过收窄目的、改用确定性规则、删除敏感数据、取消自动动作、增加有效申诉,或改用非AI方案来重新设计。新方案要作为一个新的修订版本重新梳理和度量,不能只在原审批记录上手工改一行。
临时例外不能跨越明确禁止项。对尚可管理的控制缺口,权限可批准更小群组、只读/草稿、双人操作和更短期限,但必须有补齐计划与自动到期;到期未完成,系统回到安全模式。把“紧急业务”写成长期理由或每月续签同一例外,触发治理审计。
发现用途可能伤害特定群体但证据不足时,不把不确定性解释为低可能性。先限制受影响人群、邀请领域/可能受影响方验证、建立申诉与可逆路径;若重大影响仍无法测量或控制,结论仍可是不部署。治理的职责包含识别何时AI不是合适方案。
六维0—20分只做可解释初筛:影响和自主权限各0—4,触达、数据、难逆与不确定性各0—3
分数让不同部门使用同一语言,但不是精确科学。影响看错误对个人、客户、业务、安全/环境的严重度;自主权限看从建议到执行;触达看内部小组到大规模外部;数据看公开到高敏/跨主体;难逆看发现前能否阻止和补偿;不确定性看新颖性、证据、依赖和变化。
| 维度 | 0 锚点 | 中间 | 最大锚点 |
|---|---|---|---|
| 影响 0–4 | 只影响外观或没有实质后果 | 造成业务返工或客户困惑 | 严重影响权利、安全或财务 |
| 自主性 0–4 | 不执行操作,只生成内部草稿 | 使用有边界且可撤回的工具 | 可自主触发一连串业务动作 |
| 覆盖范围 0–3 | 一名受训用户 | 一个部门或客户群体 | 大规模公开或系统性覆盖 |
| 数据 0–3 | 公开或合成数据 | 内部或机密数据 | 敏感、跨主体或大规模数据 |
| 不可逆性 0–3 | 在影响发生前即可拦截 | 可通过人工操作恢复 | 无法完整撤回或补偿 |
| 不确定性 0–3 | 证据成熟且系统稳定 | 存在缺口或新连接器 | 未测试、变化快或依赖链未知 |
建议初筛:0—4为G1,5—8为G2,9—13为G3,14—20为G4;任何否决项覆盖总分。阈值只适用于本教学组织,必须用历史/边界案例校准。分数相同的用例可能需要不同控制:数据泄露与安全动作不能只因都是12分而用同一评估集。
每个分值要写证据和不确定性。影响不是“感觉2分”,而是列错误影响对象、最大合理可预见的后果与现有补偿;自主性从工具合同/凭证验证;覆盖范围从合格接收方;数据从流程图;可逆性从回滚演练;不确定性从评估覆盖率与依赖。证据不足本身提高不确定性,而不是默认0。
六维没有单列可能性,是因为早期用例往往没有可靠发生率,团队容易用主观“小概率”压低重大后果。复核仍在每项风险记录触发条件、暴露频率和证据,并在层级内优先处理;运行数据成熟后可估计频率,但跨层否决项不因历史未发生而消失。分数表达治理路由,不是预期损失公式。
评分要同时保留“控制前”和“控制后”两列:前者回答关键控制一旦失效可能造成什么,后者回答已经验证的控制实施后还剩下什么。审查路线不能低于重大后果否决项和剩余不确定性所要求的级别,防止项目把尚未完成的控制写进计划,就提前申请降级。只有控制已经实施、测试通过,并且部署边界真实存在,才可以更新剩余风险并申请调整层级。
完整走例:自动营销从G1自报到16分G4,再通过删除数据和发送权限真正降到G1
用例MKT-031最初描述为“帮助营销团队写活动文案”。评审从部署图发现智能体读取客户分群和C-882合同价,自动选择报价、生成A/B文本,计划向12万订阅者发送;审批者只抽看10条,发送连接器在模型工具集,错误内容发出后无法召回。
| 维度 | 证据 | 分数 |
|---|---|---|
| 影响 | 错误价格/声明, 保密性/客户信任 | 2/4 |
| 自主性 | 模型选择内容/报价并发送 | 4/4 |
| 覆盖范围 | 120,000 外部接收方 | 3/3 |
| 数据 | 细分 + 客户合同价格 | 2/3 |
| 不可逆性 | 邮件无法撤回 | 3/3 |
| 不确定性 | 无跨客户/后果评估 | 2/3 |
| 总计 | 加大型不可逆发送否决 | 16/20→G4 |
G4要求独立的内容、数据和安全复核,以接近真实运行形态的材料评估,精确批准接收方和报价,先做不产生影响的后台对照,再做小范围测试;还要具备退订与抑制规则、发送回执、紧急停止和事件演练。业务团队评估成本后选择重新设计:系统只读取公共目录与已批准简报,模型只生成内部草稿,不能读取客户分群和合同,也没有任何发送或发布工具;营销人员必须回到既有活动系统中重新选择接收方并完成审批。
重新设计后的版本为:影响1分、自主性0分、覆盖范围0分、数据0分、不可逆性0分、不确定性1分,总分2分,对应G1。降级的原因是架构和工作流已经改变,而不是把名称改成“副驾驶”。如果以后重新接入客户分群或发送能力,变更检测必须阻止它继续沿用G1部署,并要求重新分级。
对照:一个客服智能体可在已验证客户、单笔≤¥50、总日限额、可撤回窗口内自动发信用,可能是G3;若把上限改成任意退款或批量账户调整,会升G4。金额不是唯一尺度,身份、数据、规模、投诉/撤销和个体影响共同决定。
MKT-031重新设计后,部署检查要从四层证明风险确实下降:工具注册表中没有发送或发布能力,运行身份不能访问活动发布接口,上下文扫描器拒绝“客户分群”和“合同价格”字段,网络也只允许访问内部预览环境。四层全部通过,才能认定为G1。若只是操作界面隐藏了发送按钮,而后端令牌仍可调用发送服务,自主性仍按4分计算。降级批准绑定具体修订版本和部署清单,旧智能体不能被直接重新打开。
G4原方案也没有被“永久搁置”。如果业务以后能够证明自动发送的必要性,可以先把受众从12万人缩小到500名明确选择的客户,固定报价,使用确定性的接收方选择和退订抑制规则,精确批准内容与受众,再按5%、20%、50%的比例分阶段扩大。完成这些改变后可以重新评分,但即使分数下降,邮件不可召回和外部触达仍然意味着它不可能回到G1。
请求受理先做组合登记和快速发现:连数据、工具、接收方都未知时不要急着给分
统一入口接收新建、采购、集成、内部脚本和未登记使用,不要求发起人先学会治理术语。15分钟快速表只收集必要事实:目的、用户与受影响者、输入输出、内外部接收方、工具与实际动作、人工决策、规模、数据类别、供应商和负责人。治理团队再结合单点登录、采购记录、接口网关和费用线索发现漏登项目。
| 受理结果 | 条件 | 下一步行动 |
|---|---|---|
| 重复 | 相同使用/上下文已存在 | 合并/扩展记录 |
| 需要发现 | 未知数据/工具/接收者 | 分层前映射 |
| 触发停止条件 | 命中否决项或存在法律顾虑 | 专家复核 |
| 临时 G1/G2 | 限定低/中等 | 领域路径 |
| 临时 G3/G4 | 行动/重大影响 | 专家/完整路径 |
| 仅限沙箱 | 需要学习, 无生产数据/影响 | 限时实验 |
沙盒不是无治理空间:只能用合成/公开或批准数据,无生产凭证/外部接收方,设过期、负责人和禁止迁移。实验成功后必须重新登记生产上下文;开发者不能把沙箱端点悄悄连真实数据库。
受理时限要按风险双向约束:G1需要快速确认,减少员工转向未登记工具;一旦发现否决项,则立即升级,不能等到委员会的月度会议。被退回的申请要说明具体缺失和可选的重新设计路径,不能只留下一句“风险太高”。所有决策都允许申诉,但提出申诉不等于系统可以先运行。
处置未登记使用时,应先保全业务证据,不默认处罚主动报告的人。发现未登记工具后,先确认是否涉及敏感数据、外部影响和现存副本,必要时立即隔离,再帮助负责人补建记录或迁移到批准路径;若已经发生披露或越权,就进入事件响应。治理如果只靠禁令和惩罚,会促使员工隐藏使用,反而让组织失去对整体AI组合的视野。
采购、单点登录、网络代理、接口网关、费用和浏览器管理提供不同的发现线索,但每种线索都可能误报。注册表按使用情境而不是账号数量去重:同一部门20名员工使用同一个获批的G1工具,不会因此变成20个项目;同一账号如果同时用于人力资源决策和公共文案,却必须拆成两条不同记录。
四级治理不是四种标签:每一级都要把影响边界、审批责任和上线条件落到证据
G1内部辅助仍需四项基本证据:负责人、边界、允许数据与工具和最小结果检查
G1适用于受过培训的小范围内部用户、只生成可丢弃草稿、无生产写入、无敏感/跨主体数据或重大个体影响,错误能在工作内发现并纠正。典型例是基于公共材料的会议议程、内部措辞草稿或代码解释,但实际上下文仍要验证。
| G1 级产物 | 最低证据 | 负责人 |
|---|---|---|
| 使用卡片 | 目的/用户/非使用 | 业务负责人 |
| 数据/工具边界 | 允许来源; 无影响工具 | 系统/数据负责人 |
| 基础评估 | 20–50 代表性任务 + 关键检查 | 产品/领域 |
| 操作说明 | 用户核对方法、报告入口和有效期 | 经理/产品 |
G1不需要经过中央委员会,可由业务负责人结合登记规则放行,风险团队再按比例抽样。一旦出现公开页面、客户消息、自动决策、生产凭证或高敏数据,就不能继续按G1处理。用户必须知道输出只是草稿、哪些字段必须核对、问题在哪里报告;一句“员工自己负责一切”不构成治理控制。
抽样发现边界漂移可立即暂停。注册表每90天问负责人、活跃用户、数据连接器、工具、外部共享和事件;无负责人、证据到期或实际行为超过登记时状态转已暂停。低流程不等于低可见性。
G1基础评估不是随便问20次。样本覆盖常见、边界、空输入、旧资料、敏感信息误粘贴和用户过度依赖;关键检查验证不会调用外部工具、不会跨用户读取、明显不确定时会标示。用户必须能在原工作中核对,不把需要专家才能发现的错误包装成低风险草稿。
G1输出若被复制到公开渠道,责任点已变化。产品通过导出限制、清晰标签和培训减少误用,但如果主要使用模式本来就是公开发布,就应登记G2,不用“员工理论上会再审核”保持G1。抽样访谈真实工作流,而不只看产品说明。
G2受控外部内容增加真实性、披露和发布责任:人按准确对象批准后才公开
G2覆盖模型生成外部可见内容但没有自主发送/发布、没有重大交易或个体决定,例如官网文章草稿、公开常见问题或销售材料,最终由有责任的人在既有系统发布。外部传播使准确性、品牌、知识产权、披露、无障碍和受众影响进入评估。
| 添加 G2 证据 | 接受 |
|---|---|
| 来源/主张矩阵 | 已支持/当前的实质性主张 |
| 输出风险测试 | 有害/机密/跨客户/品牌案例 |
| 审核员协议 | 发布前的确切内容/受众/渠道 |
| 披露/标签规则 | 已确定的适用上下文 |
| 发布/版本记录 | 谁/什么/何时/渠道 |
| 更正/撤回 | 负责人、渠道清单和处理时限 |
| 监控 | 报告, 页面检查, 漂移/变更 |
G2的人不是橡皮图章。复核人看完整内容、来源、目标渠道和变化,能编辑/拒绝,发布动作来自人的独立会话;模型没有发布凭证。大规模不可召回发送、实时价格/法律/健康建议或个性化影响可能因触达/影响升G3/G4。
发布后错误有纠正路径并形成评估案例。审批覆盖一个产物哈希和渠道,不是给模型永久品牌授权。模板复用、新语言或新市场若改变受众/义务,触发重评。
G2的主张矩阵把事实主张、来源、适用日期、限定条件和复核人列在一起;模型创意文案可不逐句外部引用,但价格、性能、条款、案例和健康/法律等高影响主张必须有权威依据。来源更新或过期让产物失效,不能因曾批准过继续自动复用。
对外内容若含个性化报价、从客户数据推断、允许即时交易或触达规模很大,触达/数据/影响会升层。发布人只有在能看懂来源和差异、时间足够且对渠道有决定权时才算人工控制;批量点“全部通过”会在监测中成为控制失效信号。
G3可逆业务动作要求工具契约、授权、后台对照、限额、回执和回滚演练
G3适用于对业务记录或客户产生影响,但范围、金额/数量受限,能在短窗口发现、撤回或补偿,且不涉及最高后果。例如已验证客户的低额信用、内部工单状态更新或可撤销预约;模型提出动作,确定性策略和必要审批决定。
| 添加 G3 控制 | 证据 |
|---|---|
| 类型化工具/授权 | 执行者/资源/动作/字段/目的 |
| 前置条件与幂等性 | 状态、版本、重试和未知状态测试 |
| 限制 | 按动作/天/租户/值/速率 |
| 后台对照评估 | 不产生影响的候选动作与权威规则对比 |
| 批准/例外 | 达到阈值时的确切对象/差异 |
| 回执/对账 | 权威系统中的最终状态 |
| 回滚/补偿 | 排查所有下游影响 |
| 值班/事件 | 紧急停止开关 + 负责人 + 运行手册 |
| 小流量发布 | 分阶段扩大并设置不可突破的门槛 |
| 季度复核 | 未遂事件, 覆盖, 范围漂移 |
“可逆”用演练证明。CRM字段可改回但客户已收到通知,就不是完全可逆;退款能冲正但带来客户/财务影响,也需记录。若补偿必须跨多个系统且无法列出终态,不可逆性分提高。
G3由业务、系统负责人和相应安全/数据/风险专家审批,不必每例上执行委员会。任何越权影响、跨租户、无法对账或终止失败立即停并按E29响应。
G3的限制必须在资源服务器执行,不能只写在提示词里。单笔¥50、每日总额、允许的客户关系、动作类型和有效期都由确定性策略判断;模型不能把一笔¥200操作拆成四笔,以此规避限额。接近上限、重复接收方、人工改判和补偿次数都要进入监测,业务负责人还要定期确认这些上限仍符合组织的风险承受度。
可逆动作所需的人工容量也必须测量。若每天有200个例外需要两名专家逐一判断,而团队只能处理40例,系统最终不是积压,就是迫使人员盲目批准。试点要把队列长度、复核时长、修改与拒绝比例和处理时限纳入放行门槛。治理等级不只是给技术增加控制,也意味着组织必须为必要的人力投入买单。
G4重大、难逆或高不确定性用独立审查和明确风险接受,必要时结论是不部署
G4包含可能重大影响权益、就业、信用、医疗、安全、安全控制、较大金融交易、广泛不可召回传播、敏感人群或无法可靠补偿的系统;也包括新型智能体组合导致证据不足。更高文档量不能自动让风险可接受。
| G4 要求 | 问题已解答 |
|---|---|
| 影响/受影响方评估 | 谁可能遭遇什么问题 |
| 法律/权利/领域复核 | 适用义务/可争议性 |
| 独立测试、评估与验证/红队 | 取得不依赖建设团队的证据 |
| 数据/血缘/供应商评估 | 来源, 接收方, 留存, 变更 |
| 人工权限/申诉 | 由谁决定, 受影响人员能否提出异议 |
| 隔离/最小权限 | 模型无法自我批准/扩展 |
| 故障安全/人工备选方案 | 不确定/中断时的安全行为 |
| 高管风险决策 | 残余, 范围, 过期, 条件 |
| 持续监控/事件 | 同时检查动作前条件、最终结果和停止门槛 |
| 退役计划 | 撤销, 迁移, 删除, 沟通 |
独立复核人不向交付负责人汇报同一上线目标,能要求更多证据或拒绝。领域专家和可能受影响群体的参与方式按上下文设计,不能只由技术团队替他们假设影响。任何申诉/人工复核必须有真实权限、时间和记录。
若错误后果严重且当前测量、控制或人工能力不足,选择确定性系统、纯人工、缩小人群/权限或不做。G4 委员会批准的是明确范围和期限,新增地区、人群、模型、工具或自动化级别重新审批。
G4中的人工复核不能变成责任转移。复核人需要看到独立来源、实际对象、模型置信信息或多个结果之间的分歧、替代选项和申诉信息,并且能够暂停操作而不受产量考核惩罚。抽样复核不适用于每一例都可能造成重大后果的场景。若人在给定时间内根本不可能发现错误,这条流程仍应按自动化决策评估,不能因为最后有人点击就降低风险级别。
重大决定保留受影响者可理解的通知、人工复查和更正渠道,但具体形式由领域和适用义务决定。模型建议、规则、人的决策和最终影响各自留痕,不能用“最终有人点击”掩盖系统实际主导。跨群体结果与异常既看总体也看重要切片。
复核路由让低级靠近业务、高级引入独立专业角色:中央委员会只处理真正需要集体风险负责人的事项
审查路线由临时层级和独立覆盖项共同决定。G1由业务负责人自助登记并接受抽样;G2加入内容、品牌和领域人员,必要时加入隐私或法律人员;G3由业务、系统、安全、数据和风险人员共同处理;G4则需要跨职能委员会、独立验证和有权接受风险的高管。某项法规或合同要求,可以在任何内部层级上额外加入专业人员。
| 决策 | 提议人 | 验证器 | 审批人 | 不可合并 |
|---|---|---|---|---|
| 使用边界 | 产品/业务 | 领域/数据 | 业务负责人 | 证据作者≠唯一 G4 批准 |
| 层级评分 | 产品 | 风险复核人 | 路由权限 | 请求者无法自行降级 |
| 技术控制 | 建设团队 | 安全与独立验证人员 | 系统与风险负责人 | 建设者无权豁免关键放行门槛 |
| 残余风险 | 负责人 | 独立复核 | 指定主管 | 模型/供应商无法接受 |
| 生产放行 | 放行负责人 | 放行门槛自动化 | 指定放行权限 | 提交人≠唯一 G4 批准人 |
中央委员会每月只处理12个G4及4个跨层争议/重大覆盖层,共16个案例,而不是72个。会议材料提前结构化,缺证据退回负责人,不在会议现场看演示后凭印象通过。决策是批准范围、批准条件、重新设计、暂停或停止,有过期和复核条件。
审核者工作量进入容量计划。业务需要快速上线不能把G4降级,治理团队也不能无限排队;组织通过复用控制证据、增加复核人、缩小范围或选择低风险设计解决。紧急例外有明确权限、补偿控制、短过期和事后复核,不是“高管说可以”。
复核会前进行完整性检查,会中只讨论影响、证据缺口、权衡和决策,避免高级专家逐页修格式。争议记录不同观点和最终权限,不追求表面一致;若业务负责人不同意停止,可提交新证据或重设计,但不能在另一个部门重新申请同一系统绕过原记录。
复核人也要接受利益冲突和轮换管理。参与系统建设、与供应商存在销售关系,或直接承担上线业绩的人可以提供事实,但不能独立验证自己的G4结果。长期只有一名专家,不仅会形成瓶颈,也会把个人判断变成单点偏见;组织需要培养第二名审核者,引入必要的外部专长或跨部门评审组,并持续校准判断标准。
各级证据可继承但不能复制空模板:一份数据流或评估必须对应当前范围和运行版本
证据按层级递增:G3包含G1和G2中仍然适用的项目,再增加工具与运行控制;G4则进一步增加独立的影响评估和技术测试、评估与验证。公共平台的身份、日志、供应商或事件响应能力可以作为共享控制引用,用例只需证明当前配置确实启用了这些能力且适用于自身范围,避免72次复制同一份政策。
| 证据属性 | 验收测试 |
|---|---|
| 限定范围 | 匹配当前用例编号、受众、数据和工具 |
| 当前 | 模型/提示词/检索/工具/策略版本 |
| 可观测 | 由测试、追踪和执行回执证明,不依赖口头承诺 |
| 有负责人 | 指定责任人及有效期 |
| 可复用 | 共享控制及适用性声明 |
| 可质疑 | 审核员可追踪声明→产物 |
| 变更感知 | 触发项使过时证据失效 |
14项证据不等于14份独立文档。它们可以是注册表字段、测试报告、数据流查询、策略结果、批准记录和演练回执。证据项数量只用于本案例的容量计算,实际质量取决于它是否回答了关键问题。为了凑数量而把一份报告拆成五份,并不会提高成熟度。
证据有效期根据变化速度和风险设定:用途长期稳定,可以按年复核;供应商、模型或事件控制变化很快,则需要更频繁复核,或在事件发生时立即触发。证据过期不一定立刻停止G1,但高风险用例的关键放行证据一旦过期,就要暂停扩量或退回人工流程。
继承共享控制需要三项证明:平台能力当前有效、当前用例确实启用了它、失效时有人负责响应。例如,企业模型网关具备日志,不代表MKT-031真的经过该网关;平台通过年度测试,也不能证明营销活动租户的保留期限配置正确。用例记录需要引用控制编号、版本和配置证据;平台一旦发生事件或重大变更,所有依赖它的用例都应自动标记为需要复核。
证据缺口不能靠更多叙述补齐。没有回滚回执就标记为未测试;没有受影响群体的输入,就说明缺失范围和采用了什么替代信息;没有供应商信息,就明确标为状态未知。复核人再决定缩小范围、补测或拒绝。把未知写清楚,比团队猜出一个乐观答案更有利于分配资源。
试点与生产放行门槛随层级递增:所有级别都先限定范围,高级别增加后台对照、小流量验证、停止演练和业务结果
G1可以在小组内使用合成或获准数据完成任务集测试;G2先做内部预览和渠道测试;G3先在沙盒中验证工具,再做不产生业务影响的后台对照,随后经过草稿与批准流程进入小流量测试;G4还需要独立技术评估与验证、关键人群切片、故障和事件演练、人工复核与申诉容量,以及高层风险决策。阶段不是日历上的日期,而是一组必须满足的证据门槛。
| 层级 | 首次上线范围 | 关键放行门槛 |
|---|---|---|
| G1 | 受训内部用户 | 不出现外部发送、实际业务动作或数据越界 |
| G2 | 单一受控渠道 | 无依据主张、机密内容和跨接收方泄露均为零 |
| G3 | 受限租户、金额与操作的小流量测试 | 未授权业务影响为零且全部操作可对账 |
| G4 | 最小授权群体 | 重大后果否决项为零并取得独立签署 |
每级同时看任务正确、关键失败、误阻断、人工时间、延迟、成本和事件就绪。高总体准确率不能抵消一个严重权益/安全/越权案例;低级也不能用“风险低”接受完全无用的系统。
扩量由指定的放行负责人执行,不需要治理委员会操作日常发布,但必须严格遵守获批范围。自动门槛检查层级、证据有效期、部署包、合格人群、可用能力和监控状态;任何标记错误都默认阻止进入更高风险路径。回滚或降级方案也不能拥有比候选版本更宽的权限。
试点章程要预先写明合格与排除条件、持续时间、抽样方法、负责人、指标、关键门槛、人工容量、事件与停止条件和结束决策。试点结束不代表自然转入生产,必须比较基线、收益、错误、人工负荷和剩余风险。即使系统没有造成安全问题,只要价值未达到预期,也可以停止,不能让“已经投入”成为扩大范围的理由。
用户培训是每级发布产物的一部分,但内容不同:G1教核对与禁止数据,G2教来源/接收方,G3教对象/回执/异常,G4教决定权、申诉和停止。培训通过不能替代系统控制,且角色/流程变化后重新覆盖。运行中用户报告与修改行为回流评估。
变更触发器防止“获批的是草稿,生产长成智能体”:人群、数据、工具、模型和规模变化都可能升层
层级要在设计、试点、放行和运行阶段持续有效。新增外部接收方、敏感数据、写入工具、自动决策、批量规模、不可逆渠道、新地区或人群,更换供应商或模型,引入长期记忆或多智能体,改变回退路径,减少人工步骤,都要触发变更前后的影响差异复核。
| 变更 | 可能影响 | 部署前行动 |
|---|---|---|
| 草稿→自动发布 | 自主性/范围/不可逆性↑ | 重新分级/完整放行门槛 |
| 公开→客户数据 | 数据/受影响方↑ | 数据/隐私复核 |
| 读取→写入工具 | 影响/恢复↑ | G3/G4 控制 |
| 100 用户→公开 | 触达/支持↑ | 负载/事件/通信 |
| 移除人工审批 | 自主性/可争议性↑ | 否决检查 |
| 模型/提供商更新 | 不确定性/供应商证据↑ | 回退/复核 |
| 新国家/行业 | 法律/上下文叠加 | 专家判定 |
部署清单要声明用例编号、层级、部署包、工具、数据连接器和受众;任何一项与注册表不符,流水线就阻断部署。运行阶段则监测实际工具调用、接收方、数据类别和数量,一旦发现能力超出获批层级,立即收窄权限,而不是等到年度问卷才处理。
多个小改动组合起来,也可能形成重大变化。单独新增客户查询和邮件草稿功能,看似都不需要升层;放进同一个智能体后,却可能形成向外发送敏感数据的完整能力。变更评审必须检查能力组合和数据从来源到接收方的完整路径,不能只看单个工单。
变更检测要阻断而非只发邮件。部署流水线把清单与注册表比较,新增工具、连接器、接收方类别或规模超过批准范围时拒绝;运行时发现异常调用立即移除能力。若紧急修复需要不同模型/提供商,先用同层级最小回归和短期批准,不能用“热修复”跳过数据/区域/权限审查。
组织变化同样会触发复核。负责人离职、部门重组、人工审核外包、政策变更、用户从专家变成普通员工、支持团队缩编,都可能降低原有控制的有效性。注册表应从人力资源、身份权限和合同系统接收这些信号,避免因为技术配置没有改变,就误判整体风险也没有改变。
降级必须减少真实风险驱动因素,升级也允许申诉:防止等级只升不降或被政治化
团队可以申请重新评分,但提交执行前后架构、权限、数据、受众、评估和运行证据。有效降级包括移除写入/发送、换合成/公共数据、限制单租户/金额、增加可阻断的人类决策、使用确定性规则、缩小群组或证明可靠补偿。
| 建议降级 | 有效? | 原因 |
|---|---|---|
| 把“智能体”改名为“助手” | 否 | 实际能力没有变化 |
| 在页脚添加“由人工负责” | 否 | 影响和权限没有变化 |
| 从工具注册表和资源服务器同时移除发送能力 | 是 | 自主性和影响范围确实降低 |
| 对数据做掩码,但模型仍可访问还原映射 | 否或仅部分有效 | 暴露风险仍然存在 |
| 把退款绑定为单笔不超过¥50、设置每日限额并保留回执 | 可能 | 影响范围收窄且更容易补偿 |
| 拆分高风险执行能力并增加精确审批 | 可能 | 自动执行链已经被切断 |
升级决策同样可以申诉,例如指出事实错误、提供回滚演练,或证明实际受众更小。第二名风险复核人重新评估,存在利益冲突的人回避;最终决定、理由、不同意见和有效期限都进入注册表。申诉期间保持原层级与限制,不能默认先放行。
层级不是惩罚。如果G4的控制成本超过业务价值,把系统重新设计成G1或G2,恰恰是治理发挥作用;停止一个用例也可能释放资金。组合报告不能把“高层级项目越少越好”当成考核目标,否则团队会为了数字好看而隐藏风险。
反规避检查比较的是名称与实际权限。把一个G4流程拆成四个G1小服务,把自动发送改称“建议发送”,把客户数据换名为“业务上下文”,把生产运行称作“长期试验”,都不会改变端到端影响。审查应以身份、网络、工具回执、接收方和业务状态为证据;发现故意规避时,暂停用例并交由有权治理负责人处理。
真正的降级还必须处理旧版本:撤销原凭证,处置队列和内存,删除或隔离高风险数据,停止旧服务入口,确认没有遗留客户或订单影响,然后才能启用低层级修订版。只发布一个新的操作界面,而旧接口仍然可以调用,会让注册表严重低估系统的真实能力。
组合容量按风险分配并复用共享控制:508小时来自透明假设,不是凭感觉说更高效
旧流程按每个案例12个专家小时估算,72×12=864小时。新流程假设G1每例2小时、G2为5小时、G3为9小时、G4为18小时,得到48+100+144+216=508小时,减少356小时,即41.20%。这不是裁减必要控制,而是让G1由业务负责人承担,复用平台证据,把专家时间集中到高层级项目。
| 容量指标 | 旧单一路径 | 分层目标 |
|---|---|---|
| 专家工时 | 864 | 508 |
| 全体委员会案例 | 72 | 16 含 4 次升级 |
| 证据项 | 1,008 | 564 |
| G1 中位等待时间 | 63 天 | 4 天 |
| G4 中位等待时间 | 63 天 | 41 天 |
| 未注册发现 | 稍后测量 | 月度趋势下降 |
时间节省不能用审核质量下降来换。每个层级都要分别报告返工、事件与未遂事件、层级漂移、监测覆盖、证据过期和业务结果;若G1抽样中的关键故障上升,就提高抽样比例或收紧边界。G4中位等待41天仍然可能太慢,此时应增加独立测试与验证能力,或让审查人员更早介入设计,而不是把项目硬压成G2。
组合负责人每季度看风险集中:同一供应商、共享检索、身份或发布平台支撑多少G3/G4,用例逐个低分也可能形成系统性依赖。集中风险需要平台级控制、容量/退出和跨用例事件查询。
72例的业务结果按层级展开:G1 22继续、2合并;G2 16继续、3重设计、1停止;G3 10继续、4重设计、2停止;G4 4进入最小试点、5重设计、3停止,合计52继续、12重设计、6停止、2合并。该分布不设目标配额,下一批即使更多G4也可能是业务组合变化,不应为符合比例调整评分。
治理费用还包括业务和领域复核人的时间,以及项目重新设计的投入,并不只有508个专家小时;完整总成本应按E09和E37的方法另行核算。这里用专家小时说明审查路线的容量,不能据此承诺节省的356小时会直接变成财务收益。若业务负责人的工作从旧流程转移到G1,这部分负荷也要在部门计划中可见。
用72个双人盲评和边界案例校准评分标准:一致率从39/72提升到65/72,分歧必须被解释
初版让两名复核人分别独立评估72例,只有39例被分到同一层级,一致率为54.17%。主要分歧来自把“流程中有人”误当成有效审批,把数据库字段可以改回误当成影响完全可逆,以及忽略传播规模和数据组合。团队补充分值锚点、否决项、已结案事件和证据要求后重新评估,65/72一致,一致率提高到90.28%。
| 分歧领域 | 之前 | 校准锚点 |
|---|---|---|
| 人工监督 | 10 案例 | 必须是事前/精确/授权 |
| 可逆性 | 8 | 包含下游/个体影响 |
| 数据组合 | 6 | 衍生/可链接性/上下文 |
| 覆盖范围/规模 | 5 | 合格外部受众, 非测试样本 |
| 自主性/工具 | 4 | 服务器能力, 非界面措辞 |
| 总分歧数 | 33 | 修订到第7版评分准则后剩7例 |
余下7例由领域/风险裁决,4例升层、3例降层并记录原因;不强迫100%一致,因为真实价值判断存在。若某维度持续分歧,修订锚点而不是要求复核人服从资深者。
校准集保留典型和边界案例,每半年及重大事件后重跑;新复核人先完成训练。一致性只是可靠性,不证明层级正确,还要用生产近失事件、事件、申诉和受影响方反馈检验预测有效性。
运行监测、抽样和审计既防治理不足也防过度治理:等级错高同样有成本
注册表要关联生产放行、身份、连接器、数据类别、工具回执、事件和负责人。监测同时寻找两类偏差:一类是实际覆盖范围、权限或数据已经超过获批层级;另一类是系统长期没有实际影响、风险很低,却仍被困在过重流程中。前者要立即收窄权限并重新分级,后者可以提出简化申请,但仍需保留证据。
| 组合信号 | 阈值/示例 | 回复 |
|---|---|---|
| G1 外部接收者/写入 | 任意 | 停止并重新定级 |
| G2 自动发布 | 任意 | 移除能力/事件评估 |
| G3 限制/租户违规 | 任意 | 事件加 G4 复核 |
| 证据过期 | 超过按风险设定的有效期 | 暂停扩展 |
| 负责人缺失 | 30 天 | 禁用/退役 |
| 覆盖 | 趋势加原因 | 权限审计 |
| 错误的高定级 | 申诉/样本证据 | 重新校准/降级 |
| 近失事件 | 每次符合条件的运行 | 控制/评估准则更新 |
审计抽取不同部门、不同层级和被拒/降级用例,检查记录与生产一致、证据有效、审批无冲突、变更触发器生效、退役完成。只审G4会漏掉G1漂移,只审已通过会漏掉团队如何规避入口。
受影响者、用户和运营人员都要有报告与申诉通道。问题应绑定用例编号,但报告者不需要知道内部层级。治理办公室可以发布汇总后的决策时间、层级漂移、事件和改进情况,同时不公开敏感系统细节;这种透明度有助于团队相信分层治理不是暗箱操作。
监测的分母是实际符合条件的运行、接收方、操作和受影响人群,不按“应用数”平均。一个G1每月20次与一个G3每日10万次不能同权;组合把暴露量、严重未遂事件和后果结合看,同时保留小群体严重影响,防总体比例稀释。
退役是最后一次分级动作:停止新使用、撤销身份/工具、处理队列与未完成影响、导出必要业务记录、删除数据/索引/日志按政策、通知用户、关闭供应商路由并保留最小决策依据。负责人失联的用例由组合授权接管;不活跃不等于已退役。
交付风险分级治理包:从一个“只是助手”的用例画到真实影响,再决定等级和控制
| 产物 | 最低内容 | 接受 |
|---|---|---|
| 组合注册表 | 上下文/层级/负责人/版本/状态 | 已关联的部署 |
| 评估准则 + 否决权 | 六个维度/锚点/叠加层 | 校准后的案例 |
| 已填写的评估 | 分数 + 证据 + 不确定性 | 二次评审 |
| 层级控制档案 | G1—G4证据、门槛和监控 | 负责人和自动检查 |
| 责任与审批路线 | 提议人、验证人、批准人和申诉复核人 | 已安排审查容量 |
| 变更触发器 | 数据/工具/受众/模型/规模 | 持续集成/运行时执行 |
| 例外/申诉 | 范围/理由/过期时间/权限 | 无静默豁免 |
| 仪表盘/审计 | 等待/漂移/事件/虚假层级 | 季度行动 |
来源边界:NIST AI RMF 1.0用于说明自愿、通用、贯穿生命周期的治理、映射、衡量、管理和风险优先思想;配套操作手册中“治理1.3”和“管理1.2”用于说明应按风险承受度安排管理活动,结合影响、可能性和资源确定优先级并持续校准,且操作手册不是适用于所有组织的统一清单。NIST AI 600-1用于补充生成式AI的具体风险、第三方和持续监测背景;ISO/IEC 42001官方概览用于说明AI管理系统、风险与机会和持续改进;欧盟委员会人工智能法案官方页面只用于说明法律框架也可能采用风险路径。内部G1—G4不对应任何法定类别,适用要求仍由专业人员判断。来源核验于2026-07-21;NIST页面同时注明AI RMF 1.0正在修订,本文不把当前版本视为永久不变。
- NIST AI RMF 1.0
- NIST AI RMF Playbook
- NIST AI 600-1:Generative AI Profile
- ISO/IEC 42001:2023:AI Management Systems
- European Commission:AI Act risk-based approach
今天可以选一个被描述为“只是辅助”的真实AI用例,先不要接受这个标签。写清可能受影响的人、输入与数据、输出与接收方、工具与实际动作、人工决策、预计规模、回滚方式和仍然未知的状态;先检查否决项,再按六个维度评分,并交给第二名复核人独立判断。接着追问哪一项架构改变能够真正降低最高风险因素:移除发送能力、缩小数据范围、绑定具体资源、减少规模,还是增加能够在影响发生前阻断的人工决定。若团队无法证明实际部署与低层级边界一致,就按更高层级控制,或继续留在沙盒。分级治理的价值不是更快盖章,而是让低风险路径更轻,让高风险路径真正被看见。