最终只批准了90天组合试点
恒砺工业材料有2,300名员工,86名标书作者、10名领域复核人和4名管理员需要处理客户建议书请求。当前每月约3,600道问题,答案来自18,400份产品、合规、质量与交付资料,覆盖6个销售地区和不同生效日期。业务目标不是“人人有聊天机器人”,而是缩短查证与草拟、提高有效引用,同时不跨客户泄露、不自动向客户发布。
采购组比较三案:购买100席端到端SaaS产品;组合托管模型、搜索、身份与自建证据控制服务;自主运行推理、检索和应用平台。购买方案的三年教学总体拥有成本为432.6万元,但完整的“事实陈述—证据”关系和评估日志不能导出,退出后无法重建答案链。自主建设约1,154万元,需要约4.5个全职当量的持续团队,当前能力门也没有通过。组合方案约592.8万元,是唯一能在当前证据下满足硬门且有团队承接的方案,但只获批20名用户、90天和封顶预算,不提前承诺三年。
| 结果 | 购买 | 组合 | 构建 |
|---|---|---|---|
| 三年总体拥有成本(教学案例) | 432.6万元 | 592.8万元 | 1,154.0万元 |
| 七道硬门 | 4项通过、3项失败 | 需建设并验证7项控制 | 技术控制可行、团队容量失败 |
| 可用试点前置时间 | 8 周 | 14 周 | 32+ 周 |
| 内部稳定团队 | 0.8个全职当量 | 2.0个全职当量 | 4.5个全职当量 |
| 决策 | 不作为端到端方案采用 | 90天受限试点 | 停止并重新审视团队容量 |
企业、人员、资料、供应商能力、价格、时间与结果均为虚构教学数据,不是市场报价或产品推荐。真实采购须结合当地合同、数据保护、知识产权、安全、行业、竞争与采购、财务和劳动要求,由合格专业人员审查。
这是一个虚构教学案例,重点不是证明组合普遍优于购买或构建,而是展示如何让选择随任务证据变化。如果场景只处理公开资料、只需要一次性草稿且允许人工重新建立来源,购买的两项不通过可能不再是硬门;如果企业已有成熟模型平台和轮值团队,构建能力门也可能通过。读者应复制问题、字段和检查方法,不应复制本案例结论或金额。
购买、组合和建设描述的是责任边界
| 模式 | 组织拥有 | 供应商/组件拥有 | 常见误解 |
|---|---|---|---|
| 购买 | 用例、资料权利、配置、采用、结果、供应商管理 | 打包的用户体验/工作流/模型/运营 | 购买=不用内部团队 |
| 组合 | 任务合同、控制平面、集成、评估、放行 | 托管模型/搜索/身份组件 | 组合=天然可移植 |
| 构建 | 应用程序/平台/模型服务代码与运行 | 芯片/云/开放组件仍为外部 | 构建=从零训练基础模型 |
“自主建设”要再问构建哪一层:自建客户特有工作流很常见;自建模型网关或检索可能合理;训练通用基础模型是完全不同的资本、数据和人才项目。本案例的构建只是假设企业自己运行选定模型和整套应用平台,不包含从零预训练。
购买也不是把责任外包。资料是否合法可用、答案如何进入客户承诺、谁审核、员工怎样培训、供应商变化如何发现,仍由恒砺承担。组合可更换模型,却可能锁在特定搜索索引、日志模式或编排软件开发工具包。选择标签前,先画每层负责人、接口、失败和退出。
选择会议先填一张责任边界记录:出现错误客户资料时谁能隔离,模型版本改变时谁触发回归,供应商中断时谁切人工,合同结束时谁验证删除,业务负责人怎样知道结果仍值得付费。若回答都是“供应商负责”,说明企业没有定义自己的服务;若回答都是“内部团队负责”,则报价中的托管服务可能没有提供想象中的价值。责任表比产品类别更早决定真实人力。
同一供应商也可能同时出现在三案:购买使用其完整应用,组合只使用其模型或检索服务,构建仍可能租它的云和硬件。采购比较的是企业保留哪些设计、运行和变化责任,不是给供应商贴永久标签。决策记录把每个组件、可替代实现、内部能力和合同责任逐行保存,避免架构名称掩盖供应链。
先把“标书助手”改写成任务合同
业务团队最初列出“能聊天、能总结、能一键生成整份标书”。项目组从60份连续建议书请求、720道问题和32次专家修改中重写范围:系统仅对已分配客户工作区中的问题检索有效资料,生成事实陈述、对应证据和内部草稿;作者核对客户、产品、地区、生效日、引用与承诺,复核人批准后才复制到正式标书。
| 字段 | 已承诺范围 |
|---|---|
| 触发 | 作者导入分配的 RFP 问题 |
| 输入 | 问题、客户工作区、已批准来源编号 |
| 输出 | 事实陈述、证据范围、来源与版本、未知状态、草稿 |
| 业务结果 | 已验证初稿;减少返工;准时响应 |
| 禁止 | 跨客户检索、价格/法律承诺、自动提交 |
| 人工 | 作者核实事实;领域审核员发布 |
| 基线 | 3,600道问题/月;实际处理14.0分钟;55%初稿有充分依据 |
| 回退 | 企业搜索/人工源复核 |
| 停止 | 错误租户、伪造源、隐藏的冲突版本 |
“生成整份标书”被拆掉,因为封面、资格证、产品事实、价格、合同偏差和客户承诺有不同资料、负责人与风险。第一批只做产品/交付事实草稿;价格、法律条款、安全声明和未经批准的未来路线图保持人工。供应商必须对这份任务合同演示,而不是用自己的最佳公开样例。
60份连续建议书请求还显示,720题中有184题可以直接复用有效标准答案,211题需组合两个以上资料,137题含客户自定义定义,96题需要地区或日期判断,52题涉及价格/法律/未来承诺,40题在现有资料中无可靠答案。类别按主要处置互斥,合计720。第一批合格只含前四类中能明确验证来源的题,后两类进入停止或人工专家路径;采购量和评估样本都按这个范围估算。
非AI替代方案也写入需求:统一资料目录、到期提醒、全文检索、标准答案负责人和客户工作区过滤。供应商要证明AI在这条改良基线之上增加什么,而不是拿14分钟旧流程与整套新平台比较。若主要价值来自资料治理和搜索,企业可以先交付这些结果,再决定是否购买生成能力,防止“为了采购AI而采购”。
采购前先证明资料和流程确实可用
18,400份文件并不等于18,400份可用知识。6周发现按产品族、地区、资料类型与活跃度抽720份:496份当前/已批准,86份过期但未撤,54份没有负责人,42份客户专属,24份扫描表格抽取失败,18份访问标签与源系统不一致。类别可重叠,所以不能把数量相加当唯一问题数。
| 探索性问题 | 证据 | 采购后果 |
|---|---|---|
| 源负责人 | 文档登记/签署 | 无负责人→不符合资格 |
| 生效/过期 | 产品/策略日期 | 需要版本过滤器 |
| 权利/目的 | 合同/分类 | 供应商处理范围 |
| 客户分区 | 工作区/ACL 样本 | 租户测试为强制 |
| 内容提取 | 文本/表格/图像样本 | 代表性基准 |
| 当前回答流程 | 60 RFP 追踪 | 集成, 非通用聊天 |
| 质量基线 | 720 问题/32 次编辑 | 供应商演示前评估集 |
| 删除/撤回 | 源事件 | 派生索引/输出删除 SLA |
项目先修54份无负责人与18份权限标签,不把供应商“能读取文件”当治理修复。若资料在合同上不能交给外部处理,购买或组合使用该服务都不合格;若企业自己也不能判答案,自主建设也不会神奇地解决可评估性。数据评估是一道立项门,不是中标后的实施工作包。
前期调查交付四张可复算清单:来源登记表记录负责人、权利、分类、生效与撤回;访问矩阵记录角色、客户工作区和负面测试;提取样本记录段落、表格、扫描件的成功与失败;回答追踪表记录问题、采用的事实陈述、原始证据、人工修改与最终结果。每张记录都抽样复核,不能只由资料上传者自证正确。
数据修复工时也进入三案共同成本。54份无负责人不是找54个人签名那么简单,可能需要撤回、合并或确认不再使用;24份扫描表格失败要比较人工结构化、OCR改进或保持人工。若候选供应商要求全部文件复制到自己的索引,项目另算增量分类、同步、删除和访问测试,不能把18,400次导入当免费按钮。
七道硬门不能被功能数量抵消
| 放行门槛 | 最低证据 | 购买结果 | 组合/构建义务 |
|---|---|---|---|
| 数据权利/边界 | 目的、区域、留存、子处理者证据 | 通过条件 | 配置 + 验证 |
| 身份/客户隔离 | SSO/角色/ACL 继承 + 负面测试 | 通过 | 设计 + 测试 |
| 证据与版本 | 事实陈述→证据片段→来源与生效时间 | 部分失败 | 标准证据对象 |
| 人工发布 | 无外部发布;角色批准 | 通过 | 状态/授权控制 |
| 评估/审计导出 | 输入、来源、版本、编辑、结果导出 | 不通过 | 自有评估/日志架构 |
| 变更与连续性 | 模型或检索变更通知、降级、回滚 | 附条件通过 | 适配器 + 回滚 |
| 退出/删除 | 可用导出、重建、已验证删除、协助 | 不通过 | 退出演练/运行手册 |
购买方案失败,不等于“供应商不好”。本案例要求迁移后仍能重建每条客户事实陈述的来源和评估历史,而候选产品只能导出最终文本与文件链接。若供应商在合同和沙盒中证明可以完整导出、删除与重建,结论可以改变;采购记录不能把销售口头承诺当作通过证据。
组合方案“可以通过”,也不代表已经通过。团队必须实际建设标准对象、权限适配、日志、模型变更回归测试与退出路径;预算或人员不够,理论控制就会变成自建风险。自主建设在技术控制上可能满足要求,但持续运行按4.5个全职当量计价,而能力审计仍显示2.5个全职当量缺口,能力门没有通过。
硬门复核由业务负责人陈述价值,数据、安全、评估和运营人员分别质询证据,采购秘书保存通过、不通过、未知、限制、负责人和到期日。功能多或报价低不能用投票覆盖不通过。对于“供应商将在路线图中支持导出”,当前状态仍是未知;只有形成合同承诺、可验收交付和未实现时的退出权后,才可转为附条件通过。
七门还要在变更时重跑:新增客户资料、开启连接器、更换模型/检索器、改变保留期、扩到外部发布或供应商加入子处理者都会使相关证据过期。项目不把首次安全复核当三年通行证;变更记录列受影响门、回归样本、审批人、放行和回滚,未完成就保持旧范围。
把系统拆成七层,再决定每层买还是建
| 层级 | 业务特异性 | 案例决策 | 原因 |
|---|---|---|---|
| 作者用户体验 | 中等 | 购买并配置 | 通用编辑与协作 |
| 身份与批准 | 高控制、通用能力 | 复用企业服务 | 单一权威来源 |
| 任务编排 | 高 | 自主建设 | 任务合同、状态与停止条件需按场景定义 |
| 资料与权限适配器 | 高 | 围绕现有系统建设 | 保留访问控制与版本 |
| 检索/模型 | 混合 | 托管购买, 在适配器之后 | 变更能力/规模 |
| 评估与可观测性 | 高 | 自主建设并持有数据 | 决策证据与可移植性 |
| 基础设施运营 | 低差异化 | 托管购买 | 无容量自运行案例 |
最终组合不是随意拼API:企业拥有任务契约、资料/权限接口、证据架构、评估集、发布日志与适配器合同;托管供应商提供模型推理、搜索候选和基础可用性。更换模型不应改业务对象,更换作者界面也不应丢失评估与来源历史。
如果一个组件没有第二个合理替代实现,架构图应标单一来源依赖并写应急计划,而不是因为有REST API就称开放。开放标准、公开模式和可执行测试比“供应商无关”口号更可靠。
每层选择还用“差异化、风险、变化速度、内部能力”四个问题。作者界面常见且更新快,自己复制成熟编辑功能没有业务优势;客户权限与发布责任高风险,必须复用企业权威身份并自己定义门;模型能力变化快,托管并隔离在适配器后比固定大额算力更可逆;证据与评估直接承载客户承诺和采购决定,因此数据与字段由企业拥有。
“建少量关键层”也会形成产品责任。源适配器需要处理权限撤回和政策失效,评估服务需要版本化评分标准与专家分歧,发布日志需要留存与访问规则。这些不是一次集成项目,必须有积压、值班人员、运行手册和下线计划;否则组合只是把供应商锁定换成离职员工锁定。
三种方案需要三类不同证据
三种方案共用同一任务范围、代表性样本和七道硬门,但各自最容易隐藏的问题不同:购买方案要证明产品在真实资料和失败样本上成立;组合方案要证明接口可以隔离供应商变化;自主建设则必须证明企业有能力长期运行。下面的证据不能互相替代。
购买方案要用真实资料和失败样本验收
| 供应商声称 | 要求证明 | 观察到的教学结果 |
|---|---|---|
| 能识别访问权限 | 40个允许、拒绝与撤权案例 | 39个通过;1个继承组过时 |
| 始终引用 | 120题含冲突版本 | 108 已支持;7弱支持;5错误版本 |
| 企业审计 | 导出 20完整回答事件 | 仅最终文本;无检索候选 |
| 模型选择 | 切换并重新运行固定评估 | 可选模型;检索变更过多 |
| 无数据训练 | 特定计划合同/子处理者 | 收到书面承诺 |
| 删除 | 删除资料或用户,并验证索引与输出 | 资料已移除;派生缓存的服务承诺不明确 |
| 轻松导出 | 重建 20 答案在其他地方 | 文本/文件导出;证据关系丢失 |
| 人工控制 | 尝试无审核员发布 | 按要求阻止 |
产品演示中90%的回答“看起来不错”没有意义;120题按正常70、边缘30、停止/权限20预先冻结,严重错误租户和虚构来源要求0。一次39/40权限测试失败就触发修复与全套回归,不以97.5%平均通过。
购买的优势仍被记录:8周可用、用户界面成熟、单点登录和审批基本满足、0.8个全职当量能运营;若场景只使用公开资料且不要求完整证据迁移,它可能成为首选。当前不入选来自任务边界,不是组织偏爱自建。
验证团队不给供应商临场挑题。120题在演示前冻结ID、预期证据、允许的多个合理答案、严重字段和人工评分标准;评审先盲判输出,再看产品名称。延迟按冷启动和连续请求分别记录,成本包含失败重试,权限测试由一个允许账号和一个相似但无权账号交叉执行。录屏只能辅助复现,结构化事件和导出文件才是验收证据。
39/40权限结果触发根本原因:问题来自继承组撤权后索引缓存延迟37分钟。供应商把缓存SLA改为15分钟仍不满足“客户撤权后立即停止新回答”的本任务边界,因此方案只能在每次检索实时重验源ACL后再测。把它写成“一个偶发错误”会丢掉真正架构要求;失败样本加入回归,未来任何候选都跑同一案例。
组合架构用标准合同隔离供应商变化
author workspace + SSO
-> task API: customer / question / allowed source IDs / purpose
-> source gateway: ACL + effective version + withdrawal events
-> retrieval adapters A|B: candidates + scores + index version
-> model adapters A|B: structured claim/evidence/unknown/draft
-> deterministic validators: tenant / source / date / prohibited claims
-> human review + release state
-> owned eval, audit, cost and outcome events
fallback: enterprise search + manual draft; no external auto-submit
标准响应保存事实陈述编号、原文证据范围、来源编号与版本、检索和模型版本、未知状态、验证器结果及人工编辑与发布记录。适配器允许替换候选组件,却不宣称输出语义完全等价;每次切换都运行固定评估,并重测长度、引用、拒绝、延迟、成本和不同语言。
组合新增的失败面包括组件超时、数据结构漂移、权限在缓存中不同步、多个供应商事件难定位和账单叠加。团队为每层设置负责人、服务目标(SLO)、追踪编号、超时、降级与回滚;若内部2个全职当量只能完成集成,无法运行评估与支持,这个方案也不应扩大。
一次回答使用贯穿各层的追踪编号,但日志按最少必要保存:业务日志记录任务、资料、版本和发布状态,安全日志记录委托人、授权和异常,成本日志记录组件用量,调试快照受限并到期删除。不能为了可观察性把所有建议书请求正文永久复制进第三个平台。事件字段、保留、访问与脱敏在设计清单中逐项签收。
故障演练覆盖四条链:模型超时则只显示搜索证据;检索返回空不允许模型凭记忆补答;权限服务不可用时故障安全关闭并转人工;日志写入失败时禁止外部放行但保留作者草稿。用户看到的是明确状态和下一动作,不是一句“稍后重试”。每次演练记录检测时间、受影响题、恢复步骤、数据完整性与运行手册缺口。
自主建设先做能力与利用率审计
| 能力 | 稳定需求 | 当前可用 | 差距 |
|---|---|---|---|
| 产品与领域 | 0.8个全职当量 | 0.8 | 0 |
| 平台/集成 | 1.2 | 0.7 | 0.5 |
| ML/模型服务 | 1.0 | 0.2 | 0.8 |
| 数据/检索 | 0.8 | 0.4 | 0.4 |
| 评估/质量 | 0.4 | 0.2 | 0.2 |
| 安全/SRE/支持 | 0.8 | 0.2 | 0.6 |
| 总计 | 5.0 | 2.5 | 2.5 FTE 差距 |
总体拥有成本按4.5个全职当量的平均持续团队计价,这是考虑角色可以组合后的情境;峰值仍需更多专家。企业当前只有2.5个全职当量可稳定投入,其中部分还要维护既有系统。招聘时间、值班人员、补丁、模型与驱动程序升级、容量、备份、灾难恢复和安全响应,不能被一次成功的概念验证掩盖。
硬件情境按平均21%、峰值65%目标利用率估算;低利用意味着为峰值和冗余持有闲置,过高则没有故障/批处理余量。价格性能可能快速变化,所以采购组不把具体图形处理器型号写成五年战略。构建保留为未来选项:当受控场景数、稳定负荷与内部平台能力达到重审门,再用新证据比较。
能力审计不只数简历。模型服务负责人要能处理版本、量化、容量和回滚,站点可靠性工程师要承担夜间事件,安全要跟踪依赖与凭证,评估负责人要组织领域专家持续标注。若五项责任由同一位“AI工程师”兼职,休假或离职就是单点失败。团队用四周值班模拟和一轮模型升级估算真实工作,而不是用概念验证开发速度推算稳态。
自主建设还要说明,为什么所需控制必须通过自有运行能力获得。资料不能离开特定边界、极低延迟、稳定巨大负荷或深度模型定制可能构成理由;仅仅“担心供应商锁定”并不充分,因为硬件、开源模型、驱动程序和关键维护者同样会形成锁定。若托管私有端点加上合同与技术控制已经满足风险要求,自己承担全部运行可能只是一种昂贵偏好。
三年总体拥有成本必须使用同一范围
三年问题量为第1年43,200、第2年54,000、第3年64,800,合计162,000;100用户保持不变。内部满载教学成本按每个全职当量每年36万元计算。所有金额为税前、未折现的虚构估算;模型、席位、算力和工资不是市场预测。
| 成本桶 | 购买 | 组合 | 构建 |
|---|---|---|---|
| 设置与集成 | 71.0万元 | 125.0万元 | 240.0万元 |
| 许可、共享服务与计算 | 187.2万元 | 108.0万元 | 180.0万元 |
| 可变推理与超额用量 | 16.0万元 | 77.8万元 | 包含在容量内 |
| 内部稳定运营 | 86.4万元 | 216.0万元 | 486.0万元 |
| 通用数据、评估与变更 | 54.0万元 | 54.0万元 | 54.0万元 |
| 能源、维护与安全 | 已包含 | 包含在服务与人力中 | 126.0万元 |
| 硬件更新 | 不适用 | 不适用 | 60.0万元 |
| 退出与迁移 | 18.0万元 | 12.0万元 | 8.0万元 |
| 三年总计 | 432.6万元 | 592.8万元 | 1,154.0万元 |
购买订阅=100×520元×36=187.2万元;组合方案的可变推理成本=162,000×4.8元≈77.8万元;内部运营分别为0.8×36万元×3=86.4万元、2×36万元×3=216万元、4.5×36万元×3=486万元。通用成本在三案中都保留,避免让某个方案看似不需要数据整理与评估。
总体拥有成本不是投资回报率,也不等于获批额度。故障、质量返工和合同争议先用情境与应急计划列示,尚无可靠概率的不塞进期望值制造精确;决策记录说明,组合方案相对购买方案多出的约160.2万元控制溢价,需要什么业务与风险证据才能成立。
成本工作簿保存数量、单价、公式、证据、置信度、负责人和更新时间。设置区分一次性资料修复、可复用平台和场景专属集成;内部人力用实际计划容量,不写成“现有员工=0”;评估流量、失败重试、开发环境和峰值预留进入用量;退出即使预计续约也必须列。共同成本三案相同并不代表可删,它们影响是否应做项目。
三年未折现是为了教学可复算,不适合直接作财务批准。真实决策还需现金流时间、税、资本/费用处理、折现、汇率、合同最低承诺与机会成本。采购组同时列已承诺、预测和有风险:例如三年总体拥有成本不等于首日承诺,90天试点只采购小额用量和退出协助,未通过门就不触发后续席位。
敏感性分析会改变三种方案的相对位置
| 场景 | 购买总计 | 组合总计 | 构建总计 | 变更内容 |
|---|---|---|---|---|
| 基础情境 | 432.6万元 | 592.8万元 | 1,154.0万元 | 已列明的假设 |
| 购买订阅上涨20% | 470.0万元 | 不变 | 不变 | 续约价格风险 |
| 200名用户,其他成本不变 | 619.8万元 | 592.8万元 | 1,154.0万元 | 仅把购买席位翻倍 |
| 组合方案问题量翻倍 | 432.6万元 | 670.5万元 | 必须重查容量 | 可变推理翻倍 |
| 组合单位成本下降40% | 不变 | 561.7万元 | 未假设 | 只影响可变部分 |
| 内部人力成本上涨20% | 449.9万元 | 636.0万元 | 1,251.2万元 | 稳定团队成本增加 |
在基础用量下,购买方案的非订阅成本约245.4万元,单用户三年订阅为18,720元;与组合方案592.8万元的教学交点约为186席。这个交点不是通用盈亏平衡:组合方案的2个全职当量和共享服务可能随用户增加,购买方案也可能有用量限制、阶梯折扣或实施变化。
敏感性揭示两种相反锁定:按席收费怕用户扩散,按量收费怕自动化高频化,自建固定容量怕需求不足或峰值。采购谈判应拿真实使用分布询价,分别列正常、峰值、失败重试、评估回放和批处理,不用“平均每月调用”隐藏极端账单。
每个敏感变量都有监控和重新决策的门槛。席位需求达到160时重谈企业套餐并复算组合;月问题量连续两月超过6,000时重做按量与容量测试;内部2个全职当量的可用容量低于1.5时冻结新场景;供应商实质性价格变更使12个月预测超预算10%时启动替代询价。这些是本案例的管理触发器,不是普遍财务规则,但比一年后才看到超支更可执行。
最坏情境不只看价格。购买若导出失败,迁移可能停工;组合若两个关键组件同时变更,回归队列会阻塞;构建若核心人员离职,补丁和事件无人承接。决策表分别写影响、早期信号、缓解、剩余风险和风险负责人,不把所有不确定性硬塞成一笔人民币。
价值只按实际采用和可证实结果计算
当前3,600题×14分钟/60=840小时/月活跃容量。若85%题合格、其中70%实际使用、端到端作者时间从14降到9分钟,则容量差=3,600×85%×70%×5/60=178.5小时/月,全年约2,142小时。它不是300小时理论上限,更不是现金节省;人员如何把时间用于更多投标、专家复核或客户沟通要另记。
| 结果层 | 基线 | 试点决策阈值 | 护栏 |
|---|---|---|---|
| 实际处理时间 | 中位数14.0分钟 | 已实际使用的合格案例中≤9.0分钟 | 人工编辑不能被隐藏 |
| 有充分依据的初稿 | 396/720=55.0% | ≥85% | 关键事实陈述必须100%有依据 |
| 无效/过期引用 | 51/720=7.1% | ≤2% | 错误客户=0 |
| 首位审核员通过 | 331/720=46.0% | ≥70% | 审核员工时未增加 |
| 准时提交 | 118/144=81.9% | 观察是否达到≥90%,不作过度因果声明 | 按范围与复杂度分层 |
| 用户采用 | 未知 | 合格任务中≥60% | 不以采用率向员工施压 |
价值不进入供应商演示总分;同一720题先跑人工、企业搜索和候选方案。若非AI统一资料视图已经达到9分钟,AI不会拥有全部5分钟。准时还受客户截止日期、定价与审批影响,试点只能报告关联和阻塞原因,不能把提速直接折成赢单收入。
利益负责人在试点前为178.5小时写去向假设:80小时应对更多合格投标,48小时增加高风险答案复核,30小时修资料与标准答案,20.5小时作为需求波动缓冲。运行后用日程、队列和完成记录确认,不通过员工监控推断“每分钟都被利用”。若释放时间被更多会议、重复复核或支持吞掉,经济模型回写为0或负,而不是继续引用理论容量。
质量和速度有先后门。错误客户、虚构证据或未经授权承诺出现一次就停止相关通道;严重为0后才比较已支持、编辑和分钟;业务结果最后看提案准时与返工。这样5分钟节时不能抵消一条错误客户承诺,采用率也不能抵消复核人工作量恶化。
供应商锁定至少发生在七个层面
| 锁定层 | 被困资产/知识 | 可移植性测试 |
|---|---|---|
| 资料与数据 | 复制文件、访问控制、版本与撤回记录 | 按资料编号和权限事件重构 |
| 索引/嵌入 | 块、元数据、排名调优 | 重建语料库并基准测试检索 |
| 任务与工作流 | 专有提示、节点与状态 | 标准任务及状态导出 |
| 证据与评估 | 事实陈述与来源关系、标签、失败 | 项目、评分表、结果与裁决导出 |
| 模型语义 | 工具架构、拒绝、长度行为 | 适配器切换 + 固定回归测试 |
| 身份/审计 | 供应商角色、批准、事件 ID | 映射主体和决策历史 |
| 运营/商业 | 运行手册、支持知识、价格层级 | 替代团队执行恢复 |
把提示词复制出来往往是最容易的一层。真正昂贵的是未知的资料切分、专家判例、失败样本、人工编辑、权限映射和支持经验。合同写“客户拥有数据”仍可能只给最终输出;采购要逐字段定义可机器读取的导出、频率、费用、时间和终止后访问窗口。
组合也会锁定:某检索服务的排名分数无法比较,某模型的结构化输出容忍非标准字段,某可观测性平台不导出追踪关系。标准架构只降低切换成本,不消除行为差;可移植性必须用实际替换和回放证明。
锁定登记为每层记录替换候选、切换工时、必须由原供应商提供的协助、可丢失内容和上次演练。若替代模型存在但需要重写全部评分标准,不能标“低锁定”;若数据可导出但只有专有ID、没有源版本关系,也不能标可迁移。每季度只重测变化最大或后果最高的层,年度做端到端退出演练。
锁定也可能来自组织习惯。作者若把全部检索能力交给系统、领域负责人停止维护资料、采购团队不再理解实际用量,即使代码开放也难迁移。因此人工样本、独立评估、运行手册轮换和第二名内部负责人都是退出资产,预算清单要包含它们。
三年合同前先做一次计时退出演练
| 演练步骤 | 成功证据 | 教学目标 |
|---|---|---|
| 冻结新写入 | 发布状态和变更负责人已记录 | 30 分钟 |
| 导出配置/数据/评估/日志 | 架构 + 计数 + 哈希 + 错误 | 1 工作日 |
| 重建18,400份来源资料中的合格子集 | ACL与版本一致性报告 | 5天 |
| 切换模型与检索适配器 | 600件案例回归测试 | 2天 |
| 恢复20名用户的服务与人工路径 | 身份、发布与监控有效 | 总计不超过10天 |
| 撤销供应商访问 | 账户/令牌/连接已禁用 | 同一天 |
| 已验证删除 | 范围、副本、备份、子处理者证据 | 合同 SLA |
| 对账记录/成本 | 保留审计和最终发票 | 15 天 |
演练使用两个客户工作区、20个完整回答链,以及包含撤权和过期资料的来源样本,不只是搬文件。迁移后随机重建20个事实陈述,检查证据片段、版本、批准人与最终文本;600题回归允许模型表达改变,却不允许严重错误、权限或引用门退化。
若供应商不允许合约前真实删除演练,至少在付费沙箱演示资料与用户删除和导出,并把生产验收设为付款门。退出期间保留企业搜索和人工路径,不以继续使用失效供应商作为唯一连续性。
本案例演练第一次在第7天发现96条评估事件缺少人工裁决理由,迁移系统无法区分“模型错”和“存在多个合理答案”。团队没有把9天总时长当通过,而是修导出架构、补原因字段后从零重跑;第二次600题回归用9天完成且严重无退化。记录第一次失败比只保留最终成功更能说明真实切换成本。
删除验收按活跃存储、搜索索引、调试快照、备份和子处理者逐项取证;“界面里看不到”不等于删除。若备份只能按既定周期到期,合同和风险记录要写最长残留时间与访问控制,不能承诺即时物理删除。真实义务由专业人员根据资料和地区判断。
供应商证据必须对应具体套餐和部署
| 领域 | 请求证据 | 负责验证的负责人 |
|---|---|---|
| 架构/数据流 | 区域、存储、日志、模型/提供商链 | 架构/数据 |
| 合同数据使用 | 培训、留存、删除、支持访问 | 法律/隐私 |
| 身份/安全 | 单点登录、可标识用户身份管理、角色、密钥、租户测试、事件 | 安全/IAM |
| 模型/检索 | 版本、限制、评估、变更历史 | AI/评估负责人 |
| 运营 | SLO、容量、支持、备份、灾难恢复、状态历史 | SRE/服务负责人 |
| 知识产权/内容 | 输入/输出/许可/第三方声明 | 法律/内容负责人 |
| 无障碍/采用 | 受支持用户、测试、管理控制 | 用户体验/变更负责人 |
| 退出 | 导出架构、工具、费用、协助、删除证明 | 产品/采购 |
证据按拟采购套餐、区域、模型和功能核对;另一个企业层级的白皮书不能自动适用。未知项有明确处置:阻止敏感资料、限制功能、增加合同条件或不入选,不能把问卷中的“部分满足”平均进总分。
供应商也可以合理保护商业秘密;企业需要的是足够测试、运行和问责的证据,不必要求源码。若黑箱边界使关键错误无法发现、输出无法解释给复核人或迁移无法重建,本任务就不适合该组件。
证据室按A/B/C标置信:A是沙盒运行、合同附件或可核验系统导出,B是适用计划的正式文档/独立报告,C是问卷、自述或未来路线图。分级不是总分;硬性放行门槛需要哪一级在需求中预先写明。每份证据保存版本、适用服务/地区、核验人、到期日和冲突,旧认证或其他产品线资料不会自动沿用。
澄清问答也成为合同历史。供应商说“通常30天删除”时,采购追问从哪个事件起算、包含哪些副本、子处理者怎样处理、谁提供证明;说“支持模型切换”时,追问是否同时改变检索、提示词或安全过滤。问题模板逼近可测试行为,不鼓励供应商给更多形容词。
模型升级必须进入商务与技术变更条款
| 术语 | 运营验收 |
|---|---|
| 服务/范围 | 命名功能、区域、模型、限制、禁止用途 |
| 数据/知识产权 | 输入/输出/派生数据权利;除非同意否则不训练 |
| 提供商链 | 命名子处理者/位置/变更路线 |
| 模型与检索变更 | 提前通知、发布说明、在供应商允许时固定版本 |
| 客户回归测试 | 在约定窗口完成测试,并可拒绝或回滚实质性变更 |
| 日志/证据 | 字段、留存、导出/API、客户访问 |
| 事件/支持 | 严重程度、通知、证据保留、RTO/RPO |
| 价格/容量 | 席位、令牌/项目、重试次数、评估流量、费率/超额用量 |
| 暂停/终止 | 人工处理路径、数据访问窗口、退出协助 |
| 删除 | 来源、索引、日志、备份、子处理程序、认证/声明 |
条款不能许诺供应商做不到的控制。例如“永不更新模型”可能既不可用也不安全;更实际的是定义实质性变更、通知、可见版本、回归窗口、回退和未通过时的商业退出。SLA也不只可用性:权限同步、资料撤回、日志可取和严重模型变化都可能有服务目标。
本表是跨职能需求,不是合同文本。采购、法务、安全、隐私、技术、业务和财务须根据地点、行业与谈判重写;文章不提供法律结论或规定固定通知天数。
变更合同把变化分为四类:不影响行为的维护只记录;可能影响输出的模型/检索更新需通知和评估;影响资料用途、地点或提供商链的变化需重新审查权利;影响外部动作或人工权限的变化按新场景重新准入。供应商和企业都可触发变化,客户自己修改来源分类法同样需要回归。
若紧急安全修补无法等待完整回归,系统先降级到搜索/人工或旧的受支持版本,在限定窗口补测;不能以“安全更新”为由悄悄扩大资料使用,也不能为保持模型固定而拒绝必要修补。变更记录写决策人、风险、临时控制、到期和最终恢复。
分阶段采购,让每一笔承诺购买明确证据
| 阶段 | 支出/承诺边界 | 继续证据 |
|---|---|---|
| 发现,6周 | 仅限内部 | 任务、数据、基线与替代方案 |
| 市场证据, 4 周 | 无生产数据 | 需求响应/证据缺口 |
| 付费沙箱, 6 周 | 合成/去标识化/有限真实 | 600 评估、权限、导出/删除 |
| 90天试点启动 | 20名用户、1类来源资料、用量上限 | 业务、控制、支持与退出演练 |
| 有限生产 | 经董事会审批后最多100名用户 | 两期稳定并且人员容量足够 |
| 多用途平台 | 独立用例准入 | 共享组件实际复用 |
每阶段可以继续、变更、限制、切换或停止;采购方式和竞争要求按真实组织规则执行。项目不把付费沙箱写成“免费概念验证”让供应商承担无限售前劳动,也不因为付过沙盒费而扩大。三年总体拥有成本用于比较方向,不在证据不足时变成三年订单。
组合试点的采购也不指定单一模型品牌作为需求。建议书请求写明任务、证据、接口和可替代组件;供应商可提出更简单的非AI方案或打包路由。对替代方案使用同一套评估与人工边界,防止规格书暗中锁死预选架构。
沙盒数据从合成、公开、去标识样本逐级开放;只有通过身份、日志和删除测试才给少量真实受控资料。参与厂商收到相同任务、样本说明和答疑记录,评分之外保留硬性放行门槛处置。未入选方资料按约定删除,评审反馈不泄露另一方商业信息;实际程序由组织采购规则决定。
阶段门还保护内部团队。市场证据阶段若发现三案都不能满足门,可以先修资料或停止,而不是为了年度预算强行中标;试点支持工时超过计划25%时缩范围,不让运营人员无偿补贴“低价格”方案。沉没的发现或沙盒成本不进入下一阶段的优劣判断。
90天试点用同一委员会判断质量、业务与退出
| 证据 | 阈值 | 已填写的教学结果 | 决策 |
|---|---|---|---|
| 离线评估 600 | 关键 0;已支持≥90%;无效≤2% | 0;546/600=91%;8/600=1.3% | 通过 |
| 停止/权限子集 | 80/80 正确 | 80/80 | 通过, 样本受限 |
| 已上线可准入/采用 | ≥60% 可准入的 | 756/1,020=74.1% | 通过 |
| 复核后可用 | 观察/编辑原因 | 681/756=90.1% | 学习 |
| 作者实际处理中位数 | ≤9.0分钟 | 9.4分钟 | 未达到目标 |
| 错误租户/外部自动发布 | 0 | 0 观测 | 通过, 非零风险证明 |
| 支持 | ≤6 严重/用户阻断事件 | 3 用户阻断; 0 严重 | 通过 |
| 退出 | 重建/回归≤10 天 | 9 天;无严重回归 | 通过 |
已上线试点共有1,200题,其中1,020 合格;756实际使用,681经复核可用。采用分母不使用全部题,也不只报告681个成功案例。9.4分钟未达到9.0门,委员会不能用91%离线质量抵消;调查显示42%的剩余时间在客户工作区选择和来源冲突,而非生成速度。
决定是再保持20用户30天,修工作区与冲突界面,不扩100席;若第二期时间仍不达门,保留证据/搜索改进而停止草稿生成。0个错误租户只说明本轮未观察,负面测试、人工发布和停止不移除。
681个可用输出中,417个未改事实、192个修改表达或结构、54个修正来源适用、18个转人工,合计681;“90.1%可用”不等于“90.1%无需审核”。54个来源修正集中在两个产品族的生效日冲突,促使源负责人先合并版本;18个人工成为下一轮边缘样本。项目没有用人工修正后的最终答案给模型计100%正确。
3个用户阻断事件分别是工作区选择缓存、批量导入字段截断和复核队列超时,均未外发;恢复时间为42、68、31分钟。事件记录保存检测、范围、人工连续性、修复和回归。它们说明组合控制可定位,却也证明内部团队必须承担真实运行工作。
内部产品团队仍要承担结果和供应商管理
| 问责 | 指定负责人 | 定期节奏 |
|---|---|---|
| 业务结果/范围 | 提案运营负责人 | 月度结果/返工复核 |
| 来源权利/版本 | 产品/数据负责人 | 发布/撤回事件复核 |
| 任务/评分表/评估 | 领域评估负责人 | 失败裁决/回归 |
| 身份/安全 | 身份与访问管理/安全负责人 | 访问/事件/控制测试 |
| 组件/运行时 | 平台产品负责人 | 服务等级目标/成本/变更/发布 |
| 供应商/合同 | 采购 + 法律负责人 | 证据/续期/义务复核 |
| 人工发布/采用 | 提案团队负责人 | 抽样决策/培训/支持 |
| 预算/收益 | 财务 + 业务赞助方 | 预测与实际/下一期承诺 |
2个全职当量是平均技术运营估算,不包含所有兼职负责人;专家评估、资料治理、培训和采购时间另在通用成本与容量计划中。每个负责人有备份和停止授权。供应商对合同服务负责,企业流程负责人对如何使用及业务结果负责,两者不能用“共同责任”互相消失。
模型、检索、来源或合同重大变化进入同一变更日历;先跑受影响评估、权限、成本和退出冒烟测试,再金丝雀给少量用户。续约前重算用户、问题量、失败、支持、实际总体拥有成本和替代方案,首年中标理由不是自动续约理由。
团队每月维护固定容量账:产品与平台交付、资料治理、评估标注、支持与事件、供应商变更、成本优化和技术债分别占用多少小时。若运行工作连续两月超过2个全职当量,委员会选择增加资源、降低服务级别或缩小范围,不能让评估和退出演练先被挤掉。被取消的控制工作也进入风险记录,而不是从计划中消失。
最终交付的是可复算选择,不是厂商象限图
| 产物 | 最低内容 |
|---|---|
| 任务/结果合同 | 触发器/输入/输出/禁止/人工/基线 |
| 数据发现 | 负责人/权利/版本/访问控制列表/提取/撤回 |
| 七道硬门 | 证据、通过或失败、缺口负责人、复核日期 |
| 层级所有权地图 | 购买、建设或复用选择,以及单一来源依赖 |
| 代表性评估 | 正常/边缘/停止/权限 + 人工基准 |
| 三年总体拥有成本工作簿 | 用量、用户、全职当量、组件、通用与退出假设 |
| 敏感性/前沿 | 席位、数量、单位成本、人力、容量场景 |
| 供应商证据室 | 特定计划文档/测试/未知处置 |
| 标准合同 | 任务/证据/状态/日志/适配器 + 语义注意事项 |
| 变更/退出合同 | 通知/回归/回退/导出/删除/协助 |
| 分阶段放行章程 | 预算、用户、数据、操作以及继续、限制与停止 |
| 决策记录 | 已选/已拒/反证/过期/下一选项 |
英国政府的人工智能采购指南强调先做数据评估、将治理带入采购、评估模型局限、透明度、知识产权、内部能力、供应商锁定与生命周期结束;本文只借鉴问题,不把公共部门指南当恒砺的法律义务。NIST AI RMF 核心治理 6和操作手册涉及第三方/供应链风险、应急计划、监控与采购;官方页面注明AI RMF 1.0与操作手册正在更新,七道门不是NIST清单。英国政府数字服务技术行为准则与开放标准原则支持开放标准、互操作、复用、适应变化与避免供应商锁定;开放接口仍需实测,不能证明行为等价。
- GOV.UK:Guidelines for AI procurement
- NIST AIRC:AI RMF Core
- NIST AIRC:AI RMF Playbook
- GOV.UK:Technology Code of Practice
- GOV.UK:Open Standards Principles
本周选一个准备采购的AI场景,先写任务/结果合同和七道不可抵消的门,再让购买、组合、构建使用同一真实样本、总体拥有成本分母与退出测试。若某案只靠“以后能导出”“我们会补团队”或“行业领先”通过,就把它退回缺口负责人;先购买一段有上限的学习,不在关键证据未知时购买三年确定性。