最终只批准了90天组合试点

恒砺工业材料有2,300名员工,86名标书作者、10名领域复核人和4名管理员需要处理客户建议书请求。当前每月约3,600道问题,答案来自18,400份产品、合规、质量与交付资料,覆盖6个销售地区和不同生效日期。业务目标不是“人人有聊天机器人”,而是缩短查证与草拟、提高有效引用,同时不跨客户泄露、不自动向客户发布。

采购组比较三案:购买100席端到端SaaS产品;组合托管模型、搜索、身份与自建证据控制服务;自主运行推理、检索和应用平台。购买方案的三年教学总体拥有成本为432.6万元,但完整的“事实陈述—证据”关系和评估日志不能导出,退出后无法重建答案链。自主建设约1,154万元,需要约4.5个全职当量的持续团队,当前能力门也没有通过。组合方案约592.8万元,是唯一能在当前证据下满足硬门且有团队承接的方案,但只获批20名用户、90天和封顶预算,不提前承诺三年。

结果 购买 组合 构建
三年总体拥有成本(教学案例) 432.6万元 592.8万元 1,154.0万元
七道硬门 4项通过、3项失败 需建设并验证7项控制 技术控制可行、团队容量失败
可用试点前置时间 8 周 14 周 32+ 周
内部稳定团队 0.8个全职当量 2.0个全职当量 4.5个全职当量
决策 不作为端到端方案采用 90天受限试点 停止并重新审视团队容量

企业、人员、资料、供应商能力、价格、时间与结果均为虚构教学数据,不是市场报价或产品推荐。真实采购须结合当地合同、数据保护、知识产权、安全、行业、竞争与采购、财务和劳动要求,由合格专业人员审查。

这是一个虚构教学案例,重点不是证明组合普遍优于购买或构建,而是展示如何让选择随任务证据变化。如果场景只处理公开资料、只需要一次性草稿且允许人工重新建立来源,购买的两项不通过可能不再是硬门;如果企业已有成熟模型平台和轮值团队,构建能力门也可能通过。读者应复制问题、字段和检查方法,不应复制本案例结论或金额。

购买、组合和建设描述的是责任边界

模式 组织拥有 供应商/组件拥有 常见误解
购买 用例、资料权利、配置、采用、结果、供应商管理 打包的用户体验/工作流/模型/运营 购买=不用内部团队
组合 任务合同、控制平面、集成、评估、放行 托管模型/搜索/身份组件 组合=天然可移植
构建 应用程序/平台/模型服务代码与运行 芯片/云/开放组件仍为外部 构建=从零训练基础模型

“自主建设”要再问构建哪一层:自建客户特有工作流很常见;自建模型网关或检索可能合理;训练通用基础模型是完全不同的资本、数据和人才项目。本案例的构建只是假设企业自己运行选定模型和整套应用平台,不包含从零预训练。

购买也不是把责任外包。资料是否合法可用、答案如何进入客户承诺、谁审核、员工怎样培训、供应商变化如何发现,仍由恒砺承担。组合可更换模型,却可能锁在特定搜索索引、日志模式或编排软件开发工具包。选择标签前,先画每层负责人、接口、失败和退出。

选择会议先填一张责任边界记录:出现错误客户资料时谁能隔离,模型版本改变时谁触发回归,供应商中断时谁切人工,合同结束时谁验证删除,业务负责人怎样知道结果仍值得付费。若回答都是“供应商负责”,说明企业没有定义自己的服务;若回答都是“内部团队负责”,则报价中的托管服务可能没有提供想象中的价值。责任表比产品类别更早决定真实人力。

同一供应商也可能同时出现在三案:购买使用其完整应用,组合只使用其模型或检索服务,构建仍可能租它的云和硬件。采购比较的是企业保留哪些设计、运行和变化责任,不是给供应商贴永久标签。决策记录把每个组件、可替代实现、内部能力和合同责任逐行保存,避免架构名称掩盖供应链。

先把“标书助手”改写成任务合同

业务团队最初列出“能聊天、能总结、能一键生成整份标书”。项目组从60份连续建议书请求、720道问题和32次专家修改中重写范围:系统仅对已分配客户工作区中的问题检索有效资料,生成事实陈述、对应证据和内部草稿;作者核对客户、产品、地区、生效日、引用与承诺,复核人批准后才复制到正式标书。

字段 已承诺范围
触发 作者导入分配的 RFP 问题
输入 问题、客户工作区、已批准来源编号
输出 事实陈述、证据范围、来源与版本、未知状态、草稿
业务结果 已验证初稿;减少返工;准时响应
禁止 跨客户检索、价格/法律承诺、自动提交
人工 作者核实事实;领域审核员发布
基线 3,600道问题/月;实际处理14.0分钟;55%初稿有充分依据
回退 企业搜索/人工源复核
停止 错误租户、伪造源、隐藏的冲突版本

“生成整份标书”被拆掉,因为封面、资格证、产品事实、价格、合同偏差和客户承诺有不同资料、负责人与风险。第一批只做产品/交付事实草稿;价格、法律条款、安全声明和未经批准的未来路线图保持人工。供应商必须对这份任务合同演示,而不是用自己的最佳公开样例。

60份连续建议书请求还显示,720题中有184题可以直接复用有效标准答案,211题需组合两个以上资料,137题含客户自定义定义,96题需要地区或日期判断,52题涉及价格/法律/未来承诺,40题在现有资料中无可靠答案。类别按主要处置互斥,合计720。第一批合格只含前四类中能明确验证来源的题,后两类进入停止或人工专家路径;采购量和评估样本都按这个范围估算。

非AI替代方案也写入需求:统一资料目录、到期提醒、全文检索、标准答案负责人和客户工作区过滤。供应商要证明AI在这条改良基线之上增加什么,而不是拿14分钟旧流程与整套新平台比较。若主要价值来自资料治理和搜索,企业可以先交付这些结果,再决定是否购买生成能力,防止“为了采购AI而采购”。

采购前先证明资料和流程确实可用

18,400份文件并不等于18,400份可用知识。6周发现按产品族、地区、资料类型与活跃度抽720份:496份当前/已批准,86份过期但未撤,54份没有负责人,42份客户专属,24份扫描表格抽取失败,18份访问标签与源系统不一致。类别可重叠,所以不能把数量相加当唯一问题数。

探索性问题 证据 采购后果
源负责人 文档登记/签署 无负责人→不符合资格
生效/过期 产品/策略日期 需要版本过滤器
权利/目的 合同/分类 供应商处理范围
客户分区 工作区/ACL 样本 租户测试为强制
内容提取 文本/表格/图像样本 代表性基准
当前回答流程 60 RFP 追踪 集成, 非通用聊天
质量基线 720 问题/32 次编辑 供应商演示前评估集
删除/撤回 源事件 派生索引/输出删除 SLA

项目先修54份无负责人与18份权限标签,不把供应商“能读取文件”当治理修复。若资料在合同上不能交给外部处理,购买或组合使用该服务都不合格;若企业自己也不能判答案,自主建设也不会神奇地解决可评估性。数据评估是一道立项门,不是中标后的实施工作包。

前期调查交付四张可复算清单:来源登记表记录负责人、权利、分类、生效与撤回;访问矩阵记录角色、客户工作区和负面测试;提取样本记录段落、表格、扫描件的成功与失败;回答追踪表记录问题、采用的事实陈述、原始证据、人工修改与最终结果。每张记录都抽样复核,不能只由资料上传者自证正确。

数据修复工时也进入三案共同成本。54份无负责人不是找54个人签名那么简单,可能需要撤回、合并或确认不再使用;24份扫描表格失败要比较人工结构化、OCR改进或保持人工。若候选供应商要求全部文件复制到自己的索引,项目另算增量分类、同步、删除和访问测试,不能把18,400次导入当免费按钮。

七道硬门不能被功能数量抵消

放行门槛 最低证据 购买结果 组合/构建义务
数据权利/边界 目的、区域、留存、子处理者证据 通过条件 配置 + 验证
身份/客户隔离 SSO/角色/ACL 继承 + 负面测试 通过 设计 + 测试
证据与版本 事实陈述→证据片段→来源与生效时间 部分失败 标准证据对象
人工发布 无外部发布;角色批准 通过 状态/授权控制
评估/审计导出 输入、来源、版本、编辑、结果导出 不通过 自有评估/日志架构
变更与连续性 模型或检索变更通知、降级、回滚 附条件通过 适配器 + 回滚
退出/删除 可用导出、重建、已验证删除、协助 不通过 退出演练/运行手册

购买方案失败,不等于“供应商不好”。本案例要求迁移后仍能重建每条客户事实陈述的来源和评估历史,而候选产品只能导出最终文本与文件链接。若供应商在合同和沙盒中证明可以完整导出、删除与重建,结论可以改变;采购记录不能把销售口头承诺当作通过证据。

组合方案“可以通过”,也不代表已经通过。团队必须实际建设标准对象、权限适配、日志、模型变更回归测试与退出路径;预算或人员不够,理论控制就会变成自建风险。自主建设在技术控制上可能满足要求,但持续运行按4.5个全职当量计价,而能力审计仍显示2.5个全职当量缺口,能力门没有通过。

硬门复核由业务负责人陈述价值,数据、安全、评估和运营人员分别质询证据,采购秘书保存通过、不通过、未知、限制、负责人和到期日。功能多或报价低不能用投票覆盖不通过。对于“供应商将在路线图中支持导出”,当前状态仍是未知;只有形成合同承诺、可验收交付和未实现时的退出权后,才可转为附条件通过。

七门还要在变更时重跑:新增客户资料、开启连接器、更换模型/检索器、改变保留期、扩到外部发布或供应商加入子处理者都会使相关证据过期。项目不把首次安全复核当三年通行证;变更记录列受影响门、回归样本、审批人、放行和回滚,未完成就保持旧范围。

把系统拆成七层,再决定每层买还是建

层级 业务特异性 案例决策 原因
作者用户体验 中等 购买并配置 通用编辑与协作
身份与批准 高控制、通用能力 复用企业服务 单一权威来源
任务编排 自主建设 任务合同、状态与停止条件需按场景定义
资料与权限适配器 围绕现有系统建设 保留访问控制与版本
检索/模型 混合 托管购买, 在适配器之后 变更能力/规模
评估与可观测性 自主建设并持有数据 决策证据与可移植性
基础设施运营 低差异化 托管购买 无容量自运行案例

最终组合不是随意拼API:企业拥有任务契约、资料/权限接口、证据架构、评估集、发布日志与适配器合同;托管供应商提供模型推理、搜索候选和基础可用性。更换模型不应改业务对象,更换作者界面也不应丢失评估与来源历史。

如果一个组件没有第二个合理替代实现,架构图应标单一来源依赖并写应急计划,而不是因为有REST API就称开放。开放标准、公开模式和可执行测试比“供应商无关”口号更可靠。

每层选择还用“差异化、风险、变化速度、内部能力”四个问题。作者界面常见且更新快,自己复制成熟编辑功能没有业务优势;客户权限与发布责任高风险,必须复用企业权威身份并自己定义门;模型能力变化快,托管并隔离在适配器后比固定大额算力更可逆;证据与评估直接承载客户承诺和采购决定,因此数据与字段由企业拥有。

“建少量关键层”也会形成产品责任。源适配器需要处理权限撤回和政策失效,评估服务需要版本化评分标准与专家分歧,发布日志需要留存与访问规则。这些不是一次集成项目,必须有积压、值班人员、运行手册和下线计划;否则组合只是把供应商锁定换成离职员工锁定。

三种方案需要三类不同证据

三种方案共用同一任务范围、代表性样本和七道硬门,但各自最容易隐藏的问题不同:购买方案要证明产品在真实资料和失败样本上成立;组合方案要证明接口可以隔离供应商变化;自主建设则必须证明企业有能力长期运行。下面的证据不能互相替代。

购买方案要用真实资料和失败样本验收

供应商声称 要求证明 观察到的教学结果
能识别访问权限 40个允许、拒绝与撤权案例 39个通过;1个继承组过时
始终引用 120题含冲突版本 108 已支持;7弱支持;5错误版本
企业审计 导出 20完整回答事件 仅最终文本;无检索候选
模型选择 切换并重新运行固定评估 可选模型;检索变更过多
无数据训练 特定计划合同/子处理者 收到书面承诺
删除 删除资料或用户,并验证索引与输出 资料已移除;派生缓存的服务承诺不明确
轻松导出 重建 20 答案在其他地方 文本/文件导出;证据关系丢失
人工控制 尝试无审核员发布 按要求阻止

产品演示中90%的回答“看起来不错”没有意义;120题按正常70、边缘30、停止/权限20预先冻结,严重错误租户和虚构来源要求0。一次39/40权限测试失败就触发修复与全套回归,不以97.5%平均通过。

购买的优势仍被记录:8周可用、用户界面成熟、单点登录和审批基本满足、0.8个全职当量能运营;若场景只使用公开资料且不要求完整证据迁移,它可能成为首选。当前不入选来自任务边界,不是组织偏爱自建。

验证团队不给供应商临场挑题。120题在演示前冻结ID、预期证据、允许的多个合理答案、严重字段和人工评分标准;评审先盲判输出,再看产品名称。延迟按冷启动和连续请求分别记录,成本包含失败重试,权限测试由一个允许账号和一个相似但无权账号交叉执行。录屏只能辅助复现,结构化事件和导出文件才是验收证据。

39/40权限结果触发根本原因:问题来自继承组撤权后索引缓存延迟37分钟。供应商把缓存SLA改为15分钟仍不满足“客户撤权后立即停止新回答”的本任务边界,因此方案只能在每次检索实时重验源ACL后再测。把它写成“一个偶发错误”会丢掉真正架构要求;失败样本加入回归,未来任何候选都跑同一案例。

组合架构用标准合同隔离供应商变化

可复制模板
author workspace + SSO
  -> task API: customer / question / allowed source IDs / purpose
  -> source gateway: ACL + effective version + withdrawal events
  -> retrieval adapters A|B: candidates + scores + index version
  -> model adapters A|B: structured claim/evidence/unknown/draft
  -> deterministic validators: tenant / source / date / prohibited claims
  -> human review + release state
  -> owned eval, audit, cost and outcome events
fallback: enterprise search + manual draft; no external auto-submit

标准响应保存事实陈述编号、原文证据范围、来源编号与版本、检索和模型版本、未知状态、验证器结果及人工编辑与发布记录。适配器允许替换候选组件,却不宣称输出语义完全等价;每次切换都运行固定评估,并重测长度、引用、拒绝、延迟、成本和不同语言。

组合新增的失败面包括组件超时、数据结构漂移、权限在缓存中不同步、多个供应商事件难定位和账单叠加。团队为每层设置负责人、服务目标(SLO)、追踪编号、超时、降级与回滚;若内部2个全职当量只能完成集成,无法运行评估与支持,这个方案也不应扩大。

一次回答使用贯穿各层的追踪编号,但日志按最少必要保存:业务日志记录任务、资料、版本和发布状态,安全日志记录委托人、授权和异常,成本日志记录组件用量,调试快照受限并到期删除。不能为了可观察性把所有建议书请求正文永久复制进第三个平台。事件字段、保留、访问与脱敏在设计清单中逐项签收。

故障演练覆盖四条链:模型超时则只显示搜索证据;检索返回空不允许模型凭记忆补答;权限服务不可用时故障安全关闭并转人工;日志写入失败时禁止外部放行但保留作者草稿。用户看到的是明确状态和下一动作,不是一句“稍后重试”。每次演练记录检测时间、受影响题、恢复步骤、数据完整性与运行手册缺口。

自主建设先做能力与利用率审计

能力 稳定需求 当前可用 差距
产品与领域 0.8个全职当量 0.8 0
平台/集成 1.2 0.7 0.5
ML/模型服务 1.0 0.2 0.8
数据/检索 0.8 0.4 0.4
评估/质量 0.4 0.2 0.2
安全/SRE/支持 0.8 0.2 0.6
总计 5.0 2.5 2.5 FTE 差距

总体拥有成本按4.5个全职当量的平均持续团队计价,这是考虑角色可以组合后的情境;峰值仍需更多专家。企业当前只有2.5个全职当量可稳定投入,其中部分还要维护既有系统。招聘时间、值班人员、补丁、模型与驱动程序升级、容量、备份、灾难恢复和安全响应,不能被一次成功的概念验证掩盖。

硬件情境按平均21%、峰值65%目标利用率估算;低利用意味着为峰值和冗余持有闲置,过高则没有故障/批处理余量。价格性能可能快速变化,所以采购组不把具体图形处理器型号写成五年战略。构建保留为未来选项:当受控场景数、稳定负荷与内部平台能力达到重审门,再用新证据比较。

能力审计不只数简历。模型服务负责人要能处理版本、量化、容量和回滚,站点可靠性工程师要承担夜间事件,安全要跟踪依赖与凭证,评估负责人要组织领域专家持续标注。若五项责任由同一位“AI工程师”兼职,休假或离职就是单点失败。团队用四周值班模拟和一轮模型升级估算真实工作,而不是用概念验证开发速度推算稳态。

自主建设还要说明,为什么所需控制必须通过自有运行能力获得。资料不能离开特定边界、极低延迟、稳定巨大负荷或深度模型定制可能构成理由;仅仅“担心供应商锁定”并不充分,因为硬件、开源模型、驱动程序和关键维护者同样会形成锁定。若托管私有端点加上合同与技术控制已经满足风险要求,自己承担全部运行可能只是一种昂贵偏好。

三年总体拥有成本必须使用同一范围

三年问题量为第1年43,200、第2年54,000、第3年64,800,合计162,000;100用户保持不变。内部满载教学成本按每个全职当量每年36万元计算。所有金额为税前、未折现的虚构估算;模型、席位、算力和工资不是市场预测。

成本桶 购买 组合 构建
设置与集成 71.0万元 125.0万元 240.0万元
许可、共享服务与计算 187.2万元 108.0万元 180.0万元
可变推理与超额用量 16.0万元 77.8万元 包含在容量内
内部稳定运营 86.4万元 216.0万元 486.0万元
通用数据、评估与变更 54.0万元 54.0万元 54.0万元
能源、维护与安全 已包含 包含在服务与人力中 126.0万元
硬件更新 不适用 不适用 60.0万元
退出与迁移 18.0万元 12.0万元 8.0万元
三年总计 432.6万元 592.8万元 1,154.0万元

购买订阅=100×520元×36=187.2万元;组合方案的可变推理成本=162,000×4.8元≈77.8万元;内部运营分别为0.8×36万元×3=86.4万元、2×36万元×3=216万元、4.5×36万元×3=486万元。通用成本在三案中都保留,避免让某个方案看似不需要数据整理与评估。

总体拥有成本不是投资回报率,也不等于获批额度。故障、质量返工和合同争议先用情境与应急计划列示,尚无可靠概率的不塞进期望值制造精确;决策记录说明,组合方案相对购买方案多出的约160.2万元控制溢价,需要什么业务与风险证据才能成立。

成本工作簿保存数量、单价、公式、证据、置信度、负责人和更新时间。设置区分一次性资料修复、可复用平台和场景专属集成;内部人力用实际计划容量,不写成“现有员工=0”;评估流量、失败重试、开发环境和峰值预留进入用量;退出即使预计续约也必须列。共同成本三案相同并不代表可删,它们影响是否应做项目。

三年未折现是为了教学可复算,不适合直接作财务批准。真实决策还需现金流时间、税、资本/费用处理、折现、汇率、合同最低承诺与机会成本。采购组同时列已承诺、预测和有风险:例如三年总体拥有成本不等于首日承诺,90天试点只采购小额用量和退出协助,未通过门就不触发后续席位。

敏感性分析会改变三种方案的相对位置

场景 购买总计 组合总计 构建总计 变更内容
基础情境 432.6万元 592.8万元 1,154.0万元 已列明的假设
购买订阅上涨20% 470.0万元 不变 不变 续约价格风险
200名用户,其他成本不变 619.8万元 592.8万元 1,154.0万元 仅把购买席位翻倍
组合方案问题量翻倍 432.6万元 670.5万元 必须重查容量 可变推理翻倍
组合单位成本下降40% 不变 561.7万元 未假设 只影响可变部分
内部人力成本上涨20% 449.9万元 636.0万元 1,251.2万元 稳定团队成本增加

在基础用量下,购买方案的非订阅成本约245.4万元,单用户三年订阅为18,720元;与组合方案592.8万元的教学交点约为186席。这个交点不是通用盈亏平衡:组合方案的2个全职当量和共享服务可能随用户增加,购买方案也可能有用量限制、阶梯折扣或实施变化。

敏感性揭示两种相反锁定:按席收费怕用户扩散,按量收费怕自动化高频化,自建固定容量怕需求不足或峰值。采购谈判应拿真实使用分布询价,分别列正常、峰值、失败重试、评估回放和批处理,不用“平均每月调用”隐藏极端账单。

每个敏感变量都有监控和重新决策的门槛。席位需求达到160时重谈企业套餐并复算组合;月问题量连续两月超过6,000时重做按量与容量测试;内部2个全职当量的可用容量低于1.5时冻结新场景;供应商实质性价格变更使12个月预测超预算10%时启动替代询价。这些是本案例的管理触发器,不是普遍财务规则,但比一年后才看到超支更可执行。

最坏情境不只看价格。购买若导出失败,迁移可能停工;组合若两个关键组件同时变更,回归队列会阻塞;构建若核心人员离职,补丁和事件无人承接。决策表分别写影响、早期信号、缓解、剩余风险和风险负责人,不把所有不确定性硬塞成一笔人民币。

价值只按实际采用和可证实结果计算

当前3,600题×14分钟/60=840小时/月活跃容量。若85%题合格、其中70%实际使用、端到端作者时间从14降到9分钟,则容量差=3,600×85%×70%×5/60=178.5小时/月,全年约2,142小时。它不是300小时理论上限,更不是现金节省;人员如何把时间用于更多投标、专家复核或客户沟通要另记。

结果层 基线 试点决策阈值 护栏
实际处理时间 中位数14.0分钟 已实际使用的合格案例中≤9.0分钟 人工编辑不能被隐藏
有充分依据的初稿 396/720=55.0% ≥85% 关键事实陈述必须100%有依据
无效/过期引用 51/720=7.1% ≤2% 错误客户=0
首位审核员通过 331/720=46.0% ≥70% 审核员工时未增加
准时提交 118/144=81.9% 观察是否达到≥90%,不作过度因果声明 按范围与复杂度分层
用户采用 未知 合格任务中≥60% 不以采用率向员工施压

价值不进入供应商演示总分;同一720题先跑人工、企业搜索和候选方案。若非AI统一资料视图已经达到9分钟,AI不会拥有全部5分钟。准时还受客户截止日期、定价与审批影响,试点只能报告关联和阻塞原因,不能把提速直接折成赢单收入。

利益负责人在试点前为178.5小时写去向假设:80小时应对更多合格投标,48小时增加高风险答案复核,30小时修资料与标准答案,20.5小时作为需求波动缓冲。运行后用日程、队列和完成记录确认,不通过员工监控推断“每分钟都被利用”。若释放时间被更多会议、重复复核或支持吞掉,经济模型回写为0或负,而不是继续引用理论容量。

质量和速度有先后门。错误客户、虚构证据或未经授权承诺出现一次就停止相关通道;严重为0后才比较已支持、编辑和分钟;业务结果最后看提案准时与返工。这样5分钟节时不能抵消一条错误客户承诺,采用率也不能抵消复核人工作量恶化。

供应商锁定至少发生在七个层面

锁定层 被困资产/知识 可移植性测试
资料与数据 复制文件、访问控制、版本与撤回记录 按资料编号和权限事件重构
索引/嵌入 块、元数据、排名调优 重建语料库并基准测试检索
任务与工作流 专有提示、节点与状态 标准任务及状态导出
证据与评估 事实陈述与来源关系、标签、失败 项目、评分表、结果与裁决导出
模型语义 工具架构、拒绝、长度行为 适配器切换 + 固定回归测试
身份/审计 供应商角色、批准、事件 ID 映射主体和决策历史
运营/商业 运行手册、支持知识、价格层级 替代团队执行恢复

把提示词复制出来往往是最容易的一层。真正昂贵的是未知的资料切分、专家判例、失败样本、人工编辑、权限映射和支持经验。合同写“客户拥有数据”仍可能只给最终输出;采购要逐字段定义可机器读取的导出、频率、费用、时间和终止后访问窗口。

组合也会锁定:某检索服务的排名分数无法比较,某模型的结构化输出容忍非标准字段,某可观测性平台不导出追踪关系。标准架构只降低切换成本,不消除行为差;可移植性必须用实际替换和回放证明。

锁定登记为每层记录替换候选、切换工时、必须由原供应商提供的协助、可丢失内容和上次演练。若替代模型存在但需要重写全部评分标准,不能标“低锁定”;若数据可导出但只有专有ID、没有源版本关系,也不能标可迁移。每季度只重测变化最大或后果最高的层,年度做端到端退出演练。

锁定也可能来自组织习惯。作者若把全部检索能力交给系统、领域负责人停止维护资料、采购团队不再理解实际用量,即使代码开放也难迁移。因此人工样本、独立评估、运行手册轮换和第二名内部负责人都是退出资产,预算清单要包含它们。

三年合同前先做一次计时退出演练

演练步骤 成功证据 教学目标
冻结新写入 发布状态和变更负责人已记录 30 分钟
导出配置/数据/评估/日志 架构 + 计数 + 哈希 + 错误 1 工作日
重建18,400份来源资料中的合格子集 ACL与版本一致性报告 5天
切换模型与检索适配器 600件案例回归测试 2天
恢复20名用户的服务与人工路径 身份、发布与监控有效 总计不超过10天
撤销供应商访问 账户/令牌/连接已禁用 同一天
已验证删除 范围、副本、备份、子处理者证据 合同 SLA
对账记录/成本 保留审计和最终发票 15 天

演练使用两个客户工作区、20个完整回答链,以及包含撤权和过期资料的来源样本,不只是搬文件。迁移后随机重建20个事实陈述,检查证据片段、版本、批准人与最终文本;600题回归允许模型表达改变,却不允许严重错误、权限或引用门退化。

若供应商不允许合约前真实删除演练,至少在付费沙箱演示资料与用户删除和导出,并把生产验收设为付款门。退出期间保留企业搜索和人工路径,不以继续使用失效供应商作为唯一连续性。

本案例演练第一次在第7天发现96条评估事件缺少人工裁决理由,迁移系统无法区分“模型错”和“存在多个合理答案”。团队没有把9天总时长当通过,而是修导出架构、补原因字段后从零重跑;第二次600题回归用9天完成且严重无退化。记录第一次失败比只保留最终成功更能说明真实切换成本。

删除验收按活跃存储、搜索索引、调试快照、备份和子处理者逐项取证;“界面里看不到”不等于删除。若备份只能按既定周期到期,合同和风险记录要写最长残留时间与访问控制,不能承诺即时物理删除。真实义务由专业人员根据资料和地区判断。

供应商证据必须对应具体套餐和部署

领域 请求证据 负责验证的负责人
架构/数据流 区域、存储、日志、模型/提供商链 架构/数据
合同数据使用 培训、留存、删除、支持访问 法律/隐私
身份/安全 单点登录、可标识用户身份管理、角色、密钥、租户测试、事件 安全/IAM
模型/检索 版本、限制、评估、变更历史 AI/评估负责人
运营 SLO、容量、支持、备份、灾难恢复、状态历史 SRE/服务负责人
知识产权/内容 输入/输出/许可/第三方声明 法律/内容负责人
无障碍/采用 受支持用户、测试、管理控制 用户体验/变更负责人
退出 导出架构、工具、费用、协助、删除证明 产品/采购

证据按拟采购套餐、区域、模型和功能核对;另一个企业层级的白皮书不能自动适用。未知项有明确处置:阻止敏感资料、限制功能、增加合同条件或不入选,不能把问卷中的“部分满足”平均进总分。

供应商也可以合理保护商业秘密;企业需要的是足够测试、运行和问责的证据,不必要求源码。若黑箱边界使关键错误无法发现、输出无法解释给复核人或迁移无法重建,本任务就不适合该组件。

证据室按A/B/C标置信:A是沙盒运行、合同附件或可核验系统导出,B是适用计划的正式文档/独立报告,C是问卷、自述或未来路线图。分级不是总分;硬性放行门槛需要哪一级在需求中预先写明。每份证据保存版本、适用服务/地区、核验人、到期日和冲突,旧认证或其他产品线资料不会自动沿用。

澄清问答也成为合同历史。供应商说“通常30天删除”时,采购追问从哪个事件起算、包含哪些副本、子处理者怎样处理、谁提供证明;说“支持模型切换”时,追问是否同时改变检索、提示词或安全过滤。问题模板逼近可测试行为,不鼓励供应商给更多形容词。

模型升级必须进入商务与技术变更条款

术语 运营验收
服务/范围 命名功能、区域、模型、限制、禁止用途
数据/知识产权 输入/输出/派生数据权利;除非同意否则不训练
提供商链 命名子处理者/位置/变更路线
模型与检索变更 提前通知、发布说明、在供应商允许时固定版本
客户回归测试 在约定窗口完成测试,并可拒绝或回滚实质性变更
日志/证据 字段、留存、导出/API、客户访问
事件/支持 严重程度、通知、证据保留、RTO/RPO
价格/容量 席位、令牌/项目、重试次数、评估流量、费率/超额用量
暂停/终止 人工处理路径、数据访问窗口、退出协助
删除 来源、索引、日志、备份、子处理程序、认证/声明

条款不能许诺供应商做不到的控制。例如“永不更新模型”可能既不可用也不安全;更实际的是定义实质性变更、通知、可见版本、回归窗口、回退和未通过时的商业退出。SLA也不只可用性:权限同步、资料撤回、日志可取和严重模型变化都可能有服务目标。

本表是跨职能需求,不是合同文本。采购、法务、安全、隐私、技术、业务和财务须根据地点、行业与谈判重写;文章不提供法律结论或规定固定通知天数。

变更合同把变化分为四类:不影响行为的维护只记录;可能影响输出的模型/检索更新需通知和评估;影响资料用途、地点或提供商链的变化需重新审查权利;影响外部动作或人工权限的变化按新场景重新准入。供应商和企业都可触发变化,客户自己修改来源分类法同样需要回归。

若紧急安全修补无法等待完整回归,系统先降级到搜索/人工或旧的受支持版本,在限定窗口补测;不能以“安全更新”为由悄悄扩大资料使用,也不能为保持模型固定而拒绝必要修补。变更记录写决策人、风险、临时控制、到期和最终恢复。

分阶段采购,让每一笔承诺购买明确证据

阶段 支出/承诺边界 继续证据
发现,6周 仅限内部 任务、数据、基线与替代方案
市场证据, 4 周 无生产数据 需求响应/证据缺口
付费沙箱, 6 周 合成/去标识化/有限真实 600 评估、权限、导出/删除
90天试点启动 20名用户、1类来源资料、用量上限 业务、控制、支持与退出演练
有限生产 经董事会审批后最多100名用户 两期稳定并且人员容量足够
多用途平台 独立用例准入 共享组件实际复用

每阶段可以继续、变更、限制、切换或停止;采购方式和竞争要求按真实组织规则执行。项目不把付费沙箱写成“免费概念验证”让供应商承担无限售前劳动,也不因为付过沙盒费而扩大。三年总体拥有成本用于比较方向,不在证据不足时变成三年订单。

组合试点的采购也不指定单一模型品牌作为需求。建议书请求写明任务、证据、接口和可替代组件;供应商可提出更简单的非AI方案或打包路由。对替代方案使用同一套评估与人工边界,防止规格书暗中锁死预选架构。

沙盒数据从合成、公开、去标识样本逐级开放;只有通过身份、日志和删除测试才给少量真实受控资料。参与厂商收到相同任务、样本说明和答疑记录,评分之外保留硬性放行门槛处置。未入选方资料按约定删除,评审反馈不泄露另一方商业信息;实际程序由组织采购规则决定。

阶段门还保护内部团队。市场证据阶段若发现三案都不能满足门,可以先修资料或停止,而不是为了年度预算强行中标;试点支持工时超过计划25%时缩范围,不让运营人员无偿补贴“低价格”方案。沉没的发现或沙盒成本不进入下一阶段的优劣判断。

90天试点用同一委员会判断质量、业务与退出

证据 阈值 已填写的教学结果 决策
离线评估 600 关键 0;已支持≥90%;无效≤2% 0;546/600=91%;8/600=1.3% 通过
停止/权限子集 80/80 正确 80/80 通过, 样本受限
已上线可准入/采用 ≥60% 可准入的 756/1,020=74.1% 通过
复核后可用 观察/编辑原因 681/756=90.1% 学习
作者实际处理中位数 ≤9.0分钟 9.4分钟 未达到目标
错误租户/外部自动发布 0 0 观测 通过, 非零风险证明
支持 ≤6 严重/用户阻断事件 3 用户阻断; 0 严重 通过
退出 重建/回归≤10 天 9 天;无严重回归 通过

已上线试点共有1,200题,其中1,020 合格;756实际使用,681经复核可用。采用分母不使用全部题,也不只报告681个成功案例。9.4分钟未达到9.0门,委员会不能用91%离线质量抵消;调查显示42%的剩余时间在客户工作区选择和来源冲突,而非生成速度。

决定是再保持20用户30天,修工作区与冲突界面,不扩100席;若第二期时间仍不达门,保留证据/搜索改进而停止草稿生成。0个错误租户只说明本轮未观察,负面测试、人工发布和停止不移除。

681个可用输出中,417个未改事实、192个修改表达或结构、54个修正来源适用、18个转人工,合计681;“90.1%可用”不等于“90.1%无需审核”。54个来源修正集中在两个产品族的生效日冲突,促使源负责人先合并版本;18个人工成为下一轮边缘样本。项目没有用人工修正后的最终答案给模型计100%正确。

3个用户阻断事件分别是工作区选择缓存、批量导入字段截断和复核队列超时,均未外发;恢复时间为42、68、31分钟。事件记录保存检测、范围、人工连续性、修复和回归。它们说明组合控制可定位,却也证明内部团队必须承担真实运行工作。

内部产品团队仍要承担结果和供应商管理

问责 指定负责人 定期节奏
业务结果/范围 提案运营负责人 月度结果/返工复核
来源权利/版本 产品/数据负责人 发布/撤回事件复核
任务/评分表/评估 领域评估负责人 失败裁决/回归
身份/安全 身份与访问管理/安全负责人 访问/事件/控制测试
组件/运行时 平台产品负责人 服务等级目标/成本/变更/发布
供应商/合同 采购 + 法律负责人 证据/续期/义务复核
人工发布/采用 提案团队负责人 抽样决策/培训/支持
预算/收益 财务 + 业务赞助方 预测与实际/下一期承诺

2个全职当量是平均技术运营估算,不包含所有兼职负责人;专家评估、资料治理、培训和采购时间另在通用成本与容量计划中。每个负责人有备份和停止授权。供应商对合同服务负责,企业流程负责人对如何使用及业务结果负责,两者不能用“共同责任”互相消失。

模型、检索、来源或合同重大变化进入同一变更日历;先跑受影响评估、权限、成本和退出冒烟测试,再金丝雀给少量用户。续约前重算用户、问题量、失败、支持、实际总体拥有成本和替代方案,首年中标理由不是自动续约理由。

团队每月维护固定容量账:产品与平台交付、资料治理、评估标注、支持与事件、供应商变更、成本优化和技术债分别占用多少小时。若运行工作连续两月超过2个全职当量,委员会选择增加资源、降低服务级别或缩小范围,不能让评估和退出演练先被挤掉。被取消的控制工作也进入风险记录,而不是从计划中消失。

最终交付的是可复算选择,不是厂商象限图

产物 最低内容
任务/结果合同 触发器/输入/输出/禁止/人工/基线
数据发现 负责人/权利/版本/访问控制列表/提取/撤回
七道硬门 证据、通过或失败、缺口负责人、复核日期
层级所有权地图 购买、建设或复用选择,以及单一来源依赖
代表性评估 正常/边缘/停止/权限 + 人工基准
三年总体拥有成本工作簿 用量、用户、全职当量、组件、通用与退出假设
敏感性/前沿 席位、数量、单位成本、人力、容量场景
供应商证据室 特定计划文档/测试/未知处置
标准合同 任务/证据/状态/日志/适配器 + 语义注意事项
变更/退出合同 通知/回归/回退/导出/删除/协助
分阶段放行章程 预算、用户、数据、操作以及继续、限制与停止
决策记录 已选/已拒/反证/过期/下一选项

英国政府的人工智能采购指南强调先做数据评估、将治理带入采购、评估模型局限、透明度、知识产权、内部能力、供应商锁定与生命周期结束;本文只借鉴问题,不把公共部门指南当恒砺的法律义务。NIST AI RMF 核心治理 6和操作手册涉及第三方/供应链风险、应急计划、监控与采购;官方页面注明AI RMF 1.0与操作手册正在更新,七道门不是NIST清单。英国政府数字服务技术行为准则与开放标准原则支持开放标准、互操作、复用、适应变化与避免供应商锁定;开放接口仍需实测,不能证明行为等价。

本周选一个准备采购的AI场景,先写任务/结果合同和七道不可抵消的门,再让购买、组合、构建使用同一真实样本、总体拥有成本分母与退出测试。若某案只靠“以后能导出”“我们会补团队”或“行业领先”通过,就把它退回缺口负责人;先购买一段有上限的学习,不在关键证据未知时购买三年确定性。