先看结果:四类负载被放到四种位置,没有一个“私有化或上云”的总答案
沅澄轨道设备有3,800名员工、3座工厂和42个服务站。团队原计划买一组“本地AI算力机”,理由是数据更安全、长期更便宜;另一组则主张全部使用在线模型,因为弹性更好。架构评审没有按部门投票,而是把四类工作负载分别过资料、动作、质量、网络、负载与运行门。
公开投标草稿每月18万个业务请求,月末峰值是平时8倍,选择在线模型;受限图纸与物料清单差异每月9.6万份,原文不得离开批准环境,选择中央本地推理;3座工厂的视觉复核每月480万帧,且现场闭环要求150毫秒,放在厂站边缘;现场维修助手每月72万次,把权限检索、原始记录、标识化和工具留在本地,只把批准的最少上下文送在线模型,形成混合推理。
| 工作负载 | 最终放置 | 决定性理由 | 发布与备用 |
|---|---|---|---|
| 公开投标草稿 | 在线托管 | 峰值为平时8倍;数据允许;C模型质量过门 | 人工发布;广域网中断时排队或转人工 |
| 受限图纸差异 | 中央本地 | 原始图纸与物料清单不得外发;D通过任务门 | 工程师签发;双节点冗余、队列与人工 |
| 工厂视觉分诊 | 工厂边缘本地 | 150毫秒闭环、广域网不可依赖、站点隔离 | 只分流复检;待机设备或人工检查 |
| 现场服务助手 | 混合 | 权限、资料源与工具留在本地;在线只见最少的已批准上下文 | 技师确认;仅检索、排队或转人工 |
90天后没有宣布“本地更安全”或“云更先进”。在线草稿95%的完整结果在4.2秒内返回;中央本地图纸差异任务在6个活跃加速器下,95%的结果在22.8秒内完成;边缘视觉99分位延迟为118毫秒;混合助手95分位为6.9秒。一次37分钟广域网中断按预定状态处理14,420个在线与混合对象,没有把受限资料改发未批准端点,也没有重复现场动作。
公司、负载、模型代号、性能、费用、容量、阈值与结果均为虚构教学案例,不对应真实客户、设备或供应商能力。真实资料分类、跨境、合同、安全、行业、环境、硬件、电力、价格和劳动要求须由相应负责人按实际地点与版本核验。
本文决定的是推理放置,不是采购形态、模型排行榜、完整总体拥有成本或容量工程
放置回答“这个已定义任务的哪些计算与数据在哪个信任、网络和运行环境执行”。它不等于购买、组合或自主建设:企业可以买本地产品、租专属云、托管自有权重或组合服务;也不等于模型选择:某模型必须先在任务评估中达到质量门。E09会展开完整总体拥有成本,E10会展开并发、队列、服务承诺与降级,本文只保留足以做位置决定的成本与容量证据。
| 先决条件 | 必须在放置前已知 | 不能从位置推断 |
|---|---|---|
| 任务合同 | 输入、输出、关键失败、操作、人工与服务目标 | 本地不自动获得业务正确性 |
| 数据决策 | 类别、资料源、区域、保留与出站 | 内网不自动等于资料合规 |
| 模型评估 | 配置×任务×切片的质量与稳定性 | 云端大模型不自动适合任务 |
| 需求概况 | 每小时到达、长度、并发与截止时间 | 月平均不代表峰值容量 |
| 运营模式 | 负责人、值班、补丁、事件与人工路径 | 买机器不自动产生运维团队 |
| 退出与连续性 | 导出、重建、备用与恢复目标 | 多个位置不自动等于高可用 |
架构负责人组织决定,但不能替资料负责人放行、替业务负责人接受结果、替安全与设施负责人确认环境,或替财务确认成本。每个工作负载都有业务负责人、数据负责人、模型负责人、平台与基础设施负责人、安全负责人、财务与供应商负责人和人工连续性负责人;其中任何硬门缺证据,状态就是待定,不能用一个风险总分平均过去。
本文把“本地”拆成中心本地/私有环境与工厂/边缘。中央机房离工厂仍可能跨广域网;边缘设备靠近业务动作,却有空间、电力、热、补丁与物理访问限制。把两者都叫私有化会漏掉最关键的故障域。
在线、本地、边缘和混合只是不同的执行拓扑
在线托管通常由供应商运营模型与弹性资源,企业通过网络按请求使用;本地中央由企业或托管方在批准环境运行;边缘在工厂、门店或设备附近执行;混合把一次业务任务拆成多个有明确数据契约的阶段。还有专属租户、私有端点和托管自有权重等中间形态,不能只靠“公有/私有”标签判断。
| 拓扑 | 企业直接控制 | 外部依赖保留 | 典型错误 |
|---|---|---|---|
| 在线托管 | 身份、应用、提示词、数据准入与结果发布 | 供应商服务、区域、网络与条款 | 把接口加密等同于可上传全部资料 |
| 中央本地 | 主机、网络、运行时、模型与观测 | 硬件、驱动程序、模型供应与支持 | 把机房位置等同于最小权限和已打补丁 |
| 边缘本地 | 设备、站点、网络、缓存与本地模型 | 物理访问、电源、站点人员与供应 | 把各站点小机器假装成可集中调度资源池 |
| 混合 | 阶段边界、分词、路由与工具 | 两侧和连接都必须可用 | 只画一根箭头,不定义跨界字段与失败状态 |
安全原则与位置正交。在线端点可以有企业身份、最小保留、批准区域和强审计;本地服务器也可能共享管理员账号、暴露调试内容、长期不更新。NIST SP 800-207明确不因物理/网络位置或资产所有权隐含信任,本文据此要求每一跳认证、授权和资源保护,不把“在内网”当准入证据。
弹性也不是“云无限、本地固定”的口号。在线受提供商配额、区域、网络、合同和成本限制;本地可用批量、队列、模型压缩和多任务调度改善利用率,却受设备交付与故障域限制。决定必须回到可测的工作负载包络。
同一个应用的不同阶段可能需要不同位置
现场维修助手不是一个提示词。它先验证技师、设备与工单权限,检索维修历史和受限手册,去掉姓名/客户标识并选择必要片段,再生成故障假设与检查顺序,最后查询备件并由技师确认任何工单更新。只有中间“对最少上下文生成草稿”可考虑在线,权限、原始资料、工具和最终动作必须留在企业控制面。
| 字段 | service-assist.v2 填充值 |
|---|---|
| 参与者 | 已培训现场技师;应用服务身份;值班工程师 |
| 原始资料 | 工单、设备序列号、维修记录、受限手册、库存只读接口 |
| 边界 | 原始记录、访问控制、客户身份与工具不外发;已批准片段可送往区域R1 |
| 在线输入 | 案例化名、故障码、最多12段已授权摘录、任务与输出结构 |
| 输出 | 证据关联检查草稿、状态未知、不可执行建议、引用来源编号 |
| 操作 | 技师确认;应用按独立授权查询库存;模型不得更新/派单 |
| 服务目标与负载 | 95%的完整结果不超过8秒;正常每秒12个请求,峰值每秒35个 |
| 严重失败 | 串设备、越权资料、虚构安全步骤、模型文字触发工具 |
| 回退 | 本地仅检索→在线草稿排队→值班工程师或人工 |
| 停止 | 出站字段违例、关键错误、访问控制失效、95分位连续15分钟超过8秒 |
每个阶段写输入/输出模式、数据类别、身份、允许的目标、保留/日志、超时/重试和负责人。混合不是把敏感提示词“简单脱敏”;若序列号、故障组合或自由文本仍能识别客户,数据负责人不会因删姓名就自动批准。标识化映射留本地且访问受限。
对照任务是厂站视觉分流。相机帧只用于把疑似缺陷送人工复检,不自动停线或报废;150毫秒包含采集、预处理、推理、规则与可编程逻辑控制器旁路信号。即使在线视觉模型更准确,只要广域网往返/中断无法满足动作窗口,就不能以平均延迟进入控制链。离线复盘可另行使用批准环境,不等于实时放置。
放置契约还要声明“允许位置”与“首选位置”不同。投标草稿的数据允许在线和本地,但当前负载/成本使在线成为首选,本地B只是经过任务评估的连续性候选;图纸差异的数据只允许本地,在线不是昂贵而是无资格;维修助手只允许最少上下文在线,不能把整条工作流标成云批准。报表分别保存合格位置、选定拓扑和拒绝原因,避免未来价格变化被误读为资料授权变化。
若任务负责人无法说明模型错误发生后、外部影响前是否能拦截,就先把动作降成草稿/只读再决定位置。例如视觉结果若直接控制停线,边缘低延迟仍不足以证明可用,还需独立安全逻辑、故障安全状态和相应工程审查;本文案例明确只路由人工复检,不能被复制成自动控制方案。
数据流和硬门先决定哪些位置有资格
画清原始资料、跨界字段、结果动作与故障域
项目先列来源、转换、推断、验证器、工具、人工发布和记录,而不是先画云图标。每条边标资料类别、字段、加密/认证、允许区域、保留、重试和断开状态;每个节点标负责人、容量、版本、日志和故障域。模型权重、输入、键值对/缓存、输出和调试快照分别处理,不能用一个“数据不落盘”覆盖全部。
| 工作负载 | 资料源与转换 | 推理路径 | 结果与操作记录 |
|---|---|---|---|
| 投标草稿 | 已批准的公开招标文件 | 托管C在区域R1 | 编辑草稿、版本与发布批准 |
| 图纸差异 | 产品生命周期管理系统的权限→本地解析与分块 | 中央隔离环境中的D | 差异、证据与工程师处置 |
| 视觉分诊 | 相机→边缘裁剪与归一化 | 站点V模型加规则 | 帧哈希、分数与人工检查 |
| 服务助手 | 本地权限检索→案例化名 | 托管C生成→本地验证与工具 | 追踪、来源编号与技师结果 |
故障域不是位置名称。托管C的供应商区域、企业广域网、身份服务和网关都可能分别故障;中央D的两台节点可能共享同一电源、存储、驱动程序或错误镜像;3座工厂的边缘环境彼此隔离,但每站可能只有一名支持人员;混合链路任一阶段失败都不能返回伪完整答案。
团队把依赖相关性单独标记:两台本地节点接同一存储并不是两个独立副本,两个在线端点若同区域/身份/提供商也不是完整备用,三厂都自动接收同一坏模型包会形成共同故障。架构图除组件正常运行时间外还保存共享电源、网络、身份、产物、操作员和变更通道;故障演练至少覆盖一个共享依赖,而不是只杀一台最容易恢复的进程。
每条跨界边还有可逆性判断。原始图纸一旦发给无资格端点无法靠删除本地日志撤回,因此数据网关必须在发送前;投标草稿生成失败可重做,因此可队列;现场复检路由若丢帧,后续产品已离开相机位置,恢复动作是人工挂起/追踪而非简单重试。可逆性决定故障安全关闭、队列还是补偿,不由技术组件自行猜测。
资料生命周期随路径计算。在线输入内容日志默认关闭不代表供应商完全不处理元数据;本地调试也不能永久保存图纸;边缘帧按缺陷调查需要保留,普通帧只留哈希/聚合。真实保存期限由业务、合同、法律与安全共同决定,本文不设置通用天数。
资料、动作、质量、网络、环境和运营是六道硬门
| 放行门槛 | 在线问题 | 本地/边缘问题 | 故障处置 |
|---|---|---|---|
| 数据与契约 | 区域、使用、留存、子处理方允许吗 | 主机、管理员、备份和观测在批准边界吗 | 拒绝或缩小数据与阶段 |
| 操作与安全 | 网络中断或错误能否在动作前拦截 | 本地模型是否越过可编程控制器与工具权限 | 草稿、只读或人工 |
| 任务质量 | 可交付配置是否通过本任务严重风险门 | 较小或量化模型是否仍通过 | 不因位置偏好降低门槛 |
| 延迟与网络 | 含广域网的95与99分位是否满足要求 | 站点内端到端是否满足要求 | 排队、边缘或人工 |
| 设施与平台 | 供应商服务目标、额度与变更可接受吗 | 电力、散热、空间、补丁、备件和监控足够吗 | 待定或备用 |
| 连续性与运营 | 中断、导出与支持是否演练 | 值班、重建、恢复与人工容量是否足够 | 不进入生产 |
受限图纸在数据网关排除在线,不再计算“在线便宜多少”;视觉闭环在网络与操作门排除广域网控制链;本地D若任务质量低于图纸差异门,同样不能因资料合规就上线。硬门按任务通道和配置判断,不能把一个失败扩大成对整个供应商或所有本地模型的判断。
合规/安全证据也有有效期。供应商合同、租户设置、区域和模型版本改变会重开在线放行门槛;本地机房迁移、管理员、遥测、备份和镜像供应链改变会重开本地网关。准入记录保存证据负责人与过期,不写“已通过安全”永久标签。
性能包络必须来自真实输入和到达曲线
每条负载保存输入/输出长度分布、批处理/流、到达模式、并发、截止日期、质量配置、验证器和重试。测试必须运行最终量化/适配器/检索与网络路径;同一加速器换模型、上下文、批量或精度,吞吐和内存都会变。厂商理论算力不直接换算文档/秒。
| 工作负载包络 | 正常 | 峰值与测试 | 验收条件 |
|---|---|---|---|
| 投标草稿 | 每秒3个请求;交互式返回 | 每秒24个请求,持续30分钟 | 95%的请求在6秒内完成;关键失败为0 |
| 图纸差异 | 每天批量4,000份 | 4小时窗口内12,000份 | 99%在截止日期内完成;95分位不超过30秒 |
| 每座工厂视觉 | 平均每秒采样0.74帧 | 每秒48帧突发,持续10分钟 | 99分位不超过150毫秒;无关键帧丢失 |
| 服务助手 | 每秒12个请求 | 每秒35个请求,持续20分钟 | 95分位不超过8秒;权限与证据100%通过 |
在线C在每秒24个请求时,95分位为4.2秒、99分位为7.9秒;低于6秒的门只说明95分位通过,99分位超出仍需应用妥善处理超时与展示。中央D用6个活跃加速器处理12,000份、4小时的窗口,实测99.3%按期完成,95分位为22.8秒;边缘V在每秒48帧时,99分位为118毫秒;混合链路在每秒35个请求时,95分位为6.9秒。其本地检索1.8秒、广域网与托管生成4.1秒、验证器1.0秒的分位数不能简单相加,因此保留整链追踪。
MLCommons的推理资料将离线、服务器、交互式等视为不同场景,并用特定负载/准确率/延迟规则比较系统;本文只借鉴“固定模型配置、负载形态与可验证结果”的方法。案例阈值由业务任务定义,不照搬MLPerf数值,也不把内部测试称为MLPerf结果。
峰谷和利用率决定本地经济性
180,000个投标草稿有63%集中在每月最后4个工作日,月末单小时可达14,400;按月均约250/小时购本地容量会严重不足,按14,400/小时永久买机器则大部分时间闲置。在线弹性仍受配额,团队提前预留24 请求/秒并做负载测试,不把“按量”误解成自动获得容量。
| 中央本地每月用途 | 加速器小时数 | 占8×720小时原始容量的份额 |
|---|---|---|
| 图纸生产 | 1,920 | 33.3% |
| 混合任务的本地备用与评估 | 480 | 8.3% |
| 模型回归与批量测试 | 320 | 5.6% |
| 维护与重建预留 | 160 | 2.8% |
| 总计划用量 | 2,880 | 50.0% |
| 原始安装 | 5,760 | 100% |
8个加速器并非都能承诺给常态业务。双节点冗余策略把2个留作节点故障和维护,6个活跃加速器的理论月时数为4,320;2,880小时计划负载占活跃包络的66.7%,还要用峰时队列仿真确认,不能只用月小时相除。维护160小时是计划占用,不是业务产出;财务利用率、容量利用率与可用性储备要分别报告。
3厂边缘各2个设备,一主一可接管,不能把A厂空闲设备在毫秒内借给B厂。每厂生产/回放约600 设备小时数/月,占双设备原始1,440小时的41.7%,但占单设备可服务720小时的83.3%;这是为站点故障与150毫秒动作窗口购买的冗余,不应被中央平均利用率判为“浪费”。
小时曲线还揭示了中央聚合的条件。图纸任务若三个工程部门都在周五17:00提交,月度2,880小时看似只占50%,峰时仍可能越过6 活跃包络;团队因此把非紧急回归安排在夜间,给生产批量设截止时间感知准入,并保留2张储备不接常态作业。若连续8周峰时不足35%、储备从未演练,评审的是缩设备或共享其他已过门负载;若峰时超过85%且队列老化上升,则先优化输入/批量,再比较扩容与部分合规托管,不能只看财务平均利用率。
利用率分母也必须注明。安装利用率用8×720小时,活跃服务利用率用6×720小时,生产利用率只算合格生产/评估输出,维护与空闲分别列;三者回答资产、容量和价值不同问题。把维护算“使用中”可以美化资产率,却不能说明交付了多少合格差异;把储备算浪费则会破坏故障目标。
四种拓扑各自承担不同的适用条件和运行责任
在线推理适合数据可放行、波动大且需要快速换能力的负载
投标草稿的来源已是批准公开材料,输出只是编辑草稿,C配置在本任务过质量门,网络中断可队列,月末峰值能提前申请配额。在线路径因此把弹性、模型更新选择和少维护转为供应商依赖;企业仍运营身份、网关、任务/数据策略、评估、用量、事件与放行。
| 托管准入项 | 已填充决策 | 证据/负责人 |
|---|---|---|
| 服务与模型 | 固定模型编号(如支持);C-r3 | 响应元数据与模型负责人 |
| 区域与数据使用 | 区域R1;已批准公开输入;关闭内容日志 | 租户配置、合同与数据负责人 |
| 额度 | 预留每秒24个请求;突发测试持续30分钟 | 供应商确认与平台记录 |
| 超时与重试 | 10秒;截止前仅允许一次有界重试 | 应用状态机 |
| 变更 | 目标为提前30天通知;旧版与新版小流量对照 | 合同与供应商负责人 |
| 中断 | 排队2小时;编辑人员使用人工模板 | 演练与业务负责人 |
| 退出 | 导出提示词、评估与日志元数据;备选B已评估 | 采购与模型负责人 |
在线不能承诺的任务不会因私有端点自动放行。私有连接改变网络路径,不自动改变供应商对内容的处理、管理员、区域、模型行为或合同;资料负责人逐项验证。专属容量也可能改善配额/隔离,但要计最低承诺和利用率。
缓存、批量和降级只在任务允许时使用。投标草稿可以将非紧急批量延后,但不能让不同客户材料共用语义缓存而造成串答;广域网中断时返回“已排队”或“使用人工模板”,不能伪造模型成功。供应商恢复后先用小流量处理旧队列,避免全部重放和重复发布。
中央本地适合不可外发且能聚合的负载
图纸差异任务的产品生命周期管理权限、原文、分块、向量表示与缓存、模型输入输出和调试均留在批准的隔离环境。D的权重与哈希、运行时、量化、提示词、解析器和验证器被冻结;工程师只看到自己有权访问的图纸,输出是差异草稿与页码,不自动修改物料清单或批准变更。
| 本地栈责任 | 上线前证据 | 运营负责人 |
|---|---|---|
| 设施 | 双电源、冷却、空间、消防与物理访问 | 设施与安全负责人 |
| 硬件 | 清单、固件、健康、备件与返修 | 基础设施负责人 |
| 驱动与运行时 | 签名来源、软件物料清单、补丁、回归与回滚 | 平台安全负责人 |
| 模型 | 许可、权重哈希、配置、评估与变更 | 模型负责人 |
| 服务 | 调度器、队列、额度、租户隔离与服务目标 | AI平台 |
| 数据 | 产品生命周期管理权限、缓存、日志、备份与删除 | 数据和应用负责人 |
| 连续性 | 双节点冗余、重建镜像与人工差异容量 | 运营和工程负责人 |
本地模型更新节奏由团队承担。安全补丁可能改变驱动/运行时,量化或服务优化可能改变输出;每次变更先在影子节点重建、跑严重/性能回归、金丝雀一批,再滚动。长期不升级不是稳定策略,会积累安全与供应风险。
中央本地适合跨部门聚合负载,但资源争抢必须有优先级。图纸生产高于评估和低优先批量,故障恢复预留不能被研发占满;大上下文任务在接受前检查内存与并发,不能等内存溢出后无限重试。E10会展开队列与服务承诺,本文只以6个活跃加速器加2个预留作为放置可行性门。
边缘推理缩短动作链,但每个站点都是生产环境
视觉模型只把帧标成正常、复核或传感器故障,可编程逻辑控制器/产线安全逻辑不由模型控制;复核进入人工检查,传感器故障触发设备检查。相机断流、时间戳漂移、光照变化和模型低置信不应全部算缺陷,状态分别保存。厂站不因断网继续无限缓存,达到空间门就降采样并启动人工巡检。
| 边缘关注点 | 控制 | 验收证据 |
|---|---|---|
| 物理访问 | 锁定机箱、篡改检测与资产负责人 | 季度检查 |
| 电源与散热 | 监控不间断电源、温度与降频告警 | 双电源与热环境演练 |
| 模型发布 | 签名包、站点批次、小流量试运行与回滚 | 哈希与站点部署账本 |
| 数据缓冲 | 有界加密环;按案例需要保留 | 填充、删除与恢复测试 |
| 时钟/网络 | 时间同步健康;离线状态 | 事件排序测试 |
| 安全边界 | 模型只路由人工复核;产线控制器的安全互锁独立 | 故障注入 |
| 支持 | 本地运行手册、远程管理、临时授权访问与备件 | 站点响应演练 |
三厂版本不能无声分叉。中央注册表记录站点、设备、模型/运行时/配置哈希、上次签到、缓冲、健康和负责人;发布先一条非关键线,观察一个生产周期再按站点扩展。离线厂站恢复连接后先上传健康/结果摘要,再按授权传案例证据,不把全部帧自动回灌。
边缘的低延迟是整条路径测得,不只是模型内核。相机预处理、复制、推断、规则、可编程控制器旁路信号和人机界面显示共同计入150毫秒;99分位为118毫秒,仍保留32毫秒预算。若热降频使99分位连续超过门,就转人工检查,而不是降低置信阈值来追求吞吐。
混合推理需要字段级的跨界契约
维修助手的本地阶段验证ACL并生成案例化名,只取12段已授权手册/历史摘录;出站验证器拒绝姓名、客户名、完整序列号、自由附件和未批准数据标签。在线C返回结构化草稿和来源编号,本地验证器检查引用、禁止动作与模式;库存工具使用独立服务身份读取,模型不能把文本变成工具令牌。
technician + work_order_id
-> local identity / work-order ACL / source retrieval
-> local minimization: case_alias + fault_code + <=12 approved snippets
-> egress policy: task, data class, region, prohibited fields
-> deny/manual OR hosted C-r3 generate draft only
-> local schema + citation + safety-rule validation
-> technician reviews evidence and chooses next check
-> local inventory read with separate authorization
-> outcome/edit/error linked to original business object
no cloud response can grant source or tool permission
| 混合阶段 | 失败 | 状态/动作 |
|---|---|---|
| 访问控制与资料源 | 拒绝、陈旧或不可用 | 不调用模型;解释原因并转人工 |
| 最小化 | 仍包含禁止字段 | 拒绝出站;安全与数据复核 |
| 广域网与托管 | 超时、额度不足或中断 | 仅检索、排队或转人工 |
| 生成 | 无依据或关键错误文本 | 验证器失败;技师不采取行动 |
| 本地验证器 | 不可用或审计降级 | 不发布高风险响应 |
| 库存查询 | 权限或状态变化 | 工具拒绝;刷新授权 |
| 记录写入 | 重复或冲突 | 幂等合并后关闭 |
混合质量按端到端配置评估,不能把在线模型单测分数当助手分数。检索漏文、错误标识化、片段截断、广域网重试和验证器过严都会影响结果。720,000 业务请求只计一次业务对象;云调用尝试、本地检索和工具读取另用于成本/故障诊断。
一条完整运行是工单WO-7314:技师只输入“制动控制器E17,重启后复现”。本地访问控制确认他只可查看设备别名R42与当前客户工作区;检索返回手册v6的5段内容、3段历史工单和一条已撤回旧公告。版本过滤先排除旧公告,标识化移除客户名、地址和完整序列号,形成故障码E17、环境温度、最近两个检查结果与8段来源编号。出站检查发现一段自由备注仍含联系人手机号,就整段拒绝并重新提取最少片段,不能只用正则遮掉号码后赌剩余语义无法识别客户。
在线C返回三步检查草稿,其中第二步声称“可带电重插端子”。本地安全规则发现它与手册v6第18页的断电要求冲突,把回复标为关键失败,不展示为建议;技师看到的是原文证据、冲突原因和“转值班工程师”,库存接口没有被调用。值班工程师选择断电检查并记录最终原因是端子松动,耗时11分钟。运行账本保存第一次模型输出失败、人工决定和最终状态,不能只保留人工修正后的漂亮答案。
这个案例同时验证三种位置责任:本地检索/版本过滤若错,在线模型再强也没有正确证据;在线生成出现不支持动作,必须由本地验证器在技师行动前挡住;人工结论不会反写成模型“通过”。下一轮把该案例加入关键保留集,修复必须重跑相同切片,而不是把冲突规则写成专门匹配E17的补丁。
混合并非总能兼得。若最少上下文仍含不允许外发的商业秘密,就全链本地或人工;若本地预处理占到大部分成本和延迟,可能不值得在线;若两侧团队没有共同值班人员和追踪,问题会在边界互相甩责。只有字段、状态、SLO与负责人都能测试时才准入。
容量与成本只比较同质量、同边界的方案
从可承诺服务量倒推设备和预留
中央D的负载测试在最终输入分布下,单个活跃加速器可承诺平均每小时处理2,100页图纸,同时满足95分位不超过30秒;6个活跃加速器合计每小时12,600页。4小时窗口的12,000份图纸平均3.1页,共约37,200页,计入10%重试与校验负荷后为40,920页,平均每小时需要处理10,230页,约占可承诺吞吐的81.2%。因此方案通过,但不能把每小时3,000份文档与每小时页面数混在一起计算。
| 容量账本 | 价值 | 计算/含义 |
|---|---|---|
| 峰值文档 | 12,000/4小时 | 业务对象 |
| 额外尝试前的页面 | 37,200 | 12,000×3.1 |
| 计入重试的页面尝试 | 40,920 | 37,200×1.10 |
| 所需速率 | 10,230 页面/小时 | 40,920/4 |
| 6个活跃加速器承诺 | 每小时12,600页 | 6×2,100实测 |
| 峰值利用率 | 81.2% | 10,230/12,600 |
| 伴随失败 5 活跃 | 10,500 页面/小时 | 2.6% 余量;紧密排队 |
一张活跃失效时只剩约2.6%吞吐余量,仍可能被到达波动吃掉;第7张储备需在5分钟内接管,期间队列保存业务对象、截止日期和访问控制列表版本。两张同时不可用时降到人工优先级清单与延长非关键截止日期,不把图纸发在线候选。
内存、上下文与并发也进准入控制。单卡页面/小时只对3.1页分布和固定D 配置成立;20页图纸包进入长通道,限制并发并单独测。超出形状的请求不偷偷截断,而是队列、拆分后保持引用或转工程师。
位置成本只比较同质量、同边界的方案
投标草稿使用在线C时,每个合格请求成本为0.32元,18万份约57,600元。假设把同质量模型放在本地,每月固定可归属成本为21万元,变量成本为每个合格请求0.08元,则盈亏平衡为210,000÷(0.32−0.08)=每月875,000份;当前量远低于该点且峰谷明显,因此在线更合适。这个算式只在质量、资料、服务水平和成本项都可比时成立。
| 投标量场景 | 托管 C | 本地等效 | 差异/决策 |
|---|---|---|---|
| 每月18万份 | 5.76万元 | 22.44万元 | 托管低16.68万元 |
| 每月50万份 | 16万元 | 25万元 | 托管低9万元 |
| 每月87.5万份 | 28万元 | 28万元 | 算术盈亏平衡 |
| 每月100万份 | 32万元 | 29万元 | 本地低3万元,尚未计迁移与风险 |
每月21万元固定成本至少应明确包含设备折旧或租用、支持、基础平台与最低人员分摊;每次0.08元变量成本包含电力、耗材与随用量变化的平台项。本篇不是完整总体拥有成本:机房、网络、备件、建设、迁移、评估、值班、停机和退出由E09再展开。数字只用来说明量与利用率怎样改变方向。
混合助手的教学月情境为在线生成72万次×0.78元=56.16万元,本地访问控制、检索增强生成、出站检查与验证器分摊12万元,合计68.16万元;全本地情境为固定42万元加72万次×0.38元=69.36万元,但本地候选尚未通过任务质量门,所以不能因为成本接近就替代。全在线原始资料路径在数据网关失败,也不进入价格表。
对盈亏平衡至少做三项敏感性。若投标量只有9万份,托管约2.88万元而本地约21.72万元;若达到100万份但月末峰值需要本地再买一组容量,原先29万元的情境立即失效;若在线单价下降但人工编辑上升,技术账省下的钱可能被合格结果成本反转。本地已买设备的账面沉没成本也不能让新任务跳过质量与资料门,决策比较的是从今天起仍可避免的现金、占用容量与机会成本。
承诺折扣和闲置分别披露。在线年提交未用部分不能全摊给这一个任务来制造本地优势,也不能藏在中央预算制造在线便宜;本地闲置储备按连续性目的分摊,普通闲置作为利用率问题。财务提供现金、会计和满载三种视图,架构决定注明使用哪一种,避免同一表把折旧成本与即时API账单直接相减。
FinOps 单位经济学建议把技术成本联系到业务单位,并可支持工作负载放置取舍;本文使用成本/合格业务结果而非成本/令牌。单位还需带质量、人工、失败和利用率,否则本地低账单可能只是固定成本未分配,在线低单价可能遗漏重试和审核。
故障切换、安全和运维共同决定位置能否长期成立
故障切换不能扩大资料与动作边界
37分钟广域网中断影响投标4,820个对象:3,540个在2小时截止日期内排队,1,280个临近截止转编辑人工模板;混合助手9,600个对象:6,720个显示本地检索与原文、不给生成式结论,1,920个排队,960个转值班工程师。4,820+9,600=14,420,每个对象有唯一状态。
| 故障注入 | 受影响 | 安全处置 | 恢复证明 |
|---|---|---|---|
| 广域网中断37分钟 | 14,420个在线与混合对象 | 5,460个排队;8,000个本地或人工;960个转工程师 | 无未授权出站;无重复操作 |
| 中央节点丢失 | 12,400个图纸任务 | 9,920个由剩余与预留容量处理;1,860个排队;620个按人工优先级处理 | 9,920+1,860+620=12,400 |
| 边缘活跃设备丢失 | 6,300个采样帧 | 4,900个由待机设备处理;1,400个人工检查 | 产线安全逻辑独立;所有对象有最终状态 |
| 托管模型错误更新 | 240个小流量案例 | 路由至固定B或人工;冻结C | 配置编号、关键回归与回滚记录 |
广域网汇总中的5,460个排队对象=3,540+1,920;8,000个本地或人工对象=1,280个人工模板+6,720个仅检索对象;另有960个转值班工程师。恢复时,排队任务重新验证截止日期、身份、资料访问控制和配置,过期就取消或转人工,不能机械重放。已展示仅检索结果的对象可以再生成草稿,但界面必须标记新版本,由技师确认不会把两份建议混成一次动作。
演练时间线从告警而不是恢复开始:第0分钟合成探针与广域网遥测同时告警,第3分钟事件指挥官确认不是供应商单点,第5分钟应用切断新托管尝试并显示降级状态,第8分钟业务负责人启动人工模板/值班队列,第37分钟网络恢复,第42分钟只放1%新请求金丝雀,第49分钟确认资料标签、P95和严重无异常,第55分钟按截止日期重放。任何时刻都没有把托管允许集扩大,也没有重新启用散落的直接密钥。
恢复对账使用业务对象账本而非供应商调用数。14,420个对象必须各处于排队、仅检索、人工、取消或完成之一;同一对象可以有多个尝试但只能有一个最终外部状态。队列5,460中有310个恢复时已过截止日期,取消并通知;相应已完成数从原队列分母扣除时仍保留中断影响,不能用“后来成功”抹去延迟违约。
本地故障不把图纸改发云,边缘故障不把安全分流改为远程广域网推理。备用位置只有在相同任务/数据/动作门提前通过时才可用;否则回退是队列、降为只读、人工或故障安全关闭。演练成功指标包括关键错误0、资料越界0、重复动作0、所有对象单一终态和人工队列未超容量,不是“系统返回200”。
本地部署扩大了企业自己的安全责任
在线把部分平台运营交给供应商但仍有第三方风险;本地把更多攻击面与证据义务拿回来。模型权重可能有许可/供应链问题,驱动/容器有漏洞,服务管理员可能导出输入,调试可复制图纸,备份/遥测可能离开边界,边缘设备可能被接触或遗失。
| 威胁/控制 | 托管 | 中心/边缘本地 | 通用证据 |
|---|---|---|---|
| 身份与管理员 | 企业租户加供应商管理员复核 | 独立临时授权管理员;无共享最高权限账户 | 访问、撤销与管理事件 |
| 软件供应链 | 模型与服务变更、合同 | 权重、镜像、软件物料清单、签名与补丁 | 版本、哈希与变更记录 |
| 运行时数据 | 供应商处理、缓存与日志设置 | 内存、缓存、交换、调试与备份 | 用途、访问、保留与删除 |
| 网络与出站 | 批准端点、区域与域名解析 | 白名单、更新与观测路径 | 流量、拒绝与异常日志 |
| 物理与设施 | 供应商保证证据 | 机架或边缘锁定、电源、冷却与备件 | 检查、事件与演练 |
| 租户与工作负载隔离 | 供应商租户控制 | 调度器、容器与设备分离 | 反向与跨任务测试 |
本地设备不能使用团队共享根或永久供应商远程账户;管理员与应用身份分开,高敏内容调试按案例授权且短期删除。补丁不能因“怕影响模型”无限推迟:先克隆/金丝雀/回归再滚动,无法修复的漏洞有隔离、停用或正式例外与过期。
混合链路尤其要防“本地先查到就可以外发”。出站策略基于任务/数据/源/字段,不以请求来自内网为允许;追踪上下文不携带原文/客户ID到托管供应商;在线响应也不携带工具权限回本地。安全验证覆盖越权来源、注入要求上传附件、模型伪造工具调用和跨案例缓存。
运维能力本身也是放置门
中央平台需要7×24还是工作时段值班人员取决于任务截止日期;厂站需要当地断网/硬件处理;业务团队维护手动容量。职责表写明检测、第一响应、升级、恢复、业务通知和事件后,不把所有问题交给一个“AI团队”。
| 角色 | 托管责任 | 本地/边缘责任 | 共享/混合 |
|---|---|---|---|
| 业务负责人 | 发布、人工路径与截止日期 | 相同 | 决定降级或停止 |
| AI平台 | 网关、评估与供应商事件 | 服务、调度器与模型发布 | 追踪、状态与回退 |
| 基础设施与设施 | 网络与身份依赖 | 硬件、驱动程序、电源、冷却与备件 | 端到端容量 |
| 数据与安全 | 供应商条款与出站 | 主机、管理员、缓存与备份 | 跨边界策略 |
| 供应商与采购 | 额度、服务目标、变更与退出 | 硬件返修、许可与支持 | 续订与可移植性 |
| 站点与工程 | 用户支持 | 边缘检查与人工流程 | 演练与结果反馈 |
团队做从镜像构建演练:中央一台储备设备从空盘、签名镜像、驱动与运行时、权重与配置、密钥到通过关键冒烟测试需要74分钟,超过30分钟恢复目标,因此保留热预留,并把冷重建目标设为120分钟;边缘备件从封存到接管需要26分钟,现场人工检查可承接45分钟。恢复时间与数据恢复点目标必须与业务连续性匹配,不能只写“有备份”。
技能与值班成本进入放置记录。若只有一名能修运行时的人,总线系数本身是硬风险;培训第二人、供应商支持、运行手册和简化栈可能比再买卡重要。外包运维仍需企业负责人、访问边界和验收,责任不会因合同消失。
90天按低后果在线、中央批量、单厂边缘和一条混合链逐批验证
| 阶段 | 范围 | 入口证据 | 出口证据 |
|---|---|---|---|
| 第1—15天:契约 | 4个任务的数据、负载与失败契约 | 已批准负责人和基线 | 候选拓扑与硬门记录 |
| 第16—30天:离线与负载 | 冻结配置、回放与合成峰值 | 任务评估与数据权限 | 95与99分位、吞吐和成本包络 |
| 第31—45天:在线托管 | 投标草稿从5%增至25% | 额度、发布与队列 | 峰值演练、质量、编辑与成本 |
| 第46—60天:中央本地 | 图纸影子运行到一条批处理通道 | 产品生命周期管理权限、双节点冗余与人工路径 | 截止日期、节点丢失与重建 |
| 第61—75天:边缘 | 一条非关键产线 | 站点安全、缓冲与回滚 | 散热、电源、广域网与待机演练 |
| 第76—90天:混合 | 2个服务区域、8名技师 | 现场契约、出站与工具隔离 | 访问控制、关键失败、95分位、中断与人工路径 |
每批只扩大已测试的任务、数据、站点、模型/配置和操作。在线先选可人工发布的公开草稿;中央先影子差异,不写物料清单;边缘先一条非关键线,只路由复检;混合只读库存,不更新工单。上一批未关闭严重、容量或负责人问题不进入下一批。
90天验收同时看质量、边界、95与99分位、截止日期、尝试、人工时间、单位成本、支持和恢复。业务价值不足时即使技术成功也可以停止;本地利用率不足可以合并或改租;在线峰值额度不可靠可以保留人工或重新谈容量;混合问题若多发生在接口,就简化阶段,而不是换更大模型。
资产退场从一开始写:托管撤凭证/租户数据,中心撤权重/运行时/缓存/密钥/主机分配,边缘擦除缓冲/凭证并更新资产账本,混合撤跨界策略/分词映射和工具身份。试点停止不是把设备留在角落继续带权限。
运行中按变化触发重新放置:数据、负载、模型、网络、价格和人员都会移动门槛
| 触发 | 调查 | 可能放置动作 |
|---|---|---|
| 数据类/区域变更 | 源/合同/出站/备份 | 托管→本地或更窄混合 |
| 量/峰值/利用率变更 | 小时曲线/队列/预留 | 托管突发/本地基础拆分 |
| 本地模型通过新的放行门 | 完整任务与配置评估 | 小流量通过后减少托管阶段 |
| 托管模型/条款变更 | 旧/新质量/数据/成本 | 固定/备选/本地/手动 |
| 广域网/站点可靠性变更 | 中断持续时间/手动加载 | 边缘缓存/本地回退/投资链路 |
| 硬件或支持生命周期结束 | 容量、补丁、返修与部件 | 更新、转托管服务或退役 |
| 待命容量下降 | 事件、恢复目标与关键人员依赖 | 简化架构、增加主机或停止高服务目标通道 |
月度查看小时需求、有效吞吐、储备、队列、任务成功、严重失败、人工编辑、数据拒绝、95与99分位、中断,以及每个合格结果的成本;季度重算情境,但任何关键、合同或模型变更都会立即触发。不要因为设备折旧未完就把新资料塞进本地,也不要因为已有云采购承诺就扩大未授权使用。
迁移先做桥接集与双状态,不一定双发真实敏感内容。托管→本地可用固定评估+分配群组;本地→托管先过数据网关;边缘版本更新用站点金丝雀;混合阶段重构保留旧/新追踪。切换后对账业务对象、质量、成本和人工,不把两套结果都执行。
交付推理放置包:让每个位置的边界、容量、费用和坏法都能被复算
| 产物/模板 | 最低内容 |
|---|---|
| 工作负载与放置契约 | 任务、输入、输出、动作、人工、服务目标、手动路径与负责人 |
| 数据流与失败图 | 阶段、字段、类别、身份、目的地、状态与依赖 |
| 硬门记录 | 数据、动作、质量、网络、设施与运营证据 |
| 配置清单 | 模型、哈希、运行时、量化、提示词、适配器与站点 |
| 需求概况 | 小时到达、长度、并发、批处理、截止日期与季节 |
| 性能包络 | 负载、配置、中位数、95与99分位、吞吐、质量与错误 |
| 容量账本 | 有效工时、峰值、预留、维护与故障容量 |
| 单位成本情境 | 固定、可变、利用率、合格单位与敏感度 |
| 备用矩阵 | 失败、合格路由、队列、降级、人工、停止与恢复 |
| 运营责任矩阵 | 检测、响应、补丁、重建、站点、支持与业务发布 |
| 发布与退役 | 批次、放行门、回滚、凭证、数据、资产与许可凭证 |
| 放置决策记录 | 已准入范围、假设、证据日期、到期与触发器 |
NIST云计算定义SP 800-145把云计算描述为按需访问共享且可配置的资源,并包含资源池化、快速弹性和计量服务等特征;本文据此使用“弹性”和“计量”,但不宣称所有在线模型都能无限伸缩。NIST零信任架构SP 800-207说明,不能因网络位置或资产所有权而隐含信任,支持“本地不自动更安全”。MLCommons推理文档区分离线、服务器与交互式场景,并按各自负载和延迟规则测试,支持按工作负载测性能。FinOps单位经济方法把技术成本联系到业务单位,可用于工作负载放置取舍;本文因此比较每个合格业务结果的成本,而不是词元单价。所有来源核验于2026-07-21。
- NIST:SP 800-145 The NIST Definition of Cloud Computing
- NIST:SP 800-207 Zero Trust Architecture
- NIST:SP 1800-35 Implementing a Zero Trust Architecture
- MLCommons:MLPerf Inference Submission Guide and Scenarios
- MLCommons:Llama 2 Inference Offline/Server Run Documentation
- FinOps Framework:Unit Economics
本周不要先问“买几张卡”或“用哪家云”。选一个已定义任务,画出从资料来源、转换、推断、验证器到工具与人工的字段级数据流,写明资料、动作、质量、网络、环境和运营六道硬门;用真实长度与小时峰谷分别测试托管和可交付本地配置,再演练广域网、本地节点与站点故障。只有当位置能够守住边界、满足整链任务、由明确团队持续运行,并在故障时保持单一业务状态,才签发带范围和有效期的放置记录。