先看结果:四类负载被放到四种位置,没有一个“私有化或上云”的总答案

沅澄轨道设备有3,800名员工、3座工厂和42个服务站。团队原计划买一组“本地AI算力机”,理由是数据更安全、长期更便宜;另一组则主张全部使用在线模型,因为弹性更好。架构评审没有按部门投票,而是把四类工作负载分别过资料、动作、质量、网络、负载与运行门。

公开投标草稿每月18万个业务请求,月末峰值是平时8倍,选择在线模型;受限图纸与物料清单差异每月9.6万份,原文不得离开批准环境,选择中央本地推理;3座工厂的视觉复核每月480万帧,且现场闭环要求150毫秒,放在厂站边缘;现场维修助手每月72万次,把权限检索、原始记录、标识化和工具留在本地,只把批准的最少上下文送在线模型,形成混合推理。

工作负载 最终放置 决定性理由 发布与备用
公开投标草稿 在线托管 峰值为平时8倍;数据允许;C模型质量过门 人工发布;广域网中断时排队或转人工
受限图纸差异 中央本地 原始图纸与物料清单不得外发;D通过任务门 工程师签发;双节点冗余、队列与人工
工厂视觉分诊 工厂边缘本地 150毫秒闭环、广域网不可依赖、站点隔离 只分流复检;待机设备或人工检查
现场服务助手 混合 权限、资料源与工具留在本地;在线只见最少的已批准上下文 技师确认;仅检索、排队或转人工

90天后没有宣布“本地更安全”或“云更先进”。在线草稿95%的完整结果在4.2秒内返回;中央本地图纸差异任务在6个活跃加速器下,95%的结果在22.8秒内完成;边缘视觉99分位延迟为118毫秒;混合助手95分位为6.9秒。一次37分钟广域网中断按预定状态处理14,420个在线与混合对象,没有把受限资料改发未批准端点,也没有重复现场动作。

公司、负载、模型代号、性能、费用、容量、阈值与结果均为虚构教学案例,不对应真实客户、设备或供应商能力。真实资料分类、跨境、合同、安全、行业、环境、硬件、电力、价格和劳动要求须由相应负责人按实际地点与版本核验。

本文决定的是推理放置,不是采购形态、模型排行榜、完整总体拥有成本或容量工程

放置回答“这个已定义任务的哪些计算与数据在哪个信任、网络和运行环境执行”。它不等于购买、组合或自主建设:企业可以买本地产品、租专属云、托管自有权重或组合服务;也不等于模型选择:某模型必须先在任务评估中达到质量门。E09会展开完整总体拥有成本,E10会展开并发、队列、服务承诺与降级,本文只保留足以做位置决定的成本与容量证据。

先决条件 必须在放置前已知 不能从位置推断
任务合同 输入、输出、关键失败、操作、人工与服务目标 本地不自动获得业务正确性
数据决策 类别、资料源、区域、保留与出站 内网不自动等于资料合规
模型评估 配置×任务×切片的质量与稳定性 云端大模型不自动适合任务
需求概况 每小时到达、长度、并发与截止时间 月平均不代表峰值容量
运营模式 负责人、值班、补丁、事件与人工路径 买机器不自动产生运维团队
退出与连续性 导出、重建、备用与恢复目标 多个位置不自动等于高可用

架构负责人组织决定,但不能替资料负责人放行、替业务负责人接受结果、替安全与设施负责人确认环境,或替财务确认成本。每个工作负载都有业务负责人、数据负责人、模型负责人、平台与基础设施负责人、安全负责人、财务与供应商负责人和人工连续性负责人;其中任何硬门缺证据,状态就是待定,不能用一个风险总分平均过去。

本文把“本地”拆成中心本地/私有环境与工厂/边缘。中央机房离工厂仍可能跨广域网;边缘设备靠近业务动作,却有空间、电力、热、补丁与物理访问限制。把两者都叫私有化会漏掉最关键的故障域。

在线、本地、边缘和混合只是不同的执行拓扑

在线托管通常由供应商运营模型与弹性资源,企业通过网络按请求使用;本地中央由企业或托管方在批准环境运行;边缘在工厂、门店或设备附近执行;混合把一次业务任务拆成多个有明确数据契约的阶段。还有专属租户、私有端点和托管自有权重等中间形态,不能只靠“公有/私有”标签判断。

拓扑 企业直接控制 外部依赖保留 典型错误
在线托管 身份、应用、提示词、数据准入与结果发布 供应商服务、区域、网络与条款 把接口加密等同于可上传全部资料
中央本地 主机、网络、运行时、模型与观测 硬件、驱动程序、模型供应与支持 把机房位置等同于最小权限和已打补丁
边缘本地 设备、站点、网络、缓存与本地模型 物理访问、电源、站点人员与供应 把各站点小机器假装成可集中调度资源池
混合 阶段边界、分词、路由与工具 两侧和连接都必须可用 只画一根箭头,不定义跨界字段与失败状态

安全原则与位置正交。在线端点可以有企业身份、最小保留、批准区域和强审计;本地服务器也可能共享管理员账号、暴露调试内容、长期不更新。NIST SP 800-207明确不因物理/网络位置或资产所有权隐含信任,本文据此要求每一跳认证、授权和资源保护,不把“在内网”当准入证据。

弹性也不是“云无限、本地固定”的口号。在线受提供商配额、区域、网络、合同和成本限制;本地可用批量、队列、模型压缩和多任务调度改善利用率,却受设备交付与故障域限制。决定必须回到可测的工作负载包络。

同一个应用的不同阶段可能需要不同位置

现场维修助手不是一个提示词。它先验证技师、设备与工单权限,检索维修历史和受限手册,去掉姓名/客户标识并选择必要片段,再生成故障假设与检查顺序,最后查询备件并由技师确认任何工单更新。只有中间“对最少上下文生成草稿”可考虑在线,权限、原始资料、工具和最终动作必须留在企业控制面。

字段 service-assist.v2 填充值
参与者 已培训现场技师;应用服务身份;值班工程师
原始资料 工单、设备序列号、维修记录、受限手册、库存只读接口
边界 原始记录、访问控制、客户身份与工具不外发;已批准片段可送往区域R1
在线输入 案例化名、故障码、最多12段已授权摘录、任务与输出结构
输出 证据关联检查草稿、状态未知、不可执行建议、引用来源编号
操作 技师确认;应用按独立授权查询库存;模型不得更新/派单
服务目标与负载 95%的完整结果不超过8秒;正常每秒12个请求,峰值每秒35个
严重失败 串设备、越权资料、虚构安全步骤、模型文字触发工具
回退 本地仅检索→在线草稿排队→值班工程师或人工
停止 出站字段违例、关键错误、访问控制失效、95分位连续15分钟超过8秒

每个阶段写输入/输出模式、数据类别、身份、允许的目标、保留/日志、超时/重试和负责人。混合不是把敏感提示词“简单脱敏”;若序列号、故障组合或自由文本仍能识别客户,数据负责人不会因删姓名就自动批准。标识化映射留本地且访问受限。

对照任务是厂站视觉分流。相机帧只用于把疑似缺陷送人工复检,不自动停线或报废;150毫秒包含采集、预处理、推理、规则与可编程逻辑控制器旁路信号。即使在线视觉模型更准确,只要广域网往返/中断无法满足动作窗口,就不能以平均延迟进入控制链。离线复盘可另行使用批准环境,不等于实时放置。

放置契约还要声明“允许位置”与“首选位置”不同。投标草稿的数据允许在线和本地,但当前负载/成本使在线成为首选,本地B只是经过任务评估的连续性候选;图纸差异的数据只允许本地,在线不是昂贵而是无资格;维修助手只允许最少上下文在线,不能把整条工作流标成云批准。报表分别保存合格位置、选定拓扑和拒绝原因,避免未来价格变化被误读为资料授权变化。

若任务负责人无法说明模型错误发生后、外部影响前是否能拦截,就先把动作降成草稿/只读再决定位置。例如视觉结果若直接控制停线,边缘低延迟仍不足以证明可用,还需独立安全逻辑、故障安全状态和相应工程审查;本文案例明确只路由人工复检,不能被复制成自动控制方案。

数据流和硬门先决定哪些位置有资格

画清原始资料、跨界字段、结果动作与故障域

项目先列来源、转换、推断、验证器、工具、人工发布和记录,而不是先画云图标。每条边标资料类别、字段、加密/认证、允许区域、保留、重试和断开状态;每个节点标负责人、容量、版本、日志和故障域。模型权重、输入、键值对/缓存、输出和调试快照分别处理,不能用一个“数据不落盘”覆盖全部。

工作负载 资料源与转换 推理路径 结果与操作记录
投标草稿 已批准的公开招标文件 托管C在区域R1 编辑草稿、版本与发布批准
图纸差异 产品生命周期管理系统的权限→本地解析与分块 中央隔离环境中的D 差异、证据与工程师处置
视觉分诊 相机→边缘裁剪与归一化 站点V模型加规则 帧哈希、分数与人工检查
服务助手 本地权限检索→案例化名 托管C生成→本地验证与工具 追踪、来源编号与技师结果

故障域不是位置名称。托管C的供应商区域、企业广域网、身份服务和网关都可能分别故障;中央D的两台节点可能共享同一电源、存储、驱动程序或错误镜像;3座工厂的边缘环境彼此隔离,但每站可能只有一名支持人员;混合链路任一阶段失败都不能返回伪完整答案。

团队把依赖相关性单独标记:两台本地节点接同一存储并不是两个独立副本,两个在线端点若同区域/身份/提供商也不是完整备用,三厂都自动接收同一坏模型包会形成共同故障。架构图除组件正常运行时间外还保存共享电源、网络、身份、产物、操作员和变更通道;故障演练至少覆盖一个共享依赖,而不是只杀一台最容易恢复的进程。

每条跨界边还有可逆性判断。原始图纸一旦发给无资格端点无法靠删除本地日志撤回,因此数据网关必须在发送前;投标草稿生成失败可重做,因此可队列;现场复检路由若丢帧,后续产品已离开相机位置,恢复动作是人工挂起/追踪而非简单重试。可逆性决定故障安全关闭、队列还是补偿,不由技术组件自行猜测。

资料生命周期随路径计算。在线输入内容日志默认关闭不代表供应商完全不处理元数据;本地调试也不能永久保存图纸;边缘帧按缺陷调查需要保留,普通帧只留哈希/聚合。真实保存期限由业务、合同、法律与安全共同决定,本文不设置通用天数。

资料、动作、质量、网络、环境和运营是六道硬门

放行门槛 在线问题 本地/边缘问题 故障处置
数据与契约 区域、使用、留存、子处理方允许吗 主机、管理员、备份和观测在批准边界吗 拒绝或缩小数据与阶段
操作与安全 网络中断或错误能否在动作前拦截 本地模型是否越过可编程控制器与工具权限 草稿、只读或人工
任务质量 可交付配置是否通过本任务严重风险门 较小或量化模型是否仍通过 不因位置偏好降低门槛
延迟与网络 含广域网的95与99分位是否满足要求 站点内端到端是否满足要求 排队、边缘或人工
设施与平台 供应商服务目标、额度与变更可接受吗 电力、散热、空间、补丁、备件和监控足够吗 待定或备用
连续性与运营 中断、导出与支持是否演练 值班、重建、恢复与人工容量是否足够 不进入生产

受限图纸在数据网关排除在线,不再计算“在线便宜多少”;视觉闭环在网络与操作门排除广域网控制链;本地D若任务质量低于图纸差异门,同样不能因资料合规就上线。硬门按任务通道和配置判断,不能把一个失败扩大成对整个供应商或所有本地模型的判断。

合规/安全证据也有有效期。供应商合同、租户设置、区域和模型版本改变会重开在线放行门槛;本地机房迁移、管理员、遥测、备份和镜像供应链改变会重开本地网关。准入记录保存证据负责人与过期,不写“已通过安全”永久标签。

性能包络必须来自真实输入和到达曲线

每条负载保存输入/输出长度分布、批处理/流、到达模式、并发、截止日期、质量配置、验证器和重试。测试必须运行最终量化/适配器/检索与网络路径;同一加速器换模型、上下文、批量或精度,吞吐和内存都会变。厂商理论算力不直接换算文档/秒。

工作负载包络 正常 峰值与测试 验收条件
投标草稿 每秒3个请求;交互式返回 每秒24个请求,持续30分钟 95%的请求在6秒内完成;关键失败为0
图纸差异 每天批量4,000份 4小时窗口内12,000份 99%在截止日期内完成;95分位不超过30秒
每座工厂视觉 平均每秒采样0.74帧 每秒48帧突发,持续10分钟 99分位不超过150毫秒;无关键帧丢失
服务助手 每秒12个请求 每秒35个请求,持续20分钟 95分位不超过8秒;权限与证据100%通过

在线C在每秒24个请求时,95分位为4.2秒、99分位为7.9秒;低于6秒的门只说明95分位通过,99分位超出仍需应用妥善处理超时与展示。中央D用6个活跃加速器处理12,000份、4小时的窗口,实测99.3%按期完成,95分位为22.8秒;边缘V在每秒48帧时,99分位为118毫秒;混合链路在每秒35个请求时,95分位为6.9秒。其本地检索1.8秒、广域网与托管生成4.1秒、验证器1.0秒的分位数不能简单相加,因此保留整链追踪。

MLCommons的推理资料将离线、服务器、交互式等视为不同场景,并用特定负载/准确率/延迟规则比较系统;本文只借鉴“固定模型配置、负载形态与可验证结果”的方法。案例阈值由业务任务定义,不照搬MLPerf数值,也不把内部测试称为MLPerf结果。

峰谷和利用率决定本地经济性

180,000个投标草稿有63%集中在每月最后4个工作日,月末单小时可达14,400;按月均约250/小时购本地容量会严重不足,按14,400/小时永久买机器则大部分时间闲置。在线弹性仍受配额,团队提前预留24 请求/秒并做负载测试,不把“按量”误解成自动获得容量。

中央本地每月用途 加速器小时数 占8×720小时原始容量的份额
图纸生产 1,920 33.3%
混合任务的本地备用与评估 480 8.3%
模型回归与批量测试 320 5.6%
维护与重建预留 160 2.8%
总计划用量 2,880 50.0%
原始安装 5,760 100%

8个加速器并非都能承诺给常态业务。双节点冗余策略把2个留作节点故障和维护,6个活跃加速器的理论月时数为4,320;2,880小时计划负载占活跃包络的66.7%,还要用峰时队列仿真确认,不能只用月小时相除。维护160小时是计划占用,不是业务产出;财务利用率、容量利用率与可用性储备要分别报告。

3厂边缘各2个设备,一主一可接管,不能把A厂空闲设备在毫秒内借给B厂。每厂生产/回放约600 设备小时数/月,占双设备原始1,440小时的41.7%,但占单设备可服务720小时的83.3%;这是为站点故障与150毫秒动作窗口购买的冗余,不应被中央平均利用率判为“浪费”。

小时曲线还揭示了中央聚合的条件。图纸任务若三个工程部门都在周五17:00提交,月度2,880小时看似只占50%,峰时仍可能越过6 活跃包络;团队因此把非紧急回归安排在夜间,给生产批量设截止时间感知准入,并保留2张储备不接常态作业。若连续8周峰时不足35%、储备从未演练,评审的是缩设备或共享其他已过门负载;若峰时超过85%且队列老化上升,则先优化输入/批量,再比较扩容与部分合规托管,不能只看财务平均利用率。

利用率分母也必须注明。安装利用率用8×720小时,活跃服务利用率用6×720小时,生产利用率只算合格生产/评估输出,维护与空闲分别列;三者回答资产、容量和价值不同问题。把维护算“使用中”可以美化资产率,却不能说明交付了多少合格差异;把储备算浪费则会破坏故障目标。

四种拓扑各自承担不同的适用条件和运行责任

在线推理适合数据可放行、波动大且需要快速换能力的负载

投标草稿的来源已是批准公开材料,输出只是编辑草稿,C配置在本任务过质量门,网络中断可队列,月末峰值能提前申请配额。在线路径因此把弹性、模型更新选择和少维护转为供应商依赖;企业仍运营身份、网关、任务/数据策略、评估、用量、事件与放行。

托管准入项 已填充决策 证据/负责人
服务与模型 固定模型编号(如支持);C-r3 响应元数据与模型负责人
区域与数据使用 区域R1;已批准公开输入;关闭内容日志 租户配置、合同与数据负责人
额度 预留每秒24个请求;突发测试持续30分钟 供应商确认与平台记录
超时与重试 10秒;截止前仅允许一次有界重试 应用状态机
变更 目标为提前30天通知;旧版与新版小流量对照 合同与供应商负责人
中断 排队2小时;编辑人员使用人工模板 演练与业务负责人
退出 导出提示词、评估与日志元数据;备选B已评估 采购与模型负责人

在线不能承诺的任务不会因私有端点自动放行。私有连接改变网络路径,不自动改变供应商对内容的处理、管理员、区域、模型行为或合同;资料负责人逐项验证。专属容量也可能改善配额/隔离,但要计最低承诺和利用率。

缓存、批量和降级只在任务允许时使用。投标草稿可以将非紧急批量延后,但不能让不同客户材料共用语义缓存而造成串答;广域网中断时返回“已排队”或“使用人工模板”,不能伪造模型成功。供应商恢复后先用小流量处理旧队列,避免全部重放和重复发布。

中央本地适合不可外发且能聚合的负载

图纸差异任务的产品生命周期管理权限、原文、分块、向量表示与缓存、模型输入输出和调试均留在批准的隔离环境。D的权重与哈希、运行时、量化、提示词、解析器和验证器被冻结;工程师只看到自己有权访问的图纸,输出是差异草稿与页码,不自动修改物料清单或批准变更。

本地栈责任 上线前证据 运营负责人
设施 双电源、冷却、空间、消防与物理访问 设施与安全负责人
硬件 清单、固件、健康、备件与返修 基础设施负责人
驱动与运行时 签名来源、软件物料清单、补丁、回归与回滚 平台安全负责人
模型 许可、权重哈希、配置、评估与变更 模型负责人
服务 调度器、队列、额度、租户隔离与服务目标 AI平台
数据 产品生命周期管理权限、缓存、日志、备份与删除 数据和应用负责人
连续性 双节点冗余、重建镜像与人工差异容量 运营和工程负责人

本地模型更新节奏由团队承担。安全补丁可能改变驱动/运行时,量化或服务优化可能改变输出;每次变更先在影子节点重建、跑严重/性能回归、金丝雀一批,再滚动。长期不升级不是稳定策略,会积累安全与供应风险。

中央本地适合跨部门聚合负载,但资源争抢必须有优先级。图纸生产高于评估和低优先批量,故障恢复预留不能被研发占满;大上下文任务在接受前检查内存与并发,不能等内存溢出后无限重试。E10会展开队列与服务承诺,本文只以6个活跃加速器加2个预留作为放置可行性门。

边缘推理缩短动作链,但每个站点都是生产环境

视觉模型只把帧标成正常、复核或传感器故障,可编程逻辑控制器/产线安全逻辑不由模型控制;复核进入人工检查,传感器故障触发设备检查。相机断流、时间戳漂移、光照变化和模型低置信不应全部算缺陷,状态分别保存。厂站不因断网继续无限缓存,达到空间门就降采样并启动人工巡检。

边缘关注点 控制 验收证据
物理访问 锁定机箱、篡改检测与资产负责人 季度检查
电源与散热 监控不间断电源、温度与降频告警 双电源与热环境演练
模型发布 签名包、站点批次、小流量试运行与回滚 哈希与站点部署账本
数据缓冲 有界加密环;按案例需要保留 填充、删除与恢复测试
时钟/网络 时间同步健康;离线状态 事件排序测试
安全边界 模型只路由人工复核;产线控制器的安全互锁独立 故障注入
支持 本地运行手册、远程管理、临时授权访问与备件 站点响应演练

三厂版本不能无声分叉。中央注册表记录站点、设备、模型/运行时/配置哈希、上次签到、缓冲、健康和负责人;发布先一条非关键线,观察一个生产周期再按站点扩展。离线厂站恢复连接后先上传健康/结果摘要,再按授权传案例证据,不把全部帧自动回灌。

边缘的低延迟是整条路径测得,不只是模型内核。相机预处理、复制、推断、规则、可编程控制器旁路信号和人机界面显示共同计入150毫秒;99分位为118毫秒,仍保留32毫秒预算。若热降频使99分位连续超过门,就转人工检查,而不是降低置信阈值来追求吞吐。

混合推理需要字段级的跨界契约

维修助手的本地阶段验证ACL并生成案例化名,只取12段已授权手册/历史摘录;出站验证器拒绝姓名、客户名、完整序列号、自由附件和未批准数据标签。在线C返回结构化草稿和来源编号,本地验证器检查引用、禁止动作与模式;库存工具使用独立服务身份读取,模型不能把文本变成工具令牌。

可复制模板
technician + work_order_id
  -> local identity / work-order ACL / source retrieval
  -> local minimization: case_alias + fault_code + <=12 approved snippets
  -> egress policy: task, data class, region, prohibited fields
     -> deny/manual OR hosted C-r3 generate draft only
  -> local schema + citation + safety-rule validation
  -> technician reviews evidence and chooses next check
  -> local inventory read with separate authorization
  -> outcome/edit/error linked to original business object
no cloud response can grant source or tool permission
混合阶段 失败 状态/动作
访问控制与资料源 拒绝、陈旧或不可用 不调用模型;解释原因并转人工
最小化 仍包含禁止字段 拒绝出站;安全与数据复核
广域网与托管 超时、额度不足或中断 仅检索、排队或转人工
生成 无依据或关键错误文本 验证器失败;技师不采取行动
本地验证器 不可用或审计降级 不发布高风险响应
库存查询 权限或状态变化 工具拒绝;刷新授权
记录写入 重复或冲突 幂等合并后关闭

混合质量按端到端配置评估,不能把在线模型单测分数当助手分数。检索漏文、错误标识化、片段截断、广域网重试和验证器过严都会影响结果。720,000 业务请求只计一次业务对象;云调用尝试、本地检索和工具读取另用于成本/故障诊断。

一条完整运行是工单WO-7314:技师只输入“制动控制器E17,重启后复现”。本地访问控制确认他只可查看设备别名R42与当前客户工作区;检索返回手册v6的5段内容、3段历史工单和一条已撤回旧公告。版本过滤先排除旧公告,标识化移除客户名、地址和完整序列号,形成故障码E17、环境温度、最近两个检查结果与8段来源编号。出站检查发现一段自由备注仍含联系人手机号,就整段拒绝并重新提取最少片段,不能只用正则遮掉号码后赌剩余语义无法识别客户。

在线C返回三步检查草稿,其中第二步声称“可带电重插端子”。本地安全规则发现它与手册v6第18页的断电要求冲突,把回复标为关键失败,不展示为建议;技师看到的是原文证据、冲突原因和“转值班工程师”,库存接口没有被调用。值班工程师选择断电检查并记录最终原因是端子松动,耗时11分钟。运行账本保存第一次模型输出失败、人工决定和最终状态,不能只保留人工修正后的漂亮答案。

这个案例同时验证三种位置责任:本地检索/版本过滤若错,在线模型再强也没有正确证据;在线生成出现不支持动作,必须由本地验证器在技师行动前挡住;人工结论不会反写成模型“通过”。下一轮把该案例加入关键保留集,修复必须重跑相同切片,而不是把冲突规则写成专门匹配E17的补丁。

混合并非总能兼得。若最少上下文仍含不允许外发的商业秘密,就全链本地或人工;若本地预处理占到大部分成本和延迟,可能不值得在线;若两侧团队没有共同值班人员和追踪,问题会在边界互相甩责。只有字段、状态、SLO与负责人都能测试时才准入。

容量与成本只比较同质量、同边界的方案

从可承诺服务量倒推设备和预留

中央D的负载测试在最终输入分布下,单个活跃加速器可承诺平均每小时处理2,100页图纸,同时满足95分位不超过30秒;6个活跃加速器合计每小时12,600页。4小时窗口的12,000份图纸平均3.1页,共约37,200页,计入10%重试与校验负荷后为40,920页,平均每小时需要处理10,230页,约占可承诺吞吐的81.2%。因此方案通过,但不能把每小时3,000份文档与每小时页面数混在一起计算。

容量账本 价值 计算/含义
峰值文档 12,000/4小时 业务对象
额外尝试前的页面 37,200 12,000×3.1
计入重试的页面尝试 40,920 37,200×1.10
所需速率 10,230 页面/小时 40,920/4
6个活跃加速器承诺 每小时12,600页 6×2,100实测
峰值利用率 81.2% 10,230/12,600
伴随失败 5 活跃 10,500 页面/小时 2.6% 余量;紧密排队

一张活跃失效时只剩约2.6%吞吐余量,仍可能被到达波动吃掉;第7张储备需在5分钟内接管,期间队列保存业务对象、截止日期和访问控制列表版本。两张同时不可用时降到人工优先级清单与延长非关键截止日期,不把图纸发在线候选。

内存、上下文与并发也进准入控制。单卡页面/小时只对3.1页分布和固定D 配置成立;20页图纸包进入长通道,限制并发并单独测。超出形状的请求不偷偷截断,而是队列、拆分后保持引用或转工程师。

位置成本只比较同质量、同边界的方案

投标草稿使用在线C时,每个合格请求成本为0.32元,18万份约57,600元。假设把同质量模型放在本地,每月固定可归属成本为21万元,变量成本为每个合格请求0.08元,则盈亏平衡为210,000÷(0.32−0.08)=每月875,000份;当前量远低于该点且峰谷明显,因此在线更合适。这个算式只在质量、资料、服务水平和成本项都可比时成立。

投标量场景 托管 C 本地等效 差异/决策
每月18万份 5.76万元 22.44万元 托管低16.68万元
每月50万份 16万元 25万元 托管低9万元
每月87.5万份 28万元 28万元 算术盈亏平衡
每月100万份 32万元 29万元 本地低3万元,尚未计迁移与风险

每月21万元固定成本至少应明确包含设备折旧或租用、支持、基础平台与最低人员分摊;每次0.08元变量成本包含电力、耗材与随用量变化的平台项。本篇不是完整总体拥有成本:机房、网络、备件、建设、迁移、评估、值班、停机和退出由E09再展开。数字只用来说明量与利用率怎样改变方向。

混合助手的教学月情境为在线生成72万次×0.78元=56.16万元,本地访问控制、检索增强生成、出站检查与验证器分摊12万元,合计68.16万元;全本地情境为固定42万元加72万次×0.38元=69.36万元,但本地候选尚未通过任务质量门,所以不能因为成本接近就替代。全在线原始资料路径在数据网关失败,也不进入价格表。

对盈亏平衡至少做三项敏感性。若投标量只有9万份,托管约2.88万元而本地约21.72万元;若达到100万份但月末峰值需要本地再买一组容量,原先29万元的情境立即失效;若在线单价下降但人工编辑上升,技术账省下的钱可能被合格结果成本反转。本地已买设备的账面沉没成本也不能让新任务跳过质量与资料门,决策比较的是从今天起仍可避免的现金、占用容量与机会成本。

承诺折扣和闲置分别披露。在线年提交未用部分不能全摊给这一个任务来制造本地优势,也不能藏在中央预算制造在线便宜;本地闲置储备按连续性目的分摊,普通闲置作为利用率问题。财务提供现金、会计和满载三种视图,架构决定注明使用哪一种,避免同一表把折旧成本与即时API账单直接相减。

FinOps 单位经济学建议把技术成本联系到业务单位,并可支持工作负载放置取舍;本文使用成本/合格业务结果而非成本/令牌。单位还需带质量、人工、失败和利用率,否则本地低账单可能只是固定成本未分配,在线低单价可能遗漏重试和审核。

故障切换、安全和运维共同决定位置能否长期成立

故障切换不能扩大资料与动作边界

37分钟广域网中断影响投标4,820个对象:3,540个在2小时截止日期内排队,1,280个临近截止转编辑人工模板;混合助手9,600个对象:6,720个显示本地检索与原文、不给生成式结论,1,920个排队,960个转值班工程师。4,820+9,600=14,420,每个对象有唯一状态。

故障注入 受影响 安全处置 恢复证明
广域网中断37分钟 14,420个在线与混合对象 5,460个排队;8,000个本地或人工;960个转工程师 无未授权出站;无重复操作
中央节点丢失 12,400个图纸任务 9,920个由剩余与预留容量处理;1,860个排队;620个按人工优先级处理 9,920+1,860+620=12,400
边缘活跃设备丢失 6,300个采样帧 4,900个由待机设备处理;1,400个人工检查 产线安全逻辑独立;所有对象有最终状态
托管模型错误更新 240个小流量案例 路由至固定B或人工;冻结C 配置编号、关键回归与回滚记录

广域网汇总中的5,460个排队对象=3,540+1,920;8,000个本地或人工对象=1,280个人工模板+6,720个仅检索对象;另有960个转值班工程师。恢复时,排队任务重新验证截止日期、身份、资料访问控制和配置,过期就取消或转人工,不能机械重放。已展示仅检索结果的对象可以再生成草稿,但界面必须标记新版本,由技师确认不会把两份建议混成一次动作。

演练时间线从告警而不是恢复开始:第0分钟合成探针与广域网遥测同时告警,第3分钟事件指挥官确认不是供应商单点,第5分钟应用切断新托管尝试并显示降级状态,第8分钟业务负责人启动人工模板/值班队列,第37分钟网络恢复,第42分钟只放1%新请求金丝雀,第49分钟确认资料标签、P95和严重无异常,第55分钟按截止日期重放。任何时刻都没有把托管允许集扩大,也没有重新启用散落的直接密钥。

恢复对账使用业务对象账本而非供应商调用数。14,420个对象必须各处于排队、仅检索、人工、取消或完成之一;同一对象可以有多个尝试但只能有一个最终外部状态。队列5,460中有310个恢复时已过截止日期,取消并通知;相应已完成数从原队列分母扣除时仍保留中断影响,不能用“后来成功”抹去延迟违约。

本地故障不把图纸改发云,边缘故障不把安全分流改为远程广域网推理。备用位置只有在相同任务/数据/动作门提前通过时才可用;否则回退是队列、降为只读、人工或故障安全关闭。演练成功指标包括关键错误0、资料越界0、重复动作0、所有对象单一终态和人工队列未超容量,不是“系统返回200”。

本地部署扩大了企业自己的安全责任

在线把部分平台运营交给供应商但仍有第三方风险;本地把更多攻击面与证据义务拿回来。模型权重可能有许可/供应链问题,驱动/容器有漏洞,服务管理员可能导出输入,调试可复制图纸,备份/遥测可能离开边界,边缘设备可能被接触或遗失。

威胁/控制 托管 中心/边缘本地 通用证据
身份与管理员 企业租户加供应商管理员复核 独立临时授权管理员;无共享最高权限账户 访问、撤销与管理事件
软件供应链 模型与服务变更、合同 权重、镜像、软件物料清单、签名与补丁 版本、哈希与变更记录
运行时数据 供应商处理、缓存与日志设置 内存、缓存、交换、调试与备份 用途、访问、保留与删除
网络与出站 批准端点、区域与域名解析 白名单、更新与观测路径 流量、拒绝与异常日志
物理与设施 供应商保证证据 机架或边缘锁定、电源、冷却与备件 检查、事件与演练
租户与工作负载隔离 供应商租户控制 调度器、容器与设备分离 反向与跨任务测试

本地设备不能使用团队共享根或永久供应商远程账户;管理员与应用身份分开,高敏内容调试按案例授权且短期删除。补丁不能因“怕影响模型”无限推迟:先克隆/金丝雀/回归再滚动,无法修复的漏洞有隔离、停用或正式例外与过期。

混合链路尤其要防“本地先查到就可以外发”。出站策略基于任务/数据/源/字段,不以请求来自内网为允许;追踪上下文不携带原文/客户ID到托管供应商;在线响应也不携带工具权限回本地。安全验证覆盖越权来源、注入要求上传附件、模型伪造工具调用和跨案例缓存。

运维能力本身也是放置门

中央平台需要7×24还是工作时段值班人员取决于任务截止日期;厂站需要当地断网/硬件处理;业务团队维护手动容量。职责表写明检测、第一响应、升级、恢复、业务通知和事件后,不把所有问题交给一个“AI团队”。

角色 托管责任 本地/边缘责任 共享/混合
业务负责人 发布、人工路径与截止日期 相同 决定降级或停止
AI平台 网关、评估与供应商事件 服务、调度器与模型发布 追踪、状态与回退
基础设施与设施 网络与身份依赖 硬件、驱动程序、电源、冷却与备件 端到端容量
数据与安全 供应商条款与出站 主机、管理员、缓存与备份 跨边界策略
供应商与采购 额度、服务目标、变更与退出 硬件返修、许可与支持 续订与可移植性
站点与工程 用户支持 边缘检查与人工流程 演练与结果反馈

团队做从镜像构建演练:中央一台储备设备从空盘、签名镜像、驱动与运行时、权重与配置、密钥到通过关键冒烟测试需要74分钟,超过30分钟恢复目标,因此保留热预留,并把冷重建目标设为120分钟;边缘备件从封存到接管需要26分钟,现场人工检查可承接45分钟。恢复时间与数据恢复点目标必须与业务连续性匹配,不能只写“有备份”。

技能与值班成本进入放置记录。若只有一名能修运行时的人,总线系数本身是硬风险;培训第二人、供应商支持、运行手册和简化栈可能比再买卡重要。外包运维仍需企业负责人、访问边界和验收,责任不会因合同消失。

90天按低后果在线、中央批量、单厂边缘和一条混合链逐批验证

阶段 范围 入口证据 出口证据
第1—15天:契约 4个任务的数据、负载与失败契约 已批准负责人和基线 候选拓扑与硬门记录
第16—30天:离线与负载 冻结配置、回放与合成峰值 任务评估与数据权限 95与99分位、吞吐和成本包络
第31—45天:在线托管 投标草稿从5%增至25% 额度、发布与队列 峰值演练、质量、编辑与成本
第46—60天:中央本地 图纸影子运行到一条批处理通道 产品生命周期管理权限、双节点冗余与人工路径 截止日期、节点丢失与重建
第61—75天:边缘 一条非关键产线 站点安全、缓冲与回滚 散热、电源、广域网与待机演练
第76—90天:混合 2个服务区域、8名技师 现场契约、出站与工具隔离 访问控制、关键失败、95分位、中断与人工路径

每批只扩大已测试的任务、数据、站点、模型/配置和操作。在线先选可人工发布的公开草稿;中央先影子差异,不写物料清单;边缘先一条非关键线,只路由复检;混合只读库存,不更新工单。上一批未关闭严重、容量或负责人问题不进入下一批。

90天验收同时看质量、边界、95与99分位、截止日期、尝试、人工时间、单位成本、支持和恢复。业务价值不足时即使技术成功也可以停止;本地利用率不足可以合并或改租;在线峰值额度不可靠可以保留人工或重新谈容量;混合问题若多发生在接口,就简化阶段,而不是换更大模型。

资产退场从一开始写:托管撤凭证/租户数据,中心撤权重/运行时/缓存/密钥/主机分配,边缘擦除缓冲/凭证并更新资产账本,混合撤跨界策略/分词映射和工具身份。试点停止不是把设备留在角落继续带权限。

运行中按变化触发重新放置:数据、负载、模型、网络、价格和人员都会移动门槛

触发 调查 可能放置动作
数据类/区域变更 源/合同/出站/备份 托管→本地或更窄混合
量/峰值/利用率变更 小时曲线/队列/预留 托管突发/本地基础拆分
本地模型通过新的放行门 完整任务与配置评估 小流量通过后减少托管阶段
托管模型/条款变更 旧/新质量/数据/成本 固定/备选/本地/手动
广域网/站点可靠性变更 中断持续时间/手动加载 边缘缓存/本地回退/投资链路
硬件或支持生命周期结束 容量、补丁、返修与部件 更新、转托管服务或退役
待命容量下降 事件、恢复目标与关键人员依赖 简化架构、增加主机或停止高服务目标通道

月度查看小时需求、有效吞吐、储备、队列、任务成功、严重失败、人工编辑、数据拒绝、95与99分位、中断,以及每个合格结果的成本;季度重算情境,但任何关键、合同或模型变更都会立即触发。不要因为设备折旧未完就把新资料塞进本地,也不要因为已有云采购承诺就扩大未授权使用。

迁移先做桥接集与双状态,不一定双发真实敏感内容。托管→本地可用固定评估+分配群组;本地→托管先过数据网关;边缘版本更新用站点金丝雀;混合阶段重构保留旧/新追踪。切换后对账业务对象、质量、成本和人工,不把两套结果都执行。

交付推理放置包:让每个位置的边界、容量、费用和坏法都能被复算

产物/模板 最低内容
工作负载与放置契约 任务、输入、输出、动作、人工、服务目标、手动路径与负责人
数据流与失败图 阶段、字段、类别、身份、目的地、状态与依赖
硬门记录 数据、动作、质量、网络、设施与运营证据
配置清单 模型、哈希、运行时、量化、提示词、适配器与站点
需求概况 小时到达、长度、并发、批处理、截止日期与季节
性能包络 负载、配置、中位数、95与99分位、吞吐、质量与错误
容量账本 有效工时、峰值、预留、维护与故障容量
单位成本情境 固定、可变、利用率、合格单位与敏感度
备用矩阵 失败、合格路由、队列、降级、人工、停止与恢复
运营责任矩阵 检测、响应、补丁、重建、站点、支持与业务发布
发布与退役 批次、放行门、回滚、凭证、数据、资产与许可凭证
放置决策记录 已准入范围、假设、证据日期、到期与触发器

NIST云计算定义SP 800-145把云计算描述为按需访问共享且可配置的资源,并包含资源池化、快速弹性和计量服务等特征;本文据此使用“弹性”和“计量”,但不宣称所有在线模型都能无限伸缩。NIST零信任架构SP 800-207说明,不能因网络位置或资产所有权而隐含信任,支持“本地不自动更安全”。MLCommons推理文档区分离线、服务器与交互式场景,并按各自负载和延迟规则测试,支持按工作负载测性能。FinOps单位经济方法把技术成本联系到业务单位,可用于工作负载放置取舍;本文因此比较每个合格业务结果的成本,而不是词元单价。所有来源核验于2026-07-21。

本周不要先问“买几张卡”或“用哪家云”。选一个已定义任务,画出从资料来源、转换、推断、验证器到工具与人工的字段级数据流,写明资料、动作、质量、网络、环境和运营六道硬门;用真实长度与小时峰谷分别测试托管和可交付本地配置,再演练广域网、本地节点与站点故障。只有当位置能够守住边界、满足整链任务、由明确团队持续运行,并在故障时保持单一业务状态,才签发带范围和有效期的放置记录。