“全部用最强模型”仍然让她返工两个半小时
程砚是一名独立订阅业务运营顾问。她每月处理客户反馈分类、周报、续费分析、方案比较,也会接触包含客户联系方式的原始导出。起初,她把所有任务都交给同一个高能力在线模型,理由很简单:既然最强,就不用每次选择。
一个月后,这个选择同时暴露了三个问题。简单分类经常要等十几秒;带个人信息的原始文件不应进入当前在线账户;一份重要方案虽然文字完整,却遗漏合同限制,返工耗费 2.5 小时。模型“总体能力强”没有回答三件更具体的事:这份数据能不能进入当前环境,错误会造成什么后果,等待与复核是否值得。
程砚先记录 30 天真实工作,再从中抽取 36 个代表样本,比较三种能力角色,而不是三个永久品牌。最终 286 项任务中,178 项由快速在线路线处理,64 项进入深度推理路线,44 项在本地运行。模型等待总时长从约 51 分钟降到 24 分钟;76 项高失败成本任务中的关键返工从 5 次降到 1 次,但人工复核没有取消。
这是教学案例,不对应真实客户,任务量、质量、成本和等待也不是产品基准。51 分钟与 24 分钟来自程砚自己的任务组合、候选配置和设备。可迁移的不是分流比例,而是选择顺序:数据边界先于模型质量,错误后果决定人的责任,再用自己的样本比较等待、复核和完整成本。
先把聊天记录还原成 286 项业务任务
程砚没有把聊天窗口数当成任务数。她只记录有明确输入和可验收产出的工作:同一份方案连续追问 4 次,仍是一项业务任务,但保留 4 次底层调用和总复核时间;夜间一次处理 80 条反馈,业务任务记 1 项,样本行仍保留 80 条;同一输入分别在三条路线测试,记作一项对照任务,不把业务量算三次。
30 天最终得到 286 项业务任务、417 次底层调用。纯闲聊和产品试用被排除,文件缺失而取消的任务则保留,因为它能暴露失败路线。每项记录任务编号、触发、输入数据级别、可观察产出、错误后果、截止时间、实际路线、人工分钟和最终状态。
她先按错误后果回看任务:137 项错误可以立即重做,73 项会带来 15—60 分钟返工,61 项会影响客户判断或造成数小时返工,15 项涉及合同、价格、付款、权益或安全结果。后两类共 76 项,正是“关键返工从 5 次降到 1 次”的分母,不能拿全部 286 项稀释。
三条路线也只描述当前角色。快速在线路线用于结构清楚、互动频繁的提取和格式化;深度推理路线用于多约束比较、反例与异常解释;本地路线让获准保存在设备上的原始内容先在本机处理。配置卡另行保存版本、运行位置、允许数据、目标 P95、硬件和复测日期。模型、量化、价格或运行时变化后,这些角色都要重新验证。
程砚给当前快速路线设定 P95 不高于 6 秒,深度推理不高于 45 秒,本地不高于 20 秒。快速和推理路线只能接收公开、内部非敏感或已批准去标识的数据;本地路线只能处理已经确认可以保存在该设备上的资料。能力卡还要写清禁止假设:快速不因响应快而降低事实门槛,推理不因“会分析”而跳过来源,本地不因数据留在设备就自动获得正确性或安全性。
这张卡不是模型介绍页。它记录的是“当前配置在当前任务中的获准角色”,包括模型和运行时版本、输出上限、设备、账号设置、目标延迟、允许数据与最近复测结果。同一模型升级后,旧卡不自动沿用;另一台设备运行相同本地模型,也要视为新的候选配置。
第一项选择不是模型,而是数据能去哪里
一份公开网页和一份包含客户联系方式的导出,即使任务动作相同,也不能直接进入同一候选环境。程砚把数据分为四级:
| 数据级别 | 例子 | 当前允许路线 | 先做什么 |
|---|---|---|---|
| D0 公开 | 官网、公开报告、公开价格 | 快速、推理、本地 | 保存来源和日期 |
| D1 内部一般 | 自己的内容计划、无客户身份模板 | 经批准的三条路线 | 不与公开分享功能混用 |
| D2 客户敏感 | 联系方式、未公开经营数据、合同摘要 | 默认本地;去标识后再评估在线 | 确认授权、保存位置和必要字段 |
| D3 高敏或受限 | 密钥、完整支付信息、禁止外传资料 | 不进入当前通用模型流程 | 使用专门系统或完全人工处理 |
数据门不能被其他优点抵消。在线推理质量更高,不代表当前账户、条款和设置就允许处理 D2;任务价值很高,也不能把 D3 变成可上传。路线是否合规要在当时使用的产品、账号与配置里核对,不能根据“某类模型通常怎样”推断。
本地运行也只说明推理位置。桌面工具可能启用云模型、联网搜索、远程工具、遥测或共享目录,本地服务还可能监听整个局域网。程砚记录模型、应用和依赖来源;断网完成目标任务;确认没有启用云端能力;检查服务只监听本机地址;查清对话、缓存、日志和临时文件的位置;验证磁盘加密、账号锁定、备份与删除。任何新插件或远程能力启用后,重新检查数据流。
D2 资料先在本地缩小,再决定是否在线分析
删除姓名和邮箱不等于完成去标识。小众职位、城市、精确日期和罕见金额组合起来,仍可能指向一个客户。程砚把 D2 任务拆成四段:
| 阶段 | 使用的内容 | 产出 | 人工门 |
|---|---|---|---|
| 本地提取 | 原始反馈和客户主表 | 随机案例编号、主题、去标识文本 | 检查姓名、邮箱、电话和原客户编号 |
| 组合标识检查 | 去标识草稿 | 重新识别风险 | 中高风险必须重写或停止 |
| 在线分析 | 获准的案例编号和文本 | 分类、理由和待确认项 | 只进入批准账户 |
| 本地回填 | 在线结果与本地映射 | 内部客户表草稿 | 逐行核对后保存 |
原客户编号、映射表、原附件和隐藏列不进入在线阶段。她用 12 条反例检查姓名变体、邮箱域名、订单号、精确会议日期、唯一职位,以及“城市 + 小团队规模 + 罕见产品”等组合。四个正式去标识样本里,只要一个直接标识残留,整项就不能进入在线路线。后文的 98% 是检查点通过率,不表示 98% 的客户已经匿名。
这个分段还给出了一条回退路:本地候选若无法可靠去标识,任务停在设备上转人工,不为了使用在线模型而继续删减到失去业务意义。在线分析即使完成,也只能返回案例编号,最终映射和保存仍在本地进行。
程砚对本地路线做了两种验证。第一次在断网状态完成四个正式样本,确认任务没有悄悄调用云端模型;第二次检查服务监听地址、日志、缓存和临时导出,确认其他局域网设备无法直接访问。删除测试不仅移除原文件,还要确认应用历史、缓存、日志与导出副本是否仍在。若工具做不到完整删除,她就在资料规则中明确保留周期和人工清理位置,而不是把“点过删除”写成已经清除。
本地路线的输出继续使用与在线路线相同的事实和结构门槛。更私密的运行位置不能补偿错行、漏字段或不可靠去标识。反过来,若本地质量不足,合理结论可能是保持人工,而不是把敏感原文送到质量更高但未获准的在线环境。
错误后果决定模型投入,责任边界另算
数据门通过后,程砚才判断一次未发现的错误会造成什么:
| 级别 | 错误后果 | 默认处理 |
|---|---|---|
| C1 | 内部草稿可立即重做,不影响别人 | 快速或本地,抽样检查 |
| C2 | 浪费 15—60 分钟,但外发前能发现 | 快速首跑,规则失败时升级一次 |
| C3 | 影响客户判断、公开内容或数小时返工 | 推理路线准备,人工逐项复核 |
| C4 | 改变合同、价格、付款、权益或安全结果 | 模型只整理材料,人作最终决定 |
深度推理路线参与 C4,不代表它拥有最终决定权。它可以整理三套报价的成本、合同条款和反例,程砚仍要决定价格、批准版本并亲自发送。失败成本提高的是模型准备和人工核验的投入,不是自治等级。
等待要求随后才进入选择。即时分类的 P95 目标是 6 秒,短时方案分析可以接受 45 秒,夜间批处理只要在 30 分钟内完成即可;客户会议前的硬截止还必须为人工复核留时间。若推理路线在截止前超时,系统使用已经验证的模板和已确认事实,由人完成,不临时更换未经测试的模型。
三十六个历史样本先写答案,再比较路线
程砚从 286 项里分层抽取 36 项,不让候选模型挑选容易的样本:
| 任务族 | 数量 | 关键检查 |
|---|---|---|
| 反馈分类与字段提取 | 10 | 标签、原文证据、不得丢行 |
| 固定格式周报草稿 | 8 | 数字一致,不新增承诺 |
| 多方案比较 | 8 | 约束完整、反例和敏感性 |
| 异常原因分析 | 6 | 区分事实、假设与待查项 |
| 敏感资料去标识 | 4 | 直接标识与组合标识都被处理 |
先写答案表,再运行候选。结构化任务记录正确字段、允许变体和禁止错误;开放式方案比较没有唯一文案,但合同约束、数字和必须讨论的反例都有答案。去标识原文只在本地候选上运行,在线候选接收人工确认后的版本,不能为了所谓公平比较先破坏数据边界。
每个适用候选对同一样本运行三次,结果顺序打乱后由程砚核对。她分别记录检查点通过率、整项硬门、关键错误、人工修改分钟、端到端延迟、成本和失败是否能在外部影响前发现。C1—C2 的整项硬门至少 90%,C3 样本要在影子运行前全部通过;一个错误数字、遗漏合同限制或越界动作就让整项失败,不能被其他格式项平均掉。
人工修改从打开原始输出开始,到保存可用草稿为止;等待模型和文件下载另记。延迟同时保存 P50、P95 和超时率,不让几次极快结果掩盖最慢一段。候选运行采用轮换顺序,标记缓存是否命中和本地设备是否高负载。评审时隐藏路线名称,避免“深度推理应该更好”提前影响判断。
答案表也要区分“内容没有唯一写法”和“事实没有答案”。一份方案建议可以有不同结构,但合同最低服务期、预算上限和退出条款必须出现;异常原因可以列多项假设,但每项都要标明现有证据和下一步验证。程砚可以让 AI 帮助对齐字段,却不让另一个生成模型代替她判定客户约束是否被遗漏。
36 项足以形成第一版个人路由,不足以宣称某类模型普遍更好。没有覆盖的新任务应进入人工选择,同时加入待评估样本,而不是根据名称相似度自动猜一条路线。
结果没有产生一条“全面胜出”的路线
三次运行合并后的结果如下,修改时间为单样本中位数:
| 任务族 | 快速路线:通过率 / 修改 | 推理路线:通过率 / 修改 | 本地路线:通过率 / 修改 | 默认 |
|---|---|---|---|---|
| 分类提取 | 96% / 0.6 分钟 | 98% / 0.8 分钟 | 94% / 0.9 分钟 | 快速;D2 用本地 |
| 周报草稿 | 92% / 2.1 分钟 | 96% / 2.0 分钟 | 86% / 3.4 分钟 | 快速,关键失败升级 |
| 方案比较 | 71% / 8.3 分钟 | 93% / 3.6 分钟 | 63% / 9.1 分钟 | 推理 |
| 异常分析 | 75% / 7.4 分钟 | 92% / 3.9 分钟 | 67% / 8.0 分钟 | 推理 |
| 本地去标识 | 不测试原文 | 不测试原文 | 98% / 1.2 分钟 | 本地加人工复核 |
快速路线适合结构化高频任务,但分类组有一项漏掉第 80 行,输入输出行数检查让整批停止;这类结构失败先修重试,不需要更强推理。它在一份周报里新增“下周交付”承诺,来源检查没有找到日期,草稿被删除并转人工。
推理路线在方案比较和异常分析上明显减少人工修改,却也漏过一次合同地域限制。快速路线遗漏最低服务期后升级到推理是合理的;推理仍漏硬约束时,继续换模型没有根据,应该补齐资料并由人决定。这个失败被加入回归集,C3 继续逐项复核。
本地路线通过去标识的大部分检查,但一份文本保留了唯一职位。组合标识反例命中后,该样本没有进入在线阶段,由程砚泛化职位再重新检查。98% 的检查点成绩不能抵消这一次直接阻断。
四类任务把路由规则写了出来
程砚没有直接训练自动路由器,而是用四项边界不同的任务走完输入、路线、产出和验收:
| 任务 | 输入与后果 | 默认路线 | 人工责任与回退 |
|---|---|---|---|
| 公开评论分类 | D0、C1、互动 | 快速 | 抽查 10%;丢行停止整批 |
| 客户原始反馈汇总 | D2、C3、异步 | 本地去标识,批准后快速分类 | 查标识残留,再回填本地映射 |
| 三套续费方案比较 | D1、C3、短时 | 推理 | 核对合同;超时用人工模板 |
| 含客户名称的最终报价 | D2、C4 | 本地整理加人决定 | 本人定价、批准并手动发送 |
续费方案比较说明“复杂”不是充分条件。输入必须包含签署合同、预算上限、服务能力与退出条款;输出把硬约束和偏好分开,至少展示一个反例,未知实施周期写成待确认。合同附件缺失时,正确动作不是升级模型,而是停止并补资料。
四项演练形成了有优先级的规则:D3 直接阻断;D2 默认留在已验证本地路线,需要在线能力时先人工批准去标识结果;C3—C4 由推理路线准备并逐项复核,C4 始终由人决定;已通过测试的 C1—C2 分类、提取和固定草稿走快速路线;快速路线只有结构失败、证据缺失或规则冲突时才升级一次;未覆盖任务停在人手。
静态表的价值是能解释“为什么这次去了推理路线”。任务量和失败样本足够后,可以尝试自动路由,但实际选择、触发理由、质量、成本和人工批准仍要保存。
调用单价最低,可能仍是最贵路线
程砚把模型调用、本地设备摊销、人工等待影响、人工复核和失败返工放进同一成本口径。具体货币留在内部表,教学案例使用归一化单位:
| 方案 | 运行与设备 | 人工复核 | 失败返工 | 月总成本 |
|---|---|---|---|---|
| 全部使用推理路线 | 100 | 74 | 18 | 192 |
| 全部使用快速路线 | 24 | 118 | 83 | 225 |
| 三路分工 | 37 | 68 | 12 | 117 |
三路分工的 37 个运行单位由在线调用 24、本地设备与电力摊销 6、评估和路由维护 7 构成;68 个人工单位包括常规抽查 23、C3—C4 逐项复核 34、去标识复核 11;12 个失败单位来自 1 次关键返工和 4 次低风险重做。设备购买价按预计使用月数摊销,没有在首月一次扣完。
她的内部公式是:任务总成本等于模型调用、本地设备摊销和等待影响,再加上人工复核分钟乘以个人分钟成本,以及失败发生率乘以平均返工成本。首次搭建评估集和路由表另作启动成本,月度复测、页面或模型变化后的维护进入经常成本。若把“自己顺手检查”和“本地设备已经买了”都按零计算,任何自动路线都会显得便宜。
敏感性分析防止结论只在一套假设下成立。个人复核分钟单价下降 40% 时,三路分工为 37 + 68×0.6 + 12 = 89.8,全部推理为 100 + 74×0.6 + 18 = 162.4,差额仍有 72.6。若推理路线运行价格减半,全部推理仍达到 50 + 74 + 18 = 142。反过来,本地维护从 7 升到 35 时,三路分工变成 145;此时要重新评估 D2 的替代方案,不能因为已经买了设备继续投入。
五十一分钟降到二十四分钟,只代表模型等待
原方案的 286 项都走推理路线,平均完整响应 10.7 秒,月等待约 286×10.7÷60 = 51.0 分钟。分流后,快速路线 178 项、平均 2.5 秒;推理路线 64 项、平均 10 秒;本地路线 44 项、平均 8 秒。总等待为:
(178×2.5 + 64×10 + 44×8)÷60 = 24.0 分钟。
| 路线 | 月任务 | 平均完整响应 | P95 | 超时动作 |
|---|---|---|---|---|
| 原全部推理 | 286 | 10.7 秒 | 39 秒 | 关键任务继续等待,可能挤压复核 |
| 分流后快速 | 178 | 2.5 秒 | 5.8 秒 | 超过 6 秒或结构失败记异常 |
| 分流后推理 | 64 | 10.0 秒 | 42 秒 | 45 秒后使用人工模板 |
| 分流后本地 | 44 | 8.0 秒 | 18 秒 | 20 秒后停止批次并查设备 |
平均值用于复算总量,P95 用来判断较慢体验是否会破坏互动或截止。27 分钟差值没有包含人工复核,不能改写成“总工时节省”。候选按轮换顺序运行,并记录缓存与设备负载,避免一条路线总在空闲状态、另一条总在高负载状态下被比较。
路由先影子运行,失败只升级一次
首月规则只给建议,不自动发送请求。程砚先人工确认数据级别和失败成本,再比较规则建议与实际选择。前两周 74 项任务里有 9 项分歧,主要来自“周报草稿”中包含客户原话:旧规则根据产出名称把它认成 D1,忽略了输入附件已经是 D2。
她把识别顺序改为先看输入字段和附件,再看任务动作。第 4 周 69 项任务只剩 2 项分歧,都是尚未覆盖的新标签,正确进入人工选择。30 天监控使用以下门槛:
| 信号 | 门槛 | 触发动作 |
|---|---|---|
| D2 / D3 错路由 | 0 | 立即暂停相关规则,复查数据识别 |
| C3 / C4 未经复核放行 | 0 | 暂停整条路线并保存事件 |
| 路由建议与人工分歧 | 第 4 周低于 5% | 按原因补字段,不让模型猜 |
| 关键返工 | 不高于 1 次且外发前可发现 | 加入评估集并重跑适用候选 |
| 三路超时率 | 各低于 5% | 使用已验证降级方案 |
| 维护时间 | 不高于节省时间的 25% | 简化规则或退回人工选择 |
失败触发必须可观察。快速路线缺字段时,同输入最多重试一次;事实检查失败可以升级推理一次;推理仍然证据不足就转人工,不继续更换模型。本地路线无法完成时先判断能否去标识,不直接把原文送在线。C4 输出始终停在人工决定。
成功也可能触发降级。同一任务族连续 30 次在快速和推理路线都通过,快速路线的人工修改没有增加,才允许把默认从推理降到快速。否则路由只会上升不会下降,最后仍会回到“所有任务都用最贵路线”。
影子期结束也不是一次性开放全部任务。只有 D0—D1、C1—C2 且已经被 36 个样本覆盖的任务,才获得自动默认路线;D2、D3 与 C4 继续要求显式确认。规则建议与人工选择不一致时,程砚记录原因,不要求人工为了让分歧率变好而接受规则。指标用来暴露规则缺字段,不是考核人的服从程度。
版本变化后,旧路由必须可以撤回
模型版本、量化、提示模板、本地运行时、硬件、账户条款、价格或任务分布变化,都会使原结论失效。程砚为每个配置保存版本编号,并用原 36 个样本和新增失败样本回归。快速或推理模型更新时,适用样本各运行三次;任一 C3 关键错误或 P95 越界就回退。本地配置变化后重跑 4 个正式去标识样本与 12 个反例;出现直接标识、离线失败或速度越界即撤回。
在线条款或账户设置变化时重新检查数据流与保存方式;任务分布变化超过 20% 时重新分层抽样;价格变化则重算包含人工和失败的总成本。上一个已验证配置不可用时,回退到人工选择,不把任务送给尚未测试的候选。
路由日志至少保存任务编号、配置版本、规则版本、实际路线、触发原因、延迟、成本、验收结果、升级和最终批准人。这样季度复盘才能区分模型退化、输入漂移与路由规则错误。
开始时不需要建立完整平台。选 20—40 个自己的历史任务,先填写下面这张路由卡。配置名称可以写当前实际模型或本地环境,但判断字段不要跟产品品牌绑定:
任务动作:
触发与可观察产出:
输入数据:D0 / D1 / D2 / D3
判断依据、允许环境与禁止外传字段:
错误后果:C1 / C2 / C3 / C4
最坏错误、能否在外部影响前发现、最终责任人:
等待类型:即时互动 / 短时分析 / 异步批处理 / 硬截止
平均目标、P95 目标与无模型回退:
历史样本:常见样本、边界样本、正确事实与禁止错误
快速路线:整项通过、人工分钟、P95、运行成本
推理路线:整项通过、人工分钟、P95、运行成本
本地路线:版本、设备、离线验证、整项通过、人工分钟、P95
默认路线与理由:
没有选择另外两条路线的原因:
只允许哪一种失败触发升级,最多几次:
连续多少次通过才允许降级:
当前人工复核点与外部动作:
下次复测日期和回退配置:
填卡后先排除没有通过数据门的路线,再让适用候选使用同一材料和答案表运行。运行表至少留下配置版本、原始输出、关键错误、人工修改、延迟、成本和最终决定。只有在真实任务上通过硬门的任务族才获得默认路线;未覆盖内容继续停在人手。
这张卡完成后,读者得到的不是一个笼统的“复杂任务用强模型”,而是一项可以复测的决定。例如,D1、C3 的续费方案比较选择推理路线,是因为 8 个历史样本显示约束覆盖和人工修改更好;仍保留逐项合同核对,是因为推理候选也曾漏掉地域限制。理由与保留的人工作业同时写入,下一次版本变化才知道重测什么。
个人模型路由没有永久答案。它的价值不是始终找到“最强模型”,而是让每一次选择都能说明根据什么、由谁复核、失败后走到哪里,也能在价格、版本和任务变化后重新计算。任务边界也要随决定一起保存,不能把一类样本的通过扩大到相邻工作。
来源与进一步阅读
以下资料核验于 2026-07-21;本文没有采用具体价格或模型榜单,只使用可迁移的路由、评估和数据边界原则:
- Microsoft Learn:How to use model router:当前官方路由说明同时考虑质量、成本和延迟,并要求监控实际分布和表现。
- NIST:AI Risk Management Framework:强调在设计、使用和评估阶段按实际风险管理 AI,而不是只比较能力。
- NIST:Generative AI Profile:建议建立风险分级、评估门槛和持续测试。
- Ollama 隐私政策:区分本地运行与云端模型的数据处理;本文据此特别要求核对实际运行路线。
- LM Studio:Offline operation:说明下载后的本地模型、文档处理和本地服务可以离线运行,同时本地网络暴露仍需另行控制。