模型费少 334 元,完整成本反而多 10,978 元
独立研究顾问林澄每月为客户制作研究摘录、竞品比较、数据核算和决策简报。她曾把所有任务都切到标价最低的模型:仪表盘显示模型费很省,但她每天都在补上下文、重跑、逐句核对和重写。为了判断钱究竟花在哪里,她从过去工作中抽取 120 个有标准答案或明确验收门的任务,对便宜模型 C、强模型 S 和分级路由 R 做同条件重放。
| 方案 | 模型调用费 | 人工时间 | 完整成本 | 合格交付 | 每个合格交付 |
|---|---|---|---|---|---|
| C:全部便宜模型 | ¥286 | 81.5小时 | ¥21,470 | 120 | ¥178.92 |
| S:全部强模型 | ¥1,036 | 51.0小时 | ¥13,954 | 120 | ¥116.28 |
| R:按风险/难度路由 | ¥620 | 39.7小时 | ¥10,492 | 120 | ¥87.43 |
R的模型费比C高334元,但完整成本低10,978元,下降51.1%;相对全用S也低3,462元,下降24.8%。原因不是强模型永远更好,而是本案例里C首次通过只有72/120,引发62次额外调用、更多审校和4次手工重建。R把66个低难任务交给C、54个复杂或高后果任务交给S,并在失败后按原因升级。
全部价格、人工费率、任务和结果都是虚构教学案例数据,不代表任何厂商当前价格或性能。真实决策必须用自己的账单、合同、任务、质量门和时间记录;本文不是会计、税务或投资建议。
成本分母应当是合格交付,而不是调用次数
如果分母是接口调用,失败后的重试会制造更多“便宜单位”;如果分母是生成文档数,无法交付的草稿也会被算成产出。林澄把单位固定为“合格交付”:满足任务合同、证据、格式、关键数字和客户边界,并通过独立人工放行门槛的一项结果。
| 单元 | 能回答 | 不能回答 |
|---|---|---|
| 每百万令牌成本 | 模型资源价格与用量 | 令牌是否产生价值 |
| 每次调用代价 | 一次请求平均直接费 | 重试与质量差异 |
| 每项已完成任务的代价 | 流程是否结束 | 完成是否合格 |
| 每项已交付成果的代价 | 得到一个合格交付花多少 | 收入与客户价值仍需另算 |
| 每项交付成果的贡献 | 收入减可归属成本 | 长期品牌/风险价值 |
一个任务可能有多次尝试,但只产生一个已接受单元。120个任务最终都有交付,因此三个方案分母同为120;手工重建也算合格交付,但其人工成本必须进入分子。若有任务放弃,分母不能仍写120。
FinOps 基金会的单元经济学说明区分资源效率指标与业务单元指标,并特别举例生成式 AI可从每令牌代价扩展到每项协助代价、操作或案例。本文把该原则缩小到一人业务:技术用量用于诊断,合格交付用于决策。
先冻结质量门,再比较三个方案的成本
林澄为五类任务分别写验收表。结构化摘录要求字段齐全、原文定位可回查、不得补猜;多来源比较要求每个结论对应来源并明确冲突;数字核算要求单位、口径、公式和独立复算;客户稿还要求敏感信息、承诺和行动责任由人确认。模型流畅度和篇幅不单独决定通过。
| 放行门槛 | 自动检查 | 人工检查 | 失败状态 |
|---|---|---|---|
| 完整性 | 必需字段/架构 | 是否回答真实问题 | 不完整 |
| 证据 | 定位符/链接存在 | 来源是否支持主张 | 不受支持 |
| 数字 | 公式、单位、加总 | 口径与业务含义 | 计算错误 |
| 边界 | 禁止字段与外部动作 | 保密、承诺、责任 | 边界失败 |
| 可用性 | 格式、长度、可打开 | 客户是否能采取行动 | 不可用 |
所有方案使用同一版本放行门槛,复核人先看任务、来源和输出,不看模型品牌与账单。若发现放行门槛本身过严或漏项,只能升级版本后让三个方案重跑受影响样本,不能只给某个昂贵模型放宽。已接受不是“林澄最后修好了”,而是修复时间已入账且最终产物确实通过。
她还记录严重程度:小标题格式错属于低严重度,可局部修;引用不支持核心结论属于高严重度,必须回到证据;客户数据越界为停止事件,不能靠重写输出变成通过。这样成本优化不会用十个轻微格式通过抵消一次高后果错误。
120 个任务必须覆盖真实难度与失败后果
| 任务族 | 总数 | 低难/低风险 | 复杂/高后果 |
|---|---|---|---|
| 结构化摘录 | 36 | 30 | 6 |
| 多来源比较 | 30 | 18 | 12 |
| 综合与写作 | 24 | 10 | 14 |
| 数字/公式核算 | 18 | 6 | 12 |
| 客户可见决策稿 | 12 | 2 | 10 |
| 合计 | 120 | 66 | 54 |
每项保存输入快照、任务合同、预期字段、事实/数字检查、禁止事项和验收关口。三个方案使用同一快照与工具权限;温度、输出预算、最大尝试和人工放行门槛固定。顺序随机化,避免林澄先审一个方案后记住答案,降低后续复核时间。
120 项来自真实任务结构,但客户内容已替换为教学测试用例。它覆盖常见工作量,不代表所有未来任务;若下月大量转为长文档或实时搜索,路由结果必须重测。
样本比例按过去三个月实际任务量分层抽取,而不是刻意凑成对某个模型有利的分布。每个系列同时包含典型、边界和曾经失败的案例;12个客户可见稿虽然数量少,却因返工和责任高而不能被总体平均淹没。报告同时给宏结果和每族结果,防止36个容易摘录掩盖关键数字任务的退化。
同一任务的不同方案输出不会互相作为输入,也不允许林澄把前一个方案发现的缺失来源只补给后一个方案。外部搜索有时效时,先固定来源快照;否则模型比较混入新闻变化和网络波动。无法固定的实时任务另作观测队列,不和离线120项强行合并。
用尝试账本把发票、工时和最终成果连起来
任务编号,任务族,风险,路径,尝试编号,模型,输入令牌,
输出令牌,缓存令牌,工具成本,开始时间,总历时秒数,
复核分钟,修复分钟,结果,失败代码,已接受成果
| 账簿层级 | 关键字段 | 用途 |
|---|---|---|
| 任务 | 系列、风险、客户、截止日期 | 业务分组 |
| 尝试 | 模型、提示词/版本、令牌、缓存 | 资源成本 |
| 工具调用 | 搜索、文字识别、存储、出站流量和回执 | 非模型成本 |
| 复核 | 复核人、分钟、问题 | 人工成本 |
| 结果 | 通过/重试/升级/人工/放弃 | 分母与失败链 |
| 影响 | 延迟、信用、错过截止日期 | 失败影响 |
服务商账单通常知道账户和用量,却不知道哪个任务最后合格;工时表知道时间,却不知道由哪次尝试触发。林澄用任务编号把两者关联,并把无法分配的费用单列为“未分配”,不偷偷平均到看起来最好的方案。
账本不保存客户正文,只保存哈希值、数量、版本和成本元数据。没有准确计时的前两周允许人工按 15 分钟为一档记录,但同时标明估算;流程稳定后,再自动抓取令牌、工具用量和总历时。
每次尝试只能有一个终态:已接受、可重试失败、终止失败、转人工或取消。若超时后不知道服务商是否已经完成,先记为状态未知并查询回执,不能同时算失败、又把迟到结果算成功。尝试到任务是一对多,任务到已接受成果最多一对一;这个关系可以防止重试成功后把前面的失败成本丢掉。
月末做三方对账:服务商发票总额对使用凭证,使用凭证按任务编号对尝试账本,已接受产物按交付登记对任务。账单中有 37 元找不到任务编号,就留在未分配并追查实验或漏标;不能为了让 R 看起来便宜而把它塞进 C 或“其他”。对账差异、估算工时占比和缺失结果都是数据质量门槛。
直接技术成本不只有输入和输出令牌
| 直接成本 | 驱动因素 | 本案例记录方式 |
|---|---|---|
| 输入令牌 | 每次上下文与重试 | 供应商用量收据 |
| 输出令牌 | 草稿、JSON、解释 | 尝试用量 |
| 缓存写入/读取 | 前缀写入与命中 | 缓存明细项 |
| 嵌入/向量 | 文档块、重建频率 | 集合/任务分配 |
| 网络/搜索 | 查询/结果 | 工具收据 |
| 文字识别与解析器 | 页数与文件数 | 附件账本 |
| 存储/出站流量 | GB、天、下载 | 项目分配 |
| 订阅/平台 | 席位、基础费用 | 月度分配规则 |
C的¥286由输入 ¥154、输出 ¥109、缓存/嵌入 ¥23构成;S的¥1,036=¥480+¥520+¥36;R的¥620=¥240+¥350+¥30。这里使用重放账单,不从公开标价反推,避免折扣、批处理、地区、税费或计划差异造成偏差。
工具费用分别为C ¥244、S ¥198、R ¥172。C虽然单次模型便宜,但62个重试重复搜索或解析;R的首次通过率更高,工具重复更少。禁止把搜索算入“软件订阅已付过所以免费”,除非确实是无边际成本且固定费用在别处已分配。
费率表保存币种、含税/未税、区域、计划、批量或优先处理方式、生效日期和折扣;账单跨币种时用实际结算汇率并保存来源。公开价格只用于事前估算,复盘以发票为准。免费额度单列抵扣项,不把促销后的0元外推为长期边际成本;额度用完后的费率才用于规模预测。
第三方封装服务可能把模型、搜索和平台费合成一个价格。林澄无法拆分时,就把它记为打包直接成本,并明确不能与原生接口的令牌单价直接比较。目标是正确归属总支出,而不是伪造一份精确却错误的令牌明细。
上下文越长,不只会增加令牌费用
林澄把上下文拆为任务指令、必要来源、历史状态、输出结构和可选背景。每项记录原始字符、转换后的关键令牌、被引用来源数,以及最终输出是否实际使用。未引用不代表一定无用,但长期不影响结果的内容块可以成为删减候选。
| 上下文版本 | 中位输入令牌 | 首次通过 | 模型费/120 | 观察 |
|---|---|---|---|---|
| K0全量历史 | 148千 | 91/120 | ¥782 | 旧讨论冲突、慢 |
| K1任务相关检索 | 83千 | 108/120 | ¥641 | 来源更集中 |
| K2任务合同+证据包 | 76千 | 112/120 | ¥620 | 路由方案采用 |
| K3过度压缩 | 39千 | 94/120 | ¥431 | 关键边界/证据缺失 |
令牌最少的 K3 并非完整成本最低:18 个新增失败带来了复核和返工。K2 相对 K0 既减少令牌,又提高通过率,但这来自更好的上下文组织,不是简单截断。
缓存节省按实际命中记录。若每次把日期、随机标识或用户内容放在公共前缀前面,理论可缓存并不等于账单命中;为了提高命中而把跨客户资料放进同一缓存也不可接受。
上下文准备本身也花时间:找文件、去重、切片、修正文字识别、判断版本和授权。林澄把这 720 分钟任务准备计入三个方案,因为它们都需要;若某个模型要求专门改写输入结构或重复手工压缩,只记入对应方案。由自动检索节省的准备时间必须在实际工时里出现,不能同时再以“效率收益”减一次成本。
她用来源利用率检查删减:必要事实是否被引用、被引用的证据是否足够、未使用内容块是否在多个案例中长期没有贡献。删减上下文必须在质量集上验证,不能只凭令牌图表直接删除合同限制或失败历史。K2 的 7.6 万令牌是中位数,不是所有任务的硬上限;个别长文任务可以超出,但要说明其单位成本。
重试必须按失败原因计费和处理
| 失败代码 | C次数 | 正确下一步 |
|---|---|---|
| 缺失证据 | 16 | 补来源/检索,不盲重跑 |
| 结构/格式 | 13 | 验证器+局部修复 |
| 不支持的主张 | 11 | 强模型或人工核验 |
| 计算错误 | 9 | 确定性计算 |
| 指令冲突 | 7 | 修任务契约/上下文 |
| 超时/工具 | 6 | 幂等重试/退避 |
| 重试次数合计 | 62 | 分类处理 |
C先跑120次,48项首轮未通过;这48项各重试一次,仍有14项失败再重试一次,因此总调用120+48+14=182,额外尝试为62。最终116项由模型流程通过,4项手工重建。
重试策略最多两次,并要求改变失败原因对应的输入、工具或模型;纯随机重试只允许处理被证明为瞬时的服务错误。每次重试消耗令牌、工具、等待和新一轮复核,不能只把最后一次成功写进账簿。
重试预算在任务开始前固定:普通可逆草稿最多两次;临近截止日期或高后果任务首次核心失败就升级S/人工;结构或格式错误优先使用确定性验证器,不让整篇再生成;计算错误把公式移到可复算工具。若第二次失败原因与第一次相同,流程停止并记录根本原因,防止自动循环把一笔小任务烧成大账单。
林澄还区分重试与修复:重试创建新的模型尝试,修复是人或确定性程序修改已有产物。两者都花钱,但驱动因素不同。把人工改三小时写成“模型一次成功”会严重美化通过率;把程序补一个逗号算成完整模型失败又会夸大模型问题。
自己的时间也必须进入成本
林澄给自己的可替代交付时间设置了每小时 240 元的综合费率,来自过去三个月可计费工作与必要运营时间的保守内部值;它不是对外报价,也不是会计工资。等待模型时如果能做其他工作,就不计入人工;被迫盯屏、恢复上下文或处理延误时才计入。
| 人工活动 | C分钟 | S分钟 | R分钟 |
|---|---|---|---|
| 任务准备 | 720 | 720 | 720 |
| 复核/验收 | 2,640 | 1,680 | 1,260 |
| 修复/返工 | 1,080 | 330 | 140 |
| 手动重建 | 360 | 270 | 90 |
| 路由 | 0 | 0 | 120 |
| 账目/运营 | 90 | 60 | 50 |
| 合计 | 4,890=81.5小时 | 3,060=51.0小时 | 2,380≈39.7小时 |
人工成本因此为C ¥19,560、S ¥12,240、R ¥9,520。与C相比,R多花120分钟做路径,却少2,590分钟复核/修复/手动重建,账目/运营再少40分钟;总人工净省2,510分钟,也就是41小时50分钟,约41.8小时。
若把综合人工费率改为 0,结论就会被强行推向令牌最便宜的模型;若把同一小时既计入人工、又计入“放弃收入”,则会重复计算。林澄只在实际发生客户延迟、退款或加急时另记失败影响。
¥240/小时的计算说明保存在工作簿:过去三个月可归属的净交付收入除以可实际出售的交付小时,再扣除稳定的非计费运营比例,取较低的圆整数。她不用最高报价,也不把一天24小时都当可出售。若处于学习期或没有稳定收入,可同时展示仅限现金、¥80/小时与目标速率三个视图,避免用一个武断数字制造确定性。
计时规则先写后测:阅读输入和写任务合同属准备;检查事实、数字和边界属复核;修提示词并重跑属修复 + 尝试;模型运行时去做其他独立工作不计人工;频繁切换、等待阻塞和恢复上下文则计。每周抽查5项,将定时器、日历和产物时间戳对齐,防止只记录“积极工作”而漏掉恢复成本。
个人经营还要看容量:C多出的41.8小时即使不对应当期现金支出,也可能占掉销售、交付或休息。文章不把健康与生活全部货币化,但在路由卡中另列容量小时;若方案持续超过可用工时,它不是可扩展方案。
已发生的失败成本与未来风险不能混在一列
| 影响 | 回顾性 | 预测 |
|---|---|---|
| 返工时间 | 实际分钟×速率 | 故障概率×分钟×速率 |
| 截止日期延迟 | 实际加急/信用/机会损失 | 概率×场景影响 |
| 错误交付 | 已退款、补做、客户支持 | 分层严重程度的预期损失 |
| 安全/隐私事件 | 实际响应与通知成本 | 场景范围,不伪造精确概率 |
| 声誉/关系 | 只记录可证明事件 | 定性/区间并转人工决定 |
C有两次内部截止日期延迟,实际影响¥1,200;S一次轻微延迟 ¥300;R为0。没有把“可能失去客户”虚构成巨额精确数字。高后果但缺可信概率的风险作为硬性放行门槛:例如客户数据越界、关键财务数无复算,不能用低预期成本买通。
预算时林澄用最佳/基准/最差区间,并把概率来源写明。没有数据就先收集,不让模型凭感觉生成失败率。实际与预测分表,月末用实际更新下一期假设。
她把失败分成F0无影响内部修正、F1轻微返工、F2延误/客户可见错误、F3合同/财务/数据事件。F0/F1可以用频率×平均时间估算;F2使用实际信用、加急和支持记录;F3不因历史为0就估成0元,而以禁止路径、双重检查、保险或专业流程控制。成本表只记录已发生响应费用,风险注册另保留严重程度与控制证据。
| 级别 | 例子 | 成本处理 | 决策 |
|---|---|---|---|
| F0 | 标题格式不符 | 修复分钟数 | 局部修复 |
| F1 | 少一条非关键来源 | 重试 + 复核 | 补证据 |
| F2 | 错误数字进入客户草稿 | 返工、延误、支持 | 暂停该系列 |
| F3 | 敏感数据越界/错误外发 | 实际响应费用+风险记录 | 停止、专业升级 |
这个分层阻止两种误导:把所有失败都按一次重试平均,会低估高后果尾部;给每次小格式错套上巨额“声誉损失”,又会夸大成本。看不见的风险不能假装不存在,也不能随意货币化。
完整成本必须能从账本逐项复算
完整成本 = 模型费用 + 工具费用 + 分配的固定成本
+ 人工分钟 / 60 × 综合人工费率
+ 已发生的失败影响
每项合格交付成本 = 完整成本 / 已接受成果数
| 组件 | C | S | R |
|---|---|---|---|
| 模型 | ¥286 | ¥1,036 | ¥620 |
| 工具 | ¥244 | ¥198 | ¥172 |
| 分配固定 | ¥180 | ¥180 | ¥180 |
| 人工 | ¥19,560 | ¥12,240 | ¥9,520 |
| 实际延迟 | ¥1,200 | ¥300 | ¥0 |
| 总计 | ¥21,470 | ¥13,954 | ¥10,492 |
R合计620+172+180+9,520=10,492;C为286+244+180+19,560+1,200=21,470;S为1,036+198+180+12,240+300=13,954。三者除以120得¥87.43、¥178.92和¥116.28(显示顺序按R、C、S)。
本轮未计税务处理、资本成本和长期培训,因为三方案相同或不适合分配;这些排除项写在成本模型版本里。成本表必须能让另一个人用原始账簿复算,而不是只有一个漂亮总数。
最常见的重复计算有四种:复核分钟已经包含在综合人工成本中,却又以“机会成本”再加一次;年度订阅先全额计入固定成本,又按每次工具收据重复计算;失败重跑的令牌已经出现在发票里,却另加一笔估算接口费;人工重建既作为 120 个已接受成果之一,又把原失败任务从分母删除。工作簿为每个组件指定唯一来源和归属规则,审校时逐项查重。
另一个陷阱是把节省时间直接当收入。R相对C释放约41.8小时,只有实际用于新增付费交付、减少外包或避免加班时,才能确认相应财务收益;否则先记释放容量。投资回报率分子使用已实现收益和明确价值代理,不用“小时×最高报价”自动冒充现金收入。
便宜模型 C 的问题是失败集中在高成本任务
| C 结果路径 | 任务数 | 调用贡献 | 额外人工特征 |
|---|---|---|---|
| 首次通过 | 72 | 72 | 正常复核 |
| 一次重试后接受 | 34 | 68 | 两轮复核/修复 |
| 两次重试后接受 | 10 | 30 | 三轮复核/修复 |
| 手动重建 | 4 | 12 | 三轮后人工重做 |
| 合计 | 120 | 182 | — |
首次通过72/120=60%。结构化摘录表现尚可,但数字核算、跨来源冲突和客户可见稿的失败更贵:不仅多一次调用,还要重新打开来源、恢复判断和复核所有受影响段落。
C仍保留在路由中,因为30个低难摘录和部分标准比较的完整单位成本最低。结论不是“不要便宜模型”,而是不要把便宜标价外推为所有任务的便宜交付。
全用强模型 S 也会为低风险任务支付能力溢价
| S 结果路径 | 任务数 | 调用贡献 |
|---|---|---|
| 首次通过 | 103 | 103 |
| 一次重试后接受 | 14 | 28 |
| 手动重建 | 3 | 6 |
| 合计 | 120 | 137 |
S首次通过103/120≈85.8%,总调用137,比C少45次;人工少30.5小时。虽然模型费多750元,完整成本少7,516元。它证明更贵模型可通过减少下游工作降低总成本,但仍不是最优。
在66个低难任务中,C与S通过差距很小,S的输出优势没有转化为额外客户价值。全用S也使成本对输出长度和价格变化更敏感;因此需要按任务而不是按品牌选一个“默认最强”。
路由 R 按失败后果、证据负担和任务结构分配模型
| 路由特征 | C | S/人工升级 |
|---|---|---|
| 输出结构 | 固定格式、短摘录 | 开放综合/客户可见 |
| 证据 | 单一清晰来源 | 多来源冲突/需引用判断 |
| 数字 | 无或确定性外算 | 复杂口径、关键结论 |
| 可逆性 | 草稿、易重跑 | 截止日期/外发/高返工 |
| 数据风险 | 已最小化低敏 | 高敏不由模型路由,转人工 |
| 评估历史 | C在该系列稳定 | C失败率/复核分钟超门槛 |
R将66个低难/低风险任务送C,54个复杂/高后果任务送S。首轮112项通过,8项失败;7项改变策略后一次通过,1项手工重建,总调用120+8=128。
路径由主机规则和历史评估决定,模型不能声称“这个任务简单”来降低自己的检查。未知系列先走S+人工,收够20个样本后再考虑下调;涉及禁止数据或高后果自动决定直接停止,不进入成本竞价。
路由本身也会犯错。虚假便宜指本应走S却送C,代价是失败、延误或风险;虚假强势指本可走C却送S,主要代价是多付模型费。两种错误不对称,所以阈值不以总体准确率决定。客户可见稿宁可虚假强势,内部固定格式摘录可以容忍更多C试运行。
| 路由审计 | 20项影子结果 | 处理 |
|---|---|---|
| 修正 C | 9 | 保持 |
| 修正 S | 8 | 保持 |
| 虚假便宜 | 1 | 增加“多来源冲突”特征 |
| 虚假强势 | 2 | 收集更多低风险样本 |
这20项只用于校准路径,不代替120项结果。规则更新先影子运行:系统同时给路径建议,但实际仍走旧路径;人比较成本和质量后再发布。每个路由决策保存特征值和规则版本,月后才能解释为什么同类任务走了不同模型。
用质量—成本前沿判断方案是否值得保留
| 指标 | C | S | R |
|---|---|---|---|
| 首通通过率 | 60.0% | 85.8% | 93.3% |
| 总呼叫量 | 182 | 137 | 128 |
| 已接受单元 | 120 | 120 | 120 |
| 成本/已接受 | ¥178.92 | ¥116.28 | ¥87.43 |
| 人工工时 | 81.5 | 51.0 | 39.7 |
| 95% 任务完成时间 | 28 分钟内 | 18 分钟内 | 12 分钟内 |
在本数据上,R 同时拥有更低成本、更高首次通过率、更少人工和更快的尾部完成时间,因此 C 和 S 的“全量使用”方案都被支配。但分任务族观察时,C 可能仍位于低难摘录的前沿,S 位于高复杂综合的前沿;总表不能抹掉局部最优。
质量放行门槛必须先固定再看成本。若为压成本放松引用或数字门槛,成本下降只是把错误转移给客户。反过来,增加不产生用途差异的风格复核也会虚增人工,应该审查放行门槛本身。
前沿按系列画,而不是只画三个总点。结构摘录可能出现C成本最低且质量等同;数字核算可能S与R质量相同但R因外置计算更便宜;客户稿可能人工主导才在可接受风险范围。一个方案只有在同一质量与用途下更贵、更慢且不更可靠时才被支配。
还要报告置信范围。12个客户稿中一次失败就改变8.3个百分点,不能把小样本的91.7%与100%当成稳定差异。样本不足时写“当前未观察到差异”,不写“两个模型一样好”;继续收集后再调路径。
固定费、共享费和边际成本必须分开
| 成本类型 | 例子 | 决策处理 |
|---|---|---|
| 可变 | 输入与输出令牌、按次搜索和文字识别 | 直接归任务 |
| 固定 经常性 | 工作区席位、监控 | 按活跃任务/时间合理分配 |
| 共享 | 向量存储、公共评估 | 规则分配并留未分配 |
| 一次性设置 | 提示词/自动化建设 | 按预计使用期摊销或单列 |
| 沉没 | 已付且不可收回试验 | 不影响未来边际路径 |
| 避免的成本 | 取消旧工具/减少外包 | 只有实际停止才确认 |
三个方案各分配¥180固定费用,确保比较不因某个方案遗漏订阅而倾斜。已经买了年度席位并不代表使用它边际成本必然为0:令牌/工具可能另计,自己的时间仍发生;但做下一次路径决策也不能把已不可退的全年费用重复加在每项任务。
分配规则按月锁版本。若活跃已接受单元从120降到40,同一固定费的单位分配会升高;仪表盘要同时显示边际成本与满载成本,分别支持即时路径和服务定价。
一次性建设成本也不应消失。路由规则、评估集和账簿共花18小时,如果预计未来12个月处理1,440个已接受单元,可单列建设摊销;若只做一次20项任务,复杂系统可能不划算。本文三方案比较没有加入这18小时,因为建设用于共同实验且未来收益尚未确认,复核记录将其列为排除设置,不宣称免费。
服务定价使用全成本视角,并给波动留缓冲;今天某任务使用哪个已购买模型,则看边际视图和质量门。两个问题使用不同成本口径是合理的,前提是名称清楚,不拿边际价向客户证明整体服务有利润。
敏感性分析揭示什么变化会让赢家翻转
| 场景 | C/已接受 | S/已接受 | R/已接受 | 结论 |
|---|---|---|---|---|
| 基础:¥240/小时 | ¥178.92 | ¥116.28 | ¥87.43 | R |
| 时间只按¥80/小时 | ¥70.25 | ¥48.28 | ¥34.54 | R仍优 |
| C首次通过升至90% | ¥82.10 | ¥116.28 | ¥85.60 | C可能优 |
| 高复杂任务从54降到15 | ¥78.40 | ¥111.70 | ¥69.20 | R仍优但差距缩小 |
| S价格下降50% | ¥178.92 | ¥111.97 | ¥84.85 | R仍优 |
后三行是基于改变假设的教学情景,不是重新实跑;单元格来自模型表,不能冒充观测。它们告诉林澄最值得优化的是C在特定系列的首次通过与人工复核,而不是只谈供应商降价。
盈亏平衡用同一公式求:若 C 在目标系列中把重试和复核降到某个门槛,就可以承接更多任务;若综合人工费率很低,且质量后果可逆,便宜模型更有优势。每个假设都要记录来源、负责人和复核日。
预算告警要盯住重试、复核和上下文膨胀
| 告警 | 阈值 | 操作 |
|---|---|---|
| 尝试次数/任务 | >1.25 滚动 7d | 按失败代码暂停系列 |
| 首通通过率 | <90% 针对已路由集合 | 回滚路由/提示词/模型 |
| 人工复核 | 每个已接受成果 >12 分钟 | 抽样查找结构或证据问题 |
| 上下文令牌 | >基线25% | 检查检索与历史膨胀 |
| 工具重复 | 同任务同查询>1 | 缓存/幂等性检查 |
| 成本/已接受 | >¥100三天 | 分解驱动因素,不盲降级 |
| 未分配成本 | >5% | 修复标签与任务编号 |
月预算分为模型、工具、固定、人工和失败五袋;任何一袋节省不能自动抵消安全或质量硬性放行门槛。预测使用任务数量×家族组合×单位成本,而不是把上月总额线性复制。
异常响应先冻结自动重试,再保留账簿和回执;判断是流量增长、上下文膨胀、路径漂移、供应商价格、工具循环还是质量退化。成本告警不自动切最便宜模型,避免在最忙时放大失败。
每四周用同一任务集重新核算
| 复核节奏 | 检查 |
|---|---|
| 每日 | 重试风暴、预算、提供商错误 |
| 每周 | 家族通过率、复核分钟数、未分配 |
| 每月 | 120项或代表性增量评估、发票对账 |
| 模型或价格变更 | 同一组对照测试、路由影子运行 |
| 新工作流 | 先20项抽样,不套旧单位成本 |
| 季度 | 综合人工费率、固定成本分配、客户价值 |
林澄先用R运行四周影子:路径只建议不自动改变高风险路径;每周抽查10个C通过项和全部失败项。若C在某系列连续20项通过且复核不增,才把更多任务下调;若S在某系列无质量增益,则尝试C。
发票对账要求总账直接成本与供应商账单差异≤2%;差异来自税、舍入、未标记实验或共享服务时逐项解释。人工时间抽样与日历/交付记录核对,避免为了证明AI省钱而少记返工。
四周结束不只看平均:按系列、客户后果、输入长度和路由版本分层;列出最贵5项及原因。若少数异常源于损坏PDF或一次提供商中断,优化对应工具;若同一系列持续高复核,改合同、上下文或路径。禁止用删除异常值让曲线好看,除非同时报告原始与排除后结果及理由。
每次换模型先做离线120项,再用10个低风险真实任务影子,最后逐步放量25%→50%→100%。任一阶段出现数据边界失败、关键数字错、账簿缺失或成本/已接受连续三天超门,就回滚。价格下降可以触发评估,不能跳过质量和安全门。
决策卡记录每类任务在什么门槛下走哪条路径
| 决策字段 | R方案 |
|---|---|
| 业务单元 | 已交付成果 |
| 范围 | 120项、五系列、当前客户边界 |
| C 资格 | 低难、低风险、固定格式、历史稳定 |
| S 资格 | 多来源、复杂综合、关键数字/外发稿 |
| 仅限人工 | 禁止数据、法律/高后果责任、三次失败 |
| 重试 | 最多2次且必须针对失败改变策略 |
| 质量放行门槛 | 证据、数字、格式、边界不降低 |
| 成本放行门槛 | 滚动成本/已接受≤¥100 |
| 停止 | 数据越界、账单无法对账、首次通过<90% |
| 复核日期 | 每4周或任何模型/价格/工作流变化 |
这张卡把模型选择变成可审计路径,而不是个人偏好。便宜模型的正确位置可以扩大,前提是已接受单元成本与风险证据支持;强模型也不因“质量高”免于成本复核。无法量化声誉或安全后果时,使用硬性放行门槛和人工责任,不让一个伪精确人民币数字替代判断。
本案例参考FinOps 基金会单元经济学把技术成本连接到业务单位、区分资源效率与业务结果,并逐步纳入完全分摊成本;AWS 最佳架构成本优化强调衡量工作负载业务输出和交付成本、分析与归属支出;Microsoft FinOps 单元经济学说明共享基础设施、使用数据以及外部许可证、本地运营和人力也可能需要纳入。
- FinOps Foundation:Unit Economics
- FinOps Framework 2025
- AWS Well-Architected:Cost Optimization Pillar
- AWS Well-Architected:Cost Optimization design principles
- Microsoft FinOps:Unit economics
今天选最近 20 个已经交付的任务,不要先算令牌。给每项补上任务编号、尝试数、最终是否已接受、复核与修复分钟,以及实际工具账单;用自己的综合人工费率计算每项合格交付的成本。若最便宜模型的首次通过率和人工时间没有记录,先补账本,不做“省钱”结论。