先看结果:4个候选没有总冠军,企业得到的是4条有边界的准入决定
锐川工业分销有3,100名员工、17万种物料和9个区域服务中心。采购团队原本准备根据公开排行榜和两场供应商演示,为全公司购买一个“综合最强模型”。评估团队没有先争论品牌,而是从已经批准的业务范围中冻结960例:客服回复草稿、物料属性抽取、中英安全公告核对、合同条款差异说明各240例。4个匿名候选各有3次运行,形成11,520个计划槽位;资料门先挡下2,880次不允许的候选—任务组合,实际合规执行8,640份输出。
结果不存在单一赢家。C在客服草稿上合格率93.3%,95%的交互请求能在1.7秒内返回首个词元,且成本较低;D在属性抽取上达到98.3%,又能在批准的本地环境处理受限资料;B在安全公告核对上达到97.9%,且没有关键遗漏;合同差异说明因资料边界只允许D参与最终比较。A的平均分并不低,却在安全任务中漏掉一次“禁止带压拆卸”,因此只保留属性抽取备用资格,不能靠其他任务的高分抵消。
| 任务泳道 | 已采纳模型 | 决定性证据 | 范围被排除 |
|---|---|---|---|
| 客服回复草稿 | C主、B备 | 224/240合格;95分位首个词元延迟1.7秒;每千个合格草稿完全成本10,458元 | 不自动发送,不处理受限客户附件 |
| 物料属性抽取 | D主、A备 | 236/240合格;字段关键错0;本地批量稳定 | 不自动覆盖主数据,未知单位转人工 |
| 安全公告核对 | B唯一准入 | 235/240合格;关键遗漏0;三次翻转率1.7% | 人工安全工程师签发,A/C不准入 |
| 合同差异说明 | D有限准入 | 221/240合格;受限资料边界通过 | 只给法务草稿,不作法律结论或自动接受条款 |
公司、候选、数据、价格、阈值和结果均为虚构教学案例,不代表任何真实企业、模型、供应商报价或行业基准。真实模型能力、部署位置、保留策略、合同、监管、安全与劳动影响会变化,必须在采购和上线时由业务、资料、安全、法务、采购与受影响岗位共同复核。
这次评估的产物不是“B分数最高”的一页幻灯,而是每条任务的模型准入卡:允许的版本、资料、输入长度、提示与检索、负载、输出用途、关键错误、人工放行、成本预算、有效期和回退。这样,选择结果既能由网关或应用执行,也能在供应商更新后重新验证。
先限定模型选型到底决定什么
前提是业务场景已经过优先级和风险筛选,试点章程已经限定范围,统一入口能够执行身份、资料和动作策略。本文回答的是:对一个已定义任务,哪些模型在什么配置与边界内有足够证据进入影子或受控生产。它不证明该场景有业务价值,也不因模型通过就授权外部动作。
| 决策层 | 问题 | 负责人 | 证据移交 |
|---|---|---|---|
| 场景选择 | 值不值得验证,风险是否可逆 | 业务赞助人 | 任务合同、基线 |
| 评估资产 | 哪些案例代表真实分布与关键边缘 | 任务与评估负责人 | 冻结案件编号、评分标准 |
| 模型选择 | 哪个版本在该任务/边界内可准入 | 选拔委员会 | 准入卡、运行记录 |
| 系统设计 | 检索、工具、验证器怎样组合 | 产品与工程负责人 | 系统配置 |
| 生产路由 | 当前请求可走哪个已准入端点 | 平台与应用负责人 | 策略与路由记录 |
| 持续监控 | 分布、质量、成本或版本是否变化 | 运营与业务负责人 | 漂移与变更触发器 |
相邻环节不能相互冒充。公开排行榜适合发现候选,不等于本企业任务评估;一组离线评估通过,不等于端到端应用可以上线;生产中的对照流量表现好,也不能补救未经批准的数据外发。E21会专门讲怎样从历史工作构造、标注和维护评估集;本文仅说明选择实验需要评估资产具备哪些接口,不把“收集960例”写成一句话就算完成。
参与者至少有六类:业务负责人定义错误后果,领域审核员给出期望行为,资料与安全负责人先审查边界,工程团队固定系统配置并运行,财务与采购核对总成本和合同可执行性,独立评估负责人保管盲测答案并发布结论。供应商可以解释产品与修正配置,却不能单独挑样本、改评分或宣布自己通过。
排行榜回答的是特定数据与协议,不会自动回答你的任务、系统和后果
一个排行榜分数只在其数据集、提示方式、推理参数、评分器、模型版本和运行日期下成立。企业输入可能是中文型号表、内部缩写、带扫描噪声的PDF和相互矛盾的制度;公开题目可能是选择题或短问答。两者都叫“准确率”,测量对象仍然不同。把87.3分理解成“87.3%的企业请求正确”,分母已经被偷换。
| 公开证据可证明 | 若无本地测试则无法建立 |
|---|---|
| 候选在公开场景/指标下的相对表现 | 17万种物料编码和内部单位能否正确归一 |
| 某个上下文长度被接口接受 | 长文中关键条款能否稳定定位并引用 |
| 公开推理或语言任务的能力线索 | 本公司输出模式、禁答和人工流程是否满足 |
| 某硬件/负载协议下的吞吐或延迟 | 企业网络、配额、检索和并发下的端到端尾延迟 |
| 发布时的价格或版本信息 | 重试、审核、失败返工和平台运维后的有效成本 |
| 某安全分类测试的覆盖 | 本任务最坏错误是否被发现、能否在动作前拦截 |
公开结果仍有价值:用来把40个候选缩到4个、发现某类能力弱项、复用透明的评估思想和检查供应商声明。错误做法是把多个排行榜平均后再加价格权重,得到一个看似精确的总分。平均值会隐藏关键切片,权重会把不可补偿的资料边界或安全遗漏变成“扣几分”。
本次只把版本可识别、接口可测试、候选部署边界可接受且有基本文档的模型带入实验。公开得分不换算为本地先验分;采购简报中原样保存排行榜名称、版本、日期和适用限制,三个月后不拿旧结果证明新版本。
先写任务选择合同:把“最好的模型”改成可观察的输入、输出、错误和动作
客服任务不是“写得好”,而是根据工单事实生成不越权的中文回复草稿;物料任务不是“理解表格”,而是把供应商属性映射到固定字段;安全任务不是“总结”,而是列出每项限制、数值、适用对象和原文证据;合同任务不是“审合同”,而是指出与标准条款的差异供法务核对。每条合同都有稳定的业务对象,模型请求只是完成它的一次尝试。
| 字段 | 安全公告 v1 填充示例 |
|---|---|
| 合格输入 | 已批准供应商公告PDF,中/英,1—12页,扫描质量≥门 |
| 输出合同 | 变更项、限制、数值/单位、适用物料、原文页码、未知项 |
| 禁止声明 | 不宣布设备“安全”,不替工程师发布现场指令 |
| 关键故障 | 漏掉禁止动作/阈值;反转否定;单位或适用对象错误 |
| 正常故障 | 措辞不顺、非关键背景遗漏、字段顺序变化 |
| 放行 | 安全工程师对照原文逐项签发后进入内部公告 |
| 基线 | 人工中位31分钟/份;抽查遗漏2/240历史份 |
| 放行门槛 | 合格≥96%;严重=0;证据字段100%;翻转≤3% |
| 负载/服务级别目标 | 工作日6 请求/秒突发;P95完整结果≤8s |
| 停止 | 任一关键遗漏、跨文档串答、未授权内容日志或版本漂移 |
四条合同使用不同评分,不强求统一“正确率”。抽取以字段和值为单位,安全核对以公告为单位且关键项零容忍,草稿以有依据/不承诺/可编辑为门,合同差异以条款覆盖与引证为门。业务负责人签合同后才测试,避免看到某模型特长再改题目。
对照任务专门验证方法不会把所有模型都推向最昂贵者:客服草稿允许低风险措辞修改,关键事实来自工单;安全公告任何禁止动作遗漏都不可接受。若用安全任务门槛统一筛客服,成本与延迟可能无意义地升高;若用客服平均分筛安全,低频严重错会被淹没。
先冻结候选配置和资料边界
候选不是一个名字,而是一套可复现配置
“模型B”被固定为一个可复现的被测系统,而不是供应商家族。记录供应商、模型与版本快照、端点与区域、上下文上限、结构化输出方法、随机性参数、推理强度、系统指令、少量示例、检索索引、工具权限、软件开发工具包与适配器、超时与重试以及内容处理设置。任何一项改变都可能改变质量、延迟或价格。
| 配置编号 | 模型边界 | 任务适配 | 运行时边界 |
|---|---|---|---|
| A-20260712-r1 | 托管固定快照A;已批准内部与机密供应商资料 | 提示词p17;结构化输出v3 | 区域R1;20秒超时;重试1次 |
| B-20260712-r1 | 托管固定快照B;无受限合同资料资格 | 提示词p17;结构化输出v3 | 区域R1;30秒超时;预留容量 |
| C-20260712-r1 | 托管固定快照C;公开与内部草稿 | 提示词p17;结构化输出v3 | 区域R2;12秒超时;重试1次 |
| D-20260712-r1 | 自托管权重及哈希D | 提示词p17;结构化输出v3 | 本地集群q4;队列容量64 |
为公平比较,任务提示和可用材料相同,但“相同配置”不等于故意压制模型。若某候选必须使用其原生模式或不同量化才能正常运行,建立第二个预声明配置,先在开发集调适,再一次性冻结;不能在测试集上不断改提示词直到胜出。最终决策比较的是可交付配置,不是抽象基础模型。
答案与候选名隔离。运行器只产生运行编号和输出,领域审核员看到随机化的配置代码,不看供应商品牌、成本和历史偏好;自动评分器也固定版本。只有评分锁定后才揭示候选身份,所有人工改判都保存原因。盲测不能消除全部偏差,但能减少“贵模型应该更好”的先入判断。
候选失去固定快照时,至少保存供应商返回的明确模型标识符、执行时间和配置;若服务自动滚动且无法辨认变更,只能准入低后果范围并把漂移当已知风险,或不进入本次候选。采购承诺必须与可实际调用的版本控制能力一致。
数据边界先于质量测试
资料门逐候选、逐任务判断,不写“供应商已通过安全审查”一句总括。检查允许区域、传输/静态保护、服务是否使用输入改进模型、内容/元数据保留、管理员访问、分包、删除、事件通知、租户隔离、密钥与日志、合同审计证据。自管模型也不是天然通过:权重来源、运行主机、镜像、运维访问、遥测出口和备份同样要查。
| 候选项 | 公开或内部资料 | 供应商机密资料 | 受限合同资料 | 证据状态 |
|---|---|---|---|---|
| A | 允许 | 允许但需无内容日志义务 | 拒绝 | 受限项保留期限不完整 |
| B | 允许 | 允许已批准区域 | 拒绝 | 合同禁止所需受限范围 |
| C | 允许 | 拒绝 | 拒绝 | 类消费端端点边界不足 |
| D | 允许 | 允许 | 允许在本地飞地 | 出向/管理员控制已测试 |
因此合同任务不是四个模型赛跑:A、B、C在运行前已经被资料门排除,只测试D能否达到最低业务门,并保留纯人工回退。禁止把合同内容脱敏成无法代表真实难度的假样本后宣布云模型可用于生产;可以用合成样本研究能力,但准入卡必须明确写出“未对受限资料授权”。
评估语料导出也执行最小化。案件编号、输入版本、授权来源、资料类别、允许运行位置和删除日期随清单进入运行器;答案库与生产资料分开控制。外部候选若只允许公开与内部资料,就由策略阻止受限案例,不能依靠评估人员记忆。
发现边界证据缺失时,状态是待定或拒绝,不是先上传再询问。供应商补充合同或企业设置后,资料负责人重新签署边界决定并记录有效期;质量团队无权替其接受风险。真实隐私、跨境、行业和员工义务须按所在地及合同由专业人员判断,本文矩阵不构成法律或安全结论。
用同一套冻结实验比较合格候选
960个案例按任务、难度、语言、长度和后果切片
冻结集来自已获授权的历史形态样本、合成边缘样本和专家构造的反例。每条任务240例,不是随意凑齐:正常120例、边缘60例、关键或停止40例、对抗或格式扰动20例;再按中英文、扫描质量、长短、产品族和区域平衡。测试集的案件编号与期望行为在候选调适前锁定,另有不计分的开发集。
| 通道 | 正常 | 边缘 | 关键/停止 | 扰动 | 总计 |
|---|---|---|---|---|---|
| 服务草稿 | 120 | 60 | 40 | 20 | 240 |
| 属性提取 | 120 | 60 | 40 | 20 | 240 |
| 安全公告 | 120 | 60 | 40 | 20 | 240 |
| 合同差异 | 120 | 60 | 40 | 20 | 240 |
| 总计 | 480 | 240 | 160 | 80 | 960 |
960并非统计学万能数。团队保存每个切片的目标误差、样本来源、独立对象和覆盖缺口;同一模板的200个近重复不能假装200份独立证据。罕见但严重的错误不靠随机抽样碰运气,而由40个关键/停止样本定向验证;未知新产品族仍不被结论覆盖。
样本泄漏也要调查。公开可检索文档、供应商曾用于演示的案例、训练污染可能性和相似重复都打标签;企业无法证明模型是否见过每条历史资料,因此重点是加入上线后新生成的留置、时间切片和可变形反例。若候选对原题很好、轻微单位/顺序变化即崩,不能称稳健。
完整的数据集建设、标注一致性和版本维护另有专文。本次选择清单最低要求是案件编号、任务与切片、输入哈希与版本、预期元素、关键标签、裁判方法、数据权限和有效期;缺任何关键字段的案例不进入正式分母。
评分先判硬错误,再算任务通过率
每份输出先过确定性检查:输出结构、必填字段、引用页码、数值与单位格式、禁用动作和资料泄漏;再按任务评分标准由审核员或经过校准的评分器判断。自动评分适合能用程序验证的字段,语义充分性采用双人抽样和分歧仲裁;若使用大语言模型辅助评分,必须固定评分模型与提示词,并用人工标准答案校准,不能让参赛模型给自己评分。
| 通道 | 通过单元 | 关键放行门槛 | 报告次级指标 |
|---|---|---|---|
| 服务草稿 | 整份草稿满足事实、承诺与语气门 | 虚构退款、泄露其他客户资料=0 | 有依据的事实陈述、编辑分钟数、拒答正确性 |
| 提取 | 全部关键字段正确且结构有效 | 型号、单位或危险等级错误=0 | 字段精确率与召回率、未知处理 |
| 安全 | 每项限制与原文证据完整 | 禁止动作、阈值、否定反转=0 | 证据覆盖、不支持的增补 |
| 合同 | 关键条款差异及页码可核 | 漏掉责任/终止关键差异=0 | 条款召回率、错误问题、复核时长 |
通过率用“合格业务对象/全部合格对象”,不是正确字段数平均。物料抽取一份有60个字段,59个普通字段正确但危险等级错误,字段准确率98.3%仍整份失败并触发严重。拒绝无授权输入若符合预期可算正确行为,不能为追求回答率把它记失败。
置信区间与样本量一同报告,不把224/240的93.3%写成永久真值。候选差2个百分点但区间重叠时,结论是当前证据不能只凭准确率区分,再看硬门、稳定性、延迟、成本或增加最有信息的案例;不是用更多小数制造赢家。
审核一致性先用60份校准集。两名审核员初始对整份通过一致49/60,分歧11份集中在“是否算过度承诺”;业务负责人补充退款权限锚点后复评一致57/60,3份交仲裁。正式集抽20%双评,若一致率低于90%则暂停揭示候选身份、修订评分标准并重新检查受影响结果。
用一份安全公告展示完整裁决链
SB-087 案例是一份6页中英公告:某阀组件在压力高于0.35 兆帕时不得带压拆卸;适用型号RCV-41/42,不包括RCV-40;临时处置是隔离、泄压并由持证人员确认。输入清单标供应商保密、允许A/B/D、不允许C,期望元素有阈值、单位、否定、型号范围、三个动作和页码。
case SB-087 / source v2026-06-18 / expected elements 9
A run-2: “高压时谨慎拆卸” -> 丢失“不得”、0.35 MPa与隔离步骤 -> CRITICAL FAIL
B run-2: 禁止带压拆卸;>0.35 MPa;RCV-41/42;隔离→泄压→持证确认;p2,p4 -> PASS
C: policy deny before content transfer -> DATA-BOUNDARY CORRECT, not quality attempt
D run-2: 元素齐全,但把RCV-40写进适用范围 -> CRITICAL FAIL
final: only B passes this case; A/D failures enter slice analysis and stop review
| 检查点 | 保存证据 | 负责人及操作 |
|---|---|---|
| 准入 | 对任务、数据、目的和模型的允许决定 | 策略负责人;C未收到内容 |
| 请求 | 案例、输入、提示词与配置哈希 | 评估工程师 |
| 回复 | 原始输出、供应商请求编号与时序 | 受限结果存储 |
| 确定性检查 | 模式、数字、单位、型号、页面引用 | 测试运行器 |
| 评分标准 | 9元素、关键标签、审核员结果 | 安全审核员 |
| 裁决 | A否定弱化、D型号扩大 | 安全负责人确认 |
| 决策 | B通过;A与D在本案例失败 | 选择委员会更新通道准入状态 |
关键在于“谨慎”不是“不得”,属于动作强度反转,不能由整体摘要流畅度补偿。A在240例安全集中的239例可能都好,这一次仍使关键放行门槛失败。D的问题只在特定型号排除切片出现,团队可修检索/提示后建立新配置 D-r2重新跑完整安全集,但不能只重跑SB-087并替换旧结果。
案例还证明资料拒绝与模型失败不同。C没有被评价为“答错”,而是正确停在数据边界;报表分别给合格分母与策略拒绝。把被拒案例从所有候选共同分母平均,会错误惩罚守边界的系统,也会掩盖候选根本没有该范围资格。
三次重复运行专门测结果翻转
每个合格案例按相同冻结配置运行3次,次序随机、时间窗口分散,记录三个输出是否都通过、通过与失败是否翻转、关键字段值是否变化、引用是否漂移。共4个候选×960个案例×3次=11,520个计划输出;扣除资料门不允许的候选与任务组合时,报表同时列出计划、符合资格、已完成、超时和无效数量,避免分母消失。
| 候选项 | 符合条件的案例 / 输出 | 三者一致裁决 | 翻转率 | 跨重复的关键项 |
|---|---|---|---|---|
| A | 720 / 2,160 | 666/720=92.5% | 54/720=7.5% | 安全 1 唯一案例/2 次运行 |
| B | 720 / 2,160 | 699/720=97.1% | 21/720=2.9% | 0 |
| C | 480 / 1,440 | 430/480=89.6% | 50/480=10.4% | 0 在合格范围内 |
| D | 960 / 2,880 | 928/960=96.7% | 32/960=3.3% | 提取 0;其他 2 个唯一案例 |
表中“三者一致裁决”按独立案例报告三次是否全同,输出用于对账执行量。A/B各有3条任务获资料资格,C只有客服与公开提取,D有4条,因此8,640份实际输出与11,520个计划槽位相差2,880;未运行不是零分,必须显示边界原因。
任务准入使用更直接的稳定门:安全任务240例中,B有236例三次判定一致,4例发生一次普通通过/失败翻转,翻转率1.7%,低于3%;关键元素翻转为0。客服C有18例翻转,集中在退款措辞和长对话,仍低于该任务8%门,但准入卡要求这些切片进入强制审核。
超时、429或服务错误不是重新运行到成功后删除。第一次尝试计可靠性与成本,符合预设重试策略才重试;三次实验运行是独立重复,不是失败重试。若某候选因配额少只在夜间跑,延迟比较要标不同负载条件,不能把空闲时性能与高峰候选并列。
对合格候选比较真实负载和完全成本
延迟和吞吐要在真实输入长度与并发下测
离线质量完成后,使用经过脱敏或合成、但保持真实长度分布的负载包做端到端测试,其中包含应用、鉴权、检索、模型、结构验证器和队列。客服任务测首个词元与完整响应延迟,抽取和安全任务测完成时延,批任务测吞吐与截止日期。中位数描述常态,95与99分位暴露尾部;平均值不能回答慢请求是否会超时。
| 候选与配置 | 任务与负载 | 中位数 | 95分位与99分位 | 吞吐量与结果 |
|---|---|---|---|---|
| C-r1 | 客服18并发、峰值每秒24个请求 | 首个词元0.7秒 | 1.7秒 / 3.8秒 | 每秒23.6个请求;95分位门内 |
| B-r1 | 客服同负载 | 首个词元1.1秒 | 2.6秒 / 5.9秒 | 每秒22.1个请求;可作备用 |
| D-r1 | 抽取64并发批量 | 3.4秒完成 | 7.8秒 / 13.2秒 | 每分钟41.5份文档 |
| B-r1 | 安全任务每秒6个请求突发 | 3.2秒完成 | 7.1秒 / 10.6秒 | 95分位不超过8秒;通过 |
| D-r1 | 合同任务8并发 | 12.4秒完成 | 28.6秒 / 46.2秒 | 95分位不超过35秒;通过 |
长输入单独切片。安全公告1—3页和10—12页不能只给合并后的95分位;C虽然接口接受长上下文,但不在该资料边界内,A在长公告的99分位达到18.7秒并有2次超时。容量测试还在同一时刻注入批量抽取,验证优先队列不会让安全核对超过截止日期。
测量时间含重试与排队,缓存命中率固定并报告;自管D把模型加载、量化、批量和网络写入配置。云端候选的配额必须与预计采购层一致,不能用供应商临时演示白名单证明日常容量。三轮各30分钟,预热和正式窗口分开,原始到达/时序保存供复算。
MLPerf推理的官方材料区分首个词元延迟、逐词元延迟、吞吐和不同负载场景,说明性能指标依工作负载而异。本文只借鉴“固定场景、负载和尾延迟”的测量方式,不把MLPerf的某一阈值当成本公司的服务目标,也不声称案例数据可与其提交结果比较。
成本按每千个合格业务结果计算
采购表先分供应商或计算成本,再加检索、网关、评估摊销、运维、人工审核、失败返工和预留容量。比较单位是同一任务的1,000个合格业务成果,不是1,000次程序接口调用或一百万词元。质量未过硬门的配置不进入成本排序,再便宜也只是失败成本。
客服草稿中,C首次合格率93.3%,要得到1,000个合格草稿约需1,000÷0.933=1,072次尝试。每次技术成本0.42元,约450元;1,000份例行审核每份2.6分钟、岗位完全时薪180元,成本7,800元;约67份需8分钟返工,成本1,608元,合计约9,858元。这里不把人工时间当免费,也不把不合格尝试从账上删掉。
| 每 1,000 合格成果 | C 服务草稿 | B 安全公告 | D 提取 |
|---|---|---|---|
| 必要尝试 | 1,072 | 1,021 | 1,017 |
| 模型与平台变量 | 450元 | 3,269元 | 814元 |
| 标准人工发布与复核 | 7,800元 | 23,833元 | 4,200元 |
| 异常返工 | 1,608元 | 1,365元 | 520元 |
| 分摊固定评估与运营 | 600元 | 1,200元 | 900元 |
| 满载教学估算 | 10,458元 | 29,667元 | 6,434元 |
表中C前文的9,858元是技术、例行审核与返工小计;加入600元固定分摊后,完全成本为10,458元,两种口径必须命名,不能混用。B按1,021次尝试×3.20元约为3,269元,安全审核按1,000×5.5分钟×260元/小时≈23,833元;21份普通例外按15分钟计约1,365元,加1,200元固定分摊后为29,667元。数字均为教学假设,真实费率、词元、折扣、硬件利用率、税和岗位成本须重新核算。
D自管成本按图形处理器折旧或租用、功耗、平台与值班、闲置率和峰值预留分摊,不能用“没有接口账单等于免费”来计算。若利用率从62%降到25%,单位成本会显著上升;E08会比较云、本地与混合推理,E09会完整展开企业AI总拥有成本,本文只确保模型选择没有使用错误的成本单位。
成本敏感性给出三种情境:基准、业务量减半、人工审核时间增加50%。C的模型价格即使下降一半,完全成本也只减少约225元;若平均审核从2.6分钟增到3.9分钟,反而增加3,900元。优化优先级因此可能是减少有证据的人工修改,而不是追逐更低的词元价格。
准入决定不做加权总分
选择流程分三层。第一层硬性放行门槛:资料/合同边界、关键错误、最低任务质量、人工可释放、版本可识别;任一失败就退出相应通道。第二层比较合格候选的质量、稳定、尾延迟、容量、完全成本和可替换性,找没有被另一候选各项同时压过的非支配集。第三层由业务负责人公开取舍,例如在都过门时用更低成本换取可接受的1秒延迟差。
| 规则 | A | B | C | D | 决策含义 |
|---|---|---|---|---|---|
| 按通道数据边界 | 部分通过 | 部分通过 | 狭窄通过 | 全部通过 | 只在具体范围内成立,不是全局分数 |
| 关键放行门槛 | 安全失败 | 通过合格 | 通过合格 | 2 未选通道案例 | 仅受影响通道失败待重跑 |
| 服务 ≥92% | 91.7% 不通过 | 92.9% 通过 | 93.3% 通过 | 86.3% 不通过 | C 主用,B 备用 |
| 提取 ≥97% | 97.5% 通过 | 96.3% 不通过 | 94.6% 不通过 | 98.3% 通过 | D 主用,A 可能备用 |
| 安全不低于96%,关键失败为0 | 关键失败 | 97.9%通过 | 数据拒绝且分数低于门 | 96.7%,但有一次关键重复失败 | B已准入 |
| 合同不低于91%,数据边界通过 | 数据拒绝 | 数据拒绝 | 数据拒绝 | 92.1%通过 | D有限准入 |
表中A客服91.7%=220/240,B为223/240即92.9%,C为224/240,D为207/240;抽取A/B/C/D分别234、231、227、236;安全A/B/C/D分别230、235、229、232;合同分别218、226、212、221,但只有D具备受限资料资格。未合格候选的离线合成能力分可保留研究,不能写入生产准入。
不设置“准确40%、速度20%、成本20%、安全20%”总分,因为安全边界不应被速度补偿,权重微调也会任意改变排名。若董事会需要一页图,就展示每条通道的硬门、未被其他候选全面压过的候选、关键取舍和证据置信度,不能压成87.6分。
两候选证据接近时可以双准入主/备,但备用必须独立通过同任务门,并确认共同故障不完全相关。多模型策略增加评估、适配器、合同与运维成本,不为“选择自由”无限扩候选;每通道通常保留最少能满足连续性的组合。
被淘汰不等于模型差,准入也不等于可以处理所有请求
C只获客服草稿资格。它的93.3%超过92%门,长对话切片仍有18次判定翻转,所以应用对退款、价格承诺和附件冲突强制复核;只允许公开/内部工单,输出进入草稿状态,发送按钮由员工操作。若将来要处理客户机密附件,需先过资料门而不是重跑准确率。
D获物料抽取和合同差异的不同准入卡。抽取中236/240合格、关键字段错0,4份未知单位正确转人工;但不得直接写主数据,数据管理员确认后提交。合同221/240达到92.1%,19份多为交叉引用遗漏,全部由法务对照原文;由于没有第二个数据合格模型,故障时回人工,不把A/B作为未经批准的自动回退。
B是安全公告唯一准入。235/240合格,5份普通失败均被模式/证据验证器抓住,关键遗漏0,三次关键元素翻转0;仍由安全工程师签发。单一候选形成供应与容量风险,所以采购合同、导出能力和人工连续性比再加一个不合格备用更重要。
A保留抽取备用研究,但安全通道立即停止。安全严重不是说A在所有用途“不安全”,而是当前A-r1不能执行安全公告 v1;修复配置必须成为A-r2,完整重跑240例×3、负载和数据门。失败记录不会从报告删除。
最终矩阵还保存置信度:数据边界证据的有效期、样本未覆盖产品族、尾延迟测试日期、价格假设和单一候选风险。准入是带过期的工程判断,不是给模型颁发永久资质。
把失败、采购和上线条件写进闭环
失败样本必须有证据、处置和责任人
| 失败 | 检测证据 | 立即行动 | 负责人及下一道放行门 |
|---|---|---|---|
| A弱化“不得”为“谨慎” | SB-087 元素/否定检查 | 安全通道停止;隔离全部A输出 | 安全负责人;A-r2 完全重跑 |
| D扩大适用型号 | 预期集合差异 | 转人工;检查型号排除提示词 | 产品数据负责人 |
| C虚构退款金额 | 工单资料不匹配 | 阻止发送;标记为无依据事实陈述 | 服务负责人;切片强制复核 |
| B两次99分位延迟超过任务截止日期 | 时序追踪加队列状态 | 降低并发或排队;不无限重试 | 平台负责人;重新运行容量测试 |
| 任一跨案例串答 | 业务对象/引用不匹配 | 停止配置;事件分诊 | 安全/评估负责人 |
| 复核人一致率低于90% | 双重复核账本 | 暂停揭示候选身份,修订评分标准 | 评估负责人和业务负责人 |
| 供应商更改模型编号 | 响应元数据与变更通知 | 冻结新流量,小流量对照旧版与新版 | 供应商经理和模型负责人 |
人工审核有对象、依据、时点和留痕。客服员工在发送前核工单事实、金额权限、收件人和承诺;数据管理员在写主数据前核型号、单位、枚举和状态未知;安全工程师在内部发布前逐项对照公告页码;法务在提出条款意见前读原条款。审核结果保存接受/编辑/拒绝、错误类型、分钟和最终状态,供成本与漂移计算。
停止条件包括:任何新的关键失败、未授权资料到达候选、输出串到另一业务对象、无法识别模型版本、关键审计缺失、评估答案库泄漏、生产分布出现未覆盖的高后果切片,或人工放行队列超过连续性容量。停止不是删除模型账户,可以只停一条任务通道或一个配置,并切换到人工或已准入备用模型。
普通失败可以有界修复:模式解析失败允许一次相同内容的确定性修复,429按预设退避,未知单位转人工;禁止让模型自我重试直到“看起来对”,因为成本和选择性报告会失真。所有尝试归同一业务对象,失败仍在分母。
采购验收必须复现实验中的可交付条件
选拔委员会向采购交付的不是品牌推荐,而是需求条款:可识别版本或变更通知、批准区域/数据使用/保留、容量和配额、关键日志与用量导出、价格单位与超额、支持/事件、弃用窗口、退出/数据删除、必要的评估与金丝雀权利。自管方案则写权重许可、供应链、镜像/补丁和硬件支持。
| 采购证据 | 验收问题 | 拒绝或异常信号 |
|---|---|---|
| 服务与模型标识符 | 每次调用能否记录实际版本 | 只有营销家族名且静默变化 |
| 数据条款与配置 | 是否覆盖实际任务、数据和区域 | 演示承诺未进入合同或租户设置 |
| 速率与容量 | 已购层级能否复现负载门 | 仅临时白名单或未披露限额 |
| 使用与审计导出 | 能否对账任务、费用和事件 | 数据粒度或保留不足却声称可审计 |
| 变更与弃用 | 多久通知、能否并行小流量测试并回滚 | 强制切换且无验证窗口 |
| 退出 | 输出、配置、日志和数据怎样导出/删除 | 高额或技术上不可行的退出 |
供应商对失败提出提示词优化时可以接受为新配置,但必须在开发集完成、冻结后重跑,不开放测试答案。供应商提供自有基准可作为补充,需说明样本选择、运行参数和评分;不能替代由企业持有的留置。
价格比较锁定计费口径和日期:输入/输出、缓存、批量、推理、最低承诺、税费和汇率。若候选B只有年付提交才能获得测试配额,成本情境同时展示实际利用率,不能按100%满载摊薄。采购最终决定还需结合E04的购买/组合/构建和E09的总体拥有成本,不由本篇准确率表单独决定。
离线通过后,用30天逐级验证真实运行
第1周只做影子:从真实任务复制最少必要元数据或经授权样本给候选,结果不展示、不执行,比较分布与离线集覆盖;对敏感任务可用时间后移的留置,而非双发未授权资料。第2周5% 群组产生草稿但强制复核,第3周20%,第4周最多50%,每一步都有入门和回退门。
| 阶段 | 体量与范围 | 放行状态 | 进入下一阶段的条件 |
|---|---|---|---|
| 离线 | 每个候选与配置运行960×3次 | 无业务用途 | 硬门、稳定性、负载和成本通过 |
| 影子运行 | 1,200个合格对象 | 结果隐藏且无操作 | 分布覆盖不低于95%;关键失败为0 |
| 5%小流量 | 600个低风险草稿或提取对象 | 强制复核 | 任务通过率不低于离线下限;队列安全 |
| 受控20% | 2,400个对象 | 按通道规定由人工发布 | 编辑时间、成本与服务目标在预算内 |
| 有界50% | 6,000个对象 | 不增加数据或操作范围 | 连续2个业务周期通过;回退演练通过 |
推广分母包含策略拒绝、超时、重试、人工拒绝和手动完成。若5% 群组只有熟练用户、20%加入新区域后质量下降,不将前者外推全员;按区域、语言、输入长度和产品族查看。业务结果如首次解决率只在有可信归因时用,不把季节变化算模型提升。
一次回退演练关闭C客服端点,600个在途/排队对象中410转已准入B、126继续人工、64超过时限取消并通知;没有请求转到资料不允许的候选。恢复后核对每个业务对象只有一个最终发送状态,重复发送为0。模型备用通过不是连续性完成,应用状态和人工容量也必须演练。
30天通过只扩大已测试通道与队列,不自动增加客户资料、工具动作或地区。若人工修改时间没有下降,即使质量合格也可以停止商业扩张;若业务有价值但容量不足,就保持小范围并处理资源问题,不能降低关键门。
上线后的版本、提示、检索和业务分布都可能漂移,准入卡必须有触发式复评
模型负责人每月查看任务通过率、严重失败、翻转代理、人工编辑与拒绝、策略拒绝、超时、95与99分位延迟、尝试与结果、完全成本和切片分布;季度复核不等于机械重跑全部,应优先由风险和变化触发。新模型名不是唯一变化:系统提示词、少量示例、检索索引、光学字符识别、结构验证器、量化、软件开发工具包、额度和供应商安全设置都会改变被测系统。
| 触发 | 最小响应 | 完全重跑条件 |
|---|---|---|
| 供应商模型或版本变更 | 冻结模型编号;小流量对照旧版与新版 | 无法证明兼容或关键切片变化 |
| 提示词、检索或结构变更 | 运行受影响回归集 | 输出契约或证据路径改变 |
| 新产品、语言或数据类别 | 先标记为超出范围 | 扩大任务或资料边界前 |
| 通过率或编辑率偏移超出控制限 | 抽样故障案例 | 严重失败或多个切片持续偏移 |
| 延迟或成本阶跃变化 | 重跑负载与对账 | 路由、容量或计费单位改变 |
| 安全或合同故障 | 停止受影响通道 | 边界控制已经变更 |
| 评审员评分标准变更 | 版本标签;桥接样本 | 历史趋势不可比较 |
准入卡有效期90天只是最长复核提醒,触发事件可立即失效。更新时保留旧/新并行窗口、固定桥接案例和回滚;不能让供应商自动升级覆盖旧版本后才发现。无法长期固定版本的服务用连续金丝雀和更窄范围补偿,但高后果任务可能仍不接受。
漂移告警不直接断言模型变差。人群/输入变化、来源质量、应用缺陷、人工标准改变和日志缺失都可能造成指标偏移;调查包关联业务对象、输入/配置/模型/评分标准版本和最终人类结果。只有找到边界内的原因,才能决定修资料、提示、模型、流程或培训。
退役也是选择的一部分。没有消费者的候选移出注册表,撤凭证、容量和合同,保留必要评估/决策记录并按规则删除内容;回退若12个月未演练,不因名义存在继续算连续性。新增候选必须击败现有组合的实际缺口,不为追逐榜单频繁制造迁移。
交付模型选择证据包:让下一次采购、路由和变更能复算同一决定
| 产物/模板 | 最小字段 |
|---|---|
| 任务选择合同 | 输入、输出、关键失败、动作、基线、放行门与负责人 |
| 候选配置清单 | 模型、端点、区域、提示词、工具、参数、适配器与哈希 |
| 数据边界矩阵 | 任务×数据×候选项,以及允许、拒绝、证据与到期 |
| 评估清单 | 案例、切片、输入版本、预期、关键标签与权限 |
| 运行账本 | 案例、配置、重复、尝试、状态、时序、成本与输出指针 |
| 评分标准与裁决日志 | 检查、评审员、异议、改判与最终裁决 |
| 稳定性与负载报告 | 翻转、超时、中位数、95与99分位、吞吐和负载形态 |
| 有效成本模型 | 尝试次数、质量、评审、返工、修复与数量敏感度 |
| 准入卡 | 允许范围、版本、放行门、人工、回退与到期 |
| 采购验收 | 条款、容量、日志、变更、支持与退出证据 |
| 影子与小流量计划 | 队列、发布、分母、推广与回滚 |
| 变更与退役记录 | 触发、旧新桥接、决策、撤销与删除 |
NIST人工智能风险管理框架的测量部分强调,组织应记录测试、评估、验证与确认的方法和指标,并根据部署环境评估表现与风险;NIST生成式人工智能画像也把生成式AI放回治理、映射、测量与管理过程。本文据此强调情境化、可记录和持续复评,但虚构门槛不是NIST规定。斯坦福整体语言模型评估项目(HELM)公开说明其目标包括广泛覆盖、承认未覆盖范围和多指标测量,支持“不用单一准确率代表全部场景”的论点;它的具体排行榜不能替代锐川案例。MLCommons的MLPerf推理资料区分首个词元延迟、逐词元延迟、吞吐和负载场景,支持性能要按工作负载协议测量。所有来源核验于2026-07-21。
- NIST:AI Risk Management Framework 1.0
- NIST:Generative AI Profile,NIST AI 600-1
- NIST AIRC:AI RMF Playbook
- Stanford CRFM:Holistic Evaluation of Language Models
- Stanford CRFM:HELM Classic的覆盖与多指标说明
- MLCommons:MLPerf Inference LLM的TTFT、TPOT与server负载
今天先选一个已获授权、结果可人工拦截的真实任务,写完任务选择合同和数据边界矩阵;从公开信息只筛4个候选,冻结可交付配置,再让独立评估负责人用带正常、边缘、严重和扰动切片的留置运行三次。先看资料与关键错误硬门,再看稳定、尾延迟和每千个合格结果成本。最终只签发带范围、人工发布、回退、证据日期和过期的准入卡,不签“全公司最佳模型”。