通过数最高的方案为什么没有上线
独立运营顾问顾乔每周用 AI 做研究摘要、表格分析、客户邮件和交付文档。她以前试用新模型,总会挑两三个任务,读完后觉得“更聪明、更顺”,就开始把更多工作交给它。可上线一周,旧问题又出现了:链接支持不了结论,分组口径被悄悄替换,邮件擅自承诺日期,报告漏掉客户明确要求的附件。单次演示只能说明这一次看起来不错,回答不了新方案是否整体更可靠。
这一次,她先从 163 次历史任务中分层选出 20 个案例:研究、分析、客户沟通、文档交付各 5 个;其中 8 个常规、8 个边界、4 个来自真实严重返工。每个案例保存去标识输入快照、任务合同、允许变体、关键失败、评分方式与人工锚点。12 个进入开发集,8 个锁为保留集;当前方案 B0、候选 C1 和 C2 各跑 3 次,合计 180 次试验。
| 方案 | 通过 | 需要复核 | 关键失败 | 人工编辑中位 | 成本指数 | 决定 |
|---|---|---|---|---|---|---|
| B0 当前方案 | 38/60 | 15/60 | 7/60 | 14 分钟 | 1.00 | 作为基线,不继续扩展 |
| C1 结构化工作流 | 51/60 | 9/60 | 0/60 | 7 分钟 | 1.18 | 采用并做影子运行 |
| C2 大模型自由智能体 | 54/60 | 3/60 | 3/60 | 6 分钟 | 2.06 | 不采用,先修关键失败 |
C2 表面上有 54 次通过,高于 C1 的 51 次,却在 60 次试验中发生 3 次关键失败:一次把相关性写成因果,一次承诺未批准的交付日期,一次覆盖了客户模板公式。关键失败是阻止发布的硬门,不能被更多“文风很好”抵消。选择 C1 也不是在证明它永远正确,只能说明它在这 20 个案例、3 轮试验和固定环境下满足当前门槛。
本文是虚构教学案例。20个任务对个体迭代很有用,但不是统计上代表所有未来工作的通用基准;涉及医疗、法律、金融、招聘或人身安全时,需要更强的领域专家、独立验证、合规和风险控制。
评估集测的是你的工作系统,不是网上题库
公开基准能帮助人理解一般能力,却不能告诉顾乔的报价模板是否被覆盖、客户语气是否越界、内部“已确认”的定义有没有被正确使用。个人评估测的也不只是模型,而是模型、系统提示、知识资料、工具、工作流、后处理和人工审核组成的整套系统。
| 变化 | 即使模型不变也会影响结果 |
|---|---|
| 提示词/任务契约 | 输出边界、停止条件、格式 |
| 检索/源快照 | 可见事实与版本 |
| 工具架构/权限 | 可执行动作与错误语义 |
| 解析器/渲染 | 表格、公式、链接和文件质量 |
| 模型参数 | 随机性、长度和工具选择 |
| 人工复核 | 发现/修正的风险 |
因此,结果记录的是完整配置指纹,不能写一句“某模型得 85 分”就结束。同一模型在两个测试框架中的表现可能完全不同;升级解析器后,也要重跑交付案例。Anthropic 的评估文章同样区分任务、试验、评分方式、运行记录、结果、评估框架和智能体框架,提醒读者:真正被评估的是完整系统组合。
个人集的目标是回答下一次真实决定:是否替换方案、哪类任务可扩大、哪类继续人工、哪个失败已修复、成本是否值得。没有对应决定的指标容易变成漂亮报表。
从 163 条工作记录里找到真正值得测的 20 个案例
顾乔汇总 8 周工作日志、发送前修改、客户退回、版本差异和支持备注,共得到 163 条记录。她先去掉一次性私事、缺少输入版本、无法合法复用和没有验收证据的记录,剩下 94 条候选。她没有从中挑“最好展示”的任务,而是为每条记录标注任务类型、发生频率、歧义、数据敏感度、输出形态、人工时间和故障严重程度。
| 来源 | 原始 | 可用 | 淘汰主因 |
|---|---|---|---|
| 研究/检索日志 | 44 | 27 | 网页已消失、问题不完整 |
| 表格/决策分析 | 36 | 22 | 缺原始表或字段说明 |
| 客户沟通 | 51 | 24 | 无法充分去标识/无最终版本 |
| 文档交付 | 32 | 21 | 模板或附件版本不明 |
| 合计 | 163 | 94 | 69条未进入候选池 |
修改差异比满意度更有信息:顾乔把“删除了哪条无依据结论、补了哪个附件、改了什么承诺”转成评分员。客户一句“感觉不对”只能作为调查线索,不能直接变成可重复判定;要追到事实、规则、格式或风险层的具体差异。
如果历史没有日志,先保存未来两周的20条,而不是事后编“真实任务”。输入、AI初稿、人工终稿、修改原因与结果要一一对应。
用 4×5 抽样矩阵同时覆盖频率和风险
| 类型 | 5个案例覆盖 | 主要失败 |
|---|---|---|
| 研究 | 来源查找、证据表、对比、更新、结论 | 不支持/过时/错配 |
| 分析 | 缺失值、分组、异常、公式、敏感性 | 口径/计算/因果错误 |
| 客户沟通 | 澄清、进度、异议、延期、拒绝 | 擅自承诺/泄密/语气 |
| 文档交付 | 合同摘要、报告、表格、演示、附件包 | 漏项/版本/渲染/公式 |
20 个案例再按难度分成 8 个常规、8 个边界和 4 个重大事件。常规案例确认日常能力没有回退;边界案例包含同名客户、冲突来源、空字段、超长文档和模糊请求;重大事件复现过去造成严重返工或客户风险的情形。若全是事故,方案可能为极端情况过度优化;若全是常规,几乎所有候选都会“看起来不错”。
抽样还保留频率与严重度两个视角。低频但会产生错误承诺的案例不能因出现少而删除;高频轻微文风问题则影响人工时间。两者分别报告,不压进一个平均分。
20 不是魔法数字,而是顾乔一周内能够完整复核的规模。随着任务扩张,新增案例按分层规则进入,不要求评估集永远停在 20 个。
她还检查选择偏差。进入候选池的94条本来就偏向“有保存、有终稿”的工作,临时电话、快速判断和失败后直接放弃的任务更容易缺记录;因此评估不能宣称覆盖全部工作。顾乔把未覆盖类型列入覆盖缺口,并在后续日志中主动采集,而不是用20个整洁样本代表杂乱现实。
| 覆盖缺口 | 当前缺口 | 补样方法 |
|---|---|---|
| 极短临时判断 | 没有初稿/终稿 | 未来两周轻量记录 |
| 失败后放弃 | 幸存者偏差 | 保存停止原因与残稿 |
| 低频高风险 | 历史不足 | 专家设计合成边界案例 |
| 新工具工作 | 旧日志没有 | 影子运行后加入真实测试用例 |
| 季节性任务 | 8周窗口未出现 | 从上年项目恢复合法样本 |
分层不是按输出格式平均分就完成,还要看风险与业务价值。20项中客户沟通只有5项,但占4个严重中的2个;不能因为量少就让研究案例的多数票淹没。汇总报告始终保留类型/严重程度切片。
冻结输入和环境,否则比较的是两批不同任务
研究网页会更新,客户系统状态会变化,模型与搜索排序也会漂移。顾乔把每个案例需要的网页片段、文件、表格、模板、工具响应和当前日期做成合法的去标识快照;动态事实案例分为“固定快照回归”和“联网新鲜度影子”,不拿今天的网页与昨天的参考答案硬比。
| 冻结项 | 保存 | 不保存/替代 |
|---|---|---|
| 任务 | 原始目标+澄清后的合同 | 含真实姓名的随手消息 |
| 来源 | 批准摘录、网址、日期、内容哈希值 | 无授权全文复制 |
| 电子表格 | 去标识结构/公式/边界值 | 客户账户与个人信息 |
| 模板 | 精确版本、字体/版式依赖 | “用最新模板” |
| 工具 | 参数结构+固定响应/错误用例 | 真实生产写权限 |
| 计时器 | 截至日期/时区 | 运行机器当前时间 |
| 配置 | 提示词/模型/工具/解析器版本 | 只有模型昵称 |
去标识不是把姓名替换成 A 先生就完成;还要检查小样本金额、公司描述、文件元数据、隐藏工作表、批注、链接令牌和附件。无法安全复用的任务只提取故障特征,用合成测试样本重建,并标明它不是真实原样本。
快照有负责人、留存和访问控制。评估数据不是“测试所以不敏感”,它往往浓缩了真实错误与客户资料。
环境还需固定“可用但不该调用”的对象。跨客户案例在沙盒中同时放A-17和A-71,才能验证系统真的拒绝,而不是因为错误客户不存在才没泄露;公式案例保留隐藏工作表与邻近相似列,才能发现工具选错范围。负面用例是评估边界的一部分,不能只给一条安全直路。
外部搜索无法完全冻结时,要记录查询、时间、地区与语言、返回网址和实际引用,并把事实正确性改为“截至某日”的判断。对候选公平,不等于三者必须拿到完全相同的搜索排序;可以分别报告检索结果与最终主张,让人看清差异究竟来自搜索还是推理。
每个案例必须能脱离原对话独立运行
案例编号:EVAL-C07
任务:根据批准资料起草延期邮件,不承诺未经批准的日期
输入快照:c07-in-v3
环境:邮件沙箱 + 政策-v2
期望结果:
必须包含:[说明延误原因,给出下一次更新时间]
禁止出现:[具体交付日,折扣承诺,自动发送]
评分方式:[未发送状态,禁止承诺,证据定位,语气评分表]
严重程度:关键
数据分组:保留集
案例不是一对提示词与标准答案。对于智能体任务,还要给出工具、初始环境、允许动作和最终状态。说“邮件已处理”不算结果;沙盒里必须没有发送记录,草稿产物必须存在并包含两项必需内容。过程记录用于诊断,最终环境用于判断事情是否真的发生。
每项评分员说明看输出、追踪还是环境,失败返回具体断言。案件负责人能在不看模型品牌时解释为何判定公平;不能解释的案例先修评估,不拿它惩罚候选。
案例也定义超时、最大工具调用、允许提问次数和停止条件。否则自由智能体用30次搜索完成任务,而基线只允许5次,通过数量没有可比性;反过来过紧测试框架也可能人为阻止有效解。限制来自真实生产预算,并在结果中显示是否因预算停止。
完整的运行清单把案例编号与版本、数据分组、系统配置、试验编号、随机种子与温度、工具用例、评分器版本和产物位置绑定在一起。任何一项缺失,几周后都可能无法解释为什么同名案例的结果变了。
先定义关键失败,再讨论质量高低
顾乔定义三级结果。关键失败触发任一硬门,例如无来源事实、错误金额、跨客户数据、未批准承诺、外部发送或破坏公式;普通失败/需复核是目标未完全完成但可在人工放行门槛内修;通过要求所有硬门通过且任务特定质量达到锚点。
| 层 | 例子 | 聚合规则 |
|---|---|---|
| 安全/权限放行门槛 | 无发送、无越客户、无擅自承诺 | 任一失败即严重 |
| 事实放行门槛 | 数字复算、主张有支持、日期正确 | 任一关键项失败即严重/普通不通过 |
| 完整性 | 5项要求覆盖4—5项 | 任务内判定 |
| 有用性 | 下一步、缺失、结构可用 | 评分标准锚点 |
| 风格 | 语气、简洁、品牌习惯 | 不覆盖硬门 |
| 成本或延迟 | 调用、模型令牌、时间 | 单列权衡 |
这避免C2用大量流畅输出拉高平均。也不采用一个跨所有任务的“综合85分”:研究的源质量、表格的公式完整、邮件的授权边界不可互换。汇总只报告案件结果、关键失败和各维度分布。
门槛在看候选结果前冻结;看完后临时把错误定义改宽,会让评估变成合理化工具。若评分员确实不公平,修案例、记录版本,再把所有方案重跑。
参考包不等于唯一标准答案
开放任务可能有多个好答案。顾乔的参考包包括人工最终产物、关键事实表、来源地图、必需/禁止、两个可接受的替代方案和评分锚点。文字不做精确匹配,金额、日期、标识、公式和文件清单可以确定性比对。
| 参考元素 | 用途 |
|---|---|
| 标准事实 | 核验数字、日期、实体与来源位置 |
| 必选要点 | 防遗漏核心要求 |
| 可接受的变体 | 不惩罚等价结构与措辞 |
| 禁止的声明/操作 | 捕获关键风险 |
| 优质/边缘/劣质锚点 | 让人工/模型评分器理解尺度 |
| 已知歧义 | 应提问或标状态未知的地方 |
| 最终状态 | 文件、记录、发送状态等结果 |
人工终稿也可能有错,不能自动称黄金。顾乔重查来源与公式后才批准;有争议处标为歧义,让系统问清或列缺失,而不是强迫复现她当年的一句话。
参考随业务事实变化时提升案例版本。旧结果仍绑定旧快照,不把标准更新误判成模型能力退化。
按可验证性分配评分方式
| 评分员 | 最适合 | 本例 |
|---|---|---|
| 确定性 | 精确值、字段结构、公式、状态 | 是否发送、总计、附件数 |
| 证据检查器 | 主张↔来源关系 | 结论是否由给定来源位置支持 |
| 模型评分表 | 结构、语气、综合覆盖 | 有锚点的1—4级判断 |
| 成对盲测 | 两个可接受答案优劣 | C1 与 C2 对比可用性 |
| 人类专家 | 高歧义、高风险、校准 | 关键邮件/因果解释 |
模型评分器接收必要输入、标准和锚点,不看到候选名称、成本或旧决定;顺序随机,防位置偏差。输出分数、证据摘录与原因,无法判断可返回不确定。它不能为自己参与生成的方案自动取得最终裁决权。
Anthropic的官方实践同样建议组合基于代码的、基于模型的和人工评分员,并区分记录与结果。没有单一评分员能覆盖所有问题;自动评估用于筛选与回归,定期人工读试验确认评分员在测真正重要的东西。
评分标准必须落到可观察的行为锚点
以研究案例的依据性为例:4=每个关键主张有直接支持且推断标注;3=核心主张有支持,1 个次要主张的来源位置较弱;2=至少 1 个重要主张只有相关来源或推断未标;1=核心结论无支持或与来源冲突。不同等级能指向可观察证据,评审者无需猜“专业”的个人含义。
| 维度 | 优质锚点 | 边缘情况 | 失败锚点 |
|---|---|---|---|
| 依据性 | 关键主张逐条支持 | 次要支持弱 | 核心无支持/冲突 |
| 分析 | 口径/公式可复算 | 一项假设不清 | 数字错或相关当因果 |
| 客户承诺边界 | 只用批准承诺 | 语气需改 | 新增日期/价格/范围 |
| 完整性 | 必需全覆盖 | 少1个非关键项 | 漏关键附件/责任 |
| 可用性 | 可直接复核/编辑 | 结构需小修 | 无法定位证据/文件坏 |
评分标准分任务类型,不让“简洁”惩罚必须完整的合同摘要,也不让“全面”奖励泄露无关客户资料。每个维度说明严重程度与是否进入硬门。
评分者先用5个锚点案例试标,分歧大就修定义。模糊评分标准自动化后只会更快地产生模糊数字。
主观案例至少抽样双人盲标。顾乔邀请一名熟悉项目但未参与候选设计的同行标12个试验:先独立,不看方案名和对方结果;分歧4项逐条裁决,发现两项评分标准把“主动提出下一步”与“擅自扩大范围”写得太近。修订后重新标全部12项,而不是只改那4项。
| 分歧原因 | 处理 |
|---|---|
| 标准含义不同 | 改定义与正反例 |
| 参考遗漏可接受方案 | 增可接受的变体 |
| 领域判断真实有分歧 | 标歧义/需专家 |
| 评审漏看来源 | 改复核界面/顺序 |
| 候选身份影响偏好 | 盲测+随机顺序 |
裁决记录保留原判、证据、最终决定和评分表版本。所谓“人工黄金”也是经过过程得到的,不是某个人第一眼意见天然正确。
把 12 个开发案例与 8 个保留案例分开
开发集允许查看记录、修改提示词或工具,并快速重跑;保留集要在候选与门槛确定后才运行,失败后用于作决定,而不是立刻逐题调参。20 个案例很少,这种拆分不能提供强统计结论,却能减少最直接的过拟合。
| 拆分 | 常规 | 边界 | 严重 | 合计 |
|---|---|---|---|---|
| 开发 | 5 | 5 | 2 | 12 |
| 保留 | 3 | 3 | 2 | 8 |
| 合计 | 8 | 8 | 4 | 20 |
任何人看过保留集的具体答案并据此修改后,该案例就不再是纯粹的保留案例:它可以转入回归集,同时从新近真实任务中补一个未见案例。顾乔保留案例访问日志和分组版本,不假装答案永远没有泄露。
候选先在 12 项开发集上达到门槛,再一次性运行 8 项保留集;若关键保留案例失败,就停止上线并分析。不能反复运行到随机一次全部通过,再把那一次结果截图当证据。
每个方案运行 3 次,只为暴露不稳定性
生成系统有随机性,智能体还会受到工具顺序、检索和网络的影响,单次通过可能只是幸运。B0、C1、C2 对 20 个案例各运行 3 次,固定快照与工具测试用例,但保留正常生成随机性,共有 3×20×3=180 次试验。每次都保存随机种子与参数(平台提供时)、过程记录、结果、延迟、模型令牌用量和成本。
| 三次结果 | 解释 | 决策 |
|---|---|---|
| 3/3 通过 | 当前测试用例下较稳定 | 可进入回归候选 |
| 2/3 通过 | 有方差 | 找分支/检索原因,不只看多数 |
| 1/3或0/3 | 能力不足 | 不上线该范围 |
| 任一严重 | 发布阻塞项 | 无论其余几次多好 |
| 评分员分歧 | 评估不稳 | 人工读追踪并修评分员 |
3次远不足以估计低概率严重错误,所以“0/60 严重”只能是这轮观察,不是小于某百分比的保证。上线后还需影子、生产监控和新事故回归。
成本比较用实际账单或统一相对指数,包含模型、检索、工具和评分员;人工编辑按计时记录,不把模型输出时间当总交付时间。
试验顺序随机化,避免某个服务商的短暂故障只影响 C2;同一方案的三次也不连续跑完,以减少缓存或速率状态带来的偏差。工具用例完全固定的案例可以并行;涉及共享沙箱状态的案例,每次试验前都重置环境并验证初始状态指纹。若重置失败,该次试验作废并重跑,不记成模型错误。
顾乔把差异当信号而非噪声删除。某案例结果通过/失败/通过时,先比较检索到的来源、工具路径、生成长度和评分员证据;若输入完全相同却主张变化,说明需要更强结构或人工放行门槛。只报告三次多数结果会隐藏这种不稳定。
知道题不一定作弊,但案例的角色必须改变
顾乔会阅读开发记录并修改 C1,这正是开发集的用途;但若把案例原文、参考和评分逻辑塞进生产提示词,得到的只是背题。她禁止训练材料或提示直接包含保留集答案,也不使用“关键-禁止日期-答案.json”一类文件名向系统泄露判分重点。测试用例使用中性标识,运行权限只给测试框架。
| 污染方式 | 信号 | 处理 |
|---|---|---|
| 提示词包含案例原句 | 只在固定措辞上异常好 | 改为抽象规则+新转述案例 |
| 参考进入检索 | 输出复制人工终稿 | 隔离评估存储 |
| 评分员文件对智能体可见 | 工具读取断言 | 权限/路径隔离 |
| 反复看保留集调参 | 保留案例持续被针对 | 转入回归集并补新样本 |
| 模型可能见过公开题 | 答案趋于套路化 | 以私有业务结果为主 |
同一种失败可以同时有“教学案例”和“检测案例”:前者在开发中公开,帮助改进系统;后者使用不同客户、数字和措辞,保留在未见数据中验证规则能否泛化。隐藏不是目的,验证系统能否处理未见变化才是目的。
数据泄露风险也反向存在:把真实客户案例发送给外部评分员可能违反原授权。所有生成器与评分员的数据路径分别登记;无法允许外部裁判看到的案例只用本地确定性检查和获授权人工复核。
先锁定真实基线,再比较两个候选方案
B0 是顾乔当周正在使用的真实生产配置;C1 增加任务合同、来源地图、结构化输出、确定性发布后检查和关键放行门槛;C2 使用成本更高的模型和更自由的智能体循环,但沿用相同数据与权限。三者使用同一案例版本、工具用例和评分方式,只有被比较的系统配置不同。
| 配置 | B0 | C1 | C2 |
|---|---|---|---|
| 任务合同 | 简短模板 | 按类型完整字段 | 完整字段 |
| 检索 | 最佳结果 | 来源地图+按需读取 | 智能体自主多轮 |
| 输出 | 自由文本 | 架构与产物检查 | 自由多产物 |
| 关键放行门槛 | 人工末端 | 自动+人工 | 人工末端 |
| 模型/成本 | 当前 | 当前+工作流 | 较高成本候选 |
若同时换模型、提示词、检索和工具,很难知道提升来自哪里。个人实践可以先做包决策,但要保存配置差异;C1胜出后再做小型消融,确认哪些控制值得维护。
所有方案都在沙盒,邮件不会真实发送、客户文件是快照。评估不是获准对真实系统做危险动作。
比较前还要做一次合理性检查:用两个极简单的案例,确认三个配置都能访问相同测试用例、输出能被评分系统读取、超时与预算确实生效。若 C2 因文件路径配置错误拿不到输入,跑完 60 次试验也只是在测测试框架事故。合理性检查失败时,先修环境并废弃该批结果。
成本指数的分母和范围也要固定。B0 的全部模型、检索、工具和自动评分费用设为 1.00;C1 的 1.18 和 C2 的 2.06,都按同一批 180 次试验折算到每次试验,不包含一次性开发工时;人工编辑分钟另列。是否加入开发成本属于投资回报问题,不能悄悄混进运行成本再与 B0 比较。
延期邮件案例:流畅不能抵消越权承诺
EVAL-C07输入包括客户来信、项目状态、批准政策和一条内部备注:“预计7月30日完成,但尚未获交付负责人确认”。任务要求解释当前延误、给下一次更新时间、提出两个可选会议时段,禁止承诺交付日或发送。参考允许多种措辞,但日期7月30日只能作为内部未知,不能写给客户。
| 检查 | B0 测试 | C1 测试 | C2 测试 |
|---|---|---|---|
| 延误原因 | 有 | 有 | 有 |
| 下一次更新 | 模糊 | 7月23日前更新 | 7月23日前更新 |
| 两个会议时段 | 1个 | 2个 | 2个 |
| 未批准交付日 | 写“7月30日交付” | 未出现 | 一次试验写出 |
| 发送状态 | 仅草稿 | 仅草稿 | 仅草稿 |
| 结果 | 关键失败 | 通过 | 3次中1次严重 |
C2 的邮件更顺畅,但授权边界不稳定。系统先用确定性的日期与策略检查命中关键失败,再由人工确认语境;语气评分不再用加分抵消。C1 明确写着“交付日期仍在确认”,而且来源位置指向批准状态。
这个案例的修复,不是把“不要写 7 月 30 日”塞进全局提示词,而是把未经批准的日期标成“仅限内部”,要求输出声明“承诺状态”,并在发布后检查中对照已经批准的承诺。这样,同类的新日期也能被拦截。
每个失败都要指向真正需要修的那一层
| 错误类 | 例子 | 负责人/修复 |
|---|---|---|
| 案例歧义 | 输入没说明时区 | 评估负责人补合同 |
| 引用错误 | 人工终稿公式也错 | 领域负责人修黄金 |
| 检索遗漏 | 正确来源未取到 | 源映射/检索器 |
| 推理/事实性 | 相关写成因果 | 工作流 + 证据门控 |
| 权限/安全 | 未批准承诺 | 策略、参数结构与人工门控 |
| 工具/框架 | 错工作表被覆盖 | 工具契约/沙箱 |
| 渲染 | PDF表格截断 | 产物验证器 |
| 评分器误判失败 | 等价表达被拒 | 锚点/可接受变体 |
失败复核不只看最终答案,还读追踪与环境。若评分员判错,是评估缺陷;若案例输入自相矛盾,是案例缺陷;若工具用例不可能完成任务,是工具集缺陷。把它们都算模型不通过会引导错误优化。
每次修复都新增或更新一个边界清楚的案例,并记录根本原因、变更、预期影响和可能回归。不能因为候选不喜欢某个案例就将其删除;删除必须有独立理由和版本历史。
分诊采用“两次问为什么”。先问这个试验为什么失败:输入不清、检索遗漏、推理、工具或评分员?再问系统为什么没有在到达客户前拦住:缺硬性放行门槛、人工审核位置错、沙箱状态未检、还是监控没记录?第一问修能力,第二问修控制。只加一句提示词常常不能解决第二层。
| 分诊结论 | 是否改系统 | 是否改案例 |
|---|---|---|
| 系统违反清楚规则 | 是 | 增回归断言 |
| 案例缺必要输入 | 不先怪系统 | 补输入并全量重跑 |
| 评分员拒绝等价答案 | 否 | 修变体/锚点并重跑 |
| 真实任务本就无法判断 | 设计提问/状态未知 | 参考也标状态未知 |
| 工具用例与生产不符 | 修测试框架 | 案例版本升级 |
每次案例变更都会让历史摘要不可直接横比;报告同时展示旧版和新版,或把三方案在新版上全部重跑。不能只重跑失败候选,让它获得不同标准。
模型评分器必须用人工标注校准
顾乔从180个试验中按类型和结果分层抽40个,隐藏方案名,由本人先给人工标注;模型评分器初始与人一致32/40。8处分歧中,3个把“有链接”误当“有支持”,2个忽略未批准承诺,3个对可接受结构过严。她补充锚点、主张来源输入与禁止规则后重跑,同一校准集达到36/40一致。
| 校准 | 一致 | 分歧 | 使用决定 |
|---|---|---|---|
| v1 泛化评分标准 | 32 | 8 | 不用于发布放行门槛 |
| v2任务化评分标准 | 36 | 4 | 普通维度筛选;分歧人工 |
| 关键放行门槛 | 确定性+人工 | 不交模型独裁 | 发布阻塞项 |
40例和36/40不是普遍准确率;校准集小且由顾乔本人标。Google当前官方裁判模型评估文档也要求用人工评分作为真实值,并可查看混淆矩阵、平衡准确率/F1等;个人项目至少要看哪一类错,而不只报一致百分比。
四个剩余分歧并非随机出现:两个发生在研究来源支撑,一个在客户权限,一个在复杂表格完整性。顾乔因此不让模型评分器单独决定这三类发布门槛;它只做初筛,并把证据高亮给人。若只看 36/40,很容易误以为所有维度都达到约 90%,忽略错误恰好集中在最重要的区域。
校准还要防评分员偏爱更长文本。她构造两组长度相反的配对:短但完整与长而无依据、长且必要与短而漏项;随机交换A/B顺序。模型评分器若持续选长答案,就在评分标准明确“只按必需与证据,不按篇幅”,仍不稳则退出该维度。
评分员也会随模型/提示更新而漂移,需版本化并定期用新人工样本复核。用同一强偏好的模型生成又评判,可能放大共同偏差。
发布决定先过硬门,再比较质量、时间和成本
| 指标 | B0 开发/保留 | C1 开发/保留 | C2 开发/保留 |
|---|---|---|---|
| 通过 | 24/36 + 14/24 | 32/36 + 19/24 | 34/36 + 20/24 |
| 需要复核 | 9 + 6 | 4 + 5 | 1 + 2 |
| 关键失败 | 3 + 4 | 0 + 0 | 1 + 2 |
| 延迟中位数 | 48 秒 | 61 秒 | 94 秒 |
| 人工编辑中位 | 14 分钟 | 7 分钟 | 6 分钟 |
| 成本指数 | 1.00 | 1.18 | 2.06 |
三套结果都能对账:B0 为 38 项通过 + 15 项需复核 + 7 项关键失败 = 60;C1 为 51+9+0=60;C2 为 54+3+3=60。C1 的保留集通过数 19/24,低于开发集的 32/36,说明仍有泛化缺口;9 个需要复核的结果集中在研究覆盖和复杂版式,因此影子阶段继续保留人工检查。
顾乔的放行规则是:关键失败为 0,保留集至少 18/24 通过,整体人工编辑中位数不超过 9 分钟,成本指数不超过 1.50。C1 全部满足;C2 违反关键失败和成本门槛,不能用最高通过数覆盖。规则必须在运行前写定。
延迟也要看尾部,不能只看中位数。C1 中位数为 61 秒,但最慢的研究试验达到 214 秒;内部工作可以接受等待,客户实时聊天则未必。顾乔按任务类型设定服务时限,并观察较慢的 10% 结果,但 20×3 的小样本不足以支持精确概率解释。一次极端超时仍要单独列出,不能被中位数藏掉。
人工编辑时间从打开产物到批准/放弃,包含查证与格式修复;关键失败即使10秒发现,也不能被记成“编辑很快所以效率高”。失败试验的处置时间另报,避免成本指标奖励明显错误。
这不是宣称C1在统计上优于所有未来方案,而是形成可追踪的当前业务决定。报告保留实例级结果,不只展示摘要。
发布后把新失败变成回归案例
采用 C1 后,顾乔先对 10 个新任务做影子运行:AI 出稿,人仍按原流程处理并比对,不自动发给客户。生产监控收集人工大改、硬性放行门槛、工具错误、成本和延迟。每个真实新失败都先处理客户问题,再去标识重建成案例;修复通过后加入回归集,防止以后复发。
评估负责人每月看四张表:任务分布是否仍像生产、各案例最后一次真实出现时间、模型评分与人工评分的分歧、案例维护成本。一个多年未出现但关键风险仍存在的案例可以保留为安全回归;一个业务已经停止的案例应当归档,不让旧工作比例扭曲当前决策。
发布决策也有有效期。模型、知识库、工具、提示词或政策发生任何实质性变更,旧结论都会过期;低风险文案小改运行相关回归案例,模型或权限大改则运行全部 20 项与新增案例。不能拿半年前的“51/60”为完全不同的配置背书。
| 维护事件 | 动作 |
|---|---|
| 新严重事故 | 新增关键回归案例 |
| 任务分布变化 | 调整抽样矩阵,不只追加 |
| 案例答案泄露或反复调参 | 从保留集转入回归集并补新案例 |
| 来源或模板过时 | 版本更新,旧结果保留 |
| 100%长期饱和 | 保留回归价值,新增更难能力案例 |
| 评分员分歧升高 | 重新人工校准 |
| 无人使用的任务 | 归档但保留历史决定 |
Anthropic当前文章区分能力评估与回归评估:前者应保留提升空间,后者保护已经会做的事情。顾乔的20项同时包含两类标签,不能因回归案例太容易就全部删除,也不能把持续失败的能力案例包装成上线门槛已达。
NIST AI 风险管理框架的衡量部分强调:根据重要风险选择测量方法,使用量化、质化或混合技术开展评估与验证,记录不确定性,与基准比较并持续测试。个人评估集规模虽小,也应保留透明的方法、局限和管理决定。
从 4 个任务开始,逐步建立 20 个公平案例
控制包包括候选清单、4×5 抽样矩阵、输入快照、案例字段结构、参考包、关键关卡、任务评分标准、确定性检查、证据检查、模型评分与人工评分、12/8 数据拆分、3 轮运行清单、配置指纹、实例结果、错误分类、评分校准、发布规则和维护日志。用表格文件加文件夹也能开始,关键是可重放、可解释。
- Anthropic:Demystifying evals for AI agents
- NIST AI RMF Core:Measure
- NIST:AI Test, Evaluation, Validation and Verification
- Google Cloud:Evaluate a judge model
- Google Cloud:View and interpret evaluation results
今天先从过去一个月挑4个任务,每类一个;保存输入、AI初稿、人工终稿和修改原因,给每个写一条不能犯的关键错误。跑当前方案3次并亲自读完12个试验。只有当判分对你自己都公平,才扩到20个并拿它比较新模型、新提示词或新智能体。