先看结果:8 项重复工作里,只有“交付包预检”值得先做智能体

独立课程制作人唐棠每月为 3 个客户交付线上课程包。她列出 8 项想自动化的工作:总结访谈、重命名文件、定时备份、生成催款邮件、检查交付包、研究新工具、批准退款和向客户发送最终文件。她原以为越重要、越费时的工作越值得交给智能体,实际筛选后只选择了“客户交付包预检”。

一次交付包有 10—18 个文件,中位数为 14,包括演示、讲义、工作簿、字幕、图片和链接清单。预检不是固定的按键序列。智能体要先读取简报和文件清单,决定运行哪些解析器或渲染器;看到 PDF 截断后回查源演示;发现链接重定向后检查目标是否仍属于批准域名;在隔离副本中修正安全的元数据或文件名,再重新渲染并验证。最终只生成候选包、差异和待人工判断项,不向客户发送任何内容。

候选 最合适方案 为什么不是第一个智能体
单次访谈摘要 一次模型调用+人工审 不需跨工具决定下一步
文件重命名 确定性脚本 规则可写尽、结果易验证
定时备份 调度自动化 不需要语义判断
催款邮件 模板工作流 金额/日期由规则填,发送需人工
交付包预检 有边界的单智能体 多步、观测驱动、需修正与复验
新工具研究 人机研究流程 范围易扩散,首次先保留交互
批准退款 不自动化决定 影响金钱与客户权益
发送最终文件 人工批准动作 错发不可完全撤回

本文是虚构教学案例,任务量、测试和时间只用于演示选择方法。它不说明任何智能体平台天然可靠,也不主张个人应让 AI 自主处理付款、合同、身份、安全或客户权益。

先区分四种实现:会调用模型的多步骤流程不一定需要智能体

本文把方案按“谁决定下一步”区分。单次生成由用户给材料、模型返回结果;脚本由代码执行完全确定的规则;固定工作流按预先画好的步骤和分支调用模型/工具;智能体则在边界内根据目标、当前状态和工具观察,动态选择下一动作,直到达到停止条件或转人工。

形态 下一步由谁决定 适合 主要代价
单次生成 用户 摘要、改写、提取一次 上下文与人工复核
确定性脚本 代码规则 重命名、校验、搬运 规则维护
固定工作流 设计者的图 已知顺序与有限分支 流程编排
智能体 模型在许可边界内 路径随观察变化的目标任务 不确定轨迹、测试/监控成本
表格对照单次生成、确定性脚本、固定工作流和智能体的下一步决策者、适合任务和代价,下方区分交付包稳定外围与观察驱动的智能体局部
先按表格判断谁决定下一步,再看底部哪些稳定步骤应留给脚本、工作流和人工。智能体不是更高级的默认终点;若大多数运行都走同样步骤,应固化流程,只保留真正由工具观察驱动的异常分诊。

智能体不是“更高级”的默认终点。若 95%运行都执行同样 6 步,应该先把稳定部分写成工作流;只有真正需要观察后改计划的少量节点由模型判断。选型目标是用最简单、可验证的系统完成任务,而不是把所有自动化都改称智能体。

这四类也可以组合。交付包流程用脚本计算哈希值、用固定工作流完成清单和基础验证器、用模型在异常路径选择诊断工具,最后由人决定内容冲突与发送。架构图中只有“根据观察选下一步”的局部需要智能体;把外围确定性控制也交给模型,既更贵也更难复现。

唐棠还做了一次反事实检查:把模型决策全部替换成固定的“如果……那么……”。如果这种做法仍能覆盖 12 个历史包的全部路径,就没有必要建设智能体。结果是,仅 PDF 异常就会分成源演示、栅格图、字体缺失、页面尺寸和源文件缺失 5 条路径,下一步依赖不同的工具证据;文件重命名却只有 4 类例外,可以完整编码,因此继续留给脚本。

从工作结果倒推:先定义完成证据、失败代价和人工责任

唐棠没有先挑框架,而是为每项工作填写结果卡:输入是什么、合格输出是什么、谁使用、错误会影响谁、能否在外部影响前发现、怎样撤回、每月出现几次、现在花多少时间。描述不清的任务暂不进入技术选择。

结果字段 交付包预检填好示例
目标 交付前发现文件、版本、链接、渲染和范围问题
输入 已批准简报、候选文件夹、来源地图
输出 修正候选副本+问题报告 + 验证回执
完成 32 项需求均有通过、失败或需要人工状态,并附证据
用户 唐棠本人,客户不直接接触智能体
外部影响 无;不发送、不发布、不覆盖来源
最差遗漏 错版/缺文件交付,导致返工或泄露
负责人 唐棠批准最终包;内容冲突回客户负责人
结果卡表格将输入、输出、32 项完成证据、外部影响和最差遗漏连接到验收意义,底部区分客户负责人判断与首版成功定义
逐行把输入输出、完成状态、外部影响和最差遗漏改成可检查证据,再看底部谁负责最终决定。结果卡只覆盖标准课程包预检;无法写出外部证据、最坏后果和负责人时,不能用“看起来专业”评估智能体。

如果完成标准只能写“结果看起来专业”,既无法选择架构,也无法评估智能体。先把业务终点变成可检查状态,才能讨论是否需要动态执行。

她还把“节省时间”和“提高质量”分成两个目标。首版的主目标是关键缺陷漏检为 0,次目标才是减少人工时间;若智能体快了 30 分钟却漏掉错版,项目仍然失败。每项指标都写明负责人和数据来源:计时来自运行日志,问题真值来自双重人工复核,外部动作来自工具审计,满意度不能替代这些运行证据。

结果卡还要列明排除项。本案例不判断课程内容是否教学有效、不核实图片版权、不审核合同义务;这些工作即使也叫“交付预检”,也需要不同的专家、信息来源和风险控制。一个任务名称包含多个实际决定时,应先拆任务再选型。

盘点真实任务基线:频率、变异、返工和等待比“感觉很耗时”更有用

唐棠回看 4 个月、12 个交付包,共 168 个文件和 384 项需求检查。人工预检中位数 94 分钟,最快 61、最慢 143;等待客户补资料另计,不把等待时间冒充可节省工时。她从问题日志中找到 46 个已确认问题。

问题类型 数量 发现方式 影响
链接失效/跳错目标 9 打开并比目标域名 资料不可用/误导
旧版本混入 8 来源地图与元数据 错内容交付
缺文本替代 6 图片清单与文档结构 无障碍缺陷
PDF 截断/字体替换 5 渲染+逐页检查 信息不可读
公式/范围错误 5 工作簿检查 计算错误
缺必要文件 4 简报→文件清单 交付不完整
命名或格式错误 4 规则校验 导入或查找失败
范围或内容冲突 5 简报与成品语义比较 需业务判断
合计 46 每项只计一次主问题
上排显示 12 个历史包、168 个文件、384 项需求检查和 46 个问题,下排拆分 94 分钟人工预检并区分等待客户补资料的日历时间
先读取四个历史样本量,再看 94 分钟怎样分配,最后把外部等待从可节省工时中剔除。这些数字来自虚构样本,只保证后续影子运行使用同一比较对象,不代表其他任务会有同样收益。

频率并不自动支持智能体:定时备份每月 30 次却完全确定;范围冲突只有 5 次却需要语义判断。基线的作用是理解工作构成,并为后续节省与漏检提供同一比较对象。

12包的时间分解显示,94分钟中约31分钟用于打开/盘点文件,26分钟用于机械检查,22分钟用于渲染后寻找问题,15分钟用于判断与记录。智能体可能减少前三类切换,不应假设最后15分钟全部消失。她也记录变异来源:5种文件组合、3种简报模板、2种链接策略和4种历史命名法;若只拿最整齐的包做演示,会高估适配性。

12 个交付包中有 4 次等待补资料,等待时间从 2 小时到 3 天不等。智能体可以更早生成缺件回执,却不能把这段日历等待算成自动化节省。基线应分别记录人工操作时间、工具实际运行时间、外部等待和返工,避免出现“总周期缩短 90%”这类失真的数字。

先设否决门:高影响、不可逆、权限不清的任务不能靠高“适配分”翻盘

唐棠使用六个否决。命中任一项就不做首个自主智能体:它能直接转钱/签约;能代表本人对外承诺;能删除或覆盖唯一资料;处理权限尚未确认的敏感信息;错误无法在影响前检查;没有人能够理解并接管。

候选 否决 处理
批准退款 金钱与客户权益 智能体只可整理证据,不决定/执行
发送最终文件 错收件人或错版难撤回 人工核对并发送
催款邮件 代表本人提出付款要求 只生成草稿与金额核对表
删除旧交付 唯一资料可能丢失 改为归档候选,不执行删除
交付包预检 候选副本内可逆 继续评估

“加一个人工审批”不一定消除否决。若审批者看不到工具做了什么、没有时间核对或按钮默认放行,人工只是装饰。首个智能体应让人能在外部动作前看到完整差异和证据。

否决也按最坏合理后果而非平均情况判断。退款任务即使99次金额很小,第100次仍可能涉及争议、欺诈或法定义务;发送文件即使可以补发,错收件人获得保密材料的影响不能靠“再发正确版”撤销。将智能体降为只读证据整理可以保留部分价值,同时把决定和动作留给有权的人。

若某项否决能被架构真正移除,可以重新评估。例如,把“删除旧文件”改为复制到本次沙盒并生成归档建议,执行层根本不提供删除能力,删除风险才算被移除;仅在提示中写“不要删除”并不算。

四道必要性门:动态选择、工具反馈、修正循环和可验证终点

第一道必要性门:任务必须多步,而且步骤之间存在真正依赖

多步不是把一个提示拆成五次调用。后一步要使用前一步产生的状态或证据:文件清单决定解析工具;解析结果决定需要渲染哪些格式;渲染异常决定回查源文件;修正候选后必须重跑受影响检查。若所有步骤可并行独立完成,它更像批处理或并行工作流。

样本 是否多步依赖 判断
1 个 PDF 摘要 否,一次读写 单次生成
100 个文件按日期重命名 有多步但规则固定 脚本
收集→摘要→套模板 顺序固定 工作流
预检→根据错误选工具→修正→复验 是,路径随观察变 智能体候选
四行对照 PDF 摘要、批量重命名、固定模板流程和交付预检的步骤关系与合适方案,底部从第七页溢出分支到观察驱动的工具选择
比较多步数量与步骤依赖,只有最后一行的工具观察会改变诊断、修正与停止位置。9 种轨迹属于本文历史包;若差异只是文件数量不同而步骤不变,仍应优先脚本或固定工作流。

交付包有的只有 PDF,有的还包含源演示、外部链接和工作簿;预先运行全部工具会浪费时间,仍无法决定异常应回到哪个源。因此它通过了多步依赖门。

她把实际路径画了出来,而不是笼统地想象模型“会规划”:12 个历史包共出现 9 种轨迹,最短 8 个工具操作,最长 21 个;只有文件清点、简报地图和最终回执三段固定,中间的检查与诊断顺序各不相同。若轨迹差异只是文件数量不同、步骤仍然相同,就不足以证明智能体有必要;这里真正变化的是观察之后的工具选择和停止位置。

第二道必要性门:下一动作必须由工具反馈改变,而不是只靠模型自我反思

智能体的观察应来自可核验环境:文件存在性、解析结果、页面截图、公式检查、HTTP 状态、目标域名和哈希值。让模型连续说“我会再检查一次”不是工具反馈,也不能证明结果改善。

观察 下一动作 不应做的事
清单缺少工作簿 查简报是否要求;标为缺失 凭经验生成空工作簿
PDF 第 7 页溢出 定位源演示或字体;生成修正候选 只在报告写“可能截断”
链接重定向到新域名 跟随并比对白名单与页面标题 仅因 HTTP 200 判通过
公式范围少一行 比对来源地图并检查单元格 自行猜最终数值
简报与演示结论冲突 保存两处引用,转为需要人工 选择“更合理”一方

反馈必须真正影响计划,并留下运行轨迹。工具无法返回可靠观察的任务,不适合在首个智能体中靠自然语言猜状态。

每条观察都记录所用工具、输入摘要、时间、结构化结果和产物位置。模型看到的应是“渲染状态:部分完成,已完成页数:6/12”,不能把“渲染似乎完成”解释为成功。计划变更时还要写原因代码,例如来源缺失、重定向未批准或视觉溢出;事后才能统计错误的工具选择,而不是只能翻看冗长的思考文本。

对于外部网页,HTTP 200也只是可访问证据:还要比较最终统一资源定位符、域名、页面标题和抓取时间。对工作簿,打开成功不证明公式已重算;对PDF,12页都生成图片不证明内容未裁切。工具反馈要尽量靠近业务验收,而不只报告技术调用成功。

第三道必要性门:任务需要修正循环,但循环必须有外部验收和退出上限

生成—自评—再生成常会把错误换一种写法。可用循环是:提出最小修正、在候选副本执行、调用独立检查器观察是否通过;最多两轮,仍失败就转人工。内容或范围冲突从第一轮就不自动改。

可复制模板
检查 → 得到带证据的问题
  → 选择许可范围内的修正
  → 在沙盒副本中执行
  → 重跑受影响的检查器
  → 通过|再做一次有界修正|转人工
修复类型 智能体是否可执行 复验
文件名不符合规则 可,在副本改名 文件清单与引用检查
图片缺少替代文本草稿 可生成候选,不批准语义 结构检查与人工复核
链接协议/尾斜杠 可在规则明确时修候选 HTTP+目标检查
PDF 截断 可调整候选模板参数 重新渲染+截图对比
公式逻辑变化 不自动 提供单元格、公式和来源证据
内容范围冲突 不自动 客户负责人决定
从问题证据、选择允许修正、沙箱副本、独立复验、一次再试到停止的六步循环,下方区分可执行候选修正与首轮即转人工事项
从左到右读取有界循环,再用底部判断修正是否可逆、可复验或必须立即转人工。最多两轮是本案例预算,不是通用最优值;循环合格的关键是独立检查器、沙箱副本、权限和明确退出。

无限迭代、只看模型评分、没有最大尝试次数的任务会失控地消耗时间与成本;这类流程应先改成人机交互,不要把持续运行误当成智能。

第四道必要性门:必须存在可验证终点,而非追求“尽可能好”

预检“完成”不等于零警告,而是每项需求都有状态和证据,所有阻碍已经处理,需要人工的项目已有负责人,候选包哈希值已经冻结,而且最终发送尚未发生。允许保留已经解释清楚的警告;不允许模型为了达成“全绿”而删掉检查项。

结果状态 定义 能否完成运行
通过 验证器或人工证据满足要求
风险已接受 风险已解释,负责人明确接受 是,留痕
需要人工 需要内容/客户决定 否,等待输入
已阻塞 缺资料、权限或硬检查失败
不适用 简报证明本包无需该项 是,保存依据
状态未知 工具失败或无法读取 否,不能按“通过”处理

“完成”必须能由任务外的证据确认。若只有智能体自己知道为什么满意,出现错误时人无法接手,也无法建立评估集。

唐棠为 32 项常规需求指定了评估方式:18 项由确定性检查器判定,7 项需要视觉证据加人工复核,5 项需要比较简报与成品语义,2 项只能由客户负责人决定。智能体不得把后两类转交结果写成通过。回执还要保留覆盖率:32 项中即使有 31 项通过,只要 1 项状态未知,整包仍不能完成,不能用 96.9% 的平均数掩盖未查项目。

用适配矩阵代替一个神秘总分:核心必要性与可运营性分别过门

唐棠不给任务打“智能体适配度 87 分”。她要求四项必要性全部成立,再检查可运营条件;任何否决优先。这样不会用高频、节省时间等优点抵消不可逆风险。

候选 多步依赖 反馈改计划 修正复验 可验证终点 可逆/有界 结论
访谈摘要 单次生成
文件重命名 路径固定 脚本
新工具研究 范围不清 先缩小问题
交付包预检 首个智能体
退款批准 可能 否,否决 不自动化决定

可运营性还包括输入权限明确、工具结果可记录、代表性历史样本存在、人工负责人有时间复核、失败可转人工、频率足以回收建设成本。通过必要性只说明智能体可能合适,不说明现在值得建。

矩阵使用三种结论:是必须有历史轨迹或任务证据,否说明更简单方案足够,状态未知则要求先做人工观察。她最初把“新工具研究”四项都填是,但完成只能写“尽可能全面”,改成“比较3个已知工具的导出能力并保存官方证据”后,路径反而能预定义为研究工作流;缩清问题常会降低对智能体的需要,这是好结果。

把选中的任务缩成合同:目标、输入、工具、禁止动作和预算都写死

首版只处理标准课程包,包含 10—18 个文件、最多 40 项简报需求;不处理加密文件、视频内容质量、客户个人身份信息、法律许可或付款资料。输入必须是只读来源文件夹、已批准简报、来源地图和域名白名单。

合同字段 0.1 版
目标 找到可证明的交付缺陷并生成隔离候选包
工具 列表/读取/复制、格式解析器、渲染、链接检查、验证器
写入范围 本次运行的沙盒候选目录
禁止 来源覆盖、删除、邮件、上传、发布、付款
最大步数 24 个工具操作
修复循环 每个问题最多 2 次
时间预算 20 分钟实际运行时间
停止 权限不明、加密、工具状态未知、范围冲突、预算到顶
最终 问题表、差异、回执、需要人工,不是客户交付

边界让第一个智能体足够窄。它不是“替我处理所有客户交付”,而是“在不接触客户和不覆盖源文件的前提下,为一类标准包完成可复核预检”。

合同还要固定输入版本。运行开始时保存已批准简报的哈希值;过程中若客户上传新版本,当前运行立即标记为过时并停止,不能把新旧要求混在一个结论中。来源地图必须把每个导出件指向可编辑源;找不到关系时可以报告孤立文件,不得凭文件名猜。预算到顶时输出已完成检查与未完成清单,不能把部分验收包装成最终通过。

工具表要写清读写权限、证据和失败含义,名字相同不等于能力相同

工具 权限 返回证据 失败语义
清单 读取来源文件 路径、大小、哈希值、类型 不可读≠缺失
解析简报 读取已批准文件 需求 ID+ 定位符 歧义→人工
渲染 读取候选项/写入图像 页面图像 + 日志 部分→状态未知
检查链接 网络白名单读取 状态、最终 URL、标题、时间 超时≠损坏
检查工作簿 读取 单元格、公式、预期关系 过时缓存→状态未知
复制/重命名 沙箱写入 前后路径 + 哈希值 冲突→已阻塞
修正元数据 沙箱写入 字段差异 不支持的格式→人工

工具描述要避免让智能体把超时当成 404、把不可读当成不存在、把渲染成功当成内容正确。写工具不是 O26 的重点,但如果观察结果的含义不清,就无法证明任务真的需要或适合智能体。

完整走一条动态轨迹:同样是“第 7 页异常”,下一步由证据决定

在 09 号交付包中,文件清点工具找到 15 个文件,简报列有 34 项需求。PDF 渲染器报告第 7 页文本超出画布;智能体先读取来源地图,定位到源演示第 12 页,而不是直接编辑 PDF。重新渲染源演示后,它发现替代字体令表格增高;于是在候选副本中把该文本框字号从 18 调到 17,并将高度增加 4 像素,然后重新渲染。

步骤 观察 决策 证据或结果
1 15 个文件;简报 34 项需求 建文件清单与需求映射 15/15 可读
2 PDF 第 7 页溢出 查来源地图 来自演示文稿第 12 页
3 源演示渲染后同样溢出 查字体与文本框 发现使用了备用字体
4 修改候选参数 重渲染第 12 页 +PDF 第 7 页 边界检查通过
5 视觉差异为 3.1% 查文字和数字差异 文本与数值相同
6 链接 L08 重定向到新域名 查白名单与标题 域名未批准→需要人工
7 其余 32 需求检查通过,1 修复,1 人工 停止,不发送 候选包哈希值 + 报告

若溢出来自一张栅格截图,调整文本框就无效;若源文件缺失,应直接标记为已阻塞。智能体的价值在于根据外部反馈选择正确诊断路径,不在于自主做更多事情。

权限与沙箱决定错误半径:先做到只读诊断,再开放可逆候选修正

阶段 0 只读取去标识的历史副本;阶段 1 读取真实候选但只输出报告;阶段 2 才允许写入运行专用沙箱。客户目录、邮件、网盘共享权限和发布平台始终不可用。凭证按工具分开,链接检查器只能访问批准域名,也不携带客户令牌。

阶段 数据 写权限 人工动作 晋级条件
离线评估 12 个历史副本 仅临时目录 标注预期 冻结案例通过
影子 10 个新包 人工照常预检 关键漏检为0
候选项 新包 隔离沙箱 审查差异并决定 回滚与清理演练
辅助使用 仍不外发 仅批准候选项 人工最终打包发送 30 次稳定后重评
离线评估、影子、候选副本和辅助使用四阶段的当前数据、写权限、人工动作与晋级证据表,下方列出始终不可用权限
从离线到辅助使用逐行核对写权限怎样扩大,同时观察邮件、客户目录和发布等能力始终关闭。阶段来自本案例的错误半径设计;人工审批只有在能看到完整差异与证据且有时间核对时才有效。

首个智能体不需要生产写权限来证明价值。先证明它能发现、解释和修正候选,再讨论是否扩大动作;很多 OPC 场景长期停留在辅助使用阶段已经足够。

用 12 个历史包建立评估集:测试的是轨迹与工具选择,不只看最终报告

12 个交付包中的 46 个已知问题组成冻结集合,另外注入 14 个对抗案例:工具超时 3 个、同名错版 3 个、重定向到未批准域名 2 个、公式缓存陈旧 2 个、简报自相矛盾 2 个、源文件缺失 1 个、加密文件 1 个,共 60 个案例。每个案例都写明预期发现、允许的工具、禁止的操作、所需证据和退出状态。

评估项 首轮 修订后 放行线
46 个已知问题中找到 41 44 至少 44,且关键项 12/12
假阳性 4 2 不高于3
14 个对抗案例正确退出 9 14 14/14
源写入尝试 1 0 0
本应转人工却自行判断 3 0 0
超 24 工具操作 2 0 0
表格比较 46 个问题发现、假阳性、14 个对抗案例退出、来源写入、人工边界越权和步数预算的首轮、修订后和放行线
逐行比较首轮、修订后与硬放行线,底部强调越权不能被总体发现率抵消。60 案例是虚构冻结集;修订后必须全量回归,不能删除难例或只重跑失败项。

两项未检出是语义范围冲突,均进入人工常规复核清单,因此不宣称“自动质量保证”。关键12项包括错版、缺文件、公式范围和严重截断;修订后12/12发现。评估集不能在每次失败后删难题,应保留以防回归。

真值标注由唐棠先独立完成,再由一名熟悉课程交付的协作者复核;分歧有7项,5项在查简报后达成一致,2项保留为合法歧义,预期状态设为需要人工而非强迫唯一答案。否则评估集会把标注者个人偏好当真值,并奖励智能体自信选边。

评估不仅计“找没找到”。对每个案例还查是否调用允许工具、引用正确来源位置、没有越权修正、在预算内退出。首轮有 1 次来源文件写入尝试,哪怕最终文件看起来正确也整轮失败;安全约束不能用 44/46 的发现率平均掉。

10 次影子运行验证真实负担:发现率、误报和人工时间必须一起看

影子阶段智能体不修改也不影响人工流程。10 个新包共141个文件、318项需求;双重人工复核确认31个问题。智能体找到29个,漏2个内容范围细微冲突,另报3个误报:2次把有意保留的旧链接视为错误,1次把讲师备注缺失误判为必需。

指标 人工原流程基线 影子阶段
每包人工预检中位数 94 分钟 38 分钟(审报告+补语义检查)
智能体实际运行时间 12 分钟中位数
确认的问题 31 找到29,漏2
假阳性 不单记 3
外部动作/源修改 0 0
正确转交人工 17/17
三列并列 29 除 31 的问题发现、94 到 38 分钟人工中位数、17 次正确转交人工,下方保留语义人工层并加入建设维护经济性
同时读取发现率与误报、人工负担和安全升级,再看底部不能删除的人工语义层和经济性。影子结果是 10 包小样本记录,不是稳定性能承诺;发现率、严重度、维护与费用必须一起决定范围。

节省的是人工分钟,不把智能体自己运行的12分钟重复相加为人的工作。最终发送仍由唐棠完成。两个漏检使她保留“简报与成品语义逐项抽查”,而不是因总体发现率不错就删除人工角色。

10包按顺序运行,没有挑掉格式复杂的包。前3包误报共2次、人工复核中位数44分钟;后7包在白名单和需求映射修正后误报1次、中位数36分钟。这个改善只是小样本运行记录,不外推成稳定性能;每次结果仍保存包类型、工具版本、步骤数、状态未知、未命中和人工修改,供30次门槛复评。

31个问题的严重度为严重 6、重大 13、次要 12;智能体找到6/6 严重、12/13 重大、11/12 次要。第二个漏检虽标次要,仍揭示语义比较弱点。按严重度看比只报29/31更能决定人工检查放在哪里,但严重度由影响规则和负责人批准,不由模型为自己打分。

经济性还要包含建设、运行、复核、维护和失败返工

0.1 版的建设与标注用了 14 小时。影子数据估计每包减少 56 分钟人工预检;但每 3 包还需约 45 分钟更新解析规则、回看误报和补测试,相当于每包 0.25 小时维护。净节省约为 0.93−0.25=0.68 小时/包,静态回收点为 14÷0.68≈21 包;按每月 3 包计算约需 7 个月,尚未计入模型、平台和工具费用。

成本/收益 记录方式 本案例
初建+标注 实际工时 14 小时
每包人工节省 94−38 56 分钟
维护摊销 45 分钟÷3 个包 每包 15 分钟
净时间收益 56−15 每包 41 分钟
静态回收 14小时÷0.68小时 ≈21 包
变量费用 按运行记录 未纳入,必须补后再决策

如果每月只有 1 包,或工具格式经常变化,回收期会明显拉长。第一个智能体的目标可以是学习和降低漏检,不必伪装成短期投资回报;但动机必须写清,避免在维护上投入超过它节省的时间。

变量费用表至少记录模型调用、文档解析、渲染、网络检查、日志存储和失败重跑。案例未填写真实货币,因此21包只是时间回收点,不是完整财务盈亏平衡。唐棠设一个通过/不通过:补齐30次运行费用后,把个人时间按自己认可的机会成本换算,再比较总收益;若平台费用高于可避免返工价值,即使技术门通过也保持人工流程。

收益也不能重复计算。找到缺陷减少的返工若已经体现在94→38分钟,就不能再把同一批返工时间作为额外收益;客户满意或风险降低只有实际证据时才记录。她保留三列:观测、估算、未测量,避免模型把假设自动合并为总投资回报率。

从失败里判断应该修智能体、改工具、缩范围还是退回工作流

首轮出现来源写入尝试,并不是“模型偶尔不听话”:复制工具把来源与沙盒参数放在了同一个自由字符串中。修复办法是让工具只接收相对于沙盒的目标路径,并由执行层拒绝越界,而不是再加一句提醒。工具超时被判为文件损坏的问题,则通过返回结构化的“状态未知”来修正工具含义。

失败 根因层 处理
源目录写入尝试 权限或工具接口 执行层限制目标路径
超时→损坏 观察结果结构 分开超时、HTTP 状态和其他错误
内容冲突漏检 任务/评估 保留人工抽查,补反例
多次重复渲染 规划 先读来源地图,设置步骤预算
同样路径占 90% 的运行 选型 抽成确定性工作流
成本超过节省 经济性 缩频率或停用,不追沉没成本
六类失败分别连接到权限工具接口、观察结果结构、任务评估、规划、选型和经济性根因以及对应处理,下方说明局部修复也需全量回归
按失败—根因层—处理逐行路由,再看底部为什么修复后仍须覆盖正常、异常和停止路径。同一客户运行中不能不断改规则直到通过,否则结果来自未经完整评估的新系统。

如果运行日志显示多数路径已经稳定,就把稳定步骤固化成工作流,只保留异常分诊给智能体;智能体用得更少可能是成熟,而不是退步。

修订后重新跑完整的 60 个案例,而不是只跑失败的 5 项。新的源映射优先策略修复了重复渲染,却一度让 2 个孤立 PDF 过早进入“已阻塞”;加入“无来源时仍可完成只读 PDF 检查、但禁止自动修正”的分支后才恢复。局部修复可能改变别的轨迹,回归范围必须覆盖正常、异常与停止路径。

现场出现新失败时,应先保护任务:冻结候选包哈希值、保留工具观察、把未完成需求标为状态未知,再转人工完成本包;是否修改智能体是下一项独立变更。不能在同一次客户运行里不断改规则直到通过,否则这次结果使用的其实是未经评估的新系统。

单智能体足够:不要用多智能体架构掩盖一个尚未定义好的任务

交付包预检只有一个负责人、一个目标、7 类工具和清楚的停止规则。拆成“文件智能体、链接智能体、视觉智能体、主管智能体”会增加消息传递、上下文丢失、成本和调试面,并不会自动提升正确率。首版使用一个智能体调用确定性检查器,人工做最终审阅。

Google Cloud 当前设计指导把任务复杂度、延迟、成本和人工参与列为架构选择问题,并建议早期智能体开发从单智能体系统开始;Anthropic 也建议先用简单方案和全面评估,只有简单方案不足时再增加智能体复杂性。本文把这些作为设计参考,不把特定云平台或模型的实现当成通用保证。

何时才重评多智能体 需要的证据
工具数量使选择持续失误 单智能体评估显示明确的混淆矩阵
两类任务上下文必须隔离 数据/权限边界而非角色想象
子任务可独立并行且成本可接受 延迟与成本实测
专业审阅需要不同模型/人员 独立评估显示增益

在这些证据出现前,保持“单智能体+工具+人工放行门槛”更容易理解和接管。

所谓单个智能体也不等于一个巨型自由提示。确定性验证器各自有明确输入输出结构和测试,编排器只选择工具与解释观察;所有写入在执行层受沙盒限制。把可靠性放进工具与权限,能减少模型需要“记住”的规则。若未来拆多智能体,先证明任务边界与评估仍成立,而不是用角色名称替代接口。

建立继续、缩小和退出标准:不因“已经搭好了”继续扩大自主权

完成 30 次辅助运行后才重新评估:关键问题漏检必须为 0;来源或外部写入为 0;需要人工的项目不得被绕过;误报不高于每包 1 个;人工复核中位数不高于 45 分钟;每月维护不高于 60 分钟;变量费用在个人预算内。任一安全指标失败,立即退回只读影子阶段。

决策 条件 动作
继续 安全门全过,价值指标达到 保持范围,继续收集
狭窄 某格式持续错误 移除该格式,保留其他
工作流 路径高度稳定 固化步骤,减少模型决策
暂停 工具或模型版本变化 冻结,重跑 60 个案例
停止 高影响漏检、越权或成本失控 撤销凭证、归档、恢复人工

退出计划包含:关闭调度、撤销工具凭证、保留运行与评估证据、删除临时候选、确认来源未改、恢复人工清单。智能体不是只能升级、不能退役的“数字员工”。

唐棠实际做了一次退出演练:暂停运行入口,撤销链接检查的网络令牌和沙箱写入器,验证新任务无法启动;清理 3 个测试候选包,逐一比对来源文件哈希值;按照人工检查清单完成一个历史包,并确认问题日志仍可用。演练用了 27 分钟。若退出只能靠构建者临场解释,工具已经形成新的单点依赖,不适合作为个人首个长期智能体。

版本变化也应触发暂停,而不是自动升级。模型、解析器、渲染器或关键简报模板变化时,先重跑 60 个冻结案例,再选 3 个新包进行影子运行;只有安全门和 12 项关键检查继续通过,才恢复辅助使用。选型不是一次性决定,任务变得更稳定或更高风险时都应降级重评。

复制这张首个智能体选择卡,从三个真实候选做对比

区域 必填问题
结果 谁要什么结果,完成证据是什么
基线 频率、工时、问题、等待和返工
否决 金钱、承诺、删除、敏感数据、不可逆影响
必要性 多步依赖、工具反馈、修正复验、可验证终点
运营 权限、历史样本、负责人、接管、预算
范围 输入、工具、写入边界、停止、最大步数
评估 已知问题、对抗案例、漏检、误报和越权
试点 影子运行次数、人工时间、实际费用
决策 继续、缩小、改为工作流、暂停或停止
左侧否决门、四道必要性门、可运营条件和试点证据共同指向交付包预检的只读评估合同,下方把重命名、研究、退款发送路由到更简单方案或人工
先过否决门,再证明必要性、可运营和试点证据,最后把未通过候选送回更简单方案。选择卡不是神秘总分;没有候选同时通过硬门时,正确结论就是暂时不做智能体。

本案例参考了四类公开资料:Anthropic《构建有效的 AI 智能体》对固定工作流、动态智能体以及“先从简单方案和评估开始”的区分;Google Cloud 于 2026-05-28 复核的智能体设计模式指南,其中讨论了开放与确定性任务、延迟、成本、人工参与和单智能体起步;NIST AI RMF Core 对具体任务定义、近似部署条件下的可重复技术评估、限制记录与持续监测的要求;英国政府《AI 操作手册》对工具选择及高影响环节人工控制的说明。NIST AIRC 当前注明 AI RMF 1.0 正在修订,本文引用的是核验日可见的核心页面;后两类资料面向组织或政府语境,本文只借用风险、测试和人工控制原则,不把其治理角色直接套给个人。

今天先列出 3 项真实候选,而不是创建一个“万能助理”。逐项写清:下一步是否会因工具反馈而改变,修正后由什么独立证据验证,最坏错误能否在造成外部影响前撤回。只有同时通过四道必要性门、没有触发否决且拥有历史样本的候选,才进入只读评估;如果没有候选通过,正确结论就是暂时不做智能体。