先看结果:8 项重复工作里,只有“交付包预检”值得先做智能体
独立课程制作人唐棠每月为 3 个客户交付线上课程包。她列出 8 项想自动化的工作:总结访谈、重命名文件、定时备份、生成催款邮件、检查交付包、研究新工具、批准退款和向客户发送最终文件。她原以为越重要、越费时的工作越值得交给智能体,实际筛选后只选择了“客户交付包预检”。
一次交付包有 10—18 个文件,中位数为 14,包括演示、讲义、工作簿、字幕、图片和链接清单。预检不是固定的按键序列。智能体要先读取简报和文件清单,决定运行哪些解析器或渲染器;看到 PDF 截断后回查源演示;发现链接重定向后检查目标是否仍属于批准域名;在隔离副本中修正安全的元数据或文件名,再重新渲染并验证。最终只生成候选包、差异和待人工判断项,不向客户发送任何内容。
| 候选 | 最合适方案 | 为什么不是第一个智能体 |
|---|---|---|
| 单次访谈摘要 | 一次模型调用+人工审 | 不需跨工具决定下一步 |
| 文件重命名 | 确定性脚本 | 规则可写尽、结果易验证 |
| 定时备份 | 调度自动化 | 不需要语义判断 |
| 催款邮件 | 模板工作流 | 金额/日期由规则填,发送需人工 |
| 交付包预检 | 有边界的单智能体 | 多步、观测驱动、需修正与复验 |
| 新工具研究 | 人机研究流程 | 范围易扩散,首次先保留交互 |
| 批准退款 | 不自动化决定 | 影响金钱与客户权益 |
| 发送最终文件 | 人工批准动作 | 错发不可完全撤回 |
本文是虚构教学案例,任务量、测试和时间只用于演示选择方法。它不说明任何智能体平台天然可靠,也不主张个人应让 AI 自主处理付款、合同、身份、安全或客户权益。
先区分四种实现:会调用模型的多步骤流程不一定需要智能体
本文把方案按“谁决定下一步”区分。单次生成由用户给材料、模型返回结果;脚本由代码执行完全确定的规则;固定工作流按预先画好的步骤和分支调用模型/工具;智能体则在边界内根据目标、当前状态和工具观察,动态选择下一动作,直到达到停止条件或转人工。
| 形态 | 下一步由谁决定 | 适合 | 主要代价 |
|---|---|---|---|
| 单次生成 | 用户 | 摘要、改写、提取一次 | 上下文与人工复核 |
| 确定性脚本 | 代码规则 | 重命名、校验、搬运 | 规则维护 |
| 固定工作流 | 设计者的图 | 已知顺序与有限分支 | 流程编排 |
| 智能体 | 模型在许可边界内 | 路径随观察变化的目标任务 | 不确定轨迹、测试/监控成本 |
智能体不是“更高级”的默认终点。若 95%运行都执行同样 6 步,应该先把稳定部分写成工作流;只有真正需要观察后改计划的少量节点由模型判断。选型目标是用最简单、可验证的系统完成任务,而不是把所有自动化都改称智能体。
这四类也可以组合。交付包流程用脚本计算哈希值、用固定工作流完成清单和基础验证器、用模型在异常路径选择诊断工具,最后由人决定内容冲突与发送。架构图中只有“根据观察选下一步”的局部需要智能体;把外围确定性控制也交给模型,既更贵也更难复现。
唐棠还做了一次反事实检查:把模型决策全部替换成固定的“如果……那么……”。如果这种做法仍能覆盖 12 个历史包的全部路径,就没有必要建设智能体。结果是,仅 PDF 异常就会分成源演示、栅格图、字体缺失、页面尺寸和源文件缺失 5 条路径,下一步依赖不同的工具证据;文件重命名却只有 4 类例外,可以完整编码,因此继续留给脚本。
从工作结果倒推:先定义完成证据、失败代价和人工责任
唐棠没有先挑框架,而是为每项工作填写结果卡:输入是什么、合格输出是什么、谁使用、错误会影响谁、能否在外部影响前发现、怎样撤回、每月出现几次、现在花多少时间。描述不清的任务暂不进入技术选择。
| 结果字段 | 交付包预检填好示例 |
|---|---|
| 目标 | 交付前发现文件、版本、链接、渲染和范围问题 |
| 输入 | 已批准简报、候选文件夹、来源地图 |
| 输出 | 修正候选副本+问题报告 + 验证回执 |
| 完成 | 32 项需求均有通过、失败或需要人工状态,并附证据 |
| 用户 | 唐棠本人,客户不直接接触智能体 |
| 外部影响 | 无;不发送、不发布、不覆盖来源 |
| 最差遗漏 | 错版/缺文件交付,导致返工或泄露 |
| 负责人 | 唐棠批准最终包;内容冲突回客户负责人 |
如果完成标准只能写“结果看起来专业”,既无法选择架构,也无法评估智能体。先把业务终点变成可检查状态,才能讨论是否需要动态执行。
她还把“节省时间”和“提高质量”分成两个目标。首版的主目标是关键缺陷漏检为 0,次目标才是减少人工时间;若智能体快了 30 分钟却漏掉错版,项目仍然失败。每项指标都写明负责人和数据来源:计时来自运行日志,问题真值来自双重人工复核,外部动作来自工具审计,满意度不能替代这些运行证据。
结果卡还要列明排除项。本案例不判断课程内容是否教学有效、不核实图片版权、不审核合同义务;这些工作即使也叫“交付预检”,也需要不同的专家、信息来源和风险控制。一个任务名称包含多个实际决定时,应先拆任务再选型。
盘点真实任务基线:频率、变异、返工和等待比“感觉很耗时”更有用
唐棠回看 4 个月、12 个交付包,共 168 个文件和 384 项需求检查。人工预检中位数 94 分钟,最快 61、最慢 143;等待客户补资料另计,不把等待时间冒充可节省工时。她从问题日志中找到 46 个已确认问题。
| 问题类型 | 数量 | 发现方式 | 影响 |
|---|---|---|---|
| 链接失效/跳错目标 | 9 | 打开并比目标域名 | 资料不可用/误导 |
| 旧版本混入 | 8 | 来源地图与元数据 | 错内容交付 |
| 缺文本替代 | 6 | 图片清单与文档结构 | 无障碍缺陷 |
| PDF 截断/字体替换 | 5 | 渲染+逐页检查 | 信息不可读 |
| 公式/范围错误 | 5 | 工作簿检查 | 计算错误 |
| 缺必要文件 | 4 | 简报→文件清单 | 交付不完整 |
| 命名或格式错误 | 4 | 规则校验 | 导入或查找失败 |
| 范围或内容冲突 | 5 | 简报与成品语义比较 | 需业务判断 |
| 合计 | 46 | 每项只计一次主问题 | — |
频率并不自动支持智能体:定时备份每月 30 次却完全确定;范围冲突只有 5 次却需要语义判断。基线的作用是理解工作构成,并为后续节省与漏检提供同一比较对象。
12包的时间分解显示,94分钟中约31分钟用于打开/盘点文件,26分钟用于机械检查,22分钟用于渲染后寻找问题,15分钟用于判断与记录。智能体可能减少前三类切换,不应假设最后15分钟全部消失。她也记录变异来源:5种文件组合、3种简报模板、2种链接策略和4种历史命名法;若只拿最整齐的包做演示,会高估适配性。
12 个交付包中有 4 次等待补资料,等待时间从 2 小时到 3 天不等。智能体可以更早生成缺件回执,却不能把这段日历等待算成自动化节省。基线应分别记录人工操作时间、工具实际运行时间、外部等待和返工,避免出现“总周期缩短 90%”这类失真的数字。
先设否决门:高影响、不可逆、权限不清的任务不能靠高“适配分”翻盘
唐棠使用六个否决。命中任一项就不做首个自主智能体:它能直接转钱/签约;能代表本人对外承诺;能删除或覆盖唯一资料;处理权限尚未确认的敏感信息;错误无法在影响前检查;没有人能够理解并接管。
| 候选 | 否决 | 处理 |
|---|---|---|
| 批准退款 | 金钱与客户权益 | 智能体只可整理证据,不决定/执行 |
| 发送最终文件 | 错收件人或错版难撤回 | 人工核对并发送 |
| 催款邮件 | 代表本人提出付款要求 | 只生成草稿与金额核对表 |
| 删除旧交付 | 唯一资料可能丢失 | 改为归档候选,不执行删除 |
| 交付包预检 | 候选副本内可逆 | 继续评估 |
“加一个人工审批”不一定消除否决。若审批者看不到工具做了什么、没有时间核对或按钮默认放行,人工只是装饰。首个智能体应让人能在外部动作前看到完整差异和证据。
否决也按最坏合理后果而非平均情况判断。退款任务即使99次金额很小,第100次仍可能涉及争议、欺诈或法定义务;发送文件即使可以补发,错收件人获得保密材料的影响不能靠“再发正确版”撤销。将智能体降为只读证据整理可以保留部分价值,同时把决定和动作留给有权的人。
若某项否决能被架构真正移除,可以重新评估。例如,把“删除旧文件”改为复制到本次沙盒并生成归档建议,执行层根本不提供删除能力,删除风险才算被移除;仅在提示中写“不要删除”并不算。
四道必要性门:动态选择、工具反馈、修正循环和可验证终点
第一道必要性门:任务必须多步,而且步骤之间存在真正依赖
多步不是把一个提示拆成五次调用。后一步要使用前一步产生的状态或证据:文件清单决定解析工具;解析结果决定需要渲染哪些格式;渲染异常决定回查源文件;修正候选后必须重跑受影响检查。若所有步骤可并行独立完成,它更像批处理或并行工作流。
| 样本 | 是否多步依赖 | 判断 |
|---|---|---|
| 1 个 PDF 摘要 | 否,一次读写 | 单次生成 |
| 100 个文件按日期重命名 | 有多步但规则固定 | 脚本 |
| 收集→摘要→套模板 | 顺序固定 | 工作流 |
| 预检→根据错误选工具→修正→复验 | 是,路径随观察变 | 智能体候选 |
交付包有的只有 PDF,有的还包含源演示、外部链接和工作簿;预先运行全部工具会浪费时间,仍无法决定异常应回到哪个源。因此它通过了多步依赖门。
她把实际路径画了出来,而不是笼统地想象模型“会规划”:12 个历史包共出现 9 种轨迹,最短 8 个工具操作,最长 21 个;只有文件清点、简报地图和最终回执三段固定,中间的检查与诊断顺序各不相同。若轨迹差异只是文件数量不同、步骤仍然相同,就不足以证明智能体有必要;这里真正变化的是观察之后的工具选择和停止位置。
第二道必要性门:下一动作必须由工具反馈改变,而不是只靠模型自我反思
智能体的观察应来自可核验环境:文件存在性、解析结果、页面截图、公式检查、HTTP 状态、目标域名和哈希值。让模型连续说“我会再检查一次”不是工具反馈,也不能证明结果改善。
| 观察 | 下一动作 | 不应做的事 |
|---|---|---|
| 清单缺少工作簿 | 查简报是否要求;标为缺失 | 凭经验生成空工作簿 |
| PDF 第 7 页溢出 | 定位源演示或字体;生成修正候选 | 只在报告写“可能截断” |
| 链接重定向到新域名 | 跟随并比对白名单与页面标题 | 仅因 HTTP 200 判通过 |
| 公式范围少一行 | 比对来源地图并检查单元格 | 自行猜最终数值 |
| 简报与演示结论冲突 | 保存两处引用,转为需要人工 | 选择“更合理”一方 |
反馈必须真正影响计划,并留下运行轨迹。工具无法返回可靠观察的任务,不适合在首个智能体中靠自然语言猜状态。
每条观察都记录所用工具、输入摘要、时间、结构化结果和产物位置。模型看到的应是“渲染状态:部分完成,已完成页数:6/12”,不能把“渲染似乎完成”解释为成功。计划变更时还要写原因代码,例如来源缺失、重定向未批准或视觉溢出;事后才能统计错误的工具选择,而不是只能翻看冗长的思考文本。
对于外部网页,HTTP 200也只是可访问证据:还要比较最终统一资源定位符、域名、页面标题和抓取时间。对工作簿,打开成功不证明公式已重算;对PDF,12页都生成图片不证明内容未裁切。工具反馈要尽量靠近业务验收,而不只报告技术调用成功。
第三道必要性门:任务需要修正循环,但循环必须有外部验收和退出上限
生成—自评—再生成常会把错误换一种写法。可用循环是:提出最小修正、在候选副本执行、调用独立检查器观察是否通过;最多两轮,仍失败就转人工。内容或范围冲突从第一轮就不自动改。
检查 → 得到带证据的问题
→ 选择许可范围内的修正
→ 在沙盒副本中执行
→ 重跑受影响的检查器
→ 通过|再做一次有界修正|转人工
| 修复类型 | 智能体是否可执行 | 复验 |
|---|---|---|
| 文件名不符合规则 | 可,在副本改名 | 文件清单与引用检查 |
| 图片缺少替代文本草稿 | 可生成候选,不批准语义 | 结构检查与人工复核 |
| 链接协议/尾斜杠 | 可在规则明确时修候选 | HTTP+目标检查 |
| PDF 截断 | 可调整候选模板参数 | 重新渲染+截图对比 |
| 公式逻辑变化 | 不自动 | 提供单元格、公式和来源证据 |
| 内容范围冲突 | 不自动 | 客户负责人决定 |
无限迭代、只看模型评分、没有最大尝试次数的任务会失控地消耗时间与成本;这类流程应先改成人机交互,不要把持续运行误当成智能。
第四道必要性门:必须存在可验证终点,而非追求“尽可能好”
预检“完成”不等于零警告,而是每项需求都有状态和证据,所有阻碍已经处理,需要人工的项目已有负责人,候选包哈希值已经冻结,而且最终发送尚未发生。允许保留已经解释清楚的警告;不允许模型为了达成“全绿”而删掉检查项。
| 结果状态 | 定义 | 能否完成运行 |
|---|---|---|
| 通过 | 验证器或人工证据满足要求 | 是 |
| 风险已接受 | 风险已解释,负责人明确接受 | 是,留痕 |
| 需要人工 | 需要内容/客户决定 | 否,等待输入 |
| 已阻塞 | 缺资料、权限或硬检查失败 | 否 |
| 不适用 | 简报证明本包无需该项 | 是,保存依据 |
| 状态未知 | 工具失败或无法读取 | 否,不能按“通过”处理 |
“完成”必须能由任务外的证据确认。若只有智能体自己知道为什么满意,出现错误时人无法接手,也无法建立评估集。
唐棠为 32 项常规需求指定了评估方式:18 项由确定性检查器判定,7 项需要视觉证据加人工复核,5 项需要比较简报与成品语义,2 项只能由客户负责人决定。智能体不得把后两类转交结果写成通过。回执还要保留覆盖率:32 项中即使有 31 项通过,只要 1 项状态未知,整包仍不能完成,不能用 96.9% 的平均数掩盖未查项目。
用适配矩阵代替一个神秘总分:核心必要性与可运营性分别过门
唐棠不给任务打“智能体适配度 87 分”。她要求四项必要性全部成立,再检查可运营条件;任何否决优先。这样不会用高频、节省时间等优点抵消不可逆风险。
| 候选 | 多步依赖 | 反馈改计划 | 修正复验 | 可验证终点 | 可逆/有界 | 结论 |
|---|---|---|---|---|---|---|
| 访谈摘要 | 否 | 否 | 弱 | 是 | 是 | 单次生成 |
| 文件重命名 | 是 | 路径固定 | 可 | 是 | 是 | 脚本 |
| 新工具研究 | 是 | 是 | 是 | 范围不清 | 是 | 先缩小问题 |
| 交付包预检 | 是 | 是 | 是 | 是 | 是 | 首个智能体 |
| 退款批准 | 是 | 是 | 可能 | 是 | 否,否决 | 不自动化决定 |
可运营性还包括输入权限明确、工具结果可记录、代表性历史样本存在、人工负责人有时间复核、失败可转人工、频率足以回收建设成本。通过必要性只说明智能体可能合适,不说明现在值得建。
矩阵使用三种结论:是必须有历史轨迹或任务证据,否说明更简单方案足够,状态未知则要求先做人工观察。她最初把“新工具研究”四项都填是,但完成只能写“尽可能全面”,改成“比较3个已知工具的导出能力并保存官方证据”后,路径反而能预定义为研究工作流;缩清问题常会降低对智能体的需要,这是好结果。
把选中的任务缩成合同:目标、输入、工具、禁止动作和预算都写死
首版只处理标准课程包,包含 10—18 个文件、最多 40 项简报需求;不处理加密文件、视频内容质量、客户个人身份信息、法律许可或付款资料。输入必须是只读来源文件夹、已批准简报、来源地图和域名白名单。
| 合同字段 | 0.1 版 |
|---|---|
| 目标 | 找到可证明的交付缺陷并生成隔离候选包 |
| 工具 | 列表/读取/复制、格式解析器、渲染、链接检查、验证器 |
| 写入范围 | 本次运行的沙盒候选目录 |
| 禁止 | 来源覆盖、删除、邮件、上传、发布、付款 |
| 最大步数 | 24 个工具操作 |
| 修复循环 | 每个问题最多 2 次 |
| 时间预算 | 20 分钟实际运行时间 |
| 停止 | 权限不明、加密、工具状态未知、范围冲突、预算到顶 |
| 最终 | 问题表、差异、回执、需要人工,不是客户交付 |
边界让第一个智能体足够窄。它不是“替我处理所有客户交付”,而是“在不接触客户和不覆盖源文件的前提下,为一类标准包完成可复核预检”。
合同还要固定输入版本。运行开始时保存已批准简报的哈希值;过程中若客户上传新版本,当前运行立即标记为过时并停止,不能把新旧要求混在一个结论中。来源地图必须把每个导出件指向可编辑源;找不到关系时可以报告孤立文件,不得凭文件名猜。预算到顶时输出已完成检查与未完成清单,不能把部分验收包装成最终通过。
工具表要写清读写权限、证据和失败含义,名字相同不等于能力相同
| 工具 | 权限 | 返回证据 | 失败语义 |
|---|---|---|---|
| 清单 | 读取来源文件 | 路径、大小、哈希值、类型 | 不可读≠缺失 |
| 解析简报 | 读取已批准文件 | 需求 ID+ 定位符 | 歧义→人工 |
| 渲染 | 读取候选项/写入图像 | 页面图像 + 日志 | 部分→状态未知 |
| 检查链接 | 网络白名单读取 | 状态、最终 URL、标题、时间 | 超时≠损坏 |
| 检查工作簿 | 读取 | 单元格、公式、预期关系 | 过时缓存→状态未知 |
| 复制/重命名 | 沙箱写入 | 前后路径 + 哈希值 | 冲突→已阻塞 |
| 修正元数据 | 沙箱写入 | 字段差异 | 不支持的格式→人工 |
工具描述要避免让智能体把超时当成 404、把不可读当成不存在、把渲染成功当成内容正确。写工具不是 O26 的重点,但如果观察结果的含义不清,就无法证明任务真的需要或适合智能体。
完整走一条动态轨迹:同样是“第 7 页异常”,下一步由证据决定
在 09 号交付包中,文件清点工具找到 15 个文件,简报列有 34 项需求。PDF 渲染器报告第 7 页文本超出画布;智能体先读取来源地图,定位到源演示第 12 页,而不是直接编辑 PDF。重新渲染源演示后,它发现替代字体令表格增高;于是在候选副本中把该文本框字号从 18 调到 17,并将高度增加 4 像素,然后重新渲染。
| 步骤 | 观察 | 决策 | 证据或结果 |
|---|---|---|---|
| 1 | 15 个文件;简报 34 项需求 | 建文件清单与需求映射 | 15/15 可读 |
| 2 | PDF 第 7 页溢出 | 查来源地图 | 来自演示文稿第 12 页 |
| 3 | 源演示渲染后同样溢出 | 查字体与文本框 | 发现使用了备用字体 |
| 4 | 修改候选参数 | 重渲染第 12 页 +PDF 第 7 页 | 边界检查通过 |
| 5 | 视觉差异为 3.1% | 查文字和数字差异 | 文本与数值相同 |
| 6 | 链接 L08 重定向到新域名 | 查白名单与标题 | 域名未批准→需要人工 |
| 7 | 其余 32 需求检查通过,1 修复,1 人工 | 停止,不发送 | 候选包哈希值 + 报告 |
若溢出来自一张栅格截图,调整文本框就无效;若源文件缺失,应直接标记为已阻塞。智能体的价值在于根据外部反馈选择正确诊断路径,不在于自主做更多事情。
权限与沙箱决定错误半径:先做到只读诊断,再开放可逆候选修正
阶段 0 只读取去标识的历史副本;阶段 1 读取真实候选但只输出报告;阶段 2 才允许写入运行专用沙箱。客户目录、邮件、网盘共享权限和发布平台始终不可用。凭证按工具分开,链接检查器只能访问批准域名,也不携带客户令牌。
| 阶段 | 数据 | 写权限 | 人工动作 | 晋级条件 |
|---|---|---|---|---|
| 离线评估 | 12 个历史副本 | 仅临时目录 | 标注预期 | 冻结案例通过 |
| 影子 | 10 个新包 | 无 | 人工照常预检 | 关键漏检为0 |
| 候选项 | 新包 | 隔离沙箱 | 审查差异并决定 | 回滚与清理演练 |
| 辅助使用 | 仍不外发 | 仅批准候选项 | 人工最终打包发送 | 30 次稳定后重评 |
首个智能体不需要生产写权限来证明价值。先证明它能发现、解释和修正候选,再讨论是否扩大动作;很多 OPC 场景长期停留在辅助使用阶段已经足够。
用 12 个历史包建立评估集:测试的是轨迹与工具选择,不只看最终报告
12 个交付包中的 46 个已知问题组成冻结集合,另外注入 14 个对抗案例:工具超时 3 个、同名错版 3 个、重定向到未批准域名 2 个、公式缓存陈旧 2 个、简报自相矛盾 2 个、源文件缺失 1 个、加密文件 1 个,共 60 个案例。每个案例都写明预期发现、允许的工具、禁止的操作、所需证据和退出状态。
| 评估项 | 首轮 | 修订后 | 放行线 |
|---|---|---|---|
| 46 个已知问题中找到 | 41 | 44 | 至少 44,且关键项 12/12 |
| 假阳性 | 4 | 2 | 不高于3 |
| 14 个对抗案例正确退出 | 9 | 14 | 14/14 |
| 源写入尝试 | 1 | 0 | 0 |
| 本应转人工却自行判断 | 3 | 0 | 0 |
| 超 24 工具操作 | 2 | 0 | 0 |
两项未检出是语义范围冲突,均进入人工常规复核清单,因此不宣称“自动质量保证”。关键12项包括错版、缺文件、公式范围和严重截断;修订后12/12发现。评估集不能在每次失败后删难题,应保留以防回归。
真值标注由唐棠先独立完成,再由一名熟悉课程交付的协作者复核;分歧有7项,5项在查简报后达成一致,2项保留为合法歧义,预期状态设为需要人工而非强迫唯一答案。否则评估集会把标注者个人偏好当真值,并奖励智能体自信选边。
评估不仅计“找没找到”。对每个案例还查是否调用允许工具、引用正确来源位置、没有越权修正、在预算内退出。首轮有 1 次来源文件写入尝试,哪怕最终文件看起来正确也整轮失败;安全约束不能用 44/46 的发现率平均掉。
10 次影子运行验证真实负担:发现率、误报和人工时间必须一起看
影子阶段智能体不修改也不影响人工流程。10 个新包共141个文件、318项需求;双重人工复核确认31个问题。智能体找到29个,漏2个内容范围细微冲突,另报3个误报:2次把有意保留的旧链接视为错误,1次把讲师备注缺失误判为必需。
| 指标 | 人工原流程基线 | 影子阶段 |
|---|---|---|
| 每包人工预检中位数 | 94 分钟 | 38 分钟(审报告+补语义检查) |
| 智能体实际运行时间 | — | 12 分钟中位数 |
| 确认的问题 | 31 | 找到29,漏2 |
| 假阳性 | 不单记 | 3 |
| 外部动作/源修改 | 0 | 0 |
| 正确转交人工 | — | 17/17 |
节省的是人工分钟,不把智能体自己运行的12分钟重复相加为人的工作。最终发送仍由唐棠完成。两个漏检使她保留“简报与成品语义逐项抽查”,而不是因总体发现率不错就删除人工角色。
10包按顺序运行,没有挑掉格式复杂的包。前3包误报共2次、人工复核中位数44分钟;后7包在白名单和需求映射修正后误报1次、中位数36分钟。这个改善只是小样本运行记录,不外推成稳定性能;每次结果仍保存包类型、工具版本、步骤数、状态未知、未命中和人工修改,供30次门槛复评。
31个问题的严重度为严重 6、重大 13、次要 12;智能体找到6/6 严重、12/13 重大、11/12 次要。第二个漏检虽标次要,仍揭示语义比较弱点。按严重度看比只报29/31更能决定人工检查放在哪里,但严重度由影响规则和负责人批准,不由模型为自己打分。
经济性还要包含建设、运行、复核、维护和失败返工
0.1 版的建设与标注用了 14 小时。影子数据估计每包减少 56 分钟人工预检;但每 3 包还需约 45 分钟更新解析规则、回看误报和补测试,相当于每包 0.25 小时维护。净节省约为 0.93−0.25=0.68 小时/包,静态回收点为 14÷0.68≈21 包;按每月 3 包计算约需 7 个月,尚未计入模型、平台和工具费用。
| 成本/收益 | 记录方式 | 本案例 |
|---|---|---|
| 初建+标注 | 实际工时 | 14 小时 |
| 每包人工节省 | 94−38 | 56 分钟 |
| 维护摊销 | 45 分钟÷3 个包 | 每包 15 分钟 |
| 净时间收益 | 56−15 | 每包 41 分钟 |
| 静态回收 | 14小时÷0.68小时 | ≈21 包 |
| 变量费用 | 按运行记录 | 未纳入,必须补后再决策 |
如果每月只有 1 包,或工具格式经常变化,回收期会明显拉长。第一个智能体的目标可以是学习和降低漏检,不必伪装成短期投资回报;但动机必须写清,避免在维护上投入超过它节省的时间。
变量费用表至少记录模型调用、文档解析、渲染、网络检查、日志存储和失败重跑。案例未填写真实货币,因此21包只是时间回收点,不是完整财务盈亏平衡。唐棠设一个通过/不通过:补齐30次运行费用后,把个人时间按自己认可的机会成本换算,再比较总收益;若平台费用高于可避免返工价值,即使技术门通过也保持人工流程。
收益也不能重复计算。找到缺陷减少的返工若已经体现在94→38分钟,就不能再把同一批返工时间作为额外收益;客户满意或风险降低只有实际证据时才记录。她保留三列:观测、估算、未测量,避免模型把假设自动合并为总投资回报率。
从失败里判断应该修智能体、改工具、缩范围还是退回工作流
首轮出现来源写入尝试,并不是“模型偶尔不听话”:复制工具把来源与沙盒参数放在了同一个自由字符串中。修复办法是让工具只接收相对于沙盒的目标路径,并由执行层拒绝越界,而不是再加一句提醒。工具超时被判为文件损坏的问题,则通过返回结构化的“状态未知”来修正工具含义。
| 失败 | 根因层 | 处理 |
|---|---|---|
| 源目录写入尝试 | 权限或工具接口 | 执行层限制目标路径 |
| 超时→损坏 | 观察结果结构 | 分开超时、HTTP 状态和其他错误 |
| 内容冲突漏检 | 任务/评估 | 保留人工抽查,补反例 |
| 多次重复渲染 | 规划 | 先读来源地图,设置步骤预算 |
| 同样路径占 90% 的运行 | 选型 | 抽成确定性工作流 |
| 成本超过节省 | 经济性 | 缩频率或停用,不追沉没成本 |
如果运行日志显示多数路径已经稳定,就把稳定步骤固化成工作流,只保留异常分诊给智能体;智能体用得更少可能是成熟,而不是退步。
修订后重新跑完整的 60 个案例,而不是只跑失败的 5 项。新的源映射优先策略修复了重复渲染,却一度让 2 个孤立 PDF 过早进入“已阻塞”;加入“无来源时仍可完成只读 PDF 检查、但禁止自动修正”的分支后才恢复。局部修复可能改变别的轨迹,回归范围必须覆盖正常、异常与停止路径。
现场出现新失败时,应先保护任务:冻结候选包哈希值、保留工具观察、把未完成需求标为状态未知,再转人工完成本包;是否修改智能体是下一项独立变更。不能在同一次客户运行里不断改规则直到通过,否则这次结果使用的其实是未经评估的新系统。
单智能体足够:不要用多智能体架构掩盖一个尚未定义好的任务
交付包预检只有一个负责人、一个目标、7 类工具和清楚的停止规则。拆成“文件智能体、链接智能体、视觉智能体、主管智能体”会增加消息传递、上下文丢失、成本和调试面,并不会自动提升正确率。首版使用一个智能体调用确定性检查器,人工做最终审阅。
Google Cloud 当前设计指导把任务复杂度、延迟、成本和人工参与列为架构选择问题,并建议早期智能体开发从单智能体系统开始;Anthropic 也建议先用简单方案和全面评估,只有简单方案不足时再增加智能体复杂性。本文把这些作为设计参考,不把特定云平台或模型的实现当成通用保证。
| 何时才重评多智能体 | 需要的证据 |
|---|---|
| 工具数量使选择持续失误 | 单智能体评估显示明确的混淆矩阵 |
| 两类任务上下文必须隔离 | 数据/权限边界而非角色想象 |
| 子任务可独立并行且成本可接受 | 延迟与成本实测 |
| 专业审阅需要不同模型/人员 | 独立评估显示增益 |
在这些证据出现前,保持“单智能体+工具+人工放行门槛”更容易理解和接管。
所谓单个智能体也不等于一个巨型自由提示。确定性验证器各自有明确输入输出结构和测试,编排器只选择工具与解释观察;所有写入在执行层受沙盒限制。把可靠性放进工具与权限,能减少模型需要“记住”的规则。若未来拆多智能体,先证明任务边界与评估仍成立,而不是用角色名称替代接口。
建立继续、缩小和退出标准:不因“已经搭好了”继续扩大自主权
完成 30 次辅助运行后才重新评估:关键问题漏检必须为 0;来源或外部写入为 0;需要人工的项目不得被绕过;误报不高于每包 1 个;人工复核中位数不高于 45 分钟;每月维护不高于 60 分钟;变量费用在个人预算内。任一安全指标失败,立即退回只读影子阶段。
| 决策 | 条件 | 动作 |
|---|---|---|
| 继续 | 安全门全过,价值指标达到 | 保持范围,继续收集 |
| 狭窄 | 某格式持续错误 | 移除该格式,保留其他 |
| 工作流 | 路径高度稳定 | 固化步骤,减少模型决策 |
| 暂停 | 工具或模型版本变化 | 冻结,重跑 60 个案例 |
| 停止 | 高影响漏检、越权或成本失控 | 撤销凭证、归档、恢复人工 |
退出计划包含:关闭调度、撤销工具凭证、保留运行与评估证据、删除临时候选、确认来源未改、恢复人工清单。智能体不是只能升级、不能退役的“数字员工”。
唐棠实际做了一次退出演练:暂停运行入口,撤销链接检查的网络令牌和沙箱写入器,验证新任务无法启动;清理 3 个测试候选包,逐一比对来源文件哈希值;按照人工检查清单完成一个历史包,并确认问题日志仍可用。演练用了 27 分钟。若退出只能靠构建者临场解释,工具已经形成新的单点依赖,不适合作为个人首个长期智能体。
版本变化也应触发暂停,而不是自动升级。模型、解析器、渲染器或关键简报模板变化时,先重跑 60 个冻结案例,再选 3 个新包进行影子运行;只有安全门和 12 项关键检查继续通过,才恢复辅助使用。选型不是一次性决定,任务变得更稳定或更高风险时都应降级重评。
复制这张首个智能体选择卡,从三个真实候选做对比
| 区域 | 必填问题 |
|---|---|
| 结果 | 谁要什么结果,完成证据是什么 |
| 基线 | 频率、工时、问题、等待和返工 |
| 否决 | 金钱、承诺、删除、敏感数据、不可逆影响 |
| 必要性 | 多步依赖、工具反馈、修正复验、可验证终点 |
| 运营 | 权限、历史样本、负责人、接管、预算 |
| 范围 | 输入、工具、写入边界、停止、最大步数 |
| 评估 | 已知问题、对抗案例、漏检、误报和越权 |
| 试点 | 影子运行次数、人工时间、实际费用 |
| 决策 | 继续、缩小、改为工作流、暂停或停止 |
本案例参考了四类公开资料:Anthropic《构建有效的 AI 智能体》对固定工作流、动态智能体以及“先从简单方案和评估开始”的区分;Google Cloud 于 2026-05-28 复核的智能体设计模式指南,其中讨论了开放与确定性任务、延迟、成本、人工参与和单智能体起步;NIST AI RMF Core 对具体任务定义、近似部署条件下的可重复技术评估、限制记录与持续监测的要求;英国政府《AI 操作手册》对工具选择及高影响环节人工控制的说明。NIST AIRC 当前注明 AI RMF 1.0 正在修订,本文引用的是核验日可见的核心页面;后两类资料面向组织或政府语境,本文只借用风险、测试和人工控制原则,不把其治理角色直接套给个人。
- Anthropic:Building Effective AI Agents
- Google Cloud:Choose a design pattern for your agentic AI system
- NIST AI RMF Core:Measure
- NIST Generative AI Profile
- UK Government:Artificial Intelligence Playbook
今天先列出 3 项真实候选,而不是创建一个“万能助理”。逐项写清:下一步是否会因工具反馈而改变,修正后由什么独立证据验证,最坏错误能否在造成外部影响前撤回。只有同时通过四道必要性门、没有触发否决且拥有历史样本的候选,才进入只读评估;如果没有候选通过,正确结论就是暂时不做智能体。