两项重复工作,林舟都判断错了
林舟是一名独立市场研究顾问,同时维护 3 个客户项目。她每周都要检索资料、整理访谈、跟踪竞品、写客户周报、开票和发布内容。开始把 AI 系统地用进工作后,她形成了一个很直观的分类:临时问题放进普通对话,反复出现的工作尽量做成智能体。
最先被“升级”的是客户周报。她用了 11 小时搭建流程,希望系统自己读取资料、判断进度、写完后直接发送。实际只跑了 4 次:一次缺会议记录,系统仍然补写了进度;一次把旧客户的项目状态带进新周报;一次因任务表字段改名而中断;只有一次无需返工。
另一边,每周一的公开价格检查仍由她手工完成。这个任务要打开固定的 12 个页面,抄下套餐和价格,再与上周记录比较,平均花 70 分钟。它重复、枯燥,却一直没有进入改造清单,因为林舟觉得“只是复制数字,不够像 AI 应用”。
两个判断恰好倒了过来。价格检查的路径几乎不变,适合让规则接管;客户周报虽然每周重复,却混合了资料完整性检查、跨周判断和对外发送,不能交给一个流程统一决定。选择对话、长期项目、固定自动化还是智能体,首先要看的不是任务显得多高级,而是下一步究竟由人、规则还是模型决定。
这是一组教学案例数据,不代表特定客户或行业比例。后面的 32 项任务、运行次数和耗时,都用于展示怎样从工作记录做出选择。
先把工作记成可以判断的动作
凭记忆盘点工作,很容易只想起最累、最讨厌或最近发生的几件事。林舟连续记录了 14 天。每次开始一项工作,她写下触发原因、资料入口、临时判断、对外影响、耗时和返工;先不讨论应该使用什么工具。
原始日志有 41 行,但行数不等于任务数。里面有 6 行只是等待客户或页面响应,3 行是同一件事被会议打断后继续。它们分别被记为等待和中断时间,没有另算任务。另有 4 行把“检索资料并发送给客户”写在一起,她把读取和外发拆开,因为两者不能共用同一个权限边界。5 条名称不同、触发和产出相同的记录则合并成 2 个任务族。两项低频工作虽然只发生一次,错误后果很大,也被保留下来。
清洗后留下 32 项可观察任务。19 项有最近 10 次的完整记录,8 项只有 4—9 次,另外 5 项是首次或极低频工作。样本不足并不禁止使用 AI,但此时无法证明输入、异常和返工已经稳定,不应该直接建立无人看守的自动化。
任务从哪里断开,也不能只看操作界面。林舟把“打开客户资料、写周报、点击发送”拆开,不是因为它们分布在三个页面,而是因为控制权发生了两次变化:资料是否齐全可以按规则判断,哪些变化值得写进周报要结合项目承诺,发送则会产生外部影响。反过来,读取 12 个价格页面虽然要重复很多点击,触发、字段和验收始终相同,仍是一项完整任务。分流的边界应落在判断方式或责任改变的地方。
“做研究”“跟进客户”仍然太大,必须继续拆。一个可以分流的任务,至少要有触发、输入、动作、产出和验收。林舟重写了其中 4 项:
| 原说法 | 触发与动作 | 输入 | 产出与验收 |
|---|---|---|---|
| 做研究 | 收到客户问题后,比较 3 个市场规模估算的口径与证据 | 报告、原始链接 | 差异表和采用建议;每个数字可回到来源 |
| 跟进客户 | 周四下午汇总本周决定、风险和下周动作 | 会议记录、任务表 | 周报草稿;不新增承诺,日期一致 |
| 找潜客 | 线索进入表格后,核验公司、角色、近期事件和适配理由 | 公司名、网站、公开来源 | 带来源的研究包;身份一致,不猜测私人信息 |
| 做运营 | 每月 1 日生成待开票清单并标记缺失资料 | 合同表、交付状态 | 待开票表;金额由本人对照合同 |
这一步经常会提前给出答案。“发布周报”被拆成整理资料、判断变化、起草和发送后,各段需要的控制方式已经不同;如果继续把它当作一项工作,后面再精细的评分也会失真。
四种形态,区别在下一步由谁决定
同一个 AI 产品可能同时提供对话、项目空间、定时任务和智能体。按钮名称并不能说明工作采用了哪种控制方式,可以用下面四种情况来判断:
| 形态 | 下一步怎样产生 | 上下文怎样保留 | 常见产出 |
|---|---|---|---|
| 普通对话 | 人继续提问,模型回答当前问题 | 只保留本次问题需要的材料 | 一次解释、草稿、比较或转换 |
| 长期项目 | 人选择阶段,AI 在阶段内协助 | 跨天保存事实、规则、决定和版本 | 持续研究、内容系列、客户交付 |
| 固定自动化 | 规则或代码按预定顺序执行 | 保存字段、快照和运行状态 | 提醒、同步、变化表、格式转换 |
| 智能体 | 模型根据中间结果选择工具、改换路径或停止 | 保存目标、权限、状态和工具结果 | 需要探索与反馈的多步任务 |
这种分类没有从低到高的等级。让 AI 解释一份复杂合同,可能比同步一张表更需要推理,但前者仍可以是一轮由人控制的对话。智能体只是拿到了更多“接下来做什么”的决定权,因此也带来更多路径变化、运行成本和观察难度。
林舟接下来没有给 32 项任务打“智能程度分”,而是逐项回答四个问题:这次工作结束后,哪些信息还要留下;步骤能否事先写完;中间结果会不会改变下一步;系统的动作最多可以走到哪里。
四个问题各自解决不同的误判。重复度说明一项改造有没有机会回收投入,却不能决定采用什么形态;上下文寿命决定事实和决定放在哪里;路径变化决定由规则还是模型控制下一步;动作影响限制系统能获得的权限。把它们混成一个总分,会让“经常发生”和“可以安全运行”看起来能够互相抵消。
信息要不要跨天留下来
第一次读陌生行业报告时,林舟只想弄清“出货量”和“终端销量”的口径差异。材料服务于当前问题,回答完由她判断是否采纳,普通对话已经够用。32 项任务中有 9 项属于这种情况。
为同一客户连续六周做市场判断就不同了。新一周的工作要接着使用已经确认的数字、客户术语、被否决的假设、引用规则和上一版交付物。这 10 项工作被放进长期项目,由林舟决定现在处于研究、取舍还是交付阶段,AI 只在当前阶段内协助。
长期项目需要保存的不是越来越长的聊天记录。林舟把事实基线、工作规则、决策记录和产物清单分别维护:事实更新时保留来源和日期;引用格式与禁用表达只在她批准后修改;重要决定追加理由,不覆盖旧记录;研究表、周报和演示标出当前版本与下一步。如果这些资产仍只存在于人的记忆里,换一个“项目”界面也不会产生连续性。
她还给每类资产设置了更新责任。AI 可以根据新资料提出事实变更,但不能自行覆盖已经确认的数字;交付结构可以从模板生成,客户口径的变更仍要由她批准。这样,下次打开项目时需要恢复的是可核对的工作状态,而不是猜测上一段对话中哪句话仍然有效。
路径固定,就让规则执行
价格检查每周一 09:00 开始,输入始终是 12 个固定网页。流程依次读取页面,提取产品、套餐、价格和页面日期,与上周快照比较,再生成包含旧值、新值、来源和抓取时间的变化表。最近 10 次中有 9 次走完相同步骤;唯一异常是一个页面暂时无法访问,处理方式也可以预先写成“记录来源缺失,不生成推测值”。
这项工作适合固定自动化。模型可以在变化表生成以后解释涨价范围,但没有必要让模型临时决定访问哪些网站、先看什么或何时结束。32 项任务中有 9 项具备相似特征:触发稳定、输入字段稳定、顺序稳定,少数异常可以列明。
“每周重复”本身还不够。如果最近 10 次都需要临时找材料、改变范围和重命名字段,自动触发只会定时放大混乱。应先把输入和验收稳定下来。反过来,步骤很多也不构成使用智能体的理由;只要顺序能够可靠写完,工作流通常更容易检查和维护。
固定自动化也要预先写出失败状态。价格页面打不开时,流程不能沿用旧价格并把抓取时间改成今天;字段消失时,也不能把空值解释成“免费”。林舟只允许三种终态:生成完整变化表、生成带缺失来源的待确认表、因字段结构变化而停止。她可以据此抽查异常,而不必重新理解每次运行走过的路线。
中间结果改变路径,才出现智能体候选
潜客公开背景核验无法使用 12 个固定页面解决。公司可能有同名实体,联系人职位可能已经变化,近期事件也可能出现在公司官网、监管文件、招聘页或可追溯的新闻稿中。系统要先确认公司身份,再根据已经找到的证据选择下一处来源。
例如,发现两个同名公司时,要用地区、官网和注册信息消歧,不能选搜索结果第一项;职位来源超过 18 个月时,应转向公司官网或近期公开活动;只有行业趋势、没有公司级事件时,当前步骤应结束并写明证据不足;来源互相矛盾时,两边都要保留,交给林舟判断。
这类任务的目标相对稳定,路径却无法在运行前全部写完,智能体才有了实际用途。32 项任务中最初有 4 项进入候选名单;“候选”仍然很重要,因为动态路径只能说明可能需要模型控制下一步,不能说明输入合规、结果可验收或风险已经可控。
还有一种表面上很“动态”的情况,其实不该交给智能体:输入每次都缺字段,系统只能临时猜测去哪里补。合理的动态分支来自任务本身,例如不同公司需要不同的身份消歧证据;输入混乱则应先在入口处拦住。两者的区别可以用复盘来判断:如果所谓分支几乎都以“找不到资料、询问本人”结束,需要修的是输入合同;如果分支由可观察证据触发,并且每条路线都有合格终态,才值得继续测试模型决策。
动作权限与任务形态要分开判断
潜客研究需要动态换来源,可以采用智能体;但它只被允许读取批准的公开页面,并把结果写入内部待确认区。邮件仍由林舟本人发送。相反,客户周报的路径大体固定,但发送邮件会产生外部承诺,因此最后一步仍需逐次确认。
她用 A0—A3 标记动作影响,目的不是给任务评出高低,而是限制系统最多能走多远:
| 等级 | 系统可以做什么 | 人在何处负责 |
|---|---|---|
| A0 | 分析已经提供的材料 | 验收最终判断 |
| A1 | 读取批准的外部来源 | 抽查来源与身份 |
| A2 | 写入内部草稿或待确认区 | 发布前逐项批准 |
| A3 | 发邮件、改客户系统、预约会议等外部动作 | 默认禁止,确有需要时逐次明确确认 |
权限要落实到工具、允许访问的范围、可写入的位置、审批点和停止条件。“请谨慎操作”不能阻止系统误发邮件。读取日历也不应自动包含创建会议的权限,读取客户系统不等于可以修改客户阶段。即使产物只叫“草稿”,其中仍可能出现客户数据、错误承诺或不当推断,保存位置和可见范围都要控制。
32 项工作并没有排成一条升级路线
四个问题回答完,32 项任务被分成普通对话 9 项、长期项目 10 项、固定自动化 9 项和智能体候选 4 项。下面 8 项代表任务能看出,重复度和难度都不能单独决定形态:
| 任务 | 上下文与路径 | 最高动作 | 选择 | 主要理由 |
|---|---|---|---|---|
| 解释报告中的陌生指标 | 只服务本次问题 | A0 | 普通对话 | 不需保存状态,由人继续提问 |
| 完成六周客户研究 | 事实和决定跨周复用 | A0 | 长期项目 | 人选择研究、取舍和交付阶段 |
| 每周固定价格检查 | 入口、字段、步骤和异常稳定 | A1 | 固定自动化 | 规则可以预先写完 |
| 每月待开票清单 | 保存记录,规则稳定 | A2 | 固定自动化 | 金额和开票仍由本人对合同 |
| 把访谈拆成文章结构 | 项目内判断较多 | A0 | 长期项目 | 需要持续语境,不需系统自主行动 |
| 潜客公开背景核验 | 来源随中间证据改变 | A2 | 智能体候选 | 路径动态,结果可逐项验收 |
| 客户周报发布 | 整理路径固定 | A3 | 固定自动化加审批 | 外部发送前必须确认 |
| 最终报价决定 | 项目期内判断复杂 | A3 | 长期项目中由本人决定 | 商业责任不能转给 AI |
最后,4 个智能体候选中只有潜客研究进入试运行,另外 3 项先回到长期项目。原因不在“歧义度还不够高”,而在于它们尚未具备独立验收办法,或者动态变化其实来自输入没有整理好。
这次分流也改变了改造顺序。价格检查虽然只是固定自动化,却有清楚的 70 分钟基线和稳定输入,先进入实施;潜客研究需要更长的评估准备,排在后面;最终报价即使判断复杂、价值很高,仍保留在长期项目中由本人负责。形态回答“怎么控制”,收益回答“先做什么”,两个问题不应混在一起。
82 分也可能不该运行
林舟最初做过一张百分制评分表:重复度、歧义度、节省时间和可验证性各 25 分,超过 80 分就进入智能体试验。一项自动生成并发送客户邮件的任务得了 82 分。它高频、耗时,也有复杂判断,却没有独立事实核验办法,出错后邮件无法撤回。
总分把不可接受的风险平均掉了。林舟改用三步顺序:先排除不能安全运行的任务,再选择控制方式,最后才按收益排序。
| 顺序 | 必须回答的问题 | 不能通过时怎样处理 |
|---|---|---|
| 数据与权限 | 输入是否获准进入所选系统,是否含不必要的敏感字段 | 停止或删减输入;公开可见不等于可以批量收集 |
| 验收 | 错误能否在影响产生前被独立发现 | 没有证据或负责人时停止,不能让生成模型自评 |
| 恢复 | 运行能否停止、回滚或由人接管 | 不可逆动作没有逐次审批时停止 |
| 形态分流 | 下一步应由人、规则还是模型决定 | 根据上下文寿命和路径变化选择 |
| 收益排序 | 节省或质量改善能否覆盖维护成本 | 只在前四项通过后比较先后 |
任务本身不一定要放弃,系统能做的动作可以缩小。“生成并发送”退到“生成内部草稿”,“修改客户系统”退到“输出建议修改表”,保留前段价值,同时把责任边界放回能够承担后果的人。
周报没有继续修,而是被拆成三段
回到开头那套周报流程。4 次运行的失败看起来各不相同:缺资料时补写、客户语境串线、字段变化后中断。放回任务结构后,它们指向同一个设计问题:一个运行同时承担了稳定抽取、持续判断和高风险外发。
林舟没有再修改提示词,而是重新分配控制权:
| 原环节 | 新控制方式 | 验收与失败处置 |
|---|---|---|
| 检查会议记录和任务表是否齐全 | 固定自动化 | 缺一项就生成缺失清单,不进入写作 |
| 对比上周状态并生成变化表 | 固定自动化 | 保存旧值、新值、来源和更新时间 |
| 判断哪些变化值得告诉客户 | 长期项目中由人选阶段、AI 协助 | 每条判断引用事实基线和决策记录 |
| 按模板起草周报 | 长期项目中的项目模板 | 不得新增日期、承诺和责任人 |
| 发送邮件 | 林舟本人 | 核对收件人、附件、日期后手动发送 |
新流程连续记录了 8 周。资料完整 7 次,缺失 1 次;缺失的那次停在内部待确认区,没有补写进度。7 份草稿里有 2 份需要修改表述,没有再出现客户资料串线,也没有自动发送。林舟每周处理周报的中位数从 54 分钟降到 31 分钟:9 分钟检查差异表,14 分钟判断和改稿,8 分钟做发送前核对。
它没有实现“全自动周报”,但稳定完成了真正需要的工作。四种形态可以在一项业务里各管一段,分流不是强迫整项工作四选一。
潜客研究怎样通过智能体试验
潜客研究是唯一进入下一阶段的候选。试验开始前,林舟先把“根据公开信息研究潜客”收紧成一个可验收任务:输入只有公司名称、官网候选、目标地区和需要核验的问题;允许来源限定为公司官网、政府或监管公开页、她已获准使用的行业数据库和可追溯新闻稿;私人通讯录不能读取,也不能根据姓名猜测年龄、国籍或家庭信息。
运行先核对域名、地区和产品是否属于同一实体。公司身份确认后才检查联系人角色与 90 天内的公司事件;如果只有超过 18 个月的旧职位来源,角色写成“无法确认”;只有行业趋势而没有公司证据时,不生成事件;适配理由必须直接来自已核验证据,同时保留反证。最终结果写入内部待确认表,不触发任何外联。
五个阶段有各自的交接条件。身份消歧至少需要域名、地区和产品中的证据能够指向同一实体;两个实体都可能时,结果停在身份表。角色核验要记录来源日期和是否属于本人或公司明确陈述,旧页面不能被静默当作现状。事件检索只接受与目标问题直接相关的公司级事实。适配说明可以提出两条理由,但必须同时写出什么证据会推翻它。保存前再检查身份、角色、事件、适配理由和停止状态是否齐全。这样即使任务中途停止,留下的也是一个能够继续核查的对象,而不是半篇流畅介绍。
每个事实都要带原页面地址、页面日期和抓取时间,推断明确标成“判断”。连续 2 次返回空页、同一来源循环访问 3 次、总工具调用达到 12 次,或者运行超过 8 分钟,任一条件出现就停止。这样做是为了防止系统在证据没有增加时继续制造看似完整的进展。
林舟保存在项目里的任务说明只有下面这些内容:
目标:为一条已进入表格的公司线索建立公开信息研究包。
必须先做:确认公司身份;记录原页面地址、页面日期和抓取时间。
允许:读取批准域名;把结果写入“待确认”表。
禁止:猜测私人属性;发送消息;修改客户记录;把旧职位写成当前事实。
遇到矛盾:同时保留证据,标记“需要人工复核”,不自行裁决。
停止:身份无法消歧、关键来源缺失、12 次工具调用或 8 分钟任一达到。
完成:五个必填字段齐全,且每项事实可回到来源。
这份说明随后接受 12 条离线样本测试:5 条资料完整的常规公司,3 条无法消歧的同名实体,2 条只有过期职位信息,1 条来源矛盾,1 条网页不可访问。林舟先写期望状态,再运行系统。3 条同名、1 条矛盾和 1 条网页不可访问的正确结果都是停止;2 条职位过期样本可以保留公司事实,但角色必须写“无法确认”。
| 检查项 | 放行门槛 | 第 1 轮 | 修订后第 2 轮 |
|---|---|---|---|
| 运行终态正确 | 12/12 | 10/12 | 12/12 |
| 事实有可打开的原始来源 | 100% | 86% | 100% |
| 应停止时正确停止 | 5/5 | 2/5 | 5/5 |
| 禁止动作次数 | 0 | 0 | 0 |
| 单条人工复核中位数 | 不高于 15 分钟 | 19 分钟 | 11 分钟 |
第一轮没有放行。系统把搜索摘要当作来源,还在同名公司中选择了“信息更多”的一家。林舟要求必须打开原页面,并从消歧规则中删掉“证据最多即可选择”。第二轮通过后,才进行 10 条只读线上试运行:8 条形成了合格研究包,2 条因身份不清而停止,没有发送消息。这里不能把结果写成“80% 成功率”,因为两次停止本来就是正确终态。
评估在这里还承担了一个分流复核作用。假如两轮测试发现所有公司都按同一组固定来源和相同顺序完成,智能体就没有继续存在的必要,可以降为工作流;假如路径确实变化,但人工无法在 15 分钟内判断证据是否支持结论,问题也不是继续扩大自治,而是先改善产物结构或缩小任务。只有“动态选择有用”和“结果可以复核”同时成立,候选形态才被保留。
节省时间以后,再算维护账
价格检查上线后,手工基线仍按每周 70 分钟计算;自动运行不需要人在场,但每次平均要复核 12 分钟,每月还要用 30 分钟维护页面和字段。按一年实际运行 46 周估算,年度净节省是:
(70-12)×46÷60-0.5×12=38.5 小时
首次搭建用了 4 小时,静态回收期约 4.8 个运行周。这个数字只有在页面保持稳定时成立。如果改版频繁,每月维护升到 3 小时,年度净节省会降到约 8.5 小时,回收期拉长到约 21.7 周。此时即使流程仍能运行,也要重新判断它是否值得保留。
林舟对其他任务也记录首次设计、每次准备、平台运行、人工复核、失败处理和规则维护。订阅费只分摊因任务新增的边际费用,人的复核时间不能写成零,“以后顺手维护”也必须换成分钟。普通对话的首次投入低,但答案难复用;长期项目要维护事实和版本;固定自动化会受字段与页面变化影响;智能体还要承担工具契约、评估集、路径观察和人工接管。
她没有一次迁移 32 项任务。每项先用最低复杂度运行 10—14 天。她记录从准备到验收的人工分钟数、偏离预设路径的原因、关键错误、接管位置和维护时间。如果连续 5 次都明显省时,分支又能由证据解释,才考虑扩大使用;如果每次仍要靠记忆救场,或者复核接近原来的工作量,就退回更简单的形态。
价格检查在 12 次运行中只遇到 1 次页面不可访问,流程按规定写入“来源缺失”,没有生成推测值。潜客研究完成 10 条只读试运行后,也因为停止边界可靠而暂时保留智能体形态。选择不是一次性的:项目中稳定下来的步骤可以抽成自动化;智能体运行 20 次后,如果路径已经高度固定,也应该降级成更可预测的工作流。
一张任务分流卡就够开始
第一次分流不需要先建评分系统。选一项最近发生过的工作,把下面这张卡填完:
| 字段 | 要写下的事实 |
|---|---|
| 任务动作 | 谁在什么触发下完成什么可观察动作 |
| 最近 10 次 | 实际发生次数、耗时、中断和返工 |
| 输入与位置 | 固定资料、临时资料以及缺失时的处理 |
| 上下文寿命 | 只用于本次、在项目期复用,还是保存结构化状态 |
| 固定步骤 | 可以预先写出的顺序和已知异常 |
| 动态分支 | 哪个中间结果会改变下一步 |
| 输出与验收 | 必填字段、证据、质量门槛和禁止内容 |
| 最高动作影响 | A0 分析、A1 读取、A2 内部写入或 A3 外部动作 |
| 人工责任 | 谁在何时依据什么批准、停止或接管 |
| 初始形态 | 普通对话、长期项目、固定自动化或智能体候选 |
| 试运行 | 次数、观察指标、停止条件和复盘日期 |
以价格检查为例,卡片上写的是:周一 09:00 触发;输入为 12 个批准页面和上周快照;步骤是读取、提取、比较、保存;动态分支为空;输出必须带旧值、新值、来源和抓取时间;最高动作为 A1 读取;缺页或字段变化时不推测;先运行 12 次,在第 14 天复盘人工复核与维护时间。填完以后,固定自动化几乎是记录本身给出的答案,不需要再讨论它“够不够智能”。
先让最简单的控制方式工作,再根据运行记录增加复杂度。普通对话解决一次问题;需要跨天复用的事实和决定进入长期项目;路径稳定的步骤交给规则;只有中间反馈确实会改变路线、结果又能独立验收的局部,才交给智能体。外部动作始终另行判断权限。
这套顺序不会得到一个听起来最先进的系统,却能让人看清谁在决定下一步、失败时停在哪里、维护成本由谁承担。等到第 30 次运行,它仍然可以被检查、接管或降级,才算选对了任务形态。
来源与进一步阅读
本文的分类方法参考了当前官方资料对工作流、智能体、工具使用和人工控制的说明,相关页面于 2026-07-23 复核:
- OpenAI:A practical guide to building agents:区分由模型控制工作流的智能体与单次模型调用,并强调工具、护栏和人工接管。
- Anthropic:Building effective agents:区分预定义工作流与由模型动态决定步骤的智能体,并建议从简单、可组合模式开始。
- Microsoft Learn:Agent Framework workflows:说明确定性执行器、智能体执行器和人工门可以组合在同一工作流中。