一个月后,她仍说不清 AI 到底省了什么
陈澄是一名独立 B2B 品牌顾问,同时服务 4 家长期客户。她已经使用 AI 一个月:写邮件时润色,做方案时要提纲,会议结束后让模型总结。聊天记录里留下了很多看似有用的结果,她却无法回答三个直接关系到经营的问题:哪项工作真的变快了,节省下来的究竟是本人时间还是等待时间,哪些结果已经稳定到可以写进日常流程。
如果第二天停止使用这些工具,她甚至不知道自己的工作会在哪个环节变慢。她一直根据当天最麻烦的任务临时尝试,任务变了,输入变了,验收办法也变了。即使偶尔得到一份不错的结果,也无法和原来的做法公平比较。
她暂时停下新的工具尝试,先记录一个完整工作周。七天结束时,原始表有 34 行;清洗后得到 26 项可观察任务,本人直接工作时间为 33 小时 10 分钟。等待、通勤和无法可靠归因的零碎切换共 4 小时 35 分钟,单独保留,没有算成潜在节省。
这份日志最后把她的工作分成三类:可以让工具先做、本人验收的;需要工具参与、但判断过程仍由本人主导的;以及价格、范围和客户承诺等必须本人决定的。她从第一类中选出会议行动项整理,完成 10 次试运行。稳定后,本人处理时间中位数从 24 分钟降到 8.5 分钟,按每周 3 次、每年 46 周估算,年度净节省约 35.7 小时。
这里使用的是教学案例。人物、客户、任务和运行数字用于演示判断过程,不对应真实客户,也不是独立顾问行业的平均数据。它的价值不在于复制 35.7 小时这个结果,而在于看清这个结果是怎样从一周真实工作中得到的。
第一张日志很快暴露出记录方法的问题
最初的日志里有一行“处理客户邮件,64 分钟”。这句话符合日常记忆,却无法支持后面的判断。64 分钟里既有整理信息,也有商业判断,还有更新排期;三部分虽然都发生在邮箱附近,出错后果完全不同。
陈澄回看邮件、合同和修改记录,把这一行拆开:
| 拆分后的工作 | 本人时间 | 产出 | 适合怎样处理 |
|---|---|---|---|
| 根据项目记录起草进度邮件 | 18 分钟 | 一封内部草稿 | 可以让工具起草,本人核对事实和语气 |
| 判断新增要求是否超出原范围 | 31 分钟 | 范围判断与处理建议 | 必须由本人对照合同并作决定 |
| 更新排期并归档往来 | 15 分钟 | 新排期与可追溯记录 | 可以辅助整理,日期确认后再更新 |
这个拆分让她意识到,任务日志不能照搬日程名称。一次客户周会在日历里占 75 分钟,其中会议本身 52 分钟,等待客户上线 6 分钟,会后核对并整理行动项 17 分钟。如果她想改善的是行动项整理,真正进入基线的只有最后 17 分钟。模型没有替她参加会议,客户迟到的时间也不会因为生成了一张表而消失。
接下来的记录都要说清一项工作的触发、输入、动作和产出。任务结束后两分钟内,她只填发生了什么和实际分钟数;每天 18:30 再补输入位置、验收办法、错误后果与返工。第 4 天只检查有没有漏记高频小任务,不提前评分,也不顺手改变原流程。第 8 天才统一清洗。
等待时间仍然保留,只是不混入本人耗时。系统运行、等待他人回复、通勤和无法归因的切换分别记录;查错和返工则回填到引发返工的原任务。这样处理之后,所谓“节省”才不会同时包含本人工作、机器等待和客户迟到。
她选择七天,是因为长期客户的周会、内容制作、交付检查和一次财务处理通常都会在一周内出现。这个周期足以找到第一批重复动作,又不会把记录本身变成一个月的新项目。它无法覆盖月末集中开票、季度投标或旺季交付,所以她在日志里标出这些缺口,准备到相应周期再补样本。七天给出的只是首张工作地图,不负责代表全年所有工作。
记录动作也保持得很轻。白天若为了填写十几个字段而中断工作,日志测到的会是“工作加记录”的新流程。陈澄把事实记录与晚间补充拆开,既能保留触发时点,又能在当天材料还找得到时补上输入版本和验收依据。第 4 天的查漏只解决“有没有记”,不讨论“适不适合 AI”;这让后半周仍然可以和前半周放在同一条基线上。
七天后,34 行记录怎样变成 26 项任务
清洗在原始日志的副本上完成。原表保留,因为合并和拆分都带有判断;一旦发现任务边界划错,还能回到当时的记录。
陈澄先合并触发、动作和产出都相同的重复项,但保留每次耗时;一行里出现两种责任,就像前面的 64 分钟邮件,拆成独立任务。超过 15 分钟且已经转去做另一件事的中断,从原任务时间中扣除。等待单列,返工归回原任务,会议本身与会后处理分开。
下面 8 行展示了清洗后的任务颗粒度。完整日志有 26 项,这里只保留能够说明后续分类和选择的记录:
| 日期 | 触发 | 动作与产出 | 本人分钟 | 验收办法 | 出错后果 |
|---|---|---|---|---|---|
| 周一 | 客户周会结束 | 从逐字稿整理待确认行动项 | 27 | 回到原话逐项核对 | 错人、漏项或制造假承诺 |
| 周一 | 收到 3 个竞品页面 | 对照上周快照标出变化 | 68 | 页面证据与时间可追溯 | 把旧变化当成新变化 |
| 周二 | 客户追问当前进度 | 汇总项目记录并起草回复 | 18 | 事实与项目表一致 | 对外状态表述错误 |
| 周二 | 客户增加交付要求 | 判断是否超出合同范围 | 31 | 对照合同和会议确认 | 错误报价或免费承诺 |
| 周三 | 准备新方案 | 撰写方案主体第一版 | 210 | 逻辑、证据和取舍成立 | 方案方向偏离 |
| 周四 | 第二次周会结束 | 整理行动项并确认负责人 | 21 | 逐句核对原始记录 | 错派任务 |
| 周四 | 财务表出现逾期 | 核对发票、到账与联系人 | 38 | 银行和发票记录一致 | 错误催款 |
| 周五 | 第三次周会结束 | 整理行动项与未决事项 | 24 | 区分承诺、讨论和否定 | 把讨论写成决定 |
这一步结束后,本人可归因的任务时间合计 33 小时 10 分钟,另外 4 小时 35 分钟留在任务表之外。26 项任务中有 11 项可能重复发生;其余任务有的只在本周出现一次,有的尚未找到稳定输入。她没有给无法归因的时间做平均分摊,也没有因为某项任务看起来适合使用 AI,就把它提前改写成规则清晰的样子。
清洗最难的地方通常不是加总,而是判断两次记录究竟是不是同一项工作。三次会议整理都以“从会议材料提取明确承诺”为验收目标,可以合并并保留 21、24、27 分钟三个样本;访谈洞察归类虽然也处理逐字稿,却要解释证据和形成观点,不能因为输入格式相似就并进来。反过来,同一封邮件里的进度起草和范围判断必须拆开,因为前者核对事实即可,后者会改变商业承诺。
她还回看了返工来自哪里。报告第二天发现名称错误,修正时间应回到原报告检查;若另记成“修改文件”,原任务就会显得比实际更便宜。清洗后的 26 项不是对工作名称做得更漂亮,而是让同一行里的耗时、验收和后果指向同一件事。只有达到这个程度,后面的年度换算才有共同口径。
年度耗时把五个候选带到了同一张桌上
一周记录会低估高频小任务,也会放大偶然出现的大任务。陈澄按自己的休假和业务空档采用一年 46 个工作周,把 11 项重复任务分别换算。第一轮只比较其中 5 个更有可能产生明显收益的候选,其余 6 项继续保留在日志里,没有用一个无法展开复算的总数代替明细。
换算公式是:
年度本人小时数=每周发生次数 × 单次耗时中位数 × 年工作周数 ÷ 60。
46 个工作周来自陈澄自己的经营节奏:从 52 周里扣除休假、培训、业务空档和不执行常规周任务的时间。它不是推荐给所有独立工作者的固定参数。若某项工作只在项目交付月发生,应该按项目次数计算;若每逢月末集中处理,至少等到月末样本出现再估算。频率口径错误时,单次耗时记录得再精确也没有意义。
单次耗时采用中位数,是为了减少一次材料缺失或一次特别顺利对结果的拉动。进度邮件的六次样本从 11 分钟到 25 分钟,相差一倍以上;16 分钟的中位数可以提供首个点估计,50.6—115 小时的观察范围则提醒她继续寻找波动原因。方案主体只有一次 210 分钟记录,80.5 小时只能标成暂时估算,不能和三次相近的会议样本视为同等证据。
会议行动项每周 3 次,样本为 21、24、27 分钟,中位数是 24 分钟。年度点估计为 3 × 24 × 46 ÷ 60=55.2 小时。若用本周最低和最高样本计算,范围为 48.3—62.1 小时。这个范围只描述当前观察到的波动,不是统计置信区间。
| 候选任务 | 每周次数 | 本周耗时样本(分钟) | 年度点估计 | 现有证据的限制 |
|---|---|---|---|---|
| 整理会议行动项 | 3 | 21、24、27 | 55.2 小时 | 样本少,但三次相近 |
| 检查竞品变化 | 1 | 68、83 | 57.9 小时 | 两个网页入口不稳定 |
| 起草客户进度邮件 | 6 | 11、14、16、16、18、25 | 73.6 小时 | 年度范围约 50.6—115 小时 |
| 撰写方案主体 | 0.5 | 210 | 80.5 小时 | 只有一次样本,不能估计波动 |
| 核对逾期应收 | 1 | 38 | 29.1 小时 | 还缺月末集中处理样本 |
方案主体的点估计最高,证据却最弱;进度邮件发生最频繁,内容里又可能包含尚未确认的客户承诺。年度耗时在这里完成了筛选作用:它把值得继续分析的工作带到同一张桌上,却没有替陈澄作出自动化决定。
三类工作是在一次次取舍中分开的
陈澄没有先给任务贴“简单”或“复杂”的标签。她逐项追问四件事:结果会不会形成价格、合同、付款、公开立场或客户权利等外部承诺;能否离开模型的自我评价,用原话、合同、项目记录或明确规则独立验收;输入是否稳定并允许在当前环境使用;错误能否在影响客户之前被发现、撤回或重做。
四个问题在不同任务上产生了不同结果。会议行动项能回到逐字稿逐句核对,输出在内部表里,错了还来得及删除;它因此进入委托类。进度邮件虽然也能核对项目事实,一句话的轻重却可能改变客户对延期和范围的理解,发出后也无法真正撤回,所以只能协作起草。合同范围判断即使找到了全部条款,是否接受新增要求仍涉及价格、关系和后续责任,工具整理材料不会把最终决定转移出去。
输入条件也会改变分类。竞品变化检查在规则上很清楚,但两个网页入口不稳定,今天搜索到的页面和下周可能不同。当前条件下,它还不能稳定委托;修复入口和快照后,分类才可能改变。分类表记录的是“这项工作在现有条件下怎样处理”,并不是给任务名称贴上永久标签。
答案逐渐把工作分成三类。这里的“委托”仍然包含人工验收,只是工具可以先完成相对完整的内部产物;“协作”意味着判断过程本身由人主导,工具只处理材料或草稿;“本人决定”则不允许工具替人形成最终承诺。
| 工作 | 分类 | 工具可以做到哪一步 | 陈澄仍然负责什么 |
|---|---|---|---|
| 会议行动项整理 | 适合委托 | 从限定逐字稿生成内部待确认表 | 逐项核对负责人、日期和证据 |
| 竞品变化检查 | 条件成熟后委托 | 对稳定页面生成变化清单 | 先修复来源和快照规则,处理异常 |
| 客户进度邮件 | 适合协作 | 汇总已确认事实并起草 | 判断语气、风险和对外表述,亲自发送 |
| 方案主体撰写 | 适合协作 | 整理证据、提出结构和检查遗漏 | 决定观点、取舍和最终方案 |
| 合同范围判断 | 必须本人决定 | 找出相关合同条款和历史承诺 | 判断是否超范围以及怎样回应客户 |
| 最终报价与催款对象 | 必须本人决定 | 汇总成本、到账和联系记录 | 决定价格、关系处理和正式外部动作 |
这张表完成了七天日志最重要的产出:工作不再只有“使用 AI”和“不使用 AI”两种状态。会议行动项可以先交给工具整理,方案可以共同完成,范围和价格则明确留在人手里。即使工具能够生成一句报价,也不会改变报价责任属于陈澄。
她还设置了两条不进入比较的底线:流程若要自行执行高后果外部动作,或者必须使用尚未获准的数据,就直接停止准备。收益评分不能抵消这两类问题。
她为什么把会议行动项放在第一位
进入“适合委托”的工作仍有两个:会议行动项整理和竞品变化检查。两项都能保留来源,也都可以在内部复核后再使用。陈澄继续比较准备成本。
会议任务已经有逐字稿、参会成员表、会议日期和已确认的项目节点。第一次设置预计需要 75 分钟。竞品检查虽然规则更直观,8 个网页入口中却有 2 个依赖临时搜索,页面结构也会改变;若要让结果可复现,先要花约 4 小时整理固定入口、快照和变化证据。
进度邮件的年度耗时更高,但它会直接影响客户对项目状态的理解。方案主体耗时最高,判断标准却依赖专业取舍。把它们放进第一项试验,会同时测试信息整理、写作、商业判断和外部承诺,很难知道一次失败究竟来自哪里。
会议行动项因此成为第一项试验。它的目标被压缩得很窄:从四类限定材料生成一张内部待确认表,字段只有行动、负责人、截止日期、原话证据、状态和风险提示。它不能读取邮箱,不能连接项目系统,也不能发送结果。第一次试验只回答“能否可靠整理明确承诺”,不顺带验证更多权限。
第一次试运行立刻制造了三个错误
2026 年 7 月 20 日 18:42,一段会议记录写道:
王宁:三张主视觉我周四之前改完发群里。价格表先别动,客户还没确认。
陈澄:收到图片后我来更新方案,时间要看素材什么时候到。
赵林:价格那块我晚点也许看一下。
其中只有两项明确行动。王宁负责替换并发送三张主视觉,截止 2026 年 7 月 23 日。陈澄在收到图片后更新方案,负责人明确,日期仍待确认,并且依赖王宁交付素材。
| 原话片段 | 正确处理 | 原因 |
|---|---|---|
| “三张主视觉我周四之前改完发群里” | 王宁;替换并发送;2026-07-23 | 动作、负责人和日期都明确 |
| “收到图片后我来更新方案” | 陈澄;更新方案;日期待确认 | 有承诺,但依赖尚未完成 |
| “价格表先别动” | 不生成行动项,保留为风险提示 | 这是明确否定 |
| “我晚点也许看一下” | 不生成正式行动项 | 意愿和时间都不确定 |
第一次运行却多生成了一项:“赵林审核价格表,截止 2026 年 7 月 24 日。”这一行把否定变成任务,把可能参与的人变成负责人,还补了原话中不存在的日期。表格看起来更完整,实际创造了三个假信息。
如果只检查文字是否通顺,这一行很容易通过。赵林确实提到了价格,日期也落在会议之后,看起来符合项目语境。问题要到原话层面才能发现:他说的是可能查看,前一句还明确要求价格表暂时不动。错误因此没有被归为“表达需要润色”,而是被拆成否定识别、负责人确认和日期证据三个独立问题。后面的试验也必须分别记录它们,不能用一项总体评分互相抵消。
这个错误改变了后续试验。否定表达不得生成任务;日期只能来自同一句话或已经确认的项目节点;“也许、考虑、晚点看看”保留为讨论,不能升级成承诺;负责人或日期缺失时写“待确认”。原话证据也从辅助字段变成放行条件,找不到证据的行动项整条作废。
后九次运行不再追求“看起来不错”
陈澄选取的 10 份会议材料覆盖了明确负责人和日期、多人共同负责、没有负责人、模糊时间、明确否定,以及讨论范围变化但尚未形成决定等情况。前 5 次可以根据错误修正规则;第 6—10 次冻结任务说明,用来判断流程能否稳定重复。
她没有使用一个综合准确率掩盖不同后果。明确行动项必须全部找到,错误负责人和擅自补日期必须为零,范围变化必须进入风险提示,没有原话证据就不放行。本人复核时间的稳定段中位数要低于 10 分钟,否则相对 24 分钟基线没有足够收益。
每次运行前,她保存使用的逐字稿、成员表和任务说明版本;运行后记录工具给出的项目数、人工删改内容、关键错误和本人分钟数。这样一来,第 4 次比第 1 次好,才能说明是规则修正产生了变化,而不是换了一份更容易的会议记录。输入质量明显不足的材料会被标出,但不会悄悄从结果里删掉。
前 5 次的作用是暴露失败方式。第 1 次出现三类关键错误后,规则增加了否定、弱意愿和日期来源限制;第 2 次仍出现一次擅自补日期,说明日期规则还没有真正生效。第 3—5 次用于确认修正没有同时造成新的明确项遗漏。到了第 6 次,她停止修改任务说明。否则每次遇到新材料都临时增加一句规则,十次运行只能证明人一直在现场救火,无法证明流程能够重复。
| 运行 | 输出项数 | 明确项遗漏 | 错误负责人 | 擅自补日期 | 本人分钟 |
|---|---|---|---|---|---|
| 1 | 8 | 1 | 1 | 2 | 13 |
| 2 | 5 | 0 | 0 | 1 | 11 |
| 3 | 9 | 0 | 0 | 0 | 9 |
| 4 | 6 | 0 | 0 | 0 | 8 |
| 5 | 7 | 0 | 0 | 0 | 7 |
| 6 | 4 | 0 | 0 | 0 | 9 |
| 7 | 11 | 0 | 0 | 0 | 10 |
| 8 | 6 | 0 | 0 | 0 | 8 |
| 9 | 5 | 0 | 0 | 0 | 7 |
| 10 | 8 | 0 | 0 | 0 | 8.5 |
第 1 次暴露了遗漏、错人与编日期;第 2 次仍有一次日期错误;第 3 次以后关键错误归零。真正用于判断是否保留流程的是规则冻结后的第 6—10 次,时间分别为 9、10、8、7、8.5 分钟,中位数为 8.5 分钟。
这里没有证明工具能够理解所有会议。它只证明在当前四类输入、当前任务说明和这组边界样本下,一张内部待确认表达到了预先设定的标准。
35.7 小时是怎样得到的
原做法的三次样本为 21、24、27 分钟,中位数 24 分钟。新流程仍需要本人逐项复核,因此每次净节省是 24-8.5=15.5 分钟,而不是完整的 24 分钟。
按每周 3 次、每年 46 周计算:
15.5 × 3 × 46 ÷ 60=35.65 小时,四舍五入为 35.7 小时。
会议行动项原本的年度耗时为 55.2 小时。两者相差的 19.5 小时主要是仍然保留的人工复核时间。把 55.2 小时直接写成 AI 节省,会假设人不再检查负责人、日期和证据,与实际流程不符。
第一次设置花了 75 分钟,前 5 次探索相对稳定段多用了约 10 分钟,前期投入合计 85 分钟。每周净省 46.5 分钟,静态回收期约为 85 ÷ 46.5=1.83 周。此后若成员表维护、逐字稿清理或规则更新持续占用时间,还要继续从 35.7 小时中扣除。
35.7 小时也没有被换算成营业收入。节省出来的时间是否用于收费工作、休息还是内部维护,需要另外记录。本文到这里能够支持的结论只有两个:流程在当前范围内减少了本人处理时间,前期投入在静态估算下能够较快收回。
她最终只放行了一张内部表
陈澄保留了会议行动项整理,但没有把成功解释成更多权限。输出仍停留在内部待确认表;她本人核对后,才决定是否更新项目记录或向客户发送内容。十次运行没有测试自动写入和自动通知,自然也不能为这些动作提供依据。
接下来的 30 天,她继续记录每次复核时间和关键错误。成员表、任务说明、模型或产品设置发生变化时,都写入变更记录;每两周重跑 6 条边界样本。下面几种情况会改变当前决定:
| 观察到的情况 | 当下处理 |
|---|---|
| 把明确否定写成行动项,或出现错人、编日期 | 暂停使用,新增固定测试样本并重新验证 |
| 连续两次遗漏明确承诺 | 退回人工整理,检查输入与任务说明 |
| 连续五次复核超过 12 分钟 | 复盘维护成本,必要时停止 |
| 行动项找不到原话证据 | 当次输出作废 |
| 逐字稿缺少参与者同意或其他合法依据 | 不上传材料 |
| 出现合同、价格、人员或敏感数据 | 只在获准环境处理,无法确认则保持人工 |
只有连续 30 天没有关键错误、复核时间稳定,而且连接正式系统确实能带来额外价值,她才会单独评估下一阶段。新权限需要新的样本、验收和停止条件,不能借用这 10 次运行的结论。
NIST 的 AI 风险管理资料把情境理解、表现测量和持续管理看作反复进行的工作。放到一个人的窄流程里,对应的就是限定用途、保存证据、记录真实表现,并在收益回吐或关键错误出现时退回人工。这里不需要建立一套企业治理制度,但需要知道当前结论在哪些条件下会失效。
把同一方法用在你的一个工作日
先不要选择工具,也不用一次设计完整七天。今天只建立下面这张日志,记录实际发生的工作:
| 日期 | 触发原因 | 任务动作 | 输入位置与版本 | 本人分钟 | 等待分钟 | 产出 | 验收条件 | 错误后果 | 外部动作 | 返工原因 |
|---|---|---|---|---|---|---|---|---|---|---|
晚上挑一行检查。若写的是“做内容”“跟进项目”或“处理邮件”,继续拆到一个触发、一组输入、一个主要动作和一项可检查产出。第二天仍按原流程工作,不要因为某一行看起来适合使用 AI 就提前改变基线。
七天后再做三件事:先清洗重复、混合、等待和返工;再用实际频率与中位耗时换算年度机会;最后逐项判断它属于委托、协作还是本人决定。委托类任务中,优先选择输入已经存在、结果可以独立验收、错误能在外部影响前发现、准备成本也可接受的一项。
确定第一项候选后,另建运行表,至少记录输入版本、任务说明版本、边界样本、本人时间、遗漏、错误、人工修改和是否放行。前几次允许修正规则,稳定段冻结规则。这样得到的结果可能是继续、降级或停止;三种结论都比没有基线时宣布“效率提高”更有用。
资料来源与案例边界
- NIST AI RMF Core:用于核验先理解使用情境、再测量并持续管理风险的基本框架。页面说明 AI RMF 1.0 正在更新,本文核验日期为 2026-07-21。
- NIST AI RMF Playbook · Map:用于核验缩小用途、记录预期使用方式和影响情境的建议。这是一套自愿采用的参考,不是逐项强制清单。
- NIST AI RMF Playbook · Measure:用于核验测试、记录错误、监控表现变化和保留人工监督数据的建议。
- OpenAI Evaluation best practices:用于核验评估目标、数据、指标、持续评估,以及典型与边界样本的覆盖方法。本文只借用通用评估思路,不要求使用特定模型或接口。
以上资料支持风险和评估方法,不为案例里的 46 个工作周、26 项任务、10 次运行或 35.7 小时背书。人物、业务和数字均为教学设计;应用到自己的工作时,应重新记录实际频率、耗时、数据条件与责任边界。