一个月后,她仍说不清 AI 到底省了什么

陈澄是一名独立 B2B 品牌顾问,同时服务 4 家长期客户。她已经使用 AI 一个月:写邮件时润色,做方案时要提纲,会议结束后让模型总结。聊天记录里留下了很多看似有用的结果,她却无法回答三个直接关系到经营的问题:哪项工作真的变快了,节省下来的究竟是本人时间还是等待时间,哪些结果已经稳定到可以写进日常流程。

如果第二天停止使用这些工具,她甚至不知道自己的工作会在哪个环节变慢。她一直根据当天最麻烦的任务临时尝试,任务变了,输入变了,验收办法也变了。即使偶尔得到一份不错的结果,也无法和原来的做法公平比较。

她暂时停下新的工具尝试,先记录一个完整工作周。七天结束时,原始表有 34 行;清洗后得到 26 项可观察任务,本人直接工作时间为 33 小时 10 分钟。等待、通勤和无法可靠归因的零碎切换共 4 小时 35 分钟,单独保留,没有算成潜在节省。

这份日志最后把她的工作分成三类:可以让工具先做、本人验收的;需要工具参与、但判断过程仍由本人主导的;以及价格、范围和客户承诺等必须本人决定的。她从第一类中选出会议行动项整理,完成 10 次试运行。稳定后,本人处理时间中位数从 24 分钟降到 8.5 分钟,按每周 3 次、每年 46 周估算,年度净节省约 35.7 小时。

三项候选任务的年度耗时与当前放行判断对比,会议行动项并非耗时最长但被选为第一项试验
图 1|第一项试验不按年度耗时机械排序。会议行动项约 55.2 小时,虽然不是耗时最多的候选,却最先具备了可核验、可撤回和低准备成本三个条件。

这里使用的是教学案例。人物、客户、任务和运行数字用于演示判断过程,不对应真实客户,也不是独立顾问行业的平均数据。它的价值不在于复制 35.7 小时这个结果,而在于看清这个结果是怎样从一周真实工作中得到的。

第一张日志很快暴露出记录方法的问题

最初的日志里有一行“处理客户邮件,64 分钟”。这句话符合日常记忆,却无法支持后面的判断。64 分钟里既有整理信息,也有商业判断,还有更新排期;三部分虽然都发生在邮箱附近,出错后果完全不同。

陈澄回看邮件、合同和修改记录,把这一行拆开:

拆分后的工作 本人时间 产出 适合怎样处理
根据项目记录起草进度邮件 18 分钟 一封内部草稿 可以让工具起草,本人核对事实和语气
判断新增要求是否超出原范围 31 分钟 范围判断与处理建议 必须由本人对照合同并作决定
更新排期并归档往来 15 分钟 新排期与可追溯记录 可以辅助整理,日期确认后再更新

这个拆分让她意识到,任务日志不能照搬日程名称。一次客户周会在日历里占 75 分钟,其中会议本身 52 分钟,等待客户上线 6 分钟,会后核对并整理行动项 17 分钟。如果她想改善的是行动项整理,真正进入基线的只有最后 17 分钟。模型没有替她参加会议,客户迟到的时间也不会因为生成了一张表而消失。

一场七十五分钟周会拆成五十二分钟会议、六分钟等待和十七分钟会后行动项整理
图 2|日历占用不等于可委托工时。先把会议、等待和会后处理分开,后面才不会把不存在的收益写进结论。

接下来的记录都要说清一项工作的触发、输入、动作和产出。任务结束后两分钟内,她只填发生了什么和实际分钟数;每天 18:30 再补输入位置、验收办法、错误后果与返工。第 4 天只检查有没有漏记高频小任务,不提前评分,也不顺手改变原流程。第 8 天才统一清洗。

等待时间仍然保留,只是不混入本人耗时。系统运行、等待他人回复、通勤和无法归因的切换分别记录;查错和返工则回填到引发返工的原任务。这样处理之后,所谓“节省”才不会同时包含本人工作、机器等待和客户迟到。

她选择七天,是因为长期客户的周会、内容制作、交付检查和一次财务处理通常都会在一周内出现。这个周期足以找到第一批重复动作,又不会把记录本身变成一个月的新项目。它无法覆盖月末集中开票、季度投标或旺季交付,所以她在日志里标出这些缺口,准备到相应周期再补样本。七天给出的只是首张工作地图,不负责代表全年所有工作。

记录动作也保持得很轻。白天若为了填写十几个字段而中断工作,日志测到的会是“工作加记录”的新流程。陈澄把事实记录与晚间补充拆开,既能保留触发时点,又能在当天材料还找得到时补上输入版本和验收依据。第 4 天的查漏只解决“有没有记”,不讨论“适不适合 AI”;这让后半周仍然可以和前半周放在同一条基线上。

七天后,34 行记录怎样变成 26 项任务

清洗在原始日志的副本上完成。原表保留,因为合并和拆分都带有判断;一旦发现任务边界划错,还能回到当时的记录。

陈澄先合并触发、动作和产出都相同的重复项,但保留每次耗时;一行里出现两种责任,就像前面的 64 分钟邮件,拆成独立任务。超过 15 分钟且已经转去做另一件事的中断,从原任务时间中扣除。等待单列,返工归回原任务,会议本身与会后处理分开。

下面 8 行展示了清洗后的任务颗粒度。完整日志有 26 项,这里只保留能够说明后续分类和选择的记录:

日期 触发 动作与产出 本人分钟 验收办法 出错后果
周一 客户周会结束 从逐字稿整理待确认行动项 27 回到原话逐项核对 错人、漏项或制造假承诺
周一 收到 3 个竞品页面 对照上周快照标出变化 68 页面证据与时间可追溯 把旧变化当成新变化
周二 客户追问当前进度 汇总项目记录并起草回复 18 事实与项目表一致 对外状态表述错误
周二 客户增加交付要求 判断是否超出合同范围 31 对照合同和会议确认 错误报价或免费承诺
周三 准备新方案 撰写方案主体第一版 210 逻辑、证据和取舍成立 方案方向偏离
周四 第二次周会结束 整理行动项并确认负责人 21 逐句核对原始记录 错派任务
周四 财务表出现逾期 核对发票、到账与联系人 38 银行和发票记录一致 错误催款
周五 第三次周会结束 整理行动项与未决事项 24 区分承诺、讨论和否定 把讨论写成决定
三十四行原始记录经过合并重复项、拆分混合任务、剔除等待与归回返工后形成二十六项可观察任务
图 3|清洗不是删掉“不好看”的时间。34 行变成 26 项,是为了统一任务口径;等待、切换和返工仍被保留,只是不再混进可节省工时。

这一步结束后,本人可归因的任务时间合计 33 小时 10 分钟,另外 4 小时 35 分钟留在任务表之外。26 项任务中有 11 项可能重复发生;其余任务有的只在本周出现一次,有的尚未找到稳定输入。她没有给无法归因的时间做平均分摊,也没有因为某项任务看起来适合使用 AI,就把它提前改写成规则清晰的样子。

清洗最难的地方通常不是加总,而是判断两次记录究竟是不是同一项工作。三次会议整理都以“从会议材料提取明确承诺”为验收目标,可以合并并保留 21、24、27 分钟三个样本;访谈洞察归类虽然也处理逐字稿,却要解释证据和形成观点,不能因为输入格式相似就并进来。反过来,同一封邮件里的进度起草和范围判断必须拆开,因为前者核对事实即可,后者会改变商业承诺。

她还回看了返工来自哪里。报告第二天发现名称错误,修正时间应回到原报告检查;若另记成“修改文件”,原任务就会显得比实际更便宜。清洗后的 26 项不是对工作名称做得更漂亮,而是让同一行里的耗时、验收和后果指向同一件事。只有达到这个程度,后面的年度换算才有共同口径。

年度耗时把五个候选带到了同一张桌上

一周记录会低估高频小任务,也会放大偶然出现的大任务。陈澄按自己的休假和业务空档采用一年 46 个工作周,把 11 项重复任务分别换算。第一轮只比较其中 5 个更有可能产生明显收益的候选,其余 6 项继续保留在日志里,没有用一个无法展开复算的总数代替明细。

换算公式是:

年度本人小时数=每周发生次数 × 单次耗时中位数 × 年工作周数 ÷ 60。

46 个工作周来自陈澄自己的经营节奏:从 52 周里扣除休假、培训、业务空档和不执行常规周任务的时间。它不是推荐给所有独立工作者的固定参数。若某项工作只在项目交付月发生,应该按项目次数计算;若每逢月末集中处理,至少等到月末样本出现再估算。频率口径错误时,单次耗时记录得再精确也没有意义。

单次耗时采用中位数,是为了减少一次材料缺失或一次特别顺利对结果的拉动。进度邮件的六次样本从 11 分钟到 25 分钟,相差一倍以上;16 分钟的中位数可以提供首个点估计,50.6—115 小时的观察范围则提醒她继续寻找波动原因。方案主体只有一次 210 分钟记录,80.5 小时只能标成暂时估算,不能和三次相近的会议样本视为同等证据。

会议行动项每周 3 次,样本为 21、24、27 分钟,中位数是 24 分钟。年度点估计为 3 × 24 × 46 ÷ 60=55.2 小时。若用本周最低和最高样本计算,范围为 48.3—62.1 小时。这个范围只描述当前观察到的波动,不是统计置信区间。

候选任务 每周次数 本周耗时样本(分钟) 年度点估计 现有证据的限制
整理会议行动项 3 21、24、27 55.2 小时 样本少,但三次相近
检查竞品变化 1 68、83 57.9 小时 两个网页入口不稳定
起草客户进度邮件 6 11、14、16、16、18、25 73.6 小时 年度范围约 50.6—115 小时
撰写方案主体 0.5 210 80.5 小时 只有一次样本,不能估计波动
核对逾期应收 1 38 29.1 小时 还缺月末集中处理样本

方案主体的点估计最高,证据却最弱;进度邮件发生最频繁,内容里又可能包含尚未确认的客户承诺。年度耗时在这里完成了筛选作用:它把值得继续分析的工作带到同一张桌上,却没有替陈澄作出自动化决定。

三类工作是在一次次取舍中分开的

陈澄没有先给任务贴“简单”或“复杂”的标签。她逐项追问四件事:结果会不会形成价格、合同、付款、公开立场或客户权利等外部承诺;能否离开模型的自我评价,用原话、合同、项目记录或明确规则独立验收;输入是否稳定并允许在当前环境使用;错误能否在影响客户之前被发现、撤回或重做。

四个问题在不同任务上产生了不同结果。会议行动项能回到逐字稿逐句核对,输出在内部表里,错了还来得及删除;它因此进入委托类。进度邮件虽然也能核对项目事实,一句话的轻重却可能改变客户对延期和范围的理解,发出后也无法真正撤回,所以只能协作起草。合同范围判断即使找到了全部条款,是否接受新增要求仍涉及价格、关系和后续责任,工具整理材料不会把最终决定转移出去。

输入条件也会改变分类。竞品变化检查在规则上很清楚,但两个网页入口不稳定,今天搜索到的页面和下周可能不同。当前条件下,它还不能稳定委托;修复入口和快照后,分类才可能改变。分类表记录的是“这项工作在现有条件下怎样处理”,并不是给任务名称贴上永久标签。

答案逐渐把工作分成三类。这里的“委托”仍然包含人工验收,只是工具可以先完成相对完整的内部产物;“协作”意味着判断过程本身由人主导,工具只处理材料或草稿;“本人决定”则不允许工具替人形成最终承诺。

工作 分类 工具可以做到哪一步 陈澄仍然负责什么
会议行动项整理 适合委托 从限定逐字稿生成内部待确认表 逐项核对负责人、日期和证据
竞品变化检查 条件成熟后委托 对稳定页面生成变化清单 先修复来源和快照规则,处理异常
客户进度邮件 适合协作 汇总已确认事实并起草 判断语气、风险和对外表述,亲自发送
方案主体撰写 适合协作 整理证据、提出结构和检查遗漏 决定观点、取舍和最终方案
合同范围判断 必须本人决定 找出相关合同条款和历史承诺 判断是否超范围以及怎样回应客户
最终报价与催款对象 必须本人决定 汇总成本、到账和联系记录 决定价格、关系处理和正式外部动作

这张表完成了七天日志最重要的产出:工作不再只有“使用 AI”和“不使用 AI”两种状态。会议行动项可以先交给工具整理,方案可以共同完成,范围和价格则明确留在人手里。即使工具能够生成一句报价,也不会改变报价责任属于陈澄。

她还设置了两条不进入比较的底线:流程若要自行执行高后果外部动作,或者必须使用尚未获准的数据,就直接停止准备。收益评分不能抵消这两类问题。

五项候选任务经过责任门、否决项、准备成本和验收条件筛选后,会议行动项进入第一次试验
图 4|先过责任门,再比较收益。评分没有替代否决项。无法控制外部后果或数据使用的任务,不会因为耗时很多就排到前面。

她为什么把会议行动项放在第一位

进入“适合委托”的工作仍有两个:会议行动项整理和竞品变化检查。两项都能保留来源,也都可以在内部复核后再使用。陈澄继续比较准备成本。

会议任务已经有逐字稿、参会成员表、会议日期和已确认的项目节点。第一次设置预计需要 75 分钟。竞品检查虽然规则更直观,8 个网页入口中却有 2 个依赖临时搜索,页面结构也会改变;若要让结果可复现,先要花约 4 小时整理固定入口、快照和变化证据。

进度邮件的年度耗时更高,但它会直接影响客户对项目状态的理解。方案主体耗时最高,判断标准却依赖专业取舍。把它们放进第一项试验,会同时测试信息整理、写作、商业判断和外部承诺,很难知道一次失败究竟来自哪里。

会议行动项因此成为第一项试验。它的目标被压缩得很窄:从四类限定材料生成一张内部待确认表,字段只有行动、负责人、截止日期、原话证据、状态和风险提示。它不能读取邮箱,不能连接项目系统,也不能发送结果。第一次试验只回答“能否可靠整理明确承诺”,不顺带验证更多权限。

第一次试运行立刻制造了三个错误

2026 年 7 月 20 日 18:42,一段会议记录写道:

王宁:三张主视觉我周四之前改完发群里。价格表先别动,客户还没确认。
陈澄:收到图片后我来更新方案,时间要看素材什么时候到。
赵林:价格那块我晚点也许看一下。

其中只有两项明确行动。王宁负责替换并发送三张主视觉,截止 2026 年 7 月 23 日。陈澄在收到图片后更新方案,负责人明确,日期仍待确认,并且依赖王宁交付素材。

原话片段 正确处理 原因
“三张主视觉我周四之前改完发群里” 王宁;替换并发送;2026-07-23 动作、负责人和日期都明确
“收到图片后我来更新方案” 陈澄;更新方案;日期待确认 有承诺,但依赖尚未完成
“价格表先别动” 不生成行动项,保留为风险提示 这是明确否定
“我晚点也许看一下” 不生成正式行动项 意愿和时间都不确定

第一次运行却多生成了一项:“赵林审核价格表,截止 2026 年 7 月 24 日。”这一行把否定变成任务,把可能参与的人变成负责人,还补了原话中不存在的日期。表格看起来更完整,实际创造了三个假信息。

如果只检查文字是否通顺,这一行很容易通过。赵林确实提到了价格,日期也落在会议之后,看起来符合项目语境。问题要到原话层面才能发现:他说的是可能查看,前一句还明确要求价格表暂时不动。错误因此没有被归为“表达需要润色”,而是被拆成否定识别、负责人确认和日期证据三个独立问题。后面的试验也必须分别记录它们,不能用一项总体评分互相抵消。

会议原话被逐条映射为行动、负责人、日期、证据和风险提示,否定与模糊表态没有被生成正式任务
图 5|“不确定”应被保留下来。可靠的整理不是把每个空格填满,而是知道哪些信息目前没有证据。

这个错误改变了后续试验。否定表达不得生成任务;日期只能来自同一句话或已经确认的项目节点;“也许、考虑、晚点看看”保留为讨论,不能升级成承诺;负责人或日期缺失时写“待确认”。原话证据也从辅助字段变成放行条件,找不到证据的行动项整条作废。

后九次运行不再追求“看起来不错”

陈澄选取的 10 份会议材料覆盖了明确负责人和日期、多人共同负责、没有负责人、模糊时间、明确否定,以及讨论范围变化但尚未形成决定等情况。前 5 次可以根据错误修正规则;第 6—10 次冻结任务说明,用来判断流程能否稳定重复。

她没有使用一个综合准确率掩盖不同后果。明确行动项必须全部找到,错误负责人和擅自补日期必须为零,范围变化必须进入风险提示,没有原话证据就不放行。本人复核时间的稳定段中位数要低于 10 分钟,否则相对 24 分钟基线没有足够收益。

每次运行前,她保存使用的逐字稿、成员表和任务说明版本;运行后记录工具给出的项目数、人工删改内容、关键错误和本人分钟数。这样一来,第 4 次比第 1 次好,才能说明是规则修正产生了变化,而不是换了一份更容易的会议记录。输入质量明显不足的材料会被标出,但不会悄悄从结果里删掉。

前 5 次的作用是暴露失败方式。第 1 次出现三类关键错误后,规则增加了否定、弱意愿和日期来源限制;第 2 次仍出现一次擅自补日期,说明日期规则还没有真正生效。第 3—5 次用于确认修正没有同时造成新的明确项遗漏。到了第 6 次,她停止修改任务说明。否则每次遇到新材料都临时增加一句规则,十次运行只能证明人一直在现场救火,无法证明流程能够重复。

运行 输出项数 明确项遗漏 错误负责人 擅自补日期 本人分钟
1 8 1 1 2 13
2 5 0 0 1 11
3 9 0 0 0 9
4 6 0 0 0 8
5 7 0 0 0 7
6 4 0 0 0 9
7 11 0 0 0 10
8 6 0 0 0 8
9 5 0 0 0 7
10 8 0 0 0 8.5

第 1 次暴露了遗漏、错人与编日期;第 2 次仍有一次日期错误;第 3 次以后关键错误归零。真正用于判断是否保留流程的是规则冻结后的第 6—10 次,时间分别为 9、10、8、7、8.5 分钟,中位数为 8.5 分钟。

这里没有证明工具能够理解所有会议。它只证明在当前四类输入、当前任务说明和这组边界样本下,一张内部待确认表达到了预先设定的标准。

35.7 小时是怎样得到的

原做法的三次样本为 21、24、27 分钟,中位数 24 分钟。新流程仍需要本人逐项复核,因此每次净节省是 24-8.5=15.5 分钟,而不是完整的 24 分钟。

按每周 3 次、每年 46 周计算:

15.5 × 3 × 46 ÷ 60=35.65 小时,四舍五入为 35.7 小时。

会议行动项原本的年度耗时为 55.2 小时。两者相差的 19.5 小时主要是仍然保留的人工复核时间。把 55.2 小时直接写成 AI 节省,会假设人不再检查负责人、日期和证据,与实际流程不符。

第一次设置花了 75 分钟,前 5 次探索相对稳定段多用了约 10 分钟,前期投入合计 85 分钟。每周净省 46.5 分钟,静态回收期约为 85 ÷ 46.5=1.83 周。此后若成员表维护、逐字稿清理或规则更新持续占用时间,还要继续从 35.7 小时中扣除。

从二十四分钟人工基线扣除八点五分钟复核时间,再按每周三次和每年四十六周计算出三十五点七小时年度净节省
图 6|净节省必须扣掉人工复核。55.2 小时是原任务的年度耗时,35.7 小时才是当前流程在稳定段能够支持的净收益估计。

35.7 小时也没有被换算成营业收入。节省出来的时间是否用于收费工作、休息还是内部维护,需要另外记录。本文到这里能够支持的结论只有两个:流程在当前范围内减少了本人处理时间,前期投入在静态估算下能够较快收回。

她最终只放行了一张内部表

陈澄保留了会议行动项整理,但没有把成功解释成更多权限。输出仍停留在内部待确认表;她本人核对后,才决定是否更新项目记录或向客户发送内容。十次运行没有测试自动写入和自动通知,自然也不能为这些动作提供依据。

接下来的 30 天,她继续记录每次复核时间和关键错误。成员表、任务说明、模型或产品设置发生变化时,都写入变更记录;每两周重跑 6 条边界样本。下面几种情况会改变当前决定:

观察到的情况 当下处理
把明确否定写成行动项,或出现错人、编日期 暂停使用,新增固定测试样本并重新验证
连续两次遗漏明确承诺 退回人工整理,检查输入与任务说明
连续五次复核超过 12 分钟 复盘维护成本,必要时停止
行动项找不到原话证据 当次输出作废
逐字稿缺少参与者同意或其他合法依据 不上传材料
出现合同、价格、人员或敏感数据 只在获准环境处理,无法确认则保持人工

只有连续 30 天没有关键错误、复核时间稳定,而且连接正式系统确实能带来额外价值,她才会单独评估下一阶段。新权限需要新的样本、验收和停止条件,不能借用这 10 次运行的结论。

NIST 的 AI 风险管理资料把情境理解、表现测量和持续管理看作反复进行的工作。放到一个人的窄流程里,对应的就是限定用途、保存证据、记录真实表现,并在收益回吐或关键错误出现时退回人工。这里不需要建立一套企业治理制度,但需要知道当前结论在哪些条件下会失效。

把同一方法用在你的一个工作日

先不要选择工具,也不用一次设计完整七天。今天只建立下面这张日志,记录实际发生的工作:

日期 触发原因 任务动作 输入位置与版本 本人分钟 等待分钟 产出 验收条件 错误后果 外部动作 返工原因

晚上挑一行检查。若写的是“做内容”“跟进项目”或“处理邮件”,继续拆到一个触发、一组输入、一个主要动作和一项可检查产出。第二天仍按原流程工作,不要因为某一行看起来适合使用 AI 就提前改变基线。

七天后再做三件事:先清洗重复、混合、等待和返工;再用实际频率与中位耗时换算年度机会;最后逐项判断它属于委托、协作还是本人决定。委托类任务中,优先选择输入已经存在、结果可以独立验收、错误能在外部影响前发现、准备成本也可接受的一项。

确定第一项候选后,另建运行表,至少记录输入版本、任务说明版本、边界样本、本人时间、遗漏、错误、人工修改和是否放行。前几次允许修正规则,稳定段冻结规则。这样得到的结果可能是继续、降级或停止;三种结论都比没有基线时宣布“效率提高”更有用。

资料来源与案例边界

  • NIST AI RMF Core:用于核验先理解使用情境、再测量并持续管理风险的基本框架。页面说明 AI RMF 1.0 正在更新,本文核验日期为 2026-07-21。
  • NIST AI RMF Playbook · Map:用于核验缩小用途、记录预期使用方式和影响情境的建议。这是一套自愿采用的参考,不是逐项强制清单。
  • NIST AI RMF Playbook · Measure:用于核验测试、记录错误、监控表现变化和保留人工监督数据的建议。
  • OpenAI Evaluation best practices:用于核验评估目标、数据、指标、持续评估,以及典型与边界样本的覆盖方法。本文只借用通用评估思路,不要求使用特定模型或接口。

以上资料支持风险和评估方法,不为案例里的 46 个工作周、26 项任务、10 次运行或 35.7 小时背书。人物、业务和数字均为教学设计;应用到自己的工作时,应重新记录实际频率、耗时、数据条件与责任边界。