先看第90天:三个工作流都进入受控使用,46项同类工作少40.4小时,但106小时建设投入尚未收回

独立管理培训项目设计顾问唐宁有6家长期企业客户,每周工作上限45小时。她原来已在搜索、写作和会议整理中零散使用AI,却没有共同输入、来源记录、评估、版本或经营指标。90天项目不是“接入更多工具”,而是交付五项可验收结果:研究证据简报、提案报价包、客户状态/行动包三个工作流;一套运营证据库;一份经营记分卡。

她先从最近记录重建46项可比较任务:12份研究简报、10份提案、24份周度状态包。改造后仍用同类数量复测,任务总耗时从108.5小时降至约68.1小时,原承诺内完成从36/46升至43/46,一次通过从33/46升至41/46。所有34次客户外发都有人批准,0次错误收件、跨客户内容或未经批准发送。

第 90 天结果 基准队列 受控队列
可比项 46 46
任务工时 108.5 68.1
准时 36/46 43/46
一次通过 33/46 41/46
内容返工 13 5
外部发布 34 34
外部发送前的人工审批 未系统记录 34/34
重大事件 已知为 0、记录不完整 0 且有日志
四十六项同类任务的工时、准时、首次通过、返工、人工审批和重大事件基准与受控结果对照
第90天改善的是任务表现和控制证据,不等于已经回本。46 项同类任务从 108.5 小时降到 68.1 小时,准时、首次通过和返工均改善,34 次外发全部有人批准;但期内约 52 小时实际节省仍小于 106 小时建设投入,现金结果也未知。

但这不是“90天回本”故事。建设、清理、测试和文档共106小时,新增工具90天花费¥2,760;分阶段上线只在期内产生约52小时时间节省,净投入仍约54小时。第90天决定是维持三个有限使用工作流、继续测量和减少维护摩擦,不开放自动发送,也不开始第四个工作流。

五项结果彼此有依赖:没有知识资产,研究会每次重新寻找来源;没有研究的证据对象,提案会复用未经核验的卖点;没有范围与放行记录,状态无法区分计划、承诺与完成;没有统一记分卡,三个局部节时就无法回答经营是否更好。90天计划因此是一项小型运营改造,不是三个互不相干的自动化演示。

唐宁也保留原手工路径。任何工作流进入影子、工具不可用、来源冲突或客户要求特殊处理时,她都能从冻结的输入快照继续人工交付,并在日志标记回退。AI改造若让一个人失去不用AI完成核心服务的能力,只是把旧依赖换成新依赖。

人物、客户、日期、任务、价格和结果均为虚构教学案例。本文是OPC项目设计示例,不保证效率、收入或投资回报,也不替代客户合同、知识产权、隐私、安全、税务、财务或行业专业判断。

先定义90天结束时能拿在手里的产物:不是“学会AI”,也不是购买订阅数

结果 第 90 天证据 不算完成
工作流 1 12次研究简报运行与评估 有一个漂亮演示
工作流 2 10次提案包、10/10批准 只生成模板
工作流 3 24次状态包与动作账本 自动发一封邮件
知识资产 186项已接受、14 隔离、26 删除记录 把文件上传向量库
记分卡 基准与改造后的分母、成本、错误、决定 只报节省百分比
运营包 负责人、版本、回滚、停止、复核日期 聊天记录里的经验

90天边界不包括训练自己的基础模型、建设公共SaaS、替客户作法律/投资/人事决定,也不要求无人值守。唐宁既是负责人也是最终批准人,但在卡片上仍分别记录执行人、复核人和决策负责人,让“都是我”不成为跳过控制的理由。客户最终商业决定仍由客户作出。

她把成功写成行为与证据:任务从获准输入开始,到可定位放行或明确停止结束;时间必须包含准备、等待处理、人工复核和返工;“AI生成完成”只是中间事件。第90天若只有提示词而没有运行日志、失败样本和使用结果,项目视为未完成。

每项产物还要有使用者和使用事件。库被某次检索引用、提案被客户用于范围决定、状态使一个行动获得负责人,才说明资产进入工作;文件存在只证明生产活动。相反,被放行门槛正确拒绝的高风险请求也可以是成功结果,因为系统履行了不应自动完成的边界。

90天结束不要求流程永久定型。每个运行手册注明当前适用客户、输入类型、工具版本、复核日期和退役条件;未知项集中进入决策日志。这样日 90交付的是一套可继续经营的当前系统,而不是一套假装未来不会变化的“最佳实践”。

日 0经营快照先说明为什么改:每周45小时里29.5小时被三类可重复工作与修复占据

发布前周容量 工时 证据
客户研讨会/决策 9.0 日历 + 发票
研究/证据 10.3 时间日志
提案/范围界定 7.1 文档事件
状态/跟进 7.5 发送日志
上下文搜索/修复 4.6 抽样日记
销售对话 3.2 日历
财务/行政 2.3 任务日志
缓冲 1.0 残余
总计 45.0
四十五小时普通周按客户决策、研究、提案、状态、搜索修复、销售、行政和缓冲拆分
日0先从经营容量确定改造重点。研究、提案、状态与搜索修复合计 29.5 小时,重复转换与查找较多;图中同时保留 9 小时深度客户决策、销售、行政和缓冲。目标不是消灭 29.5 小时,其中证据判断、范围承诺与客户沟通仍创造价值。

客户决策工作只有9小时,而研究、提案、状态与找资料/修复合计29.5小时。项目目标不是把29.5小时全部消灭;其中证据判断、范围承诺和客户沟通本身创造价值。目标是在保持质量边界的条件下,把重复转换、查找和格式劳动降下来,并把释放时间明确分配给客户工作、销售、资产维护和缓冲。

经营结果设三层:运营看周期时间、一次通过和事故;容量看释放时间是否真的没有被新返工吃掉;业务看额外客户价值、提案响应与现金结果。第三层有更长因果链,90 天只能记录,不把一次签单全部归因于 AI。

日 0还冻结客户与服务组合:6家长期客户、当前包、每周固定会议与既有价格都不在实验中同时改变。若90天内发生新客户、假期或大项目,记分卡另作事件标记,不把结构变化埋进平均数。否则时间下降可能只是任务变简单,收入变化也可能来自价格或季节,而非工作流。

时间日志用两周日记与文件事件交叉:唐宁在开始、等待、复核、返工和发送分别记时间,工具处理时的被动等待不算人工分钟,但若她只能守着界面则仍算占用。抽查发现原先所谓“写提案 90分钟”只计算写正文,忽略寻找旧范围、检查价格与来回改文件,才形成285分钟的完整基线。

不用机会总分选三个工作流:先过频率、证据、可逆、数据和责任门,再按依赖顺序推进

候选项 证据 放行门槛决策
研究→证据简报 每周3次、内部先看、来源可锁 首次选择
咨询→提案包 每周约2.5次、外部承诺、人可批准 二次选择
交付日志→状态包 6客户周度、外发但可撤回/更正 三次选择
自动陌生拓客 无许可/品牌风险、需求证据弱 拒绝
合同条款红线 后果高、需专业判断 排除/专业人
自动催款 每月3—4次、规则确定 先用普通提醒
内容多渠道改写 不是当前瓶颈 积压
自动决定客户优先级 责任与关系判断不可外包 人工决策

第一个工作流产生证据卡片,第二个复用证据与服务模块,第三个复用已经承诺的范围和交付事件;顺序降低重复建设。若先做提案,唐宁会在没有可靠证据库时让模型自由找卖点;若先做状态自动发送,她会在接收方、版本和行动负责人尚未稳定时把风险推到客户面前。

选择表不使用“收益8分、难度4分”的总分,因为一项合同高后果任务不能靠频率高抵消责任门。被拒任务保留原因与复核触发器:若未来有专业合作人、客户授权或量级变化可以重审,但不因工具能演示就偷渡进本期。

三个入选任务也不是风险最低的三个,而是能形成递进证据且仍可由一个人控制的组合。研究在内部先暴露引用与状态未知;提案提高责任但发送前可逐字段批准;状态使用真实交付事件并要求客户可核对。若第一步无法稳定保留来源,后两步不进入真实客户,因为它们会放大同一缺陷。

唐宁为未选任务估算机会成本但不承诺日期。内容改写即使容易展示,对当前29.5小时瓶颈帮助有限;自动催款频率低且普通规则足够;陌生拓客缺少合法、品牌与目标证据。选择工作流的能力包括拒绝“AI味最强”的项目,把有限建设容量留给真实经营约束。

90天不是三个月后才验收:五个波次在日 14、35、56、84和90留下可退出的决策记录

焦点 具体产出 放行门槛
1—14 基线 + 范围 46 项对照任务、风险与指标合同 数据可比较
15—35 工作流 1 12 次研究运行、96 条主张 内部有限使用
29—56 工作流 2 10 提案运行、放行控制 外部人工审批
57—84 工作流 3 24 状态运行、68 待办事项 客户批准发送
78—90 集成 库、成本、记分卡、运行手册 继续/变更/停止
基线、研究、提案、状态和集成五个波次及第十四、三十五、五十六、八十四和九十天门槛
五个波次可以重叠,但客户相关使用必须等待前一门通过。图中把基线、研究、提案、状态和集成放在同一时间线上,并列出第 14、35、56、84 和 90 天各自允许的范围。日期只是容量计划;前一关失败时,后续须顺延、缩小或停止。

波次有意少量重叠:工作流 2只在工作流 1通过日 35 放行门槛后进入客户相关测试;29—35只做合成提案与字段设计。工作流 3的最后一周与集成重叠,但不再改变核心结构。若前一放行门槛失败,后续日期整体顺延,不能为了守90日海报而跳过影子或批准。

每周五固定用 90 分钟做组合评审:查看本周新建与关闭、失败、人工分钟、未解释异常和下周容量。任何高严重度事件即时复核,不等周五。每日使用仍走各工作流自己的检查清单,组合评审不能替代单次放行门。

重叠波次有明确容量上限:每周最多8小时用于新设计,4小时用于评估与复核,2小时用于库维护;客户交付和恢复缓冲不被实验预售。若建设连续两周超过14小时,先缩小本波范围而不是用夜间加班守日期。一个人的90天计划必须把个人可持续性当系统约束。

每个放行门槛会议只产生继续、变更或停止三种记录。继续注明允许范围;变更列需修的控制与复测样本;停止说明如何恢复手工、处理已收数据和通知受影响客户。没有“基本不错,先上线再说”的第四种状态,也不因下一阶段已经排期而放宽前一阶段门槛。

一张项目控制表把目标、风险、证据和成本连起来

字段 填写示例
目标 每周释放≥8小时且外部严重错误=0
基准队列 46 项 / 108.5小时 / 13 返工
范围内用户 唐宁;客户仅收放行/给批准
批准数据 公共来源、客户明确授权材料、内部方法
禁止数据 无权客户资料、专门敏感决定、未知权利
工作流进行中 同时最多1个新设计、3个试点项目
严重停止 跨客户、错误价格/范围外发、未授权操作
成本负责人 唐宁;时间¥240/小时作教学机会成本
决策日期 第 14/35/56/84/90 天
最终决策 继续 3 个工作流;不自动发送;不启动工作流 4
经营目标、同分母基线、批准和禁止数据、工作流在制、严重停止、成本负责人和决策日期控制表
一张控制表防止三个工作流各自报喜。目标、46 项基线、批准与禁止数据、在制上限、严重停止事件、机会成本和五个决策日使用同一口径。控制表只保存必要索引,受限资料仍留在获准位置;没有日志不能冒充没有事件。

控制表只保存必要索引,受限客户资料留在获准位置。每一个数字都有事件定义和来源:任务时间从准备输入到保存放行,等待客户时间单列;一次通过指没有发生内容性退回,不是连标点都没有修改;严重错误先列事件类型,再统计为 0,不能因为没有日志就默认没有发生。

当指标定义变化时写版本与重算影响。例如日 18发现过去的提案时间漏记范围澄清,唐宁没有把新口径直接接到旧图上,而是回补10个基线样本并标4项为估算。没有可靠历史的字段显示状态未知,宁可少一条趋势,也不用精确小数制造可信度。

控制表还保存假设登记册:典型周任务量是否稳定、每小时¥240是否适合作为机会成本、客户是否接受新的状态结构、工具费用会否变化。每个假设有验证日期与影响方向。经济模型出现结果时,读者能看到它依赖哪些条件,而不是只看到一个回收期数字。

范围变更也走同一张表。若有人提出“顺便让提案自动发送”,这不是实现细节,而是增加外部动作和事故责任,必须新建变更、更新风险与评估并重新过放行门槛。项目期限固定不代表风险边界可以悄悄扩大。

日 1—14先重建46项基线:同分母比较研究、提案和状态,而不是拿最好演示对平均旧流程

工作流 样本数 基线每项分钟 工时 准时 一次通过
研究简报 12 155 31.0 9/12 8/12
提案包 10 285 47.5 7/10 6/10
状态/操作包 24 75 30.0 20/24 19/24
总计 46 混合 108.5 36/46 33/46
十二项研究、十项提案和二十四项状态任务的分钟、总工时、准时、首次通过与证据置信度基线
同分母基线先于漂亮演示。46 项按相同起止和质量事件连续取样,总计 108.5 小时;42 项可由文件、日历或发送事件重建,4 项标为低置信估算,13 项返工保留类型。该群组只代表本期三类高频任务,不代表全部顾问工作。

42 项有文件时间、日历或发送事件可直接重建,4 项只有唐宁当周日志,标为低置信度估算;改造后的对照任务仍保留相同定义、输入齐全条件和停止点。提案若被客户撤回,记录为已撤回,不进入完成时间;状态任务若缺客户决定,则正确输出阻塞或未知,不因没有漂亮总结而判失败。

基线还抽取 13 项返工:4 个研究主张缺少支持,3 个提案的范围或价格不一致,1 个使用旧模板,5 个状态动作缺少负责人或到期日。没有严重事故被记录,但旧流程没有统一接收方与放行日志,所以只能写“已知为 0、日志记录不完整”,不能与改造后的“0 且有完整日志”当作同等证据。

46项不是随机代表所有顾问工作,只代表本期三个高频类型。唐宁保留任务日期、客户别名、复杂度标签和缺输入情况,发布从相同定义连续取样,不挑成功项补足数量。某次提案因客户撤回而退出分母时,记录原因并取下一项连续样本,不能用一份顺利的小提案替换复杂失败来美化结果。

准时与一次通过也不等于业务正确。研究还看主张关系,提案还看范围/价格/条款,状态还看行动负责人/截止日期,严重事件单独列零容忍。统一指标用于组合,工作流专属护栏用于阻止总平均掩盖高代价错误。

把226项候选资料变成一套运营证据库:先删除和隔离,再谈检索

唐宁盘点云盘、笔记与邮件引用得到226项候选。她没有全部上传,而是逐项确认来源、权利、客户标识、当前性、适用条件和错误后果。最终已接受 186、隔离 14、删除 26;删除包含16项重复/被替代文件与10项不再需要的旧客户敏感副本,按约定完成可恢复或不可恢复处置并留证。

候选项处置 计数 操作
已接受 186 标准化 + 版本 + 评估链接
隔离: 权限不明确 8 不进入AI,找授权/替代
隔离: 冲突/过时 6 负责人复核
删除: 重复/已取代 16 指向规范化的后删除
删除: 过期的敏感副本 10 按留存处置
总计 226

隔离不是永久垃圾桶:每项有负责人、原因、下次复核和过期;到期仍无合法用途则删除。删除对象先解析引用,避免仍在使用的提案断链。备份和第三方索引能否同步删除另行验证,不把移动到归档当完成。

8项权限不明确包括没有明确二次使用许可的客户例子,6项冲突/过时包括价格口径冲突与方法已变更。它们不能通过“只用于内部”自动放行,因为内部模型处理也可能超出原目的或产生错误引用。找不到授权时用合成例子或公开来源替代,而不是把风险藏在检索层。

26项删除先经过挂起检查:是否涉及未完合同、争议、账务或其他必须保留的义务。实际保留期限和删除方式由真实协议与专业意见决定;案例数字只演示应记录处置,不提供普遍法律期限。

186 项资产按六种对象管理

资产类型 计数 示例/用途
证据卡片 52 一条主张与来源关系
服务模块 34 范围、输入、交付物、价格规则
已批准示例 28 9项获准、19项合成
中立语言 24 去客户化问题/结果表述
决策规则 18 通过/阻塞/升级条件
失败与停止情形 30 误用、状态未知与恢复
总计 186 一套库,不是六个散库
可复制模板
资产标识:EV-037
类型:证据卡片
主张:仅描述被来源直接支持的事实
来源:网页地址 + 采集时间 + 原文定位
使用权:可公开引用 / 不可重新分发全文
适用条件:地区、日期、套餐和比较口径一致
禁止用途:个别法律结论或过期价格
版本:1.2
复核触发:来源变化、满 90 天或出现矛盾
关联评估:R-03、P-07
负责人:唐宁

库的检索结果只是候选证据,不自动成为客户结论。客户专属事实保留在独立工作区,只通过别名和授权引用连接;9个获准案例仍按具体用途使用,不因“已获一次同意”无限复用。每周维护容量固定2小时,重复失败才提炼新资产,高严重错误一次就立即修订或退役。

资产发布前要通过最小检索测试:给定 2 个适用问题和 2 个不适用问题,系统应找回正确对象,并在地区、日期或用途不匹配时降低优先级或拒绝返回。只测“能搜到”会鼓励宽泛匹配;同样重要的是,不该出现时就不要出现。失败结果连接到关联评估,下一版本重跑受影响样本。

库有自己的放行:新增、修订、退役形成变更日志,依赖提案与运行手册记录使用版本。若EV-037因来源更新退休,系统列出受影响的活跃草稿,不会静默重写已经发送的客户材料;已发布结论需按影响另行判断与沟通。

工作流 1把研究问题变成证据简报:先锁主张与来源关系,再让模型组织文字

任务合同 填写示例
目的 为C03内部提案判断三个需求信号
输入 问题 v2、14条获准统一资源定位符、区域/日期
排除 需未获准登录、无日期价格、客户G资料
输出 8条标题主张 + 证据表 + 未知
模型角色 抽取候选事实、聚类、起草限定句
人工角色 权利、来源关系、结论与放行
通过 每条主张可回源;冲突/状态未知可见
停止 来源不足、跨客户令牌、高后果个别结论

完整样本从14条来源开始。2条需要未授权登录、1条没有发布日期且内容已被新页面替代,先排除;11条进入快照。模型产出8个标题主张,其中5条直接、2条衍生、1条不受支持。“目标细分市场将在本年快速增长”没有基线与预测来源,被放行门槛阻断,不能靠语气变谨慎继续使用。

唐宁没有删除这个失败,而是在简报保留状态未知:“当前获准来源只支持需求事件增加,不能量化全年增长。”随后找到一条支持较窄事实的公开原始资料,新建EV-052,最终第8条改成有日期、地区与指标的限定主张。输入、排除、关系和人工决策都进入R-C03-04 清单。

处理顺序固定为问题合同→来源快照→候选主张→关系分类→反证→人工综合→内部放行。模型不能在关系尚未批准时直接写长文,否则复核者要从流畅叙述反向猜每句话从哪来。结构化对象虽然增加前置动作,却把最昂贵的事实错误提前到仍可撤销的位置。

来源关系至少区分直接、衍生、上下文、反驳和不支持。推导主张必须保存计算或组合步骤;上下文只能解释背景,不能冒充核心证据;反驳与状态未知不从简报消失。唐宁审批的是具体主张—来源关系和限定范围,不是笼统勾选“资料看起来可信”。

12 次研究运行只验证可追溯与正确停止

研究评估 阈值 结果 决策
运行 ≥10 可比的 12 仅够有限使用
标题主张 记录全部 96 分母已锁定
已支持初稿 ≥95% 93/96=96.9% 通过
不支持内容进入内部放行 0 0 通过
冲突/未知项已保留 全部 3 测试 3/3 通过
跨客户检索 0 0 通过
中位活跃时长 <基线 155 分钟 92 分钟 通过
是否仍需人工复核 12/12 保留人工放行门
九十六条研究主张从初稿支持、三条阻断修正到最终可追溯,并列冲突、跨客户和人工复核门
研究工作流证明的是可追溯和正确停止,不是长文流畅。96 条主张进入固定分母,93 条初稿已支持,3 条不支持内容在内部放行前修复、缩窄或保留未知;冲突测试均并列差异,人工复核 12 次全部保留。可追溯不代表主张永远为真。

3条不受支持在草稿审核被发现并修复或降级,最终放行为96/96可追溯;这不等于96条都是真理,只说明关系按案例标准成立。唐宁还放入一个反例:两条权威来源时间不同、结论相反时,期望输出是并列差异与需要的下一证据,不是挑更新或更有名的一条替用户决定。

日 35只允许内部有限使用。若连续两个四项批量低于95%、任一跨客户检索、或复核人无法在清单找到来源,就回到影子并冻结新资产发布。时间下降不能抵消关键故障。

95%不是行业标准,而是唐宁依据客户材料必须可追溯、且人工能在发布前捕获余下问题设定的本期门;更高后果任务应更严格,证据弱的探索任务也可选择只输出问题而不计算通过率。阈值、分母与允许的人工修正都在运行前写入,测试后不移动球门。

她额外复测4个过去失败案例:过期价格、来源只支持相关而非因果、两条来源冲突、需要客户专属数据。期望分别为过期阻断、降级措辞、并列冲突、请求获准输入。四项都能正确停止后,才确认方法不仅对正常样本有效。

工作流 2把询盘变成提案包:事实可以复用,范围、价格、容量和承诺必须重新批准

客户C04询问“两周内完成五次访谈、市场扫描和董事会研讨会,预算¥38,000”。当前服务模块 SM-012只承诺三次访谈、三周、¥42,000;价目表刚从v2更新到v3。模型若直接套旧模板,会同时错误承诺数量、日期和价格。

可复制模板
询盘:5 次访谈 + 市场扫描 + 董事会研讨会 / 2 周 / ¥38,000
规范化冲突:
  访谈次数:客户要求 5 次,标准服务为 3 次
  时间:客户要求 2 周,当前容量至少需要 3 周
  预算:客户预算 ¥38,000,当前标准价 ¥42,000
已起草、尚未提供给客户的选项:
  A:3 次访谈 + 市场扫描 + 工作会 / 3 周 / ¥42,000
  B:5 次访谈 + 市场扫描 + 董事会研讨会 / 4 周 / ¥55,000
  C:付费需求诊断,暂不承诺正式交付
人工检查:容量、v3 价格、排除项、接收方、税费与专业条款
客户选择:书面澄清后选择 B
放行:PROP-C04-v1.0,发送前已经批准
提案对象 来源 发布控制
客户问题 咨询原文+通话备注 客户确认
范围 服务模块版本 包含/排除一致
证据/示例 已批准资产 ID 权利/用途复核
时间表 当前容量快照 不复用旧日期
价格/条款 价目表 v3 人工商务审批
假设 明确列表 状态未知不补写
接收方 授权联系人 发布二次检查

模型负责结构化与差异提示,不进行折扣、合同承诺、法律条款或发送。若客户需要专业条款,唐宁把商业范围与法律文本分开,由合格专业人士处理;AI起草不改变谁承担承诺。

提案合同还锁住“信息不足时的输出”。预算、决策人、资料权利或时间线缺一项时,系统生成澄清简报而非完整提案;客户没有确认选项,状态保持待决。为了提高发送速度而猜一个价格,会把内部效率变成外部承诺风险。

容量快照与价目表都带生效日期。唐宁允许模型读取当前已批准版本,不允许从旧提案检索价格;案例或措辞可以复用,商业数字必须从权威对象取值。即使客户过去买过相同服务,也重新确认本期范围、日期、币种与税费口径。

10 次提案运行先挡住高代价错误

提案评估 基线 改造后 备注
运行 10 10 同类咨询/变更
每项分钟 285 190 含澄清与批准
准时 7/10 9/10 按原承诺
首轮内部质检 6/10 8/10 2项内容性回退
检测到范围冲突 未系统记 2/2 发送前
检测到过期价格 未系统记 1/1 发送前
人工商务审批 未系统记 10/10 发送前
收件人/版本错误 0 已知 0 已记录 证据强度不同
十次提案的完整分钟、准时、首次质检、范围冲突、过期价格和人工商务审批对照
提案节时之外,高代价错误必须在发送前被拦住。每项完整时间从 285 分钟降到 190 分钟,同时发现 2 个范围冲突和 1 个过期价格,10 项均由人批准商务字段;这些事件可能与 2 项返工重叠,不能相加成 5 个独立失败,也不能保证成交。

两个范围冲突与一个过期价格事件可能与两项返工重叠,所以不把2+1+2相加成五个失败。放行门槛按事件保存:检测时间、受影响字段、建议修正、人工决策和放行。没有冲突的样本也检查,避免只拿故意埋错的测试证明控制存在。

日 56允许人工批准的外部使用,但价格、范围、时间表、条款和接收方永远不自动批准。任一错误价格或未授权范围外发即暂停工作流 2;连续3次因同一模块返工则修资产,不靠加长提示词逐案补丁。

10次运行另做一次放行演练:在测试环境故意放入旧价目表和相似客户接收方,期望系统同时阻断版本与收件人。演练证明确实存在检测路径,却不计入10次真实提案成功数;测试用户、合成错误与真实运行必须分开分母。

客户是否接受提案不是单纯的生成质量指标。10份中可能因预算、竞争、时机或关系失败,唐宁在日 180按失单原因、范围适配和回款看经营结果,不把转化率直接用于调提示词。AI能改善响应与一致性,不能保证客户购买。

工作流 3把交付事件变成状态/操作包:摘要不是结果,每个行动必须有负责人、到期和状态

每位客户一周的来源不是整段会议录音,而是获准交付日志:完成事件、决策、阻碍、变更、放行和下一操作。样本C02共有14条事件:6 完成、4 进行中、2 已阻塞、2待客户决策。模型先按事件 ID生成候选周报,再提取动作账本;没有负责人或到期的项保持状态未知并回到唐宁,不根据发言频率猜负责人。

状态部分 输入 接受
完成 发布/事件 ID 客户可验证结果
进行中 活跃项 + 下一步操作 不把计划写成完成
需要决策 问题 + 选项 + 负责人 责任明确
阻碍/风险 证据 + 影响 + 下次检查 不夸大严重度
变更 前后 + 审批 范围可追踪
动作账本 操作/负责人/截止日期/状态 状态未知显式
发布说明 版本 + 接收人 人工审批
十四条获准事件分类为完成、进行中、阻塞和待决,再进入状态结构与完整行动账
状态包来自获准事件,不从会议语气猜完成或负责人。样本 14 条事件按 ID 进入完成、进行中、阻碍、待决、变更与行动账;24 次运行发现的 7 个缺字段动作全部在外发前补齐、降级或删除。送达也不等于价值,仍要看回复、引用或状态变化。

一个反例是客户在会上说“下周看看能否补访谈”,原始模型写成“客户下周补充两次访谈”。事件日志没有数量、负责人或确认,正确输出是待决决策,而不是行动项。唐宁回看录音不是默认步骤;只在已有合法录制、必要且获准时使用,并按留存处理,普通状态不为便利收集更多敏感数据。

交付事件只有明确负责人能改变状态。模型可以把“正在准备”映射为候选进行中,但若没有工作项与下一步行动就标未关联,不写进客户完成清单;会议情绪、语气和未确认推测不进入状态。这样状态反映可核对的运营事实,而不是把自然语言总结当项目账。

客户可以在下一次回复中纠正事件。纠正产生新事件并连接取代,不改写已发送周报;若涉及范围或承诺,进入变更流程。状态工作流不是会议纪要机器,而是把已有交付事实转成可共同确认的状态界面。

24 次状态运行发现 7 个责任字段缺失

状态评估 基线 改造后 决策
状态包 24 24 6 客户×4 周
每包分钟 75 45 活跃时间
准时 20/24 23/24 一项因客户输入被阻塞
一次通过 19/24 22/24 两项发生内容性退回
待办事项 未统一记 68 结构化分母
草稿中缺少负责人/截止日期 状态未知 7 跨 2 包 全部被阻塞/已修复
外部人工审批 状态未知 24/24 发送前
错误的接收人/客户事实 0 已知 0 已记录 继续监控

7个不完整操作都没有进入客户放行:4个补齐负责人/截止日期,2个降级成需要决策,1个删除为重复事件。日 84的通过门不是“AI总结准确率100%”,而是所有关键事件可追踪、状态未知不被补写、68项行动在外发时字段完整、24次均有人批准。

若客户要求把状态直接更新到其项目系统,下一阶段也只能先生成待批准的变更集;本期不授予写入权限。把邮件改成服务接口写入并不会降低责任,反而减少人看到最终动作的机会。

6家客户中有2家反馈新结构过长,唐宁没有删掉决策与阻碍,而是把正文缩成一页、完整动作账本作为附表;另1家需要不同周起止日,作为配置字段而非复制一套工作流。用户反馈改变呈现,不能删除用于责任和恢复的证据。

第 84 天还要抽查客户是否真的使用:24 次交付中有 18 次出现明确回复、会议引用或行动状态变化,另外 6 次只有送达证据,标为用途未知。送达不等于价值;下一阶段若长期无人使用,应降低频率、改变格式或停止,而不是自动增加提醒。

三个工作流共用一套权限、放行和停止控制:模型可以草拟,不能成为经营责任人

控制 W1 研究 W2 提案 W3 状态
允许读取 公开 + 已批准的客户引用 咨询 + 服务资产 客户交付事件
允许写入 内部草稿区 提案草稿区 状态草稿区
外部行动 人工发送 人工发送
关键人工检查 主张关系 范围/价格/条款 负责人/截止日期/客户
放行证据 内部清单 审批人 + 接收人 + 版本 审批人 + 接收人 + 事件引用
关键停止 跨客户或不支持的主张进入放行 错误的价格、范围或发送 错误的客户、动作或发送
恢复 撤回内部使用 + 修正 遏制 + 发布新版本 + 通知 遏制 + 修正账目/发布

连接器只授予当前阶段所需的读取或草稿权限;没有发送、付款、签约、删除客户系统记录或改变访问的权限。凭据不写进提示词和库,季度与项目结束时复核、撤销。工具调用日志要能连接到工作项,重试不能重复创建提案或放行状态。

停止事件发生时,先暂停受影响的工作流与外发,保存输入、输出、版本、调用与收件证据,确定已知和未知影响,再决定遏制、沟通、恢复和复盘。客户权益、保密、合同或法定通知由唐宁与合格人士处理,不能让 AI 根据通用模板自行决定。

投资组合记分卡把三项任务时间加总,也保留不同质量分母:总平均不能稀释提案错误

改造后队列 研究 提案 状态 总计
样本数 12 10 24 46
每项分钟 92 190 45 混合
工时 18.4 31.7 18.0 68.1
基准工时 31.0 47.5 30.0 108.5
工时减少 12.6 15.8 12.0 40.4
准时 11/12 9/10 23/24 43/46
一次通过 11/12 8/10 22/24 41/46
返工 1 2 2 5

总时数计算为 12×92/60=18.4、10×190/60≈31.7、24×45/60=18.0;与 108.5 相差约 40.4 小时。四舍五入只用于展示,原始分钟保留。准时与一次通过可以相加,是因为三类任务使用相同的事件定义;但提案的错误价格、研究中缺乏支持的主张仍要设置单独的关键护栏,不能被 43/46 的总指标覆盖。

经营层目前只有领先证据:平均提案响应更快、释放时间出现、服务承诺更稳定。90天内没有足够样本证明赢单率、收入或留存由项目提高;记分卡把已收款、新客户容量和客户结果标为滞后/未知,计划在日 180复核。

经济账必须区分组间节省、期内节省和建设投入

投资 工时/现金
基线 + 范围 12小时
资产权益/清理 28小时
工作流 1 设计/测试 18小时
工作流 2 设计/测试 22小时
工作流 3 设计/测试 18小时
集成/文档/指标 8小时
构建总计 106小时×¥240=¥25,440
工具 初始设置 ¥900 + 3×¥620 = ¥2,760
总教学投资 ¥28,200

40.4小时是两组46项群组的任务差;52小时是不同工作流分阶段上线后,在整个90天实际避免的估算时间:W1约25.2小时、W2约19.8小时、W3约6小时、上下文约1小时。二者回答不同问题,不能把两者相加成92.4小时收益。52小时×¥240=¥12,480只是时间价值,若释放时间闲置就不会变成现金。

日 90仍有约¥28,200−¥12,480=¥15,720未覆盖。稳态按典型周约节省10.6小时,毛时间价值约¥2,544/周;扣除约¥620/月的增量工具费,教学模型约需再6.6周才覆盖剩余投入。这个推算未含税、波动、维护超支和机会是否真的变现,不是投资回报率承诺。

稳态每周释放 10.6 小时 计划分配
更深入的客户决策工作 4.0小时
合格销售/跟进 2.0小时
库/评估/控制维护 2.0小时
未承诺的弹性缓冲 2.6小时

若维护连续四周超过2小时,先查资产碎片、工具不稳定或工作流范围过宽;不能从缓冲永久借时维持。唐宁也不预先售卖全部10.6小时,因为试点量和客户组合会变化。

日 90 决策记录选择带控制继续:下一阶段先证明稳定与经营结果,不增加第四个工作流

决策字段 第 90 天答复
工作流 1 继续内部有限使用;保留主张复核
工作流 2 继续人工审批;价格与范围永不自动批准
工作流 3 继续人工审批;不授予客户系统写入权限
186 活跃;14 隔离按过期处理
自动发送 停止/未授权
工作流 4 否;等稳定与业务证据
最强证据 同类任务节省 40.4 小时、41/46 一次通过、关键事故 0 且有记录
反证 106 小时建设投入、仅观察 90 天、现金结果未知
下次复核 日 120、150、180
研究、提案、状态受控继续,自动发送和第四工作流停止,并列支持证据、反证和三个复核日
继续的是有限使用和人工门,不是全面自动化。W1、W2、W3 在各自边界内继续,自动发送与工作流 4 停止;图中同时保留 40.4 小时群组节时、41 项首次通过等证据,以及 106 小时建设、仅观察 90 天和现金结果未知等反证。

日 91—120连续运行并加入一次工具故障与错误接收方演练;日 121—150检查维护、客户反馈、提案结果和实际释放时间去向;日 151—180更新经济模型,再决定是增加客户、提高价格、缩小服务,还是选择第四个工作流。任何重大事件把相关工作流退回影子,不等日 120。

项目交接也适用于一个人:导出资产登记册、评估案例、运行手册、凭证清单、发布日志和恢复步骤,确认在主工具不可用时仍能完成最低服务。若只有唐宁记得怎么运行,90天只创造了新的个人依赖。

把这份 90 天计划换成自己的数据

计划块 复制字段
业务目标 容量/结果、基线、负责人、非目标
候选放行门槛 频率、证据、可逆性、数据、责任
对照任务组 项目类型、样本数、起止、时间、质量、置信度
影子、辅助、有限使用、放行门槛、回滚
知识资产 来源、权利、适用、禁止使用、版本、复核
评估 正常、缺失、冲突、禁止、外部操作测试
放行 工作项、输入、输出、审批人、接收方、版本
记分卡 时间、准时、一次通过、返工、事件、成本、业务
决策 继续/变更/停止、反证、下次日期
业务目标、候选硬门、同分母群组、分波、知识资产、评估、放行、记分卡和决策记录九个计划块
九个计划块形成的是可退出运营闭环,不是采购清单。第0天事实与 14 天可比基线先锁定,再逐波有限使用,知识、评估、放行、记分卡和决策共同支持继续、变更或停止。今天只记录过去 14 天真实工作,不先生成无人监督智能体。

NIST当前官方页面明确AI RMF 1.0正在修订;本文只借用其自愿性风险管理思路,并参考2024年生成式 AI 画像把风险行动与目标/优先级联系起来,不把案例门槛说成NIST要求。NIST 隐私框架官方页仍标版本 1.0并列出后续项目,本文用其资产盘点、映射与隐私风险思路检查知识资产。英国政府服务绩效资料支持从项目开始定义指标、结合任务完成/时间、成本、用户反馈与多种来源评估,并在证据不足时决定继续、改变或停止;这里只借鉴测量方法。看板指南 2025.5用于进行中工作、周期时间与显式工作流,ISO公开质量资料用于过程、记录、监测与持续改进;均不代表唐宁通过认证。

今天选过去14天真实发生过的工作,不先看工具列表。为每项记录开始、结束、人工分钟、返工、外部影响和证据强度;再把最常见候选过频率、可逆、数据与责任门。只有当基线能回答“问题多大、错误是什么、谁负责”时,才写第一张工作流契约。