先看第90天:三个工作流都进入受控使用,46项同类工作少40.4小时,但106小时建设投入尚未收回
独立管理培训项目设计顾问唐宁有6家长期企业客户,每周工作上限45小时。她原来已在搜索、写作和会议整理中零散使用AI,却没有共同输入、来源记录、评估、版本或经营指标。90天项目不是“接入更多工具”,而是交付五项可验收结果:研究证据简报、提案报价包、客户状态/行动包三个工作流;一套运营证据库;一份经营记分卡。
她先从最近记录重建46项可比较任务:12份研究简报、10份提案、24份周度状态包。改造后仍用同类数量复测,任务总耗时从108.5小时降至约68.1小时,原承诺内完成从36/46升至43/46,一次通过从33/46升至41/46。所有34次客户外发都有人批准,0次错误收件、跨客户内容或未经批准发送。
| 第 90 天结果 | 基准队列 | 受控队列 |
|---|---|---|
| 可比项 | 46 | 46 |
| 任务工时 | 108.5 | 68.1 |
| 准时 | 36/46 | 43/46 |
| 一次通过 | 33/46 | 41/46 |
| 内容返工 | 13 | 5 |
| 外部发布 | 34 | 34 |
| 外部发送前的人工审批 | 未系统记录 | 34/34 |
| 重大事件 | 已知为 0、记录不完整 | 0 且有日志 |
但这不是“90天回本”故事。建设、清理、测试和文档共106小时,新增工具90天花费¥2,760;分阶段上线只在期内产生约52小时时间节省,净投入仍约54小时。第90天决定是维持三个有限使用工作流、继续测量和减少维护摩擦,不开放自动发送,也不开始第四个工作流。
五项结果彼此有依赖:没有知识资产,研究会每次重新寻找来源;没有研究的证据对象,提案会复用未经核验的卖点;没有范围与放行记录,状态无法区分计划、承诺与完成;没有统一记分卡,三个局部节时就无法回答经营是否更好。90天计划因此是一项小型运营改造,不是三个互不相干的自动化演示。
唐宁也保留原手工路径。任何工作流进入影子、工具不可用、来源冲突或客户要求特殊处理时,她都能从冻结的输入快照继续人工交付,并在日志标记回退。AI改造若让一个人失去不用AI完成核心服务的能力,只是把旧依赖换成新依赖。
人物、客户、日期、任务、价格和结果均为虚构教学案例。本文是OPC项目设计示例,不保证效率、收入或投资回报,也不替代客户合同、知识产权、隐私、安全、税务、财务或行业专业判断。
先定义90天结束时能拿在手里的产物:不是“学会AI”,也不是购买订阅数
| 结果 | 第 90 天证据 | 不算完成 |
|---|---|---|
| 工作流 1 | 12次研究简报运行与评估 | 有一个漂亮演示 |
| 工作流 2 | 10次提案包、10/10批准 | 只生成模板 |
| 工作流 3 | 24次状态包与动作账本 | 自动发一封邮件 |
| 知识资产 | 186项已接受、14 隔离、26 删除记录 | 把文件上传向量库 |
| 记分卡 | 基准与改造后的分母、成本、错误、决定 | 只报节省百分比 |
| 运营包 | 负责人、版本、回滚、停止、复核日期 | 聊天记录里的经验 |
90天边界不包括训练自己的基础模型、建设公共SaaS、替客户作法律/投资/人事决定,也不要求无人值守。唐宁既是负责人也是最终批准人,但在卡片上仍分别记录执行人、复核人和决策负责人,让“都是我”不成为跳过控制的理由。客户最终商业决定仍由客户作出。
她把成功写成行为与证据:任务从获准输入开始,到可定位放行或明确停止结束;时间必须包含准备、等待处理、人工复核和返工;“AI生成完成”只是中间事件。第90天若只有提示词而没有运行日志、失败样本和使用结果,项目视为未完成。
每项产物还要有使用者和使用事件。库被某次检索引用、提案被客户用于范围决定、状态使一个行动获得负责人,才说明资产进入工作;文件存在只证明生产活动。相反,被放行门槛正确拒绝的高风险请求也可以是成功结果,因为系统履行了不应自动完成的边界。
90天结束不要求流程永久定型。每个运行手册注明当前适用客户、输入类型、工具版本、复核日期和退役条件;未知项集中进入决策日志。这样日 90交付的是一套可继续经营的当前系统,而不是一套假装未来不会变化的“最佳实践”。
日 0经营快照先说明为什么改:每周45小时里29.5小时被三类可重复工作与修复占据
| 发布前周容量 | 工时 | 证据 |
|---|---|---|
| 客户研讨会/决策 | 9.0 | 日历 + 发票 |
| 研究/证据 | 10.3 | 时间日志 |
| 提案/范围界定 | 7.1 | 文档事件 |
| 状态/跟进 | 7.5 | 发送日志 |
| 上下文搜索/修复 | 4.6 | 抽样日记 |
| 销售对话 | 3.2 | 日历 |
| 财务/行政 | 2.3 | 任务日志 |
| 缓冲 | 1.0 | 残余 |
| 总计 | 45.0 |
客户决策工作只有9小时,而研究、提案、状态与找资料/修复合计29.5小时。项目目标不是把29.5小时全部消灭;其中证据判断、范围承诺和客户沟通本身创造价值。目标是在保持质量边界的条件下,把重复转换、查找和格式劳动降下来,并把释放时间明确分配给客户工作、销售、资产维护和缓冲。
经营结果设三层:运营看周期时间、一次通过和事故;容量看释放时间是否真的没有被新返工吃掉;业务看额外客户价值、提案响应与现金结果。第三层有更长因果链,90 天只能记录,不把一次签单全部归因于 AI。
日 0还冻结客户与服务组合:6家长期客户、当前包、每周固定会议与既有价格都不在实验中同时改变。若90天内发生新客户、假期或大项目,记分卡另作事件标记,不把结构变化埋进平均数。否则时间下降可能只是任务变简单,收入变化也可能来自价格或季节,而非工作流。
时间日志用两周日记与文件事件交叉:唐宁在开始、等待、复核、返工和发送分别记时间,工具处理时的被动等待不算人工分钟,但若她只能守着界面则仍算占用。抽查发现原先所谓“写提案 90分钟”只计算写正文,忽略寻找旧范围、检查价格与来回改文件,才形成285分钟的完整基线。
不用机会总分选三个工作流:先过频率、证据、可逆、数据和责任门,再按依赖顺序推进
| 候选项 | 证据 | 放行门槛决策 |
|---|---|---|
| 研究→证据简报 | 每周3次、内部先看、来源可锁 | 首次选择 |
| 咨询→提案包 | 每周约2.5次、外部承诺、人可批准 | 二次选择 |
| 交付日志→状态包 | 6客户周度、外发但可撤回/更正 | 三次选择 |
| 自动陌生拓客 | 无许可/品牌风险、需求证据弱 | 拒绝 |
| 合同条款红线 | 后果高、需专业判断 | 排除/专业人 |
| 自动催款 | 每月3—4次、规则确定 | 先用普通提醒 |
| 内容多渠道改写 | 不是当前瓶颈 | 积压 |
| 自动决定客户优先级 | 责任与关系判断不可外包 | 人工决策 |
第一个工作流产生证据卡片,第二个复用证据与服务模块,第三个复用已经承诺的范围和交付事件;顺序降低重复建设。若先做提案,唐宁会在没有可靠证据库时让模型自由找卖点;若先做状态自动发送,她会在接收方、版本和行动负责人尚未稳定时把风险推到客户面前。
选择表不使用“收益8分、难度4分”的总分,因为一项合同高后果任务不能靠频率高抵消责任门。被拒任务保留原因与复核触发器:若未来有专业合作人、客户授权或量级变化可以重审,但不因工具能演示就偷渡进本期。
三个入选任务也不是风险最低的三个,而是能形成递进证据且仍可由一个人控制的组合。研究在内部先暴露引用与状态未知;提案提高责任但发送前可逐字段批准;状态使用真实交付事件并要求客户可核对。若第一步无法稳定保留来源,后两步不进入真实客户,因为它们会放大同一缺陷。
唐宁为未选任务估算机会成本但不承诺日期。内容改写即使容易展示,对当前29.5小时瓶颈帮助有限;自动催款频率低且普通规则足够;陌生拓客缺少合法、品牌与目标证据。选择工作流的能力包括拒绝“AI味最强”的项目,把有限建设容量留给真实经营约束。
90天不是三个月后才验收:五个波次在日 14、35、56、84和90留下可退出的决策记录
| 天 | 焦点 | 具体产出 | 放行门槛 |
|---|---|---|---|
| 1—14 | 基线 + 范围 | 46 项对照任务、风险与指标合同 | 数据可比较 |
| 15—35 | 工作流 1 | 12 次研究运行、96 条主张 | 内部有限使用 |
| 29—56 | 工作流 2 | 10 提案运行、放行控制 | 外部人工审批 |
| 57—84 | 工作流 3 | 24 状态运行、68 待办事项 | 客户批准发送 |
| 78—90 | 集成 | 库、成本、记分卡、运行手册 | 继续/变更/停止 |
波次有意少量重叠:工作流 2只在工作流 1通过日 35 放行门槛后进入客户相关测试;29—35只做合成提案与字段设计。工作流 3的最后一周与集成重叠,但不再改变核心结构。若前一放行门槛失败,后续日期整体顺延,不能为了守90日海报而跳过影子或批准。
每周五固定用 90 分钟做组合评审:查看本周新建与关闭、失败、人工分钟、未解释异常和下周容量。任何高严重度事件即时复核,不等周五。每日使用仍走各工作流自己的检查清单,组合评审不能替代单次放行门。
重叠波次有明确容量上限:每周最多8小时用于新设计,4小时用于评估与复核,2小时用于库维护;客户交付和恢复缓冲不被实验预售。若建设连续两周超过14小时,先缩小本波范围而不是用夜间加班守日期。一个人的90天计划必须把个人可持续性当系统约束。
每个放行门槛会议只产生继续、变更或停止三种记录。继续注明允许范围;变更列需修的控制与复测样本;停止说明如何恢复手工、处理已收数据和通知受影响客户。没有“基本不错,先上线再说”的第四种状态,也不因下一阶段已经排期而放宽前一阶段门槛。
一张项目控制表把目标、风险、证据和成本连起来
| 字段 | 填写示例 |
|---|---|
| 目标 | 每周释放≥8小时且外部严重错误=0 |
| 基准队列 | 46 项 / 108.5小时 / 13 返工 |
| 范围内用户 | 唐宁;客户仅收放行/给批准 |
| 批准数据 | 公共来源、客户明确授权材料、内部方法 |
| 禁止数据 | 无权客户资料、专门敏感决定、未知权利 |
| 工作流进行中 | 同时最多1个新设计、3个试点项目 |
| 严重停止 | 跨客户、错误价格/范围外发、未授权操作 |
| 成本负责人 | 唐宁;时间¥240/小时作教学机会成本 |
| 决策日期 | 第 14/35/56/84/90 天 |
| 最终决策 | 继续 3 个工作流;不自动发送;不启动工作流 4 |
控制表只保存必要索引,受限客户资料留在获准位置。每一个数字都有事件定义和来源:任务时间从准备输入到保存放行,等待客户时间单列;一次通过指没有发生内容性退回,不是连标点都没有修改;严重错误先列事件类型,再统计为 0,不能因为没有日志就默认没有发生。
当指标定义变化时写版本与重算影响。例如日 18发现过去的提案时间漏记范围澄清,唐宁没有把新口径直接接到旧图上,而是回补10个基线样本并标4项为估算。没有可靠历史的字段显示状态未知,宁可少一条趋势,也不用精确小数制造可信度。
控制表还保存假设登记册:典型周任务量是否稳定、每小时¥240是否适合作为机会成本、客户是否接受新的状态结构、工具费用会否变化。每个假设有验证日期与影响方向。经济模型出现结果时,读者能看到它依赖哪些条件,而不是只看到一个回收期数字。
范围变更也走同一张表。若有人提出“顺便让提案自动发送”,这不是实现细节,而是增加外部动作和事故责任,必须新建变更、更新风险与评估并重新过放行门槛。项目期限固定不代表风险边界可以悄悄扩大。
日 1—14先重建46项基线:同分母比较研究、提案和状态,而不是拿最好演示对平均旧流程
| 工作流 | 样本数 | 基线每项分钟 | 工时 | 准时 | 一次通过 |
|---|---|---|---|---|---|
| 研究简报 | 12 | 155 | 31.0 | 9/12 | 8/12 |
| 提案包 | 10 | 285 | 47.5 | 7/10 | 6/10 |
| 状态/操作包 | 24 | 75 | 30.0 | 20/24 | 19/24 |
| 总计 | 46 | 混合 | 108.5 | 36/46 | 33/46 |
42 项有文件时间、日历或发送事件可直接重建,4 项只有唐宁当周日志,标为低置信度估算;改造后的对照任务仍保留相同定义、输入齐全条件和停止点。提案若被客户撤回,记录为已撤回,不进入完成时间;状态任务若缺客户决定,则正确输出阻塞或未知,不因没有漂亮总结而判失败。
基线还抽取 13 项返工:4 个研究主张缺少支持,3 个提案的范围或价格不一致,1 个使用旧模板,5 个状态动作缺少负责人或到期日。没有严重事故被记录,但旧流程没有统一接收方与放行日志,所以只能写“已知为 0、日志记录不完整”,不能与改造后的“0 且有完整日志”当作同等证据。
46项不是随机代表所有顾问工作,只代表本期三个高频类型。唐宁保留任务日期、客户别名、复杂度标签和缺输入情况,发布从相同定义连续取样,不挑成功项补足数量。某次提案因客户撤回而退出分母时,记录原因并取下一项连续样本,不能用一份顺利的小提案替换复杂失败来美化结果。
准时与一次通过也不等于业务正确。研究还看主张关系,提案还看范围/价格/条款,状态还看行动负责人/截止日期,严重事件单独列零容忍。统一指标用于组合,工作流专属护栏用于阻止总平均掩盖高代价错误。
把226项候选资料变成一套运营证据库:先删除和隔离,再谈检索
唐宁盘点云盘、笔记与邮件引用得到226项候选。她没有全部上传,而是逐项确认来源、权利、客户标识、当前性、适用条件和错误后果。最终已接受 186、隔离 14、删除 26;删除包含16项重复/被替代文件与10项不再需要的旧客户敏感副本,按约定完成可恢复或不可恢复处置并留证。
| 候选项处置 | 计数 | 操作 |
|---|---|---|
| 已接受 | 186 | 标准化 + 版本 + 评估链接 |
| 隔离: 权限不明确 | 8 | 不进入AI,找授权/替代 |
| 隔离: 冲突/过时 | 6 | 负责人复核 |
| 删除: 重复/已取代 | 16 | 指向规范化的后删除 |
| 删除: 过期的敏感副本 | 10 | 按留存处置 |
| 总计 | 226 |
隔离不是永久垃圾桶:每项有负责人、原因、下次复核和过期;到期仍无合法用途则删除。删除对象先解析引用,避免仍在使用的提案断链。备份和第三方索引能否同步删除另行验证,不把移动到归档当完成。
8项权限不明确包括没有明确二次使用许可的客户例子,6项冲突/过时包括价格口径冲突与方法已变更。它们不能通过“只用于内部”自动放行,因为内部模型处理也可能超出原目的或产生错误引用。找不到授权时用合成例子或公开来源替代,而不是把风险藏在检索层。
26项删除先经过挂起检查:是否涉及未完合同、争议、账务或其他必须保留的义务。实际保留期限和删除方式由真实协议与专业意见决定;案例数字只演示应记录处置,不提供普遍法律期限。
186 项资产按六种对象管理
| 资产类型 | 计数 | 示例/用途 |
|---|---|---|
| 证据卡片 | 52 | 一条主张与来源关系 |
| 服务模块 | 34 | 范围、输入、交付物、价格规则 |
| 已批准示例 | 28 | 9项获准、19项合成 |
| 中立语言 | 24 | 去客户化问题/结果表述 |
| 决策规则 | 18 | 通过/阻塞/升级条件 |
| 失败与停止情形 | 30 | 误用、状态未知与恢复 |
| 总计 | 186 | 一套库,不是六个散库 |
资产标识:EV-037
类型:证据卡片
主张:仅描述被来源直接支持的事实
来源:网页地址 + 采集时间 + 原文定位
使用权:可公开引用 / 不可重新分发全文
适用条件:地区、日期、套餐和比较口径一致
禁止用途:个别法律结论或过期价格
版本:1.2
复核触发:来源变化、满 90 天或出现矛盾
关联评估:R-03、P-07
负责人:唐宁
库的检索结果只是候选证据,不自动成为客户结论。客户专属事实保留在独立工作区,只通过别名和授权引用连接;9个获准案例仍按具体用途使用,不因“已获一次同意”无限复用。每周维护容量固定2小时,重复失败才提炼新资产,高严重错误一次就立即修订或退役。
资产发布前要通过最小检索测试:给定 2 个适用问题和 2 个不适用问题,系统应找回正确对象,并在地区、日期或用途不匹配时降低优先级或拒绝返回。只测“能搜到”会鼓励宽泛匹配;同样重要的是,不该出现时就不要出现。失败结果连接到关联评估,下一版本重跑受影响样本。
库有自己的放行:新增、修订、退役形成变更日志,依赖提案与运行手册记录使用版本。若EV-037因来源更新退休,系统列出受影响的活跃草稿,不会静默重写已经发送的客户材料;已发布结论需按影响另行判断与沟通。
工作流 1把研究问题变成证据简报:先锁主张与来源关系,再让模型组织文字
| 任务合同 | 填写示例 |
|---|---|
| 目的 | 为C03内部提案判断三个需求信号 |
| 输入 | 问题 v2、14条获准统一资源定位符、区域/日期 |
| 排除 | 需未获准登录、无日期价格、客户G资料 |
| 输出 | 8条标题主张 + 证据表 + 未知 |
| 模型角色 | 抽取候选事实、聚类、起草限定句 |
| 人工角色 | 权利、来源关系、结论与放行 |
| 通过 | 每条主张可回源;冲突/状态未知可见 |
| 停止 | 来源不足、跨客户令牌、高后果个别结论 |
完整样本从14条来源开始。2条需要未授权登录、1条没有发布日期且内容已被新页面替代,先排除;11条进入快照。模型产出8个标题主张,其中5条直接、2条衍生、1条不受支持。“目标细分市场将在本年快速增长”没有基线与预测来源,被放行门槛阻断,不能靠语气变谨慎继续使用。
唐宁没有删除这个失败,而是在简报保留状态未知:“当前获准来源只支持需求事件增加,不能量化全年增长。”随后找到一条支持较窄事实的公开原始资料,新建EV-052,最终第8条改成有日期、地区与指标的限定主张。输入、排除、关系和人工决策都进入R-C03-04 清单。
处理顺序固定为问题合同→来源快照→候选主张→关系分类→反证→人工综合→内部放行。模型不能在关系尚未批准时直接写长文,否则复核者要从流畅叙述反向猜每句话从哪来。结构化对象虽然增加前置动作,却把最昂贵的事实错误提前到仍可撤销的位置。
来源关系至少区分直接、衍生、上下文、反驳和不支持。推导主张必须保存计算或组合步骤;上下文只能解释背景,不能冒充核心证据;反驳与状态未知不从简报消失。唐宁审批的是具体主张—来源关系和限定范围,不是笼统勾选“资料看起来可信”。
12 次研究运行只验证可追溯与正确停止
| 研究评估 | 阈值 | 结果 | 决策 |
|---|---|---|---|
| 运行 | ≥10 可比的 | 12 | 仅够有限使用 |
| 标题主张 | 记录全部 | 96 | 分母已锁定 |
| 已支持初稿 | ≥95% | 93/96=96.9% | 通过 |
| 不支持内容进入内部放行 | 0 | 0 | 通过 |
| 冲突/未知项已保留 | 全部 3 测试 | 3/3 | 通过 |
| 跨客户检索 | 0 | 0 | 通过 |
| 中位活跃时长 | <基线 155 分钟 | 92 分钟 | 通过 |
| 是否仍需人工复核 | 是 | 12/12 | 保留人工放行门 |
3条不受支持在草稿审核被发现并修复或降级,最终放行为96/96可追溯;这不等于96条都是真理,只说明关系按案例标准成立。唐宁还放入一个反例:两条权威来源时间不同、结论相反时,期望输出是并列差异与需要的下一证据,不是挑更新或更有名的一条替用户决定。
日 35只允许内部有限使用。若连续两个四项批量低于95%、任一跨客户检索、或复核人无法在清单找到来源,就回到影子并冻结新资产发布。时间下降不能抵消关键故障。
95%不是行业标准,而是唐宁依据客户材料必须可追溯、且人工能在发布前捕获余下问题设定的本期门;更高后果任务应更严格,证据弱的探索任务也可选择只输出问题而不计算通过率。阈值、分母与允许的人工修正都在运行前写入,测试后不移动球门。
她额外复测4个过去失败案例:过期价格、来源只支持相关而非因果、两条来源冲突、需要客户专属数据。期望分别为过期阻断、降级措辞、并列冲突、请求获准输入。四项都能正确停止后,才确认方法不仅对正常样本有效。
工作流 2把询盘变成提案包:事实可以复用,范围、价格、容量和承诺必须重新批准
客户C04询问“两周内完成五次访谈、市场扫描和董事会研讨会,预算¥38,000”。当前服务模块 SM-012只承诺三次访谈、三周、¥42,000;价目表刚从v2更新到v3。模型若直接套旧模板,会同时错误承诺数量、日期和价格。
询盘:5 次访谈 + 市场扫描 + 董事会研讨会 / 2 周 / ¥38,000
规范化冲突:
访谈次数:客户要求 5 次,标准服务为 3 次
时间:客户要求 2 周,当前容量至少需要 3 周
预算:客户预算 ¥38,000,当前标准价 ¥42,000
已起草、尚未提供给客户的选项:
A:3 次访谈 + 市场扫描 + 工作会 / 3 周 / ¥42,000
B:5 次访谈 + 市场扫描 + 董事会研讨会 / 4 周 / ¥55,000
C:付费需求诊断,暂不承诺正式交付
人工检查:容量、v3 价格、排除项、接收方、税费与专业条款
客户选择:书面澄清后选择 B
放行:PROP-C04-v1.0,发送前已经批准
| 提案对象 | 来源 | 发布控制 |
|---|---|---|
| 客户问题 | 咨询原文+通话备注 | 客户确认 |
| 范围 | 服务模块版本 | 包含/排除一致 |
| 证据/示例 | 已批准资产 ID | 权利/用途复核 |
| 时间表 | 当前容量快照 | 不复用旧日期 |
| 价格/条款 | 价目表 v3 | 人工商务审批 |
| 假设 | 明确列表 | 状态未知不补写 |
| 接收方 | 授权联系人 | 发布二次检查 |
模型负责结构化与差异提示,不进行折扣、合同承诺、法律条款或发送。若客户需要专业条款,唐宁把商业范围与法律文本分开,由合格专业人士处理;AI起草不改变谁承担承诺。
提案合同还锁住“信息不足时的输出”。预算、决策人、资料权利或时间线缺一项时,系统生成澄清简报而非完整提案;客户没有确认选项,状态保持待决。为了提高发送速度而猜一个价格,会把内部效率变成外部承诺风险。
容量快照与价目表都带生效日期。唐宁允许模型读取当前已批准版本,不允许从旧提案检索价格;案例或措辞可以复用,商业数字必须从权威对象取值。即使客户过去买过相同服务,也重新确认本期范围、日期、币种与税费口径。
10 次提案运行先挡住高代价错误
| 提案评估 | 基线 | 改造后 | 备注 |
|---|---|---|---|
| 运行 | 10 | 10 | 同类咨询/变更 |
| 每项分钟 | 285 | 190 | 含澄清与批准 |
| 准时 | 7/10 | 9/10 | 按原承诺 |
| 首轮内部质检 | 6/10 | 8/10 | 2项内容性回退 |
| 检测到范围冲突 | 未系统记 | 2/2 | 发送前 |
| 检测到过期价格 | 未系统记 | 1/1 | 发送前 |
| 人工商务审批 | 未系统记 | 10/10 | 发送前 |
| 收件人/版本错误 | 0 已知 | 0 已记录 | 证据强度不同 |
两个范围冲突与一个过期价格事件可能与两项返工重叠,所以不把2+1+2相加成五个失败。放行门槛按事件保存:检测时间、受影响字段、建议修正、人工决策和放行。没有冲突的样本也检查,避免只拿故意埋错的测试证明控制存在。
日 56允许人工批准的外部使用,但价格、范围、时间表、条款和接收方永远不自动批准。任一错误价格或未授权范围外发即暂停工作流 2;连续3次因同一模块返工则修资产,不靠加长提示词逐案补丁。
10次运行另做一次放行演练:在测试环境故意放入旧价目表和相似客户接收方,期望系统同时阻断版本与收件人。演练证明确实存在检测路径,却不计入10次真实提案成功数;测试用户、合成错误与真实运行必须分开分母。
客户是否接受提案不是单纯的生成质量指标。10份中可能因预算、竞争、时机或关系失败,唐宁在日 180按失单原因、范围适配和回款看经营结果,不把转化率直接用于调提示词。AI能改善响应与一致性,不能保证客户购买。
工作流 3把交付事件变成状态/操作包:摘要不是结果,每个行动必须有负责人、到期和状态
每位客户一周的来源不是整段会议录音,而是获准交付日志:完成事件、决策、阻碍、变更、放行和下一操作。样本C02共有14条事件:6 完成、4 进行中、2 已阻塞、2待客户决策。模型先按事件 ID生成候选周报,再提取动作账本;没有负责人或到期的项保持状态未知并回到唐宁,不根据发言频率猜负责人。
| 状态部分 | 输入 | 接受 |
|---|---|---|
| 完成 | 发布/事件 ID | 客户可验证结果 |
| 进行中 | 活跃项 + 下一步操作 | 不把计划写成完成 |
| 需要决策 | 问题 + 选项 + 负责人 | 责任明确 |
| 阻碍/风险 | 证据 + 影响 + 下次检查 | 不夸大严重度 |
| 变更 | 前后 + 审批 | 范围可追踪 |
| 动作账本 | 操作/负责人/截止日期/状态 | 状态未知显式 |
| 发布说明 | 版本 + 接收人 | 人工审批 |
一个反例是客户在会上说“下周看看能否补访谈”,原始模型写成“客户下周补充两次访谈”。事件日志没有数量、负责人或确认,正确输出是待决决策,而不是行动项。唐宁回看录音不是默认步骤;只在已有合法录制、必要且获准时使用,并按留存处理,普通状态不为便利收集更多敏感数据。
交付事件只有明确负责人能改变状态。模型可以把“正在准备”映射为候选进行中,但若没有工作项与下一步行动就标未关联,不写进客户完成清单;会议情绪、语气和未确认推测不进入状态。这样状态反映可核对的运营事实,而不是把自然语言总结当项目账。
客户可以在下一次回复中纠正事件。纠正产生新事件并连接取代,不改写已发送周报;若涉及范围或承诺,进入变更流程。状态工作流不是会议纪要机器,而是把已有交付事实转成可共同确认的状态界面。
24 次状态运行发现 7 个责任字段缺失
| 状态评估 | 基线 | 改造后 | 决策 |
|---|---|---|---|
| 状态包 | 24 | 24 | 6 客户×4 周 |
| 每包分钟 | 75 | 45 | 活跃时间 |
| 准时 | 20/24 | 23/24 | 一项因客户输入被阻塞 |
| 一次通过 | 19/24 | 22/24 | 两项发生内容性退回 |
| 待办事项 | 未统一记 | 68 | 结构化分母 |
| 草稿中缺少负责人/截止日期 | 状态未知 | 7 跨 2 包 | 全部被阻塞/已修复 |
| 外部人工审批 | 状态未知 | 24/24 | 发送前 |
| 错误的接收人/客户事实 | 0 已知 | 0 已记录 | 继续监控 |
7个不完整操作都没有进入客户放行:4个补齐负责人/截止日期,2个降级成需要决策,1个删除为重复事件。日 84的通过门不是“AI总结准确率100%”,而是所有关键事件可追踪、状态未知不被补写、68项行动在外发时字段完整、24次均有人批准。
若客户要求把状态直接更新到其项目系统,下一阶段也只能先生成待批准的变更集;本期不授予写入权限。把邮件改成服务接口写入并不会降低责任,反而减少人看到最终动作的机会。
6家客户中有2家反馈新结构过长,唐宁没有删掉决策与阻碍,而是把正文缩成一页、完整动作账本作为附表;另1家需要不同周起止日,作为配置字段而非复制一套工作流。用户反馈改变呈现,不能删除用于责任和恢复的证据。
第 84 天还要抽查客户是否真的使用:24 次交付中有 18 次出现明确回复、会议引用或行动状态变化,另外 6 次只有送达证据,标为用途未知。送达不等于价值;下一阶段若长期无人使用,应降低频率、改变格式或停止,而不是自动增加提醒。
三个工作流共用一套权限、放行和停止控制:模型可以草拟,不能成为经营责任人
| 控制 | W1 研究 | W2 提案 | W3 状态 |
|---|---|---|---|
| 允许读取 | 公开 + 已批准的客户引用 | 咨询 + 服务资产 | 客户交付事件 |
| 允许写入 | 内部草稿区 | 提案草稿区 | 状态草稿区 |
| 外部行动 | 无 | 人工发送 | 人工发送 |
| 关键人工检查 | 主张关系 | 范围/价格/条款 | 负责人/截止日期/客户 |
| 放行证据 | 内部清单 | 审批人 + 接收人 + 版本 | 审批人 + 接收人 + 事件引用 |
| 关键停止 | 跨客户或不支持的主张进入放行 | 错误的价格、范围或发送 | 错误的客户、动作或发送 |
| 恢复 | 撤回内部使用 + 修正 | 遏制 + 发布新版本 + 通知 | 遏制 + 修正账目/发布 |
连接器只授予当前阶段所需的读取或草稿权限;没有发送、付款、签约、删除客户系统记录或改变访问的权限。凭据不写进提示词和库,季度与项目结束时复核、撤销。工具调用日志要能连接到工作项,重试不能重复创建提案或放行状态。
停止事件发生时,先暂停受影响的工作流与外发,保存输入、输出、版本、调用与收件证据,确定已知和未知影响,再决定遏制、沟通、恢复和复盘。客户权益、保密、合同或法定通知由唐宁与合格人士处理,不能让 AI 根据通用模板自行决定。
投资组合记分卡把三项任务时间加总,也保留不同质量分母:总平均不能稀释提案错误
| 改造后队列 | 研究 | 提案 | 状态 | 总计 |
|---|---|---|---|---|
| 样本数 | 12 | 10 | 24 | 46 |
| 每项分钟 | 92 | 190 | 45 | 混合 |
| 工时 | 18.4 | 31.7 | 18.0 | 68.1 |
| 基准工时 | 31.0 | 47.5 | 30.0 | 108.5 |
| 工时减少 | 12.6 | 15.8 | 12.0 | 40.4 |
| 准时 | 11/12 | 9/10 | 23/24 | 43/46 |
| 一次通过 | 11/12 | 8/10 | 22/24 | 41/46 |
| 返工 | 1 | 2 | 2 | 5 |
总时数计算为 12×92/60=18.4、10×190/60≈31.7、24×45/60=18.0;与 108.5 相差约 40.4 小时。四舍五入只用于展示,原始分钟保留。准时与一次通过可以相加,是因为三类任务使用相同的事件定义;但提案的错误价格、研究中缺乏支持的主张仍要设置单独的关键护栏,不能被 43/46 的总指标覆盖。
经营层目前只有领先证据:平均提案响应更快、释放时间出现、服务承诺更稳定。90天内没有足够样本证明赢单率、收入或留存由项目提高;记分卡把已收款、新客户容量和客户结果标为滞后/未知,计划在日 180复核。
经济账必须区分组间节省、期内节省和建设投入
| 投资 | 工时/现金 |
|---|---|
| 基线 + 范围 | 12小时 |
| 资产权益/清理 | 28小时 |
| 工作流 1 设计/测试 | 18小时 |
| 工作流 2 设计/测试 | 22小时 |
| 工作流 3 设计/测试 | 18小时 |
| 集成/文档/指标 | 8小时 |
| 构建总计 | 106小时×¥240=¥25,440 |
| 工具 | 初始设置 ¥900 + 3×¥620 = ¥2,760 |
| 总教学投资 | ¥28,200 |
40.4小时是两组46项群组的任务差;52小时是不同工作流分阶段上线后,在整个90天实际避免的估算时间:W1约25.2小时、W2约19.8小时、W3约6小时、上下文约1小时。二者回答不同问题,不能把两者相加成92.4小时收益。52小时×¥240=¥12,480只是时间价值,若释放时间闲置就不会变成现金。
日 90仍有约¥28,200−¥12,480=¥15,720未覆盖。稳态按典型周约节省10.6小时,毛时间价值约¥2,544/周;扣除约¥620/月的增量工具费,教学模型约需再6.6周才覆盖剩余投入。这个推算未含税、波动、维护超支和机会是否真的变现,不是投资回报率承诺。
| 稳态每周释放 10.6 小时 | 计划分配 |
|---|---|
| 更深入的客户决策工作 | 4.0小时 |
| 合格销售/跟进 | 2.0小时 |
| 库/评估/控制维护 | 2.0小时 |
| 未承诺的弹性缓冲 | 2.6小时 |
若维护连续四周超过2小时,先查资产碎片、工具不稳定或工作流范围过宽;不能从缓冲永久借时维持。唐宁也不预先售卖全部10.6小时,因为试点量和客户组合会变化。
日 90 决策记录选择带控制继续:下一阶段先证明稳定与经营结果,不增加第四个工作流
| 决策字段 | 第 90 天答复 |
|---|---|
| 工作流 1 | 继续内部有限使用;保留主张复核 |
| 工作流 2 | 继续人工审批;价格与范围永不自动批准 |
| 工作流 3 | 继续人工审批;不授予客户系统写入权限 |
| 库 | 186 活跃;14 隔离按过期处理 |
| 自动发送 | 停止/未授权 |
| 工作流 4 | 否;等稳定与业务证据 |
| 最强证据 | 同类任务节省 40.4 小时、41/46 一次通过、关键事故 0 且有记录 |
| 反证 | 106 小时建设投入、仅观察 90 天、现金结果未知 |
| 下次复核 | 日 120、150、180 |
日 91—120连续运行并加入一次工具故障与错误接收方演练;日 121—150检查维护、客户反馈、提案结果和实际释放时间去向;日 151—180更新经济模型,再决定是增加客户、提高价格、缩小服务,还是选择第四个工作流。任何重大事件把相关工作流退回影子,不等日 120。
项目交接也适用于一个人:导出资产登记册、评估案例、运行手册、凭证清单、发布日志和恢复步骤,确认在主工具不可用时仍能完成最低服务。若只有唐宁记得怎么运行,90天只创造了新的个人依赖。
把这份 90 天计划换成自己的数据
| 计划块 | 复制字段 |
|---|---|
| 业务目标 | 容量/结果、基线、负责人、非目标 |
| 候选放行门槛 | 频率、证据、可逆性、数据、责任 |
| 对照任务组 | 项目类型、样本数、起止、时间、质量、置信度 |
| 波 | 影子、辅助、有限使用、放行门槛、回滚 |
| 知识资产 | 来源、权利、适用、禁止使用、版本、复核 |
| 评估 | 正常、缺失、冲突、禁止、外部操作测试 |
| 放行 | 工作项、输入、输出、审批人、接收方、版本 |
| 记分卡 | 时间、准时、一次通过、返工、事件、成本、业务 |
| 决策 | 继续/变更/停止、反证、下次日期 |
NIST当前官方页面明确AI RMF 1.0正在修订;本文只借用其自愿性风险管理思路,并参考2024年生成式 AI 画像把风险行动与目标/优先级联系起来,不把案例门槛说成NIST要求。NIST 隐私框架官方页仍标版本 1.0并列出后续项目,本文用其资产盘点、映射与隐私风险思路检查知识资产。英国政府服务绩效资料支持从项目开始定义指标、结合任务完成/时间、成本、用户反馈与多种来源评估,并在证据不足时决定继续、改变或停止;这里只借鉴测量方法。看板指南 2025.5用于进行中工作、周期时间与显式工作流,ISO公开质量资料用于过程、记录、监测与持续改进;均不代表唐宁通过认证。
- NIST:AI Risk Management Framework
- NIST:Generative AI Profile NIST-AI-600-1
- NIST:Privacy Framework
- GOV.UK:Measuring the success of your service
- GOV.UK:Measuring the benefits of your service
- Kanban Guides:The Kanban Guide 2025.5
- ISO:ISO 9001 explained
今天选过去14天真实发生过的工作,不先看工具列表。为每项记录开始、结束、人工分钟、返工、外部影响和证据强度;再把最常见候选过频率、可逆、数据与责任门。只有当基线能回答“问题多大、错误是什么、谁负责”时,才写第一张工作流契约。