先看结果:AI 说“值得全力投入”,红队把 6 个月开发改成 8 周受控试点
独立研究顾问唐序准备把定制研究服务做成每月 249 美元的 AI 行业简报订阅。他计划投入 240 小时和 12,600 美元现金,6 个月达到 80 个付费客户、19,920 美元月度经常性收入。AI 先后给出市场趋势、差异化卖点和增长计划,结论都是“时机成熟、建议抢先进入”。
红队没有证明计划必败,而是发现原建议依赖 14 条关键假设:2 条已有矛盾证据,8 条证据不足、不可核验或只覆盖局部,另 4 条尚未压力测试;其中 2 条一旦失效会越过数据或外发硬边界。最关键的容量复算如下:历史交付中位 31 分钟/客户/周,80 个客户需要 41.3 小时/周,而计划写的是 10 分钟与 13.3 小时。
| 决策 | 原方案 | 红队后方案 |
|---|---|---|
| 承诺 | 立即开发 6 个月 | 8 周、12 客户礼宾式试点 |
| 现金上限 | 12,600 美元 | 4,800 美元 |
| 时间上限 | 240 小时开发,不含返工 | 96 小时,含交付与复盘 |
| 需求证据 | 意向访谈和 AI 市场总结 | 预付、连续使用、续费选择 |
| 扩张前容量 | 假设 10 分钟/客户/周 | 实测必须≤17 分钟 |
| 停止机制 | “效果不好再调整” | 7 个可观察触发器 |
结论是“有条件继续获取信息”,不是“否决创业”。本文人物、产品、12 个可比项目和所有数字均为教学案例;外部资料用于支持红队、结构化分析和风险管理方法,不代表真实行业成功率。
红队不是唱反调,而是改变搜索目标、证据负担和决策权
普通赞同式提示从“这个计划如何成功”开始,模型会补齐路径;红队从“什么必须为真、什么证据会推翻它、失败会怎样被尽早看见”开始。两者产物不同:
| 工作视角 | 搜索目标 | 证据负担 | 结束条件 |
|---|---|---|---|
| 倡导者 | 找可行路径和机会 | 存在一条合理路径 | 形成方案 |
| 批评者 | 找缺口、矛盾和替代解释 | 指出具体主张与证据差距 | 形成挑战 |
| 红队 | 模拟独立对手、环境与失败路径 | 证据可追溯、攻击可复现 | 形成可处置风险 |
| 决策负责人 | 平衡机会、风险与边界 | 对取舍和剩余风险负责 | 批准、缩小、延后或停止 |
让 AI 在同一回答末尾加一段“风险”不等于红队。它仍被前文方案锚定,也不知道哪些风险会改变行动。真正红队要拿到冻结的计划版本,由不同会话或不同人独立工作;原方案作者不能在挑战产生前逐条辩护。
反方也不能以“可能失败”取胜。任何计划都有风险;挑战必须指出被攻击的假设、证据、后果、触发器和可行处置。无法改变决策或控制的泛化担忧只进观察清单。
独立不等于信息不对称。倡导者与红队都获得同一冻结计划、证据包、资料截止日和工具权限;若反方只拿到摘要,它发现的“缺口”可能只是被人为拿走的资料。两边都不得联系新来源后悄悄扩展证据,新增材料先进入共享证据日志,再由双方分别更新。
会议主持人也不按“挑战数量”奖励红队。10 条同义风险不如 1 条能推翻容量假设的复算。质量指标是高影响假设覆盖率、挑战可证伪性、证据可定位性和对行动的区分力,而不是语气多尖锐。
先冻结一页决策底稿,防止被挑战后移动球门
唐序把 PLAN-01@1.0 冻结为:
| 字段 | 原始承诺 |
|---|---|
| 目标 | 6 个月建立可重复的行业简报订阅收入 |
| 目标 | 第 6 月 80 个付费客户,月价 249 美元 |
| 产品 | 每周 1 份个性化简报,含来源、解释和行动建议 |
| 构建 | 240 小时,自动采集、生成、审核和发送 |
| 现金 | 软件、外包和获客共 12,600 美元 |
| 容量 | 每客户每周交付 10 分钟,最多 13.3 小时/周 |
| 收购 | 2,400 人受众中 4.2% 在 6 个月内付费 |
| 流失 | 月流失 5% |
| 硬性边界 | 客户资料不得未经批准进入外部系统或自动外发 |
| 决策日期 | 2026-07-28 |
底稿把事实、估计和偏好分栏。当前有 2,400 个订阅联系人是事实;4.2% 转付费是预测;“现金最多 12,600”是风险偏好;“不得越权处理”是硬边界。若混成一段愿景,红队很难知道该反驳什么。
冻结不禁止改计划,只禁止静默改。每次挑战后生成 PLAN-01@1.1,并在决策差异中记录旧值、新值、理由和受影响计算。否则团队会在红队指出 80 客户容量问题后说“我们本来就只想做 20 个”,让审查永远无法失败。
先列关键假设:不用攻击 80 句话,只攻击会改变决定的 14 条
关键假设定义为:若为假,方案价值、可行性、权限或不可逆损失会跨过决策边界。唐序的假设账本如下:
| 类别 | 关键假设 | 原证据 | 初始状态 |
|---|---|---|---|
| 需求 | A01 80 人愿以 249 美元持续购买 | 9 次意向访谈 | 不足 |
| 收购 | A02 受众到付费 4.2% | 无本地漏斗 | 不受支持 |
| 留存 | A03 月流失≤5% | AI 引用行业常见值,无原表 | 不可验证 |
| 价值 | A04 每周简报触发可见行动 | 3 个现有客户反馈 | 部分 |
| 运营 | A05 每客户每周≤10 分钟 | 估计 | 被反驳 |
| 质量 | A06 自动草稿 95% 可直接审核 | 5 份顺利样本 | 范围受限 |
| 权利 | A07 所有来源允许计划中的复用 | 未逐源核对 | 状态未知 |
| 数据 | A08 客户上下文可按当前同意处理 | 仅旧服务合同 | 状态未知 |
| 财务 | A09 12,600 美元覆盖全部成本 | 未含机会成本 | 不完整 |
| 创始人 | A10 每周可稳定投入 24 小时 | 最近 8 周中位 15 小时 | 被反驳 |
另 4 条涉及价格保持、外部模型变更、单一渠道依赖和退出可导出性。账本保存负责人、上次检查时间、证伪条件、失效影响和下一项证据。没有反证条件的“假设”只是信念。
红队按“敏感性 × 不确定性 × 不可逆性”排序,不计算装饰性总分。A05、A08、A10 优先,因为会同时影响可交付性或硬边界;标志、名称和配色即使未知,也不会决定是否投入 240 小时。
外部视角先问“类似事情通常怎样”,再看这个方案为何例外
唐序最初只讲内部视角:自己懂行业、有 AI 工具、客户信任他。红队先建立参照类:过去 24 个月、单人或两人团队、从定制服务转月度信息产品、价格 150—400 美元、主要靠现有受众销售的项目。
教学数据包有 12 个可比项目:
| 指标 | 原计划 | 12 个可比项目分布 | 原计划位置 |
|---|---|---|---|
| 6 月付费客户 | 80 | 中位 23;四分位 14—41;最大 71 | 高于全部样本 |
| 达到≥50 客户 | 默认会达到 | 3/12 | 基准事件率 25% |
| 构建工时倍率 | 1.0× | 中位 1.6×;范围 0.8—2.9× | 偏乐观 |
| 月流失 | 5% | 中位 8.5%;四分位 6%—12% | 优于多数样本 |
| 每客户周交付 | 10 分钟 | 中位 28;四分位 19—46 | 优于全部但 1 个项目 |
这 12 项不是市场总体,也可能有幸存者偏差;正确用途是校正起点和设计本地测试,不是宣布成功概率精确等于 25%。参照类编号、纳入与排除规则、时间窗、原始记录和缺失项目必须可审计。
项目仍可能优于基准,但例外理由要转成可测预测:已有 2,400 人受众若真是优势,付费预售率应显著高于唐序过去 6 次产品邀请的中位 1.8%;自动化若真能降到 10 分钟,应在 20 份完整交付中包含失败与返工后达到,而不是展示一次成功演示。
基准概率不是命运:用它重算起点,不用它替代本地证据
原方案将 80÷2,400=3.33% 写成“只需转化少量受众”,另一处又用 4.2%,口径不一致。若 4.2% 是累计付费,需要 101 人;若目标 80 人,所需净转付费为 3.33%,还未考虑 6 个月流失。
假设每月流失 8.5%,80 个第 6 月仍在客户不能只靠首次获取 80 个。若每月等量新增 n,月末客户为 n × (1 + 0.915 + 0.915² + 0.915³ + 0.915⁴ + 0.915⁵) = 4.8606n,因此每月约需 16.46 个净新增,6 个月共约 98.75 个首次客户。98.75 ÷ 2,400 = 4.11%,且假设所有联系人都可触达、没有名单衰减。
| 参数 | 乐观案 | 基准案 | 压力案 |
|---|---|---|---|
| 月流失 | 5% | 8.5% | 12% |
| 第 6 月在册目标 | 80 | 80 | 80 |
| 每月等量新增 | 15.10 | 16.46 | 17.92 |
| 6 月累计首次客户 | 90.60 | 98.75 | 107.54 |
| 占 2,400 受众 | 3.77% | 4.11% | 4.48% |
基准不是只换一个流失数字;还要把构建工时、交付时间和获客率联动。《绿皮书》对乐观偏差的处理思路是用自身或可比项目的历史预测误差调整成本、时间和收益,而不是给计划加一句“保持谨慎”。小项目可以采用同样原则,但教学基准不冒充政府规定的调整率。
预测必须在结果发生前封存,再用实际误差建立自己的校准基准
红队很容易产生事后聪明:项目失败后谁都能说“我早就担心”。唐序为每个会改变承诺的预测建立预测账本,记录预测编号、数据截止日、定义、时间窗、点估计或区间、证据、负责人和结果揭晓日;到期前只能追加新版本,不能覆盖旧值。
| 预测编号 | 事前预测 | 口径 | 结果记录 | 更新条件 |
|---|---|---|---|---|
| FC-01 | 30 个合格邀请中 6—10 个预付 | 7 天内完成付款且未退款 | 7 天付费数 | 名单或价格变化即新版本 |
| FC-02 | 第 4 周 8—11/12 客户主动使用 | 无提醒完成至少 1 个真实任务 | 第 4 周活跃数 | 任务定义变化即重开 |
| FC-03 | 每客户周交付中位 24—35 分钟 | 含失败、核验、沟通与更正 | 全流程分钟数 | 自动化版本变化即重测 |
| FC-04 | 96 小时内完成 P0—P3 | 唐序全部项目工时 | 实际工时 | 范围变更必须同时改预算 |
过去 5 个内部小项目的计划/实际工时分别为 40/68、72/103、25/46、60/90、36/65,实际÷计划倍率为 1.70、1.43、1.84、1.50、1.81,中位 1.70。若直接用于原 240 小时计划,校准工时是 408 小时;它不证明本项目必然超时,却使“240 小时足够”的举证责任提高。
试点结束同时报告有方向的误差和绝对误差:实际 30 分钟落在预测区间 24—35 内,表示命中;实际 52 分钟则表示高估效率,偏差 17 分钟。连续保留 10—20 次预测后,唐序可以按获客、构建、交付分别形成内部基准,而不是每次去网上找一个漂亮的行业数。
不确定性很大时用宽而有业务含义的区间,不强迫 AI 给 63.7% 成功率。区间也必须可失败:若实际经常落在边界外,就说明定义、资料或判断过程需要修正,不能在结果后解释“本来就包含极端情况”。
关键假设检查要逐条寻找失效条件,而不是问“合理吗”
对 A05,红队不问“10 分钟是否合理”,而是拆交付链:来源抓取、异常处理、生成、主张核验、客户上下文修正、排版、发送与事后更正。20 份历史简报计时如下:
| 步骤 | 中位分钟 | 90 分位 | 原模型是否包含 |
|---|---|---|---|
| 采集与去重 | 5 | 11 | 部分 |
| 生成与结构调整 | 6 | 12 | 是 |
| 主张—来源核验 | 9 | 18 | 否 |
| 客户上下文修正 | 7 | 15 | 否 |
| 排版与发送 | 4 | 8 | 是 |
| 合计 | 31 | 64 | 原模型写 10 |
80×31÷60=41.33 小时/周,还没算销售、支持和产品维护。即使降到 17 分钟,80 客户也要 22.67 小时/周,仍超过唐序最近可用的 15 小时中位;因此 17 分钟只适合作为 50 客户时约 14.17 小时/周的扩张门槛。
每个假设都要写清失效条件。A06 的 95% 直接审核若在新样本中低于 85%,或高风险错误超过 1/20,就失效;A08 若同意未覆盖新处理方,立即停止导入,不等待概率评估。
反方论证要构造最强可检验反论点,不制造稻草人
原主张:“现有客户已经信任唐序,所以订阅能降低销售成本并维持续费。”弱反方说“客户也可能不喜欢”;强反方拆成买方、使用频率和替代行为:现有客户购买的是唐序的定制判断,不一定购买标准化周报;低销售成本可能被高个性化交付成本抵消;有用不等于每月持续付费。
| 反方字段 | A01/A04 实例 |
|---|---|
| 被攻击的主张 | 现有信任会转成 80 个持续订阅 |
| 机制 | 服务信任依赖定制互动,不可完全转移到产品 |
| 支持证据 | 9 次意向中 6 人要求保留月度电话 |
| 替代预测 | 预售可发生,但无电话组第 2 月使用下降 |
| 区分测试 | 随机提供“仅产品”与“产品+电话”两种真实价格 |
| 决策影响 | 若只有捆绑服务成交,不能按纯产品容量扩张 |
反方必须允许被驳倒。若 12 个预付客户中至少 8 个选择“仅产品”,且连续 4 周在没有催促下使用,反方力度下降。只说“竞争激烈、技术变化快”没有可证伪预测,不算完成挑战。
AI 的角色是生成候选反论点、寻找原计划内部矛盾和列区分性测试;人工要核查证据,防止模型为了显得犀利虚构失败案例或竞争数据。
用竞争假设矩阵解释信号,避免只收集支持“需求很强”的证据
30 位意向客户中有 12 位点击预售页,可能对应不同解释:H1 有持续产品需求;H2 只是支持熟人;H3 想要定制服务折扣;H4 对主题感兴趣但没有购买紧迫性。
| 证据 | H1 产品需求 | H2 人情支持 | H3 服务需求 | H4 内容兴趣 |
|---|---|---|---|---|
| 12/30 点击预售 | 一致 | 一致 | 一致 | 一致 |
| 8 人完成付款 | 强一致 | 较不一致 | 一致 | 不一致 |
| 6 人要求月度电话 | 较不一致 | 中立 | 强一致 | 中立 |
| 4 周无提醒使用≥3次 | 强一致 | 不一致 | 较不一致 | 较不一致 |
| 退款后仍阅读免费内容 | 中立 | 中立 | 不一致 | 一致 |
“点击”几乎不能区分四个假设,不应被写成需求验证。预付、重复使用和续费选择具有更高区分力。矩阵不靠支持证据数量投票,而优先寻找与假设不一致的证据。
CIA 的结构化分析入门材料把关键假设检查、竞争性假设分析、反方论证和红队分析列为不同技术。唐序借用它们的结构,不把商业决定包装成情报判断,也不假设矩阵能自动给出真相。
失败预演先假定一年后失败,再按时间线倒推可观察原因
会议开场不是“你觉得会有什么风险”,而是:“现在是 2027-07-28,项目损失 12,600 美元、核心服务客户流失、订阅已关闭。请独立写 5 个导致这一结果的具体故事。”先个人静默 8 分钟,避免第一位发言者锚定全组。
24 个失败故事合并成 9 条路径:
| 失败路径编号 | 失败故事 | 最早信号 | 原计划盲点 |
|---|---|---|---|
| F1 | 定制需求使交付无法规模化 | 每客户周工时>25 分钟 | 只计生成时间 |
| F2 | 受众愿意点赞但不付款 | 预售付款<6/30 | 用访谈意向替代购买 |
| F3 | 第 2 月使用快速下降 | 周活跃连续两周<50% | 只看首月注册 |
| F4 | 自动外发错误伤害客户关系 | 1 次未经批准发送 | 没有硬停止线 |
| F5 | 来源复用权利不清导致下架 | 关键来源无用途记录 | 把能访问当能复用 |
| F6 | 产品开发挤压高价值服务 | 服务响应超 SLA 2 次 | 未计机会成本 |
| F7 | 单一模型更新改变质量 | 高风险错误>1/20 | 无版本回归样本 |
| F8 | 退款和支持吞掉毛利 | 支持>20 分钟/客户/月 | 成本表漏支持 |
美国陆军《红队手册》将失败预演描述为从“计划已经失败”出发寻找关键脆弱点的快速模拟。它适合打破方案所有权,却不估计概率;产生的故事仍需去重、找证据和转成控制。
最后再问成功过头的失败:若突然获得 100 个订单,会不会因容量、权限和服务崩溃?机会也能触发不可接受风险,红队不只想象没有销售。
把失败故事建成因果链,区分根因、触发、控制失效和损失
F4 不应只登记为“AI 发错邮件”。完整的蝴蝶结因果链是:客户资料进入草稿→模型混入错误对象→预览未显示收件人与证据状态→自动化使用过宽权限→外发→客户看到错误信息→需通知、更正和承担关系损失。
| 位置 | F4 内容 | 可处置点 |
|---|---|---|
| 威胁 | 对象混淆、旧上下文、提示注入 | 隔离客户上下文、输入验证 |
| 预防性控制 | 默认禁止外发、最小权限 | 阻止错误离开系统 |
| 顶事件 | 未经正确批准的内容进入发送队列 | 队列状态机与双人门 |
| 探测性控制 | 收件人/主张/来源差异检查 | 发送前发现 |
| 后果 | 泄露、误导、客户关系损失 | 预案、通知、撤回 |
| 恢复 | 暂停令牌、保留日志、人工联系 | 降低后果与复发 |
“人工审核”不能作为一个万能控制。要写谁在何时看什么、依据什么通过、失败怎样阻断。若同一个疲劳的唐序既生成、又审核、又点击发送,控制独立性很弱。
控制也会引入新风险:双人审批可能延误周报,过多告警造成忽略,完整日志可能保存敏感数据。每项控制都要保存负责人、测试、证据、失效方式和剩余风险。
风险登记要分固有风险、控制效果和剩余风险,不给彩色方格就结束
唐序不用 5×5 热力图冒充精确数学。“可能性”写可观察频率或证据状态,“影响”写现金、时间、客户和不可逆后果;评分只用于排序,不让低概率越权被平均成绿色。
| 风险 | 固有风险依据 | 当前控制 | 控制证据 | 剩余风险决定 |
|---|---|---|---|---|
| R1 容量失控 | 历史 31 分钟,中位可用 15 小时 | 12 客户上限 | 每周时间账本 | 超 35 分钟缩小范围 |
| R2 需求不足 | 可比项目仅 3/12 达 50 客户 | 先收预付 | 支付与退款记录 | <6/30 停止开发 |
| R3 数据越权 | 旧合同未覆盖新处理 | 去标识沙盒、逐客户同意 | 同意账本 | 1 次即停止 |
| R4 外发错误 | 自动化计划权限过宽 | 默认关闭、发送前人工门 | 20 次测试 | 1 次即撤销令牌 |
| R5 服务被挤压 | 最近可用 15 小时 | 96 小时总上限 | 周工时与 SLA | 2 次 SLA 破坏暂停 |
《橙皮书》强调风险管理应进入决策、基于最佳可用信息、包含识别、评估、处置、监控和报告,并考虑控制的实际效果。本文把这些原则缩小到单人业务,不声称所有政府治理结构都适用于 OPC。
风险负责人不能写“AI”或“团队”。唐序对容量和客户关系负责,外部律师只对合同解释提供意见;工具失败时责任不会转移给模型。
压力测试要同时改变相关变量,不能只把收入统一乘 0.8
三个情景描述有因果关系的一组变化:
| 情景 | 联动输入 | 6 月结果 | 预先行动 |
|---|---|---|---|
| S1 基础 | 流失 8.5%、31 分钟、每月新增 16.4 | 达 80 但容量失败 | 不允许直接扩到 80 |
| S2 低需求 | 付费率 1.8%、流失 12%、支持高 | 约 43 个首次购买且留存更低 | 只做礼宾试点,停止全量开发 |
| S3 成功过快 | 首月 35 单、错误率不降、可用 15 小时 | 订单超过交付能力 | 候补名单与每周开通上限 |
| S4 供应变化 | 模型成本+40%、质量回归失败 | 毛利和审核同时恶化 | 锁版本、切换手册、暂停外发 |
S2 的 1.8% 来自过去 6 次产品邀请的中位,不是随意悲观数。S4 把成本与质量一起变,因为模型迁移可能同时影响二者。若只做单变量表,会漏掉相关冲击。
压力测试不要求每个情景都有精确概率。对于难逆、损失大的决定,能否在可信情景中生存比期望值小数更重要;若概率输入很弱,报告区间和触发器,不能模拟 10,000 次后把结果写成“成功率 63.7%”。
预防控制、侦测控制和恢复动作要覆盖不同时间点
红队对前 5 个风险各设计三类措施:
| 风险 | 预防 | 侦测 | 恢复 |
|---|---|---|---|
| 容量 | 客户上限、标准范围 | 每客户周工时、90 分位 | 暂停新开通、缩小承诺 |
| 需求 | 真实价格预付 | 使用与续费队列 | 退款、保留服务路线 |
| 质量 | 冻结评测集、来源门禁 | 20 条高风险抽查 | 撤下简报、发布更正 |
| 数据 | 同意、隔离、最小权限 | 数据流与访问日志 | 撤销令牌、删除、通知 |
| 服务挤压 | 日历容量预留 | SLA 和未完成队列 | 优先既有合同、暂停试点 |
控制设计后必须做控制测试。禁止外发不靠设置截图证明,而用 10 个无批准任务尝试发送,预期 10/10 阻断;删除不靠“按钮成功”,而在原件、索引、摘要和备份可见层分别查唯一标记。
成本也要计入控制。每周质量抽查 20 条若需 3 小时,应进入容量模型;否则风险表靠未预算劳动显得安全。无法持续运行的控制等于没有稳定控制。
把风险变成先行指标和触发器,避免事后解释“早有迹象”
7 个触发器在试点前写入决策备忘录:
| 触发器编号 | 指标 | 阈值 | 时间窗 | 触发动作 |
|---|---|---|---|---|
| T1 | 30 个合格邀请的预付 | <6 | 第 2 周 | 停止产品开发,访谈拒绝原因 |
| T2 | 12 客户周活跃 | <8 | 连续 2 周 | 不扩张,检查实际任务频率 |
| T3 | 每客户周交付中位 | >35 分钟 | 任一完整周 | 缩小个性化范围 |
| T4 | 50 客户容量演练 | >17 分钟 | 扩张前 20 份 | 禁止扩到 50 |
| T5 | 高风险主张错误 | >1/20 | 任一批抽查 | 暂停发布并全查 |
| T6 | 未经批准数据/外发 | ≥1 | 任意时点 | 立即停止、撤销权限、处置事件 |
| T7 | 既有服务 SLA 破坏 | ≥2 | 14 天 | 暂停试点,优先合同客户 |
阈值必须绑定数据来源、计算查询、负责人和响应期限。T3 若只算顺利客户会被操纵,因此分母包含失败、返工和人工沟通;T1 的“合格邀请”排除无法支付地区和重复联系人。
触发器不是自动判决一切。T6 是硬停止;T2 是诊断暂停;T1 允许重新定义目标人群,但必须开新版本,不能换名单后继续沿用 6/30 的门槛。
选择可逆动作:先购买信息,再购买规模
全量开发把需求、交付和合规三个未知同时锁进 240 小时。礼宾试点保留人工步骤,目的不是模拟最终毛利,而是用 96 小时回答最敏感问题。
| 试点阶段 | 时限/上限 | 要回答 | 扩张门 |
|---|---|---|---|
| P0 合同与来源 | 1 周、12 小时 | A07/A08 是否允许 | 12/12 客户与关键来源有记录 |
| P1 真实预售 | 1 周、18 小时 | A01/A02 是否有付费行为 | ≥6/30 预付;退款条款清楚 |
| P2 礼宾交付 | 4 周、48 小时 | A04/A05/A06 | ≥8/12 连续使用;错误≤1/20 |
| P3 容量演练 | 2 周、18 小时 | 能否从 31 降到≤17 分钟 | 20 份含异常样本过线 |
现金上限 4,800 美元,其中 2,988 是 12 个客户一个月收入时的名义回收,不能提前当净收益。人工 96 小时按机会成本 80 美元计为 7,680 美元,虽不全是现金,也必须出现在决策表中。
试点仍可能不值得做:P0 若权限不成立,直接停止;不因为前期投入 12 小时就继续。每阶段结束都有“继续、变更、停止”三种明确动作和签字时间。
重新做决策:红队的价值是改变承诺,而不是风险写得更多
DEC-01@1.1 的结论按五部分呈现:机会仍在;哪些假设被削弱;哪些硬边界不允许跨越;最小可逆行动;何时重新决定。
| 决策问题 | 结论 |
|---|---|
| 是否立即投入 240 小时与 12,600 美元 | 否,证据不足且容量矛盾 |
| 是否完全放弃产品化 | 否,付费与持续使用仍可低成本验证 |
| 现在批准什么 | 8 周、96 小时、4,800 美元现金上限的 12 客户试点 |
| 谁能叫停 | 唐序;数据边界事件由数据顾问建议立即停 |
| 何时重审 | P1、P2、P3 各阶段结束;最迟 2026-09-30 |
| 扩张到 50 的必要条件 | T1/T2 通过、交付≤17 分钟、A07/A08 有证据、SLA 未破坏 |
剩余风险不隐藏:12 客户试点仍不能证明 80 客户市场;礼宾留存可能受唐序本人互动抬高;20 份容量演练可能漏长尾异常。因此通过试点只批准下一阶段,不自动批准原全量方案。
红队若没有改变决策、实验、控制、触发器或信息优先级,可能只是表演。这里它把不可逆承诺降低 62% 现金、60% 开发时间,并把“以后观察”改为 7 条明确触发器;这些变化可核对。
AI 红队必须隔离上下文、引用证据并接受反向审计
同一会话先帮唐序写了 20 页商业计划,再问“有什么风险”,模型会继承方案措辞和未证实数字。更可靠的运行包分三次:
运行 A(倡导者):使用 PLAN-01@1.0,写最强成功路径和必要证据
运行 B(红队):只给冻结计划、证据包和攻击协议;不得看运行 A 的修辞结论
运行 C(裁决者):对齐主张编号、证据编号、挑战编号和回应;不得新增事实
红队输出固定字段:被攻击主张、失败机制、支持证据、反方证据、基准概率、证伪条件、最早信号、控制、剩余风险和决策影响。没有原文位置的外部案例标为“待核”,不得进入概率计算。
裁决不是让原作者逐项“回应完毕”就自动关闭。每条挑战只有“已接受、缩小后接受、有证据地拒绝、未解决”四种状态:“已接受”要改变计划或控制;“缩小后接受”要写新的适用范围;“有证据地拒绝”必须引用能直接处理攻击机制的证据;“未解决”则进入试点问题或阻止高承诺。单纯写“团队有信心处理”不改变状态。
| 裁决字段 | CH-05 示例 |
|---|---|
| 被攻击的假设 | A05 每客户每周≤10 分钟 |
| 红队证据 | 20 份全流程中位 31 分钟 |
| 负责人响应 | 未来自动化会减少核验时间 |
| 裁决 | 未解决;回应是预测,不是现有反证 |
| 所需证据 | 20 份含异常的容量演练≤17 分钟 |
| 决策效果 | 禁止扩到 50 客户 |
裁决者要能选择“机会成立但承诺过大”。红队不是二元法庭,方案可以被缩小、分期、改成信息购买或加硬门;这往往比全盘通过或否决更符合真实决策。
人工反向抽查 10 个挑战:从风险回到底稿,确认没有攻击计划未声称的内容;从证据回到来源,确认没有把类似项目当同一项目;再抽 5 个未被挑战的高影响假设,检查是否因模型漏读而逃过。
模型版本变化后重跑只生成差异,不能覆盖旧红队。若新模型减少挑战数,不自动代表计划更安全;可能只是行为变化。
可以直接复制的红队决策包与 90 分钟运行手册
最小决策包包含:
01-decision-brief.md
02-frozen-plan.md
03-claim-and-evidence-ledger.csv
04-reference-class.csv
05-key-assumptions.csv
06-competing-hypotheses.csv
07-premortem-and-risk-register.csv
08-controls-and-tripwires.csv
09-red-team-challenges.md
10-adjudication-and-decision.md
90 分钟会议分配:10 分钟确认决策与边界;15 分钟个人关键假设;15 分钟外部基准;15 分钟竞争假设;8 分钟个人失败预演;12 分钟合并因果链;10 分钟定义触发器;5 分钟由负责人宣布下一动作。原方案作者前 63 分钟只回答事实定位,不辩护价值判断。
发布门禁如下:
| 门禁 | 通过标准 |
|---|---|
| 计划完整性 | 原计划已冻结,所有预测都有主张编号 |
| 外部视角 | 参照类有纳入规则、分布和局限 |
| 挑战质量 | 高影响挑战有机制、证据、反证条件与决策影响 |
| 控制质量 | 负责人、测试、控制失效和剩余风险完整 |
| 可执行性 | 至少一个可逆选项,7 个触发器绑定数据与动作 |
| 独立性 | 反方先独立产出,裁决者不新增事实 |
资料核验于 2026-07-21,进一步阅读:
- CIA:A Tradecraft Primer:介绍关键假设检查、竞争假设、反方论证和红队分析等结构化技术。
- U.S. Army《The Army Lawyer》:Using Red Team Techniques to Improve Trial Advocacy:援引《红队手册 v9》,说明失败预演从假定计划已失败开始寻找关键脆弱点,并给出结构化红队步骤。
- HM Treasury:The Green Book 2026:要求显式处理乐观偏差,并用自身或可比项目历史预测误差调整成本、时间和收益;同时讨论情景与敏感性。
- HM Treasury:The Orange Book:把风险识别、评估、处置、监控、报告、控制效果和持续改进嵌入决策。
最好的红队结果不是“我们想到了更多坏事”,而是原计划里最脆弱的数字已经被重算,最危险的路径已有阻断和恢复,最重要的未知能以较小代价获得证据,负责人知道哪一条信号出现时必须承认旧判断失效。反方的任务不是赢过方案,而是让下一次承诺更小、更清醒、更容易撤回。