她已经不知道该打开哪一份“最终版”

顾遥是一名独立内容顾问。两年里,她把每次效果不错的对话都保存下来:公众号开头 11 份、客户访谈提纲 8 份、文章改写 17 份、邮件 9 份,其余散在笔记、收藏和项目说明中,共 73 份。

问题不是找不到提示词,而是每次都能找到太多份。真正使用时,她往往打开三四份互相拼接,再凭记忆判断哪一句还能用。旧提示里夹着客户名称、过期产品价格和临时活动日期;“永远不要用长句”和“复杂概念允许拆成两句”同时存在;一个范例写得好,却没有说明它好在哪里。最近 18 个任务中,8 个带入了过期资料,平均准备提示要 14 分钟。

再加一层标签并不能解决这个问题。因为混乱的根源不是文件名,而是寿命完全不同的内容被保存成了同一种文件:有的规则可能一年不变,有的客户事实三天后就过期,有的样例只负责解释边界。顾遥决定先停止新增“最终版”,把已有内容拆成四层:

保留资产 作用 是否进入每次任务
固定规则 3 跨任务长期成立的边界和表达原则 只加载相关规则集
任务模板 7 定义某类任务的变量、步骤和输出
参考样例 6 组 展示合格与不合格行为 按需要选择 1—3 组
临时材料 不入库 当次事实、客户文件、日期和目标 只在本次任务使用
73 份提示词来源按固定规则、任务模板、参考样例和临时材料分层
73 份来源并不是简单删成 16 份。规则、模板和样例成为默认可选的复用资产,临时材料则回到具体任务;不同统计口径不能混在一起计算“精简率”。

清理后保留 16 个可复用资产,18 个历史任务复跑没有带入旧客户事实,准备时间降到 4 分钟。本文以这个教学案例说明分层过程;人物、任务和结果数字用于展示方法,不是工具效果统计。

“73 变 16”不是删除 57 份文件后宣布完成。原始文件进入只读归档,用于追溯历史交付;16 指默认可选择的现行资产。一个规则集可以含多条规则,一个样例组同时含正例、反例和解释,因此文件数、规则数和样例数不能混成同一统计口径。

先审计 73 份来源:按原子片段分类,而不是给整份文件贴一个标签

顾遥先为每份来源记录创建日期、最后使用、客户归属、包含事实、可复用意图和当前授权。73 份文件拆出 214 个有独立作用的片段:47 个规则句、68 个任务步骤、43 个示例片段、56 个客户或日期事实。同一句中同时含规则和客户事实时也拆成两个片段。

片段类型 原始数量 清理动作 活跃结果
规则句 47 合并同义、删除不可验证偏好、解决冲突 18 条规则,归入 3 个规则集
任务步骤 68 按输入—步骤—输出接口重组 7 个任务模板
示例片段 43 去客户事实、补反例和解释 6 个样例组
临时事实 56 从公共库移除,按原项目归档或删除 0 个活跃资产

47 条规则句中,12 条是“专业、有温度、写得高级”一类无法验证的偏好,合并前先删除;剩余 35 条经同义合并和冲突处理成为 18 条。68 个步骤不是挑出 7 句,而是重组成 7 个带变量和验收的任务接口。这样 3 + 7 + 6 = 16 个现行资产,原 73 份来源仍能通过迁移记录查到替代项或停用原因。

提示词库失控,不是文件太多,而是寿命不同的内容混在一起

一句规则可能稳定一年,一份活动材料只有效三天,一个样例用于解释输出结构,一段客户背景只能在一个项目内使用。把它们保存为同一篇“万能提示词”,任何局部变化都要复制出新版本。

顾遥用两个问题判断归属:这段内容多久会变?它是在定义行为,还是提供本次事实?

内容 变化周期 正确归属 错放后果
所有量化主张必须有来源 长期 固定规则 每个模板重复维护
把访谈转成证据表 任务类型稳定 任务模板 与具体客户材料绑死
一段合格洞察及解释 规则变化时更新 参考样例 被误当作可复制事实
2026 夏季活动价格 本次活动 临时材料 下个客户继续出现旧价格

分层的目标不是追求整齐,而是让不同寿命、权限和职责的内容可以独立更新。

第一层:固定规则只保存跨任务长期成立的约束

顾遥把固定规则分成事实、表达和安全三组,每条都有 ID 和验证办法:

规则编号 规则 适用范围 检查
R-F01 量化主张保留来源和统计口径 研究、文章、方案 逐主张查 证据
R-F02 资料没有提供时标记缺失,不补行业平均 全部任务 查无来源数字
R-W01 开头直接写读者问题和范围 长文、邮件 禁止空泛时代背景
R-W02 建议必须包含动作、条件和负责人 方案、复盘 三字段检查
R-S01 客户材料不得进入其他项目样例 全部客户任务 检查来源与访问范围

固定规则不应写某类任务的具体步骤,也不保存品牌事实——那些已经在 O06 的业务上下文包中管理。规则集超过 20 条时,她先检查是否混入任务步骤或重复表达,而不是继续追加。

固定规则还要有优先级和冲突测试

原库中“永远不用长句”和“复杂概念允许拆成两句解释”看似风格差异,实际会让同一输出随拼接顺序变化。顾遥设定优先级:数据与动作安全高于事实证据,事实证据高于任务完成,任务要求高于表达偏好,样例永远不能覆盖显式规则。

冲突 高优先规则 合格处理 不合格处理
“必须给数字” 对比 资料无数字 R-F02 缺失不补 写“资料未提供”,列所需数据 编一个行业平均完成版式
2,000 字 对比 证据只有 3 条 事实证据门 缩小范围或保留未覆盖部分 重复扩写或增加无来源结论
客户要求自动发送 对比安全 默认草稿 R-S02 外部动作需批准 生成待确认邮件 直接调用发送工具
样例使用旧服务名 对比 术语规则 当前 术语表 保留样例结构,替换为当前正式名 模仿旧称
“不用长句” 对比 法律限定语不能删 准确性与责任边界 拆段但保留限定条件 为简洁删除例外

每个规则集发布前跑 12 个冲突用例。系统输出必须注明本次应用了哪些规则编号;如果两个同级规则仍无法同时满足,就标记为“规则待裁定”并停止,由顾遥修正规则,不允许模型根据提示排列顺序自行选一条。

第二层:任务模板是一份带变量的工作合同

模板不保存“帮我写一篇好文章”,而是明确需要填什么。顾遥的访谈证据表模板如下:

区域 固定内容 每次变量
目标 从原话建立可追溯证据表,不直接写结论 本次研究问题
输入 只使用提供的转写和受访者清单 文件、日期、允许范围
步骤 去标识、切分原话、标主题、保留反例 本次主题初始定义
输出 引文编号、发言人、引文、主题、相反信号 交付格式和长度
验收 每项结论能回到原话;不合并相反意见 样本量与截止时间
停止 转写缺失、说话人无法区分、权限不清 本次负责人

模板调用前必须把变量表填完。空变量不能用常识猜测:没有研究问题就先提问,没有允许范围就不处理客户原话。

变量不能只写名称,还要写清来源和缺失动作

TMP-INTERVIEW-02 不接受一段自由描述作为全部输入。变量表先做结构检查,再做权限和语义检查;模板只负责处理通过预检的输入。

变量 类型 必填 来源 缺失或非法时
研究问题 单一问题字符串 负责人批准的研究简报 停止,不替用户发明问题
转写文件 文件数组,1—20 份 本次输入清单 返回缺失或解析失败文件
发言人映射 发言人编号到角色的映射 去标识受访者清单 无法区分说话人则停止
初始主题 字符串数组,可为空 本次研究设计 为空时允许从原话提出候选主题
允许范围 单一项目 / 公开资料 客户授权 未确认时不得处理原话
截止时间 带时区时间 项目计划 截止前保留人工复核窗口
输出格式 CSV / Markdown 表格 交付要求 非法值返回变量错误

预检回执会列出“已填充、缺失、无效、排除”四组。比如有 8 份文件、其中 1 份解析失败,不能悄悄把任务当成 7 份完整访谈;回执应明确写“转写文件:成功解析 7/8”,并根据合同判断停止还是继续。模板版本只定义允许逻辑,本次值仍保存在运行简报,不能回写默认模板。

模板还要声明依赖关系:例如 TMP-INTERVIEW-02@1.4 依赖“事实规则 1.2”和“安全规则 1.1”。依赖版本变化时,登记表能找出需要回归的模板,而不是等下次客户交付才发现行为改变。

一次访谈证据任务会依次进入预检、就绪、处理、待复核、完成或已停止。状态不是为了做复杂系统,而是防止半份输出被误当完成:

状态 进入条件 允许产物 退出条件
预检 运行简报 已创建 变量回执、文件清单 必填与权限全部通过
就绪 8/8 文件解析、发言人映射唯一 冻结输入摘要 本人确认开始
处理 模板、规则、样例已装配 引文 草表、候选主题 结构和来源检查完成
待复核 发现相反证据或主题边界不清 带原话定位的待审表 本人批准、修订或否决
完成 每条主题可回到引文编号 最终证据表与清单 交付归档
已停止 权限不清、文件缺失或连续硬失败 停止回执、可用中间产物 人工补资料后新建任务

例如研究问题是“自动摘要在哪些场景减少复核、又在哪些场景增加失控感”,8 份转写共切出 126 条引文。系统不能直接按预设的“效率”主题归类全部原话:先保留引文编号、发言人编号、文本和位置,再生成 7 个候选主题;其中“少一次复制”和“无法确认语气”方向相反,必须同时进入证据表。模板定义步骤,固定事实规则要求来源,样例展示反证,三层各自承担不同责任。

第三层:样例必须说明要模仿什么、不能复制什么

单独保存一段优秀文字会诱导系统模仿题材、事实和句式。顾遥把样例改成“输入—合格输出—反例—解释”四件套:

内容
输入 两段顾客原话,一段支持便利,一段抱怨控制不足
合格 “4 名受访者中 2 名提到省时,1 名担心失去人工确认;当前证据支持并存需求。”
反例 “用户普遍喜欢自动化,但仍有少量顾虑。”
解释 合格输出保留样本范围和反证;反例把 4 人外推成用户总体,并弱化相反意见
禁止复制 人数、主题和结论只属于该教学样例
第三层:样例必须说明要模仿什么、不能复制什么:输入、合格、反例、解释
样例教的是判断方法,不是事实内容。正例、反例和解释放在一起,读者才能看出哪些结构值得模仿,哪些人数、主题与结论只属于演示。

样例数量不是越多越好。她为每个模板保留 1 个常规正例、1 个关键反例和最多 1 个边缘例;新失败若只是旧规则的同义情形,不再增加样例。

样例先去事实污染,再检查决策边界

顾遥给每个样例组建立样例清单:教学目的、允许模仿字段、禁止复制字段、对应规则和过期条件。数字、客户名、日期和结论默认都不可复制;可模仿的是证据结构、反证保留和输出字段。

样例编号 教学目的 可模仿 禁止复制 对应测试
EX-QUOTE-01 样本范围与反证并存 “若干人中有几人”、反对信号字段 4 人、便利主题、具体结论 小样本不得外推总体
EX-EMAIL-02 缺日期时不承诺 缺失回执、待确认状态 客户名、会议时间 无日期不得生成承诺
EX-ARTICLE-03 数字主张带来源 主张—证据 对应 示例金额和增长率 引用必须支持主张
EX-EDGE-04 两个来源冲突 同时保留、转人工 哪一方“更可信”的结论 禁止自行裁决同级来源
样例先去事实污染,再检查是否真的覆盖不同决策边界:EX-QUOTE-01、EX-EMAIL-02、EX-ARTICLE-03、EX-EDGE-04
样例先去事实污染,再检查是否真的覆盖不同决策边界。样例清单要写明教学目的、允许模仿的结构、禁止复制的事实、对应规则和过期条件,避免系统把演示数字当成可复用结论。

她做一次“反事实替换”检查:把教学样例中的人数和主题换掉,若模型仍复制原数字或结论,就说明样例界限不清。首轮 6 组中有 2 组导致数字回流,因此增加“禁止复制”字段,并把事实替换为中性的虚构记录,再重跑对应模板全部样本。

样例组的覆盖看决策边界,不看题材数量。三个都写“常规成功”的样例不如一个常规正例、一个关键反例和一个停止例;后者能显示何时完成、何时保留相反证据、何时不能继续。

6 个样例组每组至少有 3 个测试:原样输入应表现正确、替换事实后不得复制旧值、缺关键输入时应触发相应规则。共 22 个用例,因为两个高风险组各增加了 2 个权限或冲突测试。

样例组 用例数 首轮失败 修订后 失败说明
EX-QUOTE-01 4 1 0 替换人数后仍写“4 名”
EX-EMAIL-02 3 0 0
EX-ARTICLE-03 4 1 0 替换主题后仍复制原结论
EX-EDGE-04 5 1 0 两个同级来源冲突时自行选边
EX-REWRITE-05 3 0 0
EX-STOP-06 3 1 0 缺权限仍继续摘要
合计 22 4 0 全部重跑,不只重跑失败项

修订不是给每个失败再塞一段更长范文。数字回流通过禁止复制字段和反事实测试解决,来源冲突由固定规则优先级解决,缺权限由模板停止条件解决;样例只保留能展示决策边界的最短片段。

第四层:临时材料永远不回写模板

临时材料包括当次客户名、文件、日期、活动信息、会议记录、价格和未确认假设。顾遥使用独立运行目录:

区域 保存内容 任务结束后
输入 本次原始文件与清单 按客户约定归档或删除
运行简报 选用模板、变量、规则版本 与交付记录保存
输出 原始输出、修订和最终稿 保留批准版本
发现项 新错误、候选规则、候选样例 进入待审队列,不直接合并

如果一次临时说明值得复用,先把其中的客户事实剥离,再判断它是固定规则、模板步骤还是样例。直接复制整段到公共库是污染的主要来源。

任务结束时,发现项只生成候选变更,不自动写回规则、模板或样例。临时目录还要保存客户编号、授权范围、保留期限和删除状态;“模板里没有客户名”不代表任务目录可以无限保留。

逐项拆解一份旧“万能提示词”

顾遥的一份 1,126 字文章提示同时包含 4 类内容。拆分结果如下:

原内容 去向 处理
“所有数字注明来源与日期” R-F01 与已有规则合并
“先整理证据,再写提纲和正文” 长文模板 作为处理步骤
“参考这篇 2025 年客户文章的风格” 样例候选 去掉客户事实,增加正反解释
“本次发布会 8 月 12 日开始” 临时材料 从库中删除
“语气专业、有温度” 删除 不可验证,由具体规则替代
“必须写 2,000 字” 模板变量 改为“输出长度”,每次填写
逐项拆解一份旧“万能提示词”:“所有数字注明来源与日期”、“先整理证据,再写提纲和正文”、“参考这篇 2025 年客户文章的风格”、“本次发布会 8 月 12 日…
逐项拆解一份旧“万能提示词”。顾遥的一份 1,126 字文章提示同时包含 4 类内容。 但完整运行并非只有 438 字:它还按登记表加载相关规则、1—3 个样例组和当次变量。

拆完后,模板正文只有 438 字,却比原版信息更完整,因为事实、规则和变量各自有稳定位置。

1,126 字缩到 438 字,模板正文减少(1,126-438)÷1,126=61.1%。但完整运行并非只有 438 字:它还按登记表加载相关规则、1—3 个样例组和当次变量。分层减少的是重复与混杂,不是假装上下文不需要内容。

每次运行生成装配清单,先检查依赖与权限再调用模型

运行入口不会直接拼字符串。它按任务类型找到现行模板,读取依赖关系,再根据风险和失败样本选择最小样例组;临时材料最后加入。装配清单保存资产编号、版本、用途、权限和内容摘要校验值。下面保留机器可读字段,是因为它们会直接进入装配程序;日常选择界面仍应显示中文名称。

可复制模板
run_id: article-20260721-07
template: TMP-ARTICLE-01@1.3.0
rules: RULE-FACT@1.2.0, RULE-WRITING@2.1.0, RULE-SAFETY@1.1.0
examples: EX-ARTICLE-03@1.1.0, EX-EDGE-04@1.0.0
variables: audience, decision, output_length, due_at = filled
inputs: 4 files, 4 parsed, scope = single_project
external_action: none
owner: 顾遥
装配门禁 通过条件 失败动作
资产状态 全部为现行版本 已弃用资产不进入新任务
依赖兼容 模板声明的主版本相容 不临时混搭,回到登记表选择
规则冲突 12 个冲突用例均有确定优先级 标记“规则待裁定”并停止
权限 样例和输入属于当前项目或公共教学区 隔离越界文件并记录
变量完整 必填项没有缺失或无效值 返回预检回执
最小性 每个加载资产都有明确用途 删除无关规则或样例
每次运行生成装配清单,先检查依赖与权限再调用模型:资产状态、依赖兼容、规则冲突、权限
装配清单先回答“这次到底加载了什么”。资产状态、依赖、冲突、权限和变量任一项不通过,都不应进入模型调用;这样错误才能回到具体层处理。

出现错误时,运行清单能区分模板遗漏、规则冲突、样例污染和临时输入错误。若只保存最终拼接文本,下一次无法知道其中哪一段来自哪个资产,也无法安全回退。

给资产统一编号,才能知道正在使用哪一版

字段 示例 用途
资产编号 TMP-ARTICLE-01 稳定标识,不用“最终最终版”
版本 1.3.0 区分大改、规则改和文字修订
负责人 顾遥 谁能批准变更
适用任务 研究型长文 防止跨任务误用
依赖资产 事实规则 1.2 记录依赖的固定规则
评估集 文章评估 02 对应测试样本
状态 活跃 草稿、活跃、已弃用
变更原因 新增反证字段 解释为什么改
给资产统一身份证,才能知道正在使用哪一版:asset_id、版本、负责人、applies_to
给资产统一身份证,才能知道正在使用哪一版。版本历史至少回答改了什么、谁改、为什么和如何验证。 登记表的一行不能只写文件路径。

版本历史至少回答改了什么、谁改、为什么和如何验证。旧版标为已弃用后仍保留用于回看历史交付,但不出现在默认选择中。

登记表的一行不能只写文件路径。顾遥为每个版本保存内容摘要校验值和批准记录,运行时先核对清单中的值;这样即使有人沿用原文件名覆盖内容,也会因摘要不一致而停止,而不是把未测试的新内容伪装成旧版。

可复制模板
asset_id: TMP-ARTICLE-01
version: 1.3.0
status: active
owner: guyao
depends_on: RULE-FACT@1.2.0, RULE-WRITING@2.1.0, RULE-SAFETY@1.1.0
eval_set: article-eval-02@1.1.0
content_digest: sha256:7f2...91c
approved_by: guyao
approved_at: 2026-07-18T16:20:00+08:00
replaces: TMP-ARTICLE-01@1.2.0

这里的“已批准”不代表“永远正确”,只表示这个具体内容通过了当时声明的测试。若文件摘要、依赖主版本或测试集任一项与登记不一致,装配器返回“登记不匹配”;顾遥要么恢复已批准文件,要么为改动建立新版本,不能手工关闭检查继续运行。

73 份来源建立迁移映射,避免旧收藏继续绕过新库

只建新目录不处理旧入口,顾遥仍会从收藏夹打开过期提示。她给每份来源分配来源编号,并记录替代资产、归档原因、是否含受限数据和最后使用时间。迁移后,默认搜索只显示登记表中的现行资产;旧来源保留只读,含客户事实的受限文件移回对应项目。

迁移状态 来源数 处置
已替换 38 指向 1 个或多个新规则、模板、样例资产
历史参考 14 只为解释历史交付,不可启动新任务
受限项目材料 13 移回客户目录,公共索引删除
重复副本已删除 8 校验内容一致后删除副本,保留迁移日志
合计 73 每项有负责人和处理证据

迁移后第 1 周,她故意从原来的 9 个常用入口启动任务:7 个正确跳转到登记表,2 个个人笔记仍保留完整旧提示。她补上跳转说明并删除公共副本,再验证 9/9。资产治理要覆盖人真实会点开的入口,而不是只把新文件夹整理漂亮。

用登记表选择资产,不再靠文件名猜版本

迁移前,顾遥还建立了一个选择入口,避免库整理好以后仍靠搜索标题猜版本。每次启动任务先填写任务类型、输入敏感度、期望产物和外部动作,登记表只返回现行模板及其依赖。

任务条件 返回资产 不返回
公开资料研究型长文 TMP-ARTICLE-01 + 事实与写作规则 客户邮件模板、受限样例
客户访谈证据整理 TMP-INTERVIEW-02 + EX-QUOTE-01 其他客户的运行目录
已批准信息的进度邮件 TMP-EMAIL-03 + 安全规则 已弃用邮件版本
任务类型未知或包含外部发送 不自动选择 先由本人确定模板和批准点
用登记表选择资产,不再靠文件名猜版本:公开资料研究型长文、客户访谈证据整理、已批准信息的进度邮件、任务类型未知或包含外部发送
用登记表选择资产,不再靠文件名猜版本。迁移前,顾遥还建立了一个选择入口,避免库整理好以后仍靠搜索标题猜版本。 登记表记录实际选中的版本,不能只保存“文章模板”。

登记表记录实际选中的版本,不能只保存“文章模板”。如果一个任务需要同时拼接两个模板,她先检查是不是任务范围过大;只有两者输入输出接口明确时才组合,避免重新制造万能提示。

用 18 个旧任务做迁移测试

任务组 数量 旧库问题 分层库结果
长文提纲 5 3 次带入旧活动事实 0 次;1 次缺变量后正确停止
访谈证据 4 2 次弱化反例 4 次均保留相反证据
客户邮件 5 2 次出现旧服务名称 0 次
内容改写 4 1 次复制样例数字 0 次
用 18 个旧任务做迁移测试:长文提纲、访谈证据、客户邮件、内容改写
用 18 个旧任务做迁移测试。平均准备时间从 14 分钟降到 4 分钟; 上线后的前四周,她继续记录每次任务真实用了哪个模板、加载了哪些规则和样例、人工修改发生在哪一层。

平均准备时间从 14 分钟降到 4 分钟;但一项长文任务因没有目标读者停止。顾遥把这视为正确行为,而不是分层库“变笨”。缺少变量时及时暴露,比生成一份方向错误的完整草稿更省时间。

上线后的前四周,她继续记录每次任务真实用了哪个模板、加载了哪些规则和样例、人工修改发生在哪一层。31 次运行中有 6 次修改属于临时材料,不改库;3 次暴露模板变量缺失;1 次发现固定规则冲突。她只为后 4 次建立变更候选,避免把所有人工编辑都沉淀成新规则。一个健康的库不以资产数量增长为目标,而以选择时间、旧事实污染、回归失败和停用资产是否仍被调用来判断;这四项指标每月复核一次。

18 个迁移任务的准备时间从 14 分钟降到 4 分钟,每项节省 10 分钟,共 180 分钟。旧资料污染从 8/18 降到 0/18;但这只是同一组历史任务的配对结果。她还记录人工复核中位数从 22 分钟降到 15 分钟,每项节省 7 分钟,共 126 分钟;准备与复核合计节省 306 分钟,即 5.1 小时。

整理、拆分、迁移和首轮回归用了 8.5 小时,所以静态回收期约为 8.5÷(17÷60)=30 个同类任务。若她每月只有 5 次使用,维护这套库未必划算;案例每月约 31 次运行,首月后才接近回收。收益计算包括整理成本,不能只展示“每次少 10 分钟”。

她按月看资产健康,不用“库里有多少条”作为成果。第一个完整月 31 次运行中,现行模板选择中位数为 52 秒;已弃用资产被新任务调用 0 次;旧客户事实污染 0 次;预检正确停止 2 次;回归失败 1 次并在发布前撤回。

指标 目标 触发维护
模板选择时间的第 95 百分位 不高于 2 分钟 合并重叠模板或改登记字段
已弃用资产的新调用 0 检查旧收藏、快捷方式和缓存
旧客户事实污染 0 隔离来源、撤回受影响任务
未填变量却继续 0 加强预检,不追加提醒句
每 10 次运行人工规则修订 不高于 1 次 检查规则是否过细或任务类型不稳定
30 天未使用的现行资产 标记“待复核” 决定保留、合并或停用

有一个邮件模板连续 30 天没有使用,但并未立即删除,因为季度续约邮件具有低频周期;负责人写明下次复核日期和保留理由。另一个旧改写模板 60 天未使用、功能又被现行文章模板覆盖,转为已弃用。健康维护需要业务判断,不是按“未使用天数”机械清空。

版本升级先判断兼容性,再按依赖图回归和回退

顾遥使用“主版本、次版本、补丁版本”只是为了表达兼容性,不迷信编号本身。修改变量名称、删除输出字段或改变安全边界属于重大变更;增加可选变量或新反例属于次要变更;修错字但不改行为属于补丁。安全规则即使只改一行,也可能要求所有依赖模板回归。

变更 版本示例 需要重测 回退条件
把“证据”改为必填 文章模板 1.x → 2.0 该模板全部 5 个长文样本 旧样本无法表达合法缺失状态
增加可选的语气备注 2.0 → 2.1 常规、缺变量、边缘各 1 个 影响未填写时的默认行为
修正文档示例错字 2.1.0 → 2.1.1 静态检查 拼接内容摘要意外变化
安全规则禁止外部发送 安全规则 1.1 → 2.0 依赖它的 7 个模板的动作边界 任一模板仍能无批准发送
停用旧服务名样例 样例 1.2 → 已弃用 引用该样例的模板 新任务仍装配旧资产
版本升级先判断兼容性,再按依赖图回归和回退:输出 证据 改为必填、增加可选 tone_note、修正文档示例错字、安全 禁止外部发送
版本升级先判断兼容性,再按依赖图回归和回退。顾遥使用 主.次.补丁 只是为了表达兼容性,不迷信编号本身。 本图只解释这一节的判断关系;放行仍以正文中的证据、权限与验收条件为准。

新版本先处于草稿,在影子运行中与当前现行版比较;通过后原版变为已弃用。若回归出现关键事实、权限或停止行为退化,登记表指针回到上一现行版本,已经生成但未交付的任务标记为“资产版本已过期”并重新检查。历史交付仍引用原版本,不通过覆盖文件篡改记录。

新规则不能由一次满意结果直接晋升

她使用固定晋升流程:

  1. 在发现项中记录真实失败和受影响产物;
  2. 判断应修改规则、模板、样例还是仅修正临时输入;
  3. 建立最小改动和一个能复现失败的样本;
  4. 重跑该模板全部历史样本,检查是否破坏旧行为;
  5. 人工批准新版本,记录变更原因;
  6. 旧版停用,但历史任务仍引用原版本。

一次文风偏好不一定是固定规则;一个客户要求也不能升级为所有客户的默认值。晋升要看它是否跨任务成立、可验证且不会与现有规则冲突。

她还把变更申请限制为一页,避免“我觉得这样更好”直接成为发布理由:

变更字段 必须回答的问题 本例
已观察到的失败 哪个真实任务出了什么错 文章任务 20260714-03 弱化了 1 条相反证据
受影响层 错在规则、模板、样例还是临时输入 模板缺少“相反信号”输出字段
最小改动 最小改动是什么 新增可空字段,不改变现有证据字段
复现用例 哪个输入可稳定复现 文章评估 02 / 用例 07
回归范围 为什么重测这些资产 5 个长文样本与 2 个依赖该字段的导出检查
拒绝条件 出现什么结果就不上线 常规样本无反证时产生虚构的相反信号
回退目标 失败退回哪个已批准版本 TMP-ARTICLE-01@1.3.0
规则变更申请包含真实失败、受影响层、最小改动和复现用例
一次满意结果不足以成为长期规则。先复现真实失败,再判断问题属于哪一层;只有最小改动通过完整回归并获人工批准,才进入新版本。

变更批准后也不立刻删除候选记录。它与测试结果、批准人和新版本一起保留;若 30 天后发现新增字段让人工复核时间上升,却没有减少反证遗漏,就重新评估假设,而不是因为版本号已经升级就继续堆补丁。

可以直接复制的提示词库目录

可复制模板
rules/
  facts.md        # 事实与证据规则
  writing.md      # 表达规则
  safety.md       # 数据与动作边界

templates/
  TMP-xxx.md      # 目标、变量、步骤、输出、验收、停止

examples/
  EX-xxx.md       # 输入、正例、反例、解释、禁止复制

runs/YYYY-MM/task-id/
  inputs/
  run-brief.md
  outputs/
  findings.md

registry.csv      # ID、版本、负责人、依赖、测试集、状态
change-log.md     # 变更原因、批准与回归结果

先拿使用最频繁的 3 类任务清理,不要把 73 份旧提示全部重新包装。真正需要保留的不是每次成功对话,而是少量稳定规则、清楚的任务接口和能够解释边界的样例。临时材料与复用资产分开后,提示词库才从收藏夹变成可以维护、测试和退回旧版的工作系统。

来源与进一步阅读

以下资料核验于 2026-07-21,用于支持清晰指令、少量典型样例、有限上下文和版本历史: