先看结果:“用户觉得上手太复杂”被拆成 4 条可行动洞察

个人产品顾问闻谨为一款研究简报工具 BriefFlow 分析客户流失。产品团队把 18 次访谈、8 次屏幕共享上手观察和 96 条支持消息交给 AI,得到三句总结:“用户觉得上手复杂”“大家希望更多自动化”“应优化界面并加强引导”。每句话都像正确,却没有告诉团队改哪里、为什么改、改完如何知道有效。

闻谨把原材料重做为 386 条原子观察,合并重复记录后保留 312 条;经过 27 个初始代码、11 个稳定代码、12 个案例矩阵列和 19 条反例,形成 4 张洞察卡:

洞察编号 跨案例规律 解释边界 已批准行动
I-01 客户资料上传前出现责任确认中断 不是一般性“害怕 AI” 本轮测试数据边界说明,沙盒留作下一轮
I-02 “资料库、项目、简报”与客户工作语言不一致 不是按钮数量太多 用客户任务词重命名并测理解
I-03 首稿更快,但引用复核吞掉部分收益 不是生成速度不足 在交付前显示主张—来源检查表
I-04 自动外发需求按角色分裂 不能写成“大家都要自动化” 默认人工门,给管理员受控开关
先看结果:“用户觉得上手太复杂”被拆成 4 条可行动洞察:I-01、I-02、I-03、I-04
“上手太复杂”还不能指导开发。把它拆成责任确认、术语错位、引用复核和角色分化四条洞察后,团队才知道该测试什么、暂缓什么。

最终没有批准“重做整个上手流程”,而是批准 2 个两周实验、1 个证据缺口调查和 1 条不做决定。本文人物、产品和业务数字均为教学案例,外部资料只支持研究方法与隐私边界,不代表真实产品表现。

从资料到行动有六层,任意跨层都会制造假洞察

访谈不是事实自动变成建议的管道。至少要区分六层:

定义 示例 常见偷换
原材料 原录音、消息、屏幕行为 P07 12:44 停在权限页 53 秒 把摘要当原始资料
观察 可定位的所说或所做 P07 问“客户会看到什么” 写成“P07 不信任产品”
代码 对观察的分类标签 权限可见性 标签直接当结论
跨案例规律 跨案例重复或分化 7/8 观察任务在此停顿 写成“所有用户都卡住”
假设 对规律的解释 责任边界不可见导致中断 把解释当已证明因果
操作 要改变或测试什么 增加数据流说明并 A/B 测试 从一句原话直接排期

“用户想要自动发送”是观察还是行动,取决于原文。如果 P12 说“每次还要复制邮件很烦”,它支持痛点;“加入自动发送”仍是团队提出的解法。也许批量复制、草稿队列或快捷导出能解决同一问题。

闻谨要求每张洞察卡都能沿证据编号回到最小录音位置,同时每个行动都能回到对应假设。不能逆向追踪的演示文稿句子只算观点,不进入路线图依据。

先冻结研究问题和决策,不让现成资料决定你问什么

团队原问题是“客户喜欢哪些功能”,容易收集赞美和愿望。闻谨改成会影响决策的 4 个问题:

研究问题 需要决定什么 需要的证据 不足时动作
RQ1 哪一步使合格试用者中止首次简报 两周内改哪一步 行为、事后解释、任务状态 补观察,不凭回忆
RQ2 复核成本为何抵消生成收益 是否优先做引用检查 总用时、返工原因、证据缺口 计时新任务
RQ3 哪些角色需要或拒绝外发自动化 是否提供开关 角色、任务、风险、现流程 分段,不做多数投票
RQ4 现有客户语言怎样描述资料组织 是否重命名信息架构 自然用词、归类任务 做术语理解测试
四个研究问题分别决定上手步骤、引用检查、外发开关和信息架构术语
研究问题必须连接下一项决定。“客户喜欢哪些功能”只会收集愿望;改成中止位置、复核成本、角色分化和自然用词后,证据不足时也知道该补什么。

分析范围冻结为 2026-05-01 至 2026-07-10 的英语和中文资料;排除销售演示、员工内部试用和无法确认发送者角色的匿名截图。决策日志记录负责人、截止日、不可自动外发的硬边界和可用开发量 12 人日。

研究问题先于编码。若先让 AI 看全文再生成“十大主题”,高频但无决策价值的礼貌语、价格询问和功能名会占据结果;真正稀少但危险的数据越权事件可能被压到末尾。

分析前再写一份决策规则:什么证据足以形成“问题”,什么情况下只能记“信号”,什么变化需要另开研究问题。规则冻结后才打开全量资料。比如“两个独立案例 + 一个行为或事件来源”可形成候选共性,但高风险单例不因未达次数被删除,而是进入事件处理路径。这样既防止看见喜欢的原话就降低门槛,也防止机械频数掩盖严重事件。

团队还保存证伪计划:对每个预期结论,预先写可能推翻它的观察。若预期“权限文案导致退出”,那么用户准确回答处理边界却仍退出,或不读文案也顺利完成,都应进入竞争解释,而不是被标为无关资料。

建样本框架:18 次访谈不是“18 个随机用户”

18 位受访者由研究目的有意选择,并非统计抽样:6 位活跃个人顾问、4 位活跃小团队负责人、4 位近期放弃试用的个人顾问、4 位近期放弃试用的小团队负责人。8 次观察从四组各选 2 位,使用同一首次简报任务。

资料 数量 覆盖 能回答 不能单独回答
半结构访谈 18×45 分钟=810 分钟 4 个角色/状态格 目标、解释、顾虑 实际停顿与总耗时
上手观察 8×20 分钟=160 分钟 每格 2 人 行为、顺序、错误 市场发生比例
支持消息 96 条、72 个会话 主动求助者 已报告问题与措辞 未联系支持者的体验
流失原因表 41 份 主动提交者 候选原因 深层机制
产品事件 63 个合格试用账户 关键步骤时间戳 中止位置 当事人为什么中止
建样本框架:18 次访谈不是“18 个随机用户”:半结构访谈、上手观察、支持消息、流失原因表
18 位受访者是目的抽样,不是随机用户。活跃与放弃试用、个人顾问与小团队负责人四格都被主动覆盖;计数只能描述这份样本,不能外推市场比例。

支持消息中一位客户连续发 7 条,不能算 7 位客户;因此消息数、会话数和参与者数要分开保存。访谈中同一人重复 5 次“担心客户数据”,表示强度或持续性,不表示 5 个案例。

样本矩阵还有语言、工作规模、使用状态、客户敏感度和招募渠道。空白格不是可忽略的小问题:若所有放弃者都来自折扣邮件,他们可能不代表自然流量放弃者。结论只能覆盖实际样本,并把外推写成待验证。

在把录音交给 AI 前,先确认同意、处理方、保留期和撤回路径

参与者同意被访谈,不自动等于同意音频上传到新的转写或生成式 AI 服务。每份同意账本记录:谁研究、目的、收集什么、谁会处理、用于何种分析、保留多久、怎样撤回。

数据类别 示例 AI 处理规则 保存期
联系人 姓名、邮箱、招募记录 不进入分析模型 项目结束后 30 天删除
研究身份 P01—P18 映射表 单独加密,限研究负责人 90 天
记录 去标识访谈文本 仅批准环境,禁止训练用途 180 天后复审
敏感片段 客户名、合同、健康或财务信息 分析前删除或替换 原始录音内按同意处理
洞察证据 去标识摘录与原文位置 研究团队可访问 洞察有效期内

英国政府用户研究指南要求在记录前取得知情同意,并让参与者了解收集的数据、用途、共享对象、保留时间和其他处理组织。闻谨因此没有把 4 份旧录音送进 AI:原同意只允许内部笔记,没有覆盖外部转写。她改用已有人工笔记,并把证据保真度标为“仅有笔记”。

撤回演练用 P03 的测试副本验证:从身份表找到记录、代码、摘录、缓存摘要和导出报告,删除后再检索唯一标记。5 层中任何一层仍可返回,就不宣称“已撤回完成”。

转写先做质量门禁:说话人、否定词、专有名词和时间戳

自动转写提供可搜索文本,但错误可能正好改变含义。“我不会自动发送”若漏掉“不”,后续主题统计再精确也无用。闻谨从每份访谈按开头、中段、结尾各抽 90 秒,共抽查 81 分钟,并全查高风险词。

检查项 发现 修复
说话人串位 27 处 对照音频更正说话人编号
否定或条件词错误 11 处 标为高影响并双人复核
产品/客户专名错误 34 处 统一词表,客户名去标识
时间戳漂移超过 5 秒 9 段 重切分并保存新的原文位置
无法听清 16 处 标为“听不清”,不猜词

转写版本从 TR-v1 到 TR-v2,不覆盖原文件。所有观察都保存转写版本;若高影响更正发生,系统找到使用该片段的编码、跨案例规律和洞察,并标为“待复核”。

会议摘要不能替代转写做原话证据,因为它已选择、压缩和解释。英国政府指南也区分逐字转写、智能逐字稿和只保留一般意义的摘要;闻谨在需要精确措辞时使用可定位的智能逐字稿,并回听音频。

把资料拆成一个观察一个谓词,保留谁、何时、在哪个任务

初始笔记写:“P07 很困惑,不信任权限页,所以无法完成上传。”它混合状态、心理解释、因果和结果。拆分后是:

观察编号 可核验观察 原文位置 类型
O-071 P07 在权限页停留 53 秒 OBS-P07 08:12—09:05 行为
O-072 P07 问“客户能看到我上传了什么吗” TR-P07 09:07 引文
O-073 P07 返回上一页查看帮助 OBS-P07 09:32 行为
O-074 P07 未在 20 分钟内完成上传 事件 P07 任务结束 结果
H-071 边界不可见导致中止 无,待分析 假设,不是观察
把资料拆成一个观察一个谓词,保留谁、何时、在哪个任务:O-071、O-072、O-073、O-074
先记录发生了什么,再讨论为什么。P07 的停留、提问、返回和未完成被拆成四条可核验观察;“边界不可见导致中止”另列为待验证假设。

每条观察只含一个主要谓词,并保存参与者编号、场次编号、任务阶段、时间戳、来源类型、原话或行为、上下文和去标识状态。386 条观察中有 74 条来自同一事件的多位观察者或消息/访谈复述,去重后分析集为 312 条,但重复来源仍保留用于三角核对。

去重不是删除“相似意见”。只有同一参与者、同一事件、同一含义且来源可互相定位时才合并;两个不同客户说相似话,必须保留为两个案例。

记录观察与解释分栏,避免研究者的第一印象变成用户原话

记录员使用三列而不是一列“备注”:

观测 已解释 问题
P11 三次在“建立资料库”与“新建项目”之间切换 可能不理解两个容器关系 是术语、层级还是权限造成
P04 说“我宁可复制出去” 可能不想自动外发 是风险顾虑还是当前客户要求
P15 生成后逐条打开 9 个来源 可能缺少可见的引用验证状态 这是正常质量流程还是额外返工

解释列必须以“可能、假设、待核”开头,并带记录人编号。分析时先只聚类观察,防止“信任问题”这种先入标签吞掉更具体的权限、责任、可见性和客户合同差异。

英国政府的研究记录指南建议笔记聚焦看到或听到的观察,而非个人解释;每张记录基于单一观察并标参与者和场次。闻谨把这一原则实现为结构化表,而不是依赖彩色便签记忆。

若观察者意见不同,不投票覆盖。P11 的停顿一人记为“寻找返回按钮”,另一人记为“比较资料库与项目”;回看屏幕发现光标在两个入口间移动,没有寻找返回按钮,于是保留可见行为,把两种解释都放入假设队列。

建代码本:标签要有定义、包含、排除和反例

AI 第一次开放编码生成 74 个近义标签,例如“信任、隐私担忧、安全焦虑、数据恐惧”。闻谨先人工复核 60 条,收敛成 27 个初始代码,再经过两轮合并形成 11 个稳定代码。

代码 定义 包含 排除 反例
权限可见性 无法确认谁能看或处理资料 问处理方、访问者、用途 一般安全偏好 明确理解后继续
责任边界 不清楚错误或外发由谁负责 客户批准、签字、问责 单纯操作困难 接受责任但嫌步骤多
容器语言 产品容器名与用户任务词错位 资料库/项目混淆 找不到按钮 能准确解释层级
验证工作 为核对主张与来源增加工作 打开来源、修正引用 文风编辑 正常阅读而非返工
受控自动化 只在限定条件希望自动化 审批后发送、白名单 无条件自动化愿望 明确拒绝任何外发

代码不是好坏评分,也不是行动。一条观察可有多个代码,但必须说明不同维度;同义标签合并后保存别名,旧记录不失联。任何代码若在 20% 抽样中有超过 2 条无法按定义复现,就回到草稿状态。

代码本保存版本、负责人、建立日期和修改原因。v1.3 把“信任”拆为“权限可见性”和“责任边界”,因为它们对应不同证据和可能行动;这不是为了增加主题,而是避免一句“加强信任”无法执行。

AI 辅助编码要盲于产品路线图,并接受人工分歧测试

输入 AI 的不是“找出为什么应该重做上手”,而是冻结代码本、去标识观察和允许的输出格式。模型只能返回观察编号、候选代码、对应原话和不确定性,不得新增行动建议。

闻谨从 312 条中抽 63 条做双人独立编码,先不看 AI 结果。逐代码一致性如下:

代码 双人同判 分歧 主要原因 动作
权限可见性 55/63 8 与责任边界混淆 补排除规则
容器语言 59/63 4 操作错误与术语错位 增加行为例
验证工作 57/63 6 正常核验还是额外返工 要求时间基线
受控自动化 52/63 11 条件句被漏掉 保留完整上下文
权限可见性、容器语言、验证工作和受控自动化四类代码的双人一致与分歧数量
编码分歧要回到原话和定义解决。63 条双人抽查暴露了权限与责任、正常核验与额外返工等边界问题;不能用一个“模型准确率”掩盖这些差异。

分歧不是“模型准确率 87%”一个数字能解决。两人回到原音频和定义,记录解决方式:改代码、改定义、保留多代码或保持未解决。尤其是“如果有客户批准,我希望它自动发”不能只编码为“需要自动化”,条件本身才是洞察核心。

AI 适合找漏标、近义词和跨资料候选,不负责判定心理机制。每次运行保存提示词版本、模型、输入摘要、代码本版本和输出,便于模型更新后做差异检查。

从编码到跨案例规律,不能按词频直接排序

闻谨建立基于编码的案例矩阵,每行是一个参与者或支持会话,每列是稳定编码,单元格链接原始观察。跨案例规律至少满足以下一种:跨多个独立案例重复;在关键分段稳定出现;行为、语言和事件数据互相支持;或虽少见但风险不可接受。

候选规律 访谈案例 观察任务 支持会话 判定
权限/责任边界中断 11/18 7/8 14/72 强共性,三类资料一致
容器术语错位 9/18 6/8 18/72 强共性,集中在首次上手
引用复核吞掉收益 8/18 5/8 9/72 中等共性,需补总计时
无条件自动外发 3/18 1/8 5/72 不支持“普遍需求”
有条件自动外发 10/18 4/8 11/72 按角色和审批条件分裂
从编码到跨案例规律不能按词频直接排序:权限/责任边界中断、容器术语错位、引用复核吞掉收益、无条件自动外发
规律来自跨案例一致性,不来自词频排名。权限中断和容器术语在访谈、观察与支持会话中互相印证;无条件自动外发只有少量支持,不能写成“普遍需求”。

这些分数只描述本研究资料,不估计全部客户比例。支持会话分母是 72,而非 96 条消息;同一人在三种资料出现也只算一个参与者案例,同时可作为多方法一致性的证据。

所谓 12 个案例矩阵列,是 11 个稳定编码加 1 个任务结果列;参与者角色、状态和资料来源属于分层字段,不被误算成主题。矩阵同时提供参与者视图和来源视图:前者防止一人多次发言放大,后者检查结论是否只依赖访谈自述。若某项规律只在一种资料出现,卡片要明确是“用户报告”“现场观察”还是“系统记录”,不能统一写“用户表现”。

高频不等于高优先级。界面颜色出现 22 个消息提及,但多来自一次主题更新后的短暂反应,且没有任务失败;数据越权只有 1 个已确认事件,却触发立即停止线。规律表同时记录频率、严重程度、决策相关性和可逆性,不压成一个热词排名。

主动找反例、缺席者和时间顺序,防止主题只会自我确认

每项规律必须配上反例编号。I-01 有 2 位参与者不担心上传:他们只处理公开资料,并能准确说出数据流。这个反例缩小了解释范围——问题更可能与客户资料责任和边界可见性有关,而不是用户普遍排斥 AI。

检查 I-01 结果 对结论的修改
反例 P02、P16 使用公开资料后直接继续 限定为客户或敏感资料任务
缺席者 从未完成首次任务者无法接受访谈 不能代表最早流失群体
时间顺序 停顿先于责任提问,提问先于退出 支持机制顺序,仍不证明因果
替代解释 页面加载慢、术语不懂、需要客户文件 分别查日志、理解题和任务准备
反证资料 页面加载中位 0.8 秒,无异常 降低性能解释,但不消灭

团队还做异常案例复核:为什么 1 位高敏客户仍顺利完成?回放显示其公司已有批准的数据处理清单,他只是把产品名称填进模板。这个案例启发“提供责任清单”实验,比泛泛增加信任口号更具体。

没有被访谈的人也构成边界。63 个合格试用账户中 21 个从未打开权限页,当前访谈无法解释他们;因此 I-01 只处理到达权限页后的中断,不宣称解决全部流失。

次数能描述样本,不能把定性材料伪装成市场统计

“11/18 提到边界”比“很多人提到”透明,但仍不能写“61% 的客户有此问题”。招募是目的抽样,放弃者被刻意多招,且愿意受访者可能更有意见。

可以写 不可以写 原因
本样本 11/18 讨论边界 61% 客户不信任产品 非概率样本且概念增强
7/8 观察任务在权限页停顿 87.5% 用户会流失 停顿不等于流失
14/72 支持会话含相关问题 19.4% 用户会投诉 会话不是全部用户
四个分段均出现术语错位 所有人都需要重命名 分段覆盖不等于普遍
次数能描述样本,不能把定性材料伪装成市场统计:本样本 11/18 讨论边界、7/8 观察任务在权限页停顿、14/72 支持会话含相关问题、四个分段均出现术语错位
计数提高透明度,但不会把目的抽样变成市场调查。11/18、7/8 和 14/72 分别描述这次访谈、观察和支持会话,不能改写成客户总体发生率。

若路线图需要发生率,另设计事件分析或概率调查,预先定义总体、抽样框、指标和分母。定性研究擅长揭示“怎样发生、为何可能发生、有哪些不同路径”,不应靠小数点伪装总体估计。

开放策略制定工具包也明确提醒,访谈不适合提供统计稳健证据。闻谨仍保留计数,因为它帮助审计资料覆盖和异常,不把计数升级为市场占比。

解释跨案例规律时至少保留两个竞争假设和一项区分证据

“权限页停顿”可能来自四种机制。团队不让 AI 选择最顺口的一种,而是建立假设账本:

假设 已有支持 与之冲突 区分性测试 状态
H1 数据处理边界不可见 责任提问、清单案例 2 位公开资料用户无阻碍 显示数据流后测理解与继续率 领先
H2 页面信息太多 3 人说“字很多” 仍反复找处理方而非跳过 等长但分层版本测试 仍可信
H3 产品术语不懂 6/8 另有容器混淆 权限页没有容器术语 独立术语任务 次要
H4 性能慢导致退出 停顿时间长 加载日志正常、伴随责任提问 网络受控复测 已削弱

“领先”不是“已证实”。H1 能最好解释现有证据,并给出可证伪预测:若边界说明清晰,理解题应提高、相关停顿应下降;若只提高满意度而行为不变,机制仍未验证。

解释还要区分触发、机制和结果:进入客户资料任务是触发;无法判断处理责任是候选机制;返回帮助页或退出是结果。把三者写成一条“信任不足”会无法设计有效干预。

一张洞察卡要同时呈现证据、范围、反例、解释和置信状态

I-01 的发布版本如下:

可复制模板
洞察编号:I-01@1.2
发现:到达权限页且准备上传客户资料的样本中,多位参与者无法确认处理方、可见者和责任边界,并中断首次任务
证据:O-071、O-072、O-113、O-204、SUP-18……
覆盖:11/18 次访谈;7/8 次观察任务;14/72 个支持会话
反例:P02、P16;两人都使用公开资料
假设:边界不可见是当前领先但尚未证实的机制
置信状态:中等
未知:从未到达权限页的用户
决定:先测试数据流面板和空白沙盒,再考虑重做上手流程
负责人:闻谨
复审日期:2026-08-15

置信状态不由 AI 凭感觉给出。“中等”表示三类资料方向一致、存在行为证据和反例分析,但样本有缺席者、机制尚未实验验证。若只有一条强烈原话,状态应是“信号”;若跨分段重复且被新一轮验证复制,可升为“在当前情境中已建立”。

洞察标题描述用户在特定情境下的障碍,不写“用户需要一个数据流面板”,因为面板是待测解法。每个名词都能在证据中找到,解释强度不超过资料。

发布引语还要做引用完整性检查:保留原意、条件词与上下文,不把两位参与者的话拼成一句“典型用户语录”。去标识时删除客户名、项目名和可组合识别的细节;如改写以保护身份,必须标明“改写”,不能加引号冒充逐字原话。最戏剧化的句子若不代表跨案例规律,只能作为单例信号展示。

从洞察生成多个行动选项,用可逆性和区分力选实验

I-01 不只对应“重写文案”。团队产生 5 个选项:

操作选项 预计投入 可逆性 区分 H1/H2 能力 主要风险
A1 数据流与责任分层面板 2 人日 信息仍过量
A2 只删减 40% 文案 1 人日 高,可作 H2 对照 删除必要边界
A3 空白沙盒后再连接客户资料 3 人日 延后真实任务
A4 15 分钟引导电话 每客户 0.25 小时 不可规模化
A5 重做完整上手架构 12 人日 低,变量太多 无法知道何者有效

团队批准保留现有页、A1 和 A2 的三组对照;A3 空白沙盒列为下一轮,不与本轮同时改变,暂不做 A5。选择依据不是“洞察分最高”,而是能否以较低代价区分竞争解释、能否回滚、失败是否安全。

I-04 则不进入统一自动化开发。小团队负责人中有条件需求,个人顾问更常要求保持人工门;先制作管理员审批原型,并把“默认关闭、白名单、预览、撤回”作为不可删约束。

行动必须带成功线、守护指标和停止线,才能验证洞察

实验纳入 36 位新的合格试用者,按任务类型分层后分到现有页、A1、A2,每组 12 人;这不是为了估计整个市场,而是检查机制预测是否在新样本出现。表中基线来自前一轮 8 次观察,三组仍以同期结果互相比对,避免只拿历史值宣布改善。

指标 当前基线 成功线 守护线 数据来源
处理方/用途/保留理解 3/8 全答对 ≥10/12 不得靠研究员提示 3 题理解测试
权限页后完成首次任务 4/8 ≥10/12 只计合格数据任务 事件日志
权限页中位停留 52 秒 ≤30 秒 错误跳过不算改善 屏幕记录
数据越权或误上传 0 必须保持 0 出现 1 次立即停止 事件审计
首次任务总用时 18 分钟 不高于 19 分钟 90 分位≤28 分钟 端到端计时
行动必须带成功线、守护指标和停止线,才能验证洞察:处理方/用途/保留理解、权限页后完成首次任务、权限页中位停留、数据越权或误上传
实验既要证明改善,也要守住知情边界。36 位新试用者分到现有页、A1、A2 三组;即使 A2 更快,只要理解下降或发生一次数据越权,就不能放行。

若 A1 理解提高但完成率不变,H1 只解释认知,不足以解释行为;继续查客户资料准备或任务价值。若 A2 更快但理解降至 4/12,不能以完成率换掉知情边界。若任一组发生数据越权,先停止、封存日志和复盘,不等样本凑满。

每组 12 人只够做机制检验和发现明显失败,不足以承诺精确提升百分点。报告同时给出逐案例结果,不用“83.3% 对 58.3%”制造市场确定性;若差异小或由 1 人决定方向,结论是继续收集,而不是宣布 A1 获胜。研究员还要记录提示介入,防止一组因帮助更多而看似完成率更高。

实验结束仍保留原 18 人资料与 I-01@1.2。新结果生成验证事件;支持则升版本,矛盾则降低置信或分裂洞察,不能覆盖旧文让团队看不到当时依据。

用影响、证据、可逆性和等待成本排行动,不做“提及次数排行榜”

4 张洞察卡对应 9 个候选行动。闻谨没有让 AI 产生一个优先级总分,而是先筛硬风险,再做透明比较:

候选行动 用户/业务影响 证据状态 可逆性 等待成本 决定
I-01 A1/A2 测试 高,首次任务中断 中等,多资料一致 每周继续流失 现在做
I-02 术语理解测试 中,6/8 观察出现 中等 可与 A1 并行 现在做
I-03 引用检查表 高,但总计时不足 新兴 2 周可补 30 个任务 先补证
I-04 管理员自动化 角色分裂且含外发风险 中等 等待损失较低 原型,不开发
全面重做上手 影响可能高 无法区分机制 占满 12 人日 不做
用影响、证据、可逆性和等待成本排行动,不做“提及次数排行榜”:I-01 A1/A2 测试、I-02 术语理解测试、I-03 引用检查表、I-04 管理员自动化
提及最多,不一定最该先做。9 个候选行动先看风险,再比较影响、证据、可逆性和等待成本;I-03 因总计时不足,正确动作是先补证。

“先补证”是有效行动,不是分析失败。I-03 若直接开发,可能只是把正常质量核验重新包装;需要把人工旧流程与 AI 流程的生成、核验、返工、交付总时间分开计量。

决策记录写清谁承担等待风险。只要权限说明存在误导,即使相同问题出现次数少也先修正;而纯体验优化可以等区分证据。风险不能被客户原话数量平均掉。

洞察库要能更新、撤回和传播,不是一份永远正确的总结 PDF

每张洞察都有“草稿、已评审、可执行、有争议、已取代、已撤回”等状态。任何底层转写更正、参与者撤回或新证据冲突都会生成依赖事件。

事件 受影响对象 自动动作 人工动作
P07 撤回同意 4 条观察记录、2 项规律、I-01 移除发布视图并标为“待复核” 重算覆盖与措辞
TR-P12 否定词更正 “受控自动化”代码 找到所有下游使用位置 重审 I-04
新一轮 A1 行为无改善 H1、I-01 置信度 添加矛盾证据 分裂机制或降级
产品权限页重构 旧原文位置与行为数据 标为“情境已过期” 重新观察

版本差异必须回答:新增或移除了哪些证据编号,规律覆盖怎样变化,解释是否改变,哪些待办依赖旧版。路线图卡片引用“洞察编号@版本”,而不是复制一句脱离上下文的话。

每月抽查 6 张行动中的洞察:原文位置能否打开、参与者同意是否仍覆盖、反例是否保留、复审日期是否过期。过期洞察不自动变假,但不得继续作为新外发或高成本开发的唯一依据。

可以直接复制的研究分析包与发布检查表

一个人也可以维护最小研究包,不需要昂贵研究平台:

可复制模板
01-research-questions.md
02-consent-and-data-ledger.csv
03-source-register.csv
04-observations.csv
05-codebook.csv
06-case-code-matrix.csv
07-hypothesis-ledger.csv
08-insight-cards.md
09-action-experiments.csv
10-decision-and-change-log.md

发布前逐项检查:

门禁 通过标准
来源 每个问题至少 2 个独立案例且原文位置可回放,或明确标为单一高风险信号
职责分离 观察、跨案例规律、假设、操作字段不互相冒充
边界 写明样本、缺席者、反例、时间与不能外推之处
分歧 高影响代码完成双人复核,未解决项不隐藏
隐私 同意覆盖当前 AI 处理方、用途与保留;撤回链路演练通过
操作 每个已批准行动有负责人、成功线、守护线、停止线和复审日
可以直接复制的研究分析包与发布检查表:来源、职责分离、边界、分歧
一个人也能维护可审计的研究包。十个文件连接研究问题、同意、资料、观察、代码、假设、洞察、实验和变更;发布前再检查来源、边界、分歧、隐私与行动责任。

资料核验于 2026-07-21,进一步阅读:

一条好洞察不是更聪明的总结句,而是一条可质疑的证据链:读者能看见参与者真正说了或做了什么,知道跨案例规律在哪些案例出现、哪些反例不符合,能区分当前最佳解释与已证实事实,并能判断下一步行动究竟是在解决问题还是只是在响应一句醒目的原话。