12,480 条客户工单,最终只有 16 个字段进入 AI
独立客户成功顾问陈祺为 48 家软件服务客户做续约风险分析。客户导出的 90 天工单共有 12,480 行、43 列,除了响应时间、问题类型和解决状态,还混有姓名、邮箱、电话、知识产权、合同金额、内部备注、完整对话、附件链接,甚至少量用户误贴的接口令牌。她最初打算把表格直接拖进日常个人 AI 账户,请模型找出高风险客户。
预检后,她把问题从“这个 AI 安不安全”改成了一组可以核对的问题:这项处理是否有权做,哪些字段确有必要,数据会经过哪些位置,哪个账户和合同适用,谁能访问,多久删除,出错后又怎样证明影响范围。最终,原始 43 个字段被分成保留 7 个、假名化 4 个、派生后删除原值 5 个、默认排除 21 个、隔离人工处理 6 个;送入获批商用环境的分析表只有 16 列,原始工单正文与附件都不上传。
| 结果 | 数值 |
|---|---|
| 源数据 | 48客户、12,480行、43列 |
| AI输入 | 12,480行、16列 |
| 单元格规模 | 536,640→199,680,减少62.8% |
| 本地敏感命中 | 326项,分布于271条工单 |
| 上传的原始正文/附件 | 0/0 |
| 两轮人工抽样 | 各240行,最终直接标识符0 |
| 条款与技术负向测试 | 36项,36项通过 |
这不证明客户资料今后都能交给任何AI。结论只适用于本案例的处理目的、客户约定、字段、商用计划、配置和核验日期;产品条款、法律、数据位置与功能都会变化。本文为虚构教学案例,不替代律师、隐私/安全专业人员、客户书面授权或行业专门要求。
“能不能用”要沿完整数据旅程判断
用户看到的是上传框,但资料可能经过浏览器、工作区、模型服务、内容安全系统、日志、连接器、人工支持、备份、输出下载与自己的同步盘。只确认“传输加密”不能回答训练、保存、访问、跨境、删除或下游共享。
| 阶段 | 数据形态 | 谁控制 | 需要的证据 |
|---|---|---|---|
| 来源 | 客户导出表格与附件 | 客户与陈祺 | 合同、目的、授权 |
| 本地准备 | 原始表、映射表、扫描记录 | 陈祺 | 设备加密、访问与删除 |
| 传输 | 16列假名化表 | 服务商/网络 | 端点、传输层安全、区域 |
| 处理 | 提示词、上下文、临时结果 | AI 服务与子处理方 | 数据处理协议、实际用途、隔离 |
| 存储 | 历史、滥用日志、备份 | 服务商 | 留存、删除例外 |
| 输出 | 风险摘要、引用行号 | 陈祺/工作区 | 重识别与共享控制 |
| 处置 | 删除请求与残余副本 | 双方 | 回执、期限、法律保留 |
陈祺给每个副本一个数据资产编号,记录负责人、位置、数据类别、创建时间、目的、留存、删除方法和证据链接。若不知道某个副本是否存在,就不能把“我稍后删除聊天”当成全链路删除。
最容易漏掉的是本地下载目录、浏览器自动保存、团队聊天转发、AI输出里的原句、截图和备份。治理范围不是只看模型输入,而是看可识别客户资料从哪里来、流到哪里、还能被谁恢复。
先写处理目的和禁止用途
陈祺把任务限定为“按客户汇总过去90天支持摩擦,帮助人工准备续约访谈”。输出只提供账户级主题、趋势与可追溯工单标识,不自动给个人打分、不预测员工表现、不决定涨价、不联系客户,也不训练她自己的通用模型。
| 目的协议字段 | 本次定义 |
|---|---|
| 业务目的 | 发现账户级续约访谈议题 |
| 分析单元 | 48个客户账户,不是个人 |
| 时间窗口 | 最近90天 |
| 允许输出 | 主题、数量、趋势、来源工单编号 |
| 禁用使用 | 个人画像、自动决策、营销名单、模型训练 |
| 受众 | 陈祺本人;客户报告另行人工审定 |
| 过期 | 本轮交付后30天复核并删除工作副本 |
“帮我分析客户”不是合格目的,因为它无法约束字段、输出和二次使用。目的合同一旦从续约访谈变成个体流失评分、信用判断、健康推断或自动联络,就要重新检查法律基础、客户约定、透明度、公平性和人工责任,不能沿用旧批准。
欧盟委员会对通用数据保护条例原则的官方说明把目的限制、数据最小化、保存限制、安全与可证明责任分别列出。案例不假设每位读者都受通用数据保护条例约束,而是借用这些问题形成保守检查框架;适用义务必须按客户所在地、当事人、行业和合同由专业人士确认。
同一张表里的 43 个字段不能共用一个风险标签
陈祺不使用“客户表格,机密”一个标签盖住 43 列,而是逐列记录含义、数据主体、来源、必要性、敏感性、合同限制、转换方式、目标、留存和负责人。自由文本还要单独扫描,因为一列“工单正文”里可能同时出现普通报错和最高风险机密。
| 字段族 | 列数 | 例子 | 初始处理 |
|---|---|---|---|
| 操作事实 | 7 | 时间、类型、严重度、状态 | 候选保留 |
| 标识符 | 9 | 姓名、邮箱、电话、知识产权、账户 ID | 假名化或排除 |
| 商业 | 6 | 金额、折扣、续约日、合同条款 | 派生/限制 |
| 自由文本/媒体 | 6 | 正文、内部备注、附件、录音 | 默认隔离 |
| 安全或系统 | 7 | 令牌、日志、设备、内部网址 | 排除或事件处理 |
| 行政 | 8 | 导出者、权限、标签、同步字段 | 多数排除 |
| 合计 | 43 | — | 逐字段决定 |
字段盘点还要标注“谁的信息”:客户联系人、客户终端用户、陈祺的客户经理、第三方供应商可能同时出现在一条工单。删除某个联系人姓名,不代表正文没有其他可识别线索。
未知字段不按低风险处理。遇到custom_17或一列混合JSON,先向数据负责人解释语义;无法解释就不进入AI。数据量大和交付紧迫都不是把状态未知自动视为普通业务数据的理由。
四级敏感度分别对应允许、转换和隔离
| 类别 | 代表内容 | 默认AI动作 | 需要升级的原因 |
|---|---|---|---|
| D0公开 | 已发布产品文档、公开价格 | 可按普通任务评估 | 仍检查版权/准确性 |
| D1内部 | 流程、非客户化指标 | 获批业务工作区 | 内部保密与留存 |
| D2客户机密/个人 | 联系方式、工单、合同摘要 | 最小化+假名化+合同证据 | 权利、重识别、跨境 |
| D3受限/高后果 | 凭证、完整支付/证件、健康、未成年人、法律特权 | 默认禁止普通AI路径 | 专门法律/安全与合规环境 |
每个字段只有允许、转换后允许、拒绝/隔离三种结果。D2不是“打码后随便传”:组合后的时间、产品、地区、罕见故障仍可能重识别;D3也不是宣称技术上绝对无法使用AI,而是普通一人业务没有证据前不得自行放行。
陈祺把接口令牌视为安全事件,而不是分析资料;把健康、身份证件或完整支付数据从任务中剔除,并通知数据负责人走专门流程;法律意见和特权材料也不会因为删掉姓名就自动失去敏感性。敏感度要同时看内容、用途、当事人、规模、可链接性和错误后果。
客户把文件交给你,不等于同意交给第三方 AI
陈祺检查主服务合同、保密条款、数据处理附件、客户安全政策、原始收集通知和本次工作说明书。她要回答:续约分析是否在约定目的内;能否使用子处理者;是否需事先通知/批准;允许哪些地区;保留多久;是否禁止把客户内容用于服务改进;事件通知时限是什么。
| 权限问题 | 可接受证据 | 红旗 |
|---|---|---|
| 目的覆盖 | 工作说明书明确含支持趋势分析 | 只写“提供顾问服务” |
| 第三方处理 | 合同允许且有清单/流程 | 禁止未批准子处理者 |
| 机密使用 | 处理限于交付目的 | 可用于自有模型改进 |
| 数据主体依据 | 客户确认其有相应依据/通知 | 来源不明的抓取名单 |
| 位置/传输 | 允许区域与机制 | 客户要求本地但服务跨区 |
| 删除 | 期限、方法、例外 | “合理时间”无负责人 |
| 事件 | 联系人与时限 | 无法取得供应商证据 |
同意不是万能按钮,也不一定是适用法律下正确的处理基础。陈祺不自己发明法律依据;存在特殊类别数据、儿童、医疗、金融、就业、跨境或自动高后果决定时,暂停并让客户的责任人和专业顾问判断。
若客户明确禁止生成式AI,技术上能匿名化也不擅自绕过。若合同沉默且风险实质,最稳妥的是发一页处理备注,说明目的、字段、服务、区域、保存、训练、人工访问、子处理者和删除,请客户作明确决定。
48 家客户不能用一份模糊授权打包处理。陈祺为每家建立授权状态:明确允许、条件允许、待定、拒绝。只有前两类进入本次数据集;待定留在本地,拒绝则完全排除。某客户允许“使用 AI 生成自己的支持摘要”,不等于允许把其数据放入跨客户基准。跨客户聚合是另一个处理目的,需要单独说明可见粒度、最小群组和接收者。
| 客户授权状态 | 可进入的处理 | 不可推断的权限 |
|---|---|---|
| 明确允许 | 卡片列明的 16 个字段与指定服务 | 训练、公开分享、其他模型 |
| 条件 | 满足区域/保留期/字段条件后 | 条件外的新功能 |
| 待定 | 仅本地人工准备 | “没有反对”等于同意 |
| 拒绝 | 不进入AI 数据集 | 去名后自动可用 |
处理记录还保存客户联系人、决定日期、适用合同版本、目的、字段类别、接收方、跨境机制、保存期限、安全措施、权利请求路径、事件联系人和下次复核日。它让陈祺能在客户询问时说明事实,也能在条款更新后找到受影响的项目,而不是搜索聊天回忆当时怎样决定。
从任务输出反推,把 43 列压缩为 16 列
| 操作 | 源字段数 | 处理 | AI侧列数 |
|---|---|---|---|
| 保留 | 7 | 时间桶、类别、严重度、状态等 | 7 |
| 假名化 | 4 | 客户、工单、客服人员和产品转为随机标识 | 4 |
| 推导后丢弃 | 5 | 响应、解决、重开、趋势等派生 | 5 |
| 排除 | 21 | 联系方式、金额原值、内部管理字段 | 0 |
| 隔离 | 6 | 正文、备注、附件、录音、原始日志 | 0 |
| 合计 | 43 | — | 16 |
16 列包括客户键、工单键、客服人员键、产品键、周区间、类别、严重程度、渠道、最终状态、首次响应区间、解决时长区间、重开次数、是否已升级、是否违反服务时限、30 天内是否重复出现,以及续约窗口区间。模型能寻找趋势,却看不到姓名、邮箱、精确金额、原句或附件。
“模型需要上下文”不能无限扩字段。若某个建议必须依赖正文,先抽取由人工定义的问题分类法和短的去标识事实,再只对少量异常案例建立单独获批流程。宁可让输出标状态未知,也不把整盘原始客户对话当上下文保险。
列数减少62.8%只是数据量指标,不等于隐私风险也减少同样比例。四个假名键仍可链接同一账户,罕见组合仍可能识别;所以后面还要控制映射表、最小群组、输出和访问。
假名化不等于匿名化
陈祺在本地为每个项目生成独立的随机客户键,映射表加密后放在另一个保险库,不上传 AI,也不把客户名直接计算成哈希值。可猜的公司名、邮箱或手机号即使转换成哈希值,也可能被字典反推;跨项目长期稳定的标识,则会让不同数据集更容易关联。
| 转换 | 作用 | 残余风险 |
|---|---|---|
| 随机项目键 | 移除直接名称 | 映射表仍可还原 |
| 周桶 | 隐去精确时间 | 罕见事件仍可定位 |
| 金额区间 | 隐去合同原值 | 小客户群可能唯一 |
| 类别分类法 | 替代原始正文 | 分类法可能过度细分 |
| 计数抑制 | 小于3不单列 | 多表组合可能推断 |
| 聚合账户视图 | 不输出个人级结果 | 单人客户仍需特殊处理 |
案例把这种处理称为假名化 D2,而不是匿名 D0。保留可以回连的工单键是为了人工核查,但只有陈祺能在本地受控环境中回查;客户报告不暴露这些键。映射表在项目结束后按约定删除,AI 输出随之失去直接回连路径。
真正匿名化是否成立是高门槛判断,要考虑可合理获得的其他信息、链接攻击和未来数据。普通用户不要因为“删了姓名”就在登记表里把客户资料改成公开数据。
自由文本、附件和录音进入隔离队列
本地扫描器在原始区发现 326 项敏感片段,分布于 271 条工单:144 项凭证或令牌形态、82 项支付或银行信息、57 项健康或身份信息、43 项法律或高敏内部内容。326=144+82+57+43;这些是教学测试用例的分类结果,不代表真实行业发生率。
| 队列结果 | 数量 | 动作 |
|---|---|---|
| 凭证/令牌 | 144 | 从分析排除、通知负责人轮换 |
| 支付/银行 | 82 | 隔离并按客户流程处置 |
| 健康/身份 | 57 | 不进入普通AI,转专业判断 |
| 法律/受限 | 43 | 限权保存,确认特权/合同 |
| 总发现项 | 326 | 位于271 工单 |
扫描器会漏报,也会把示例令牌误报;它只负责路由,不负责授予上传权限。被标清除的正文仍不自动进入AI,因为本任务根本不需要原句。271条工单仍可凭结构化字段参加趋势统计,敏感正文保留在客户原系统或短期隔离区。
若人工确需总结一条正文,先复制最小段落、去掉标识和无关历史,在单独运行处理,结果回查原文并删除运行。附件不因扩展名是PDF就安全,录音转写也会产生新的文本副本和说话人信息。
个人账户和商用工作区适用的条件并不相同
陈祺拒绝使用自己的日常个人账号。该账号混有私人对话、浏览器扩展、个人已连接应用和无法向客户提供的组织级合同证据。她为项目使用独立业务工作区、唯一管理员身份、硬件多因素认证、专用浏览器档案、无个人连接器,并把客户A与客户B分别建项目边界。
| 边界 | 个人日常账户 | 项目业务工作区 |
|---|---|---|
| 治理条款 | 消费者条款与个人设置 | 商业条款 + 已签署数据处理协议 |
| 身份 | 与私人用途混合 | 项目专用、多因素认证 |
| 训练控制 | 依产品/设置核对 | 合同证据为默认不训练 |
| 历史/保留期 | 用户界面设置 | 管理策略+删除回执 |
| 已连接应用 | 私人邮箱/盘可能启用 | 默认0,逐个审批 |
| 共享 | 容易复制到个人空间 | 外部分享关闭 |
| 审计 | 零散个人历史 | 项目运行日志 |
“业务版”标签也不是自动通行证。同一厂商的个人、团队、企业、接口、地区和第三方应用,可能适用不同条款与留存;工作区管理员还可能打开反馈共享、公共链接或外部应用。真正需要核对的是实际登录账户、实际计划、实际功能和实际配置。
账户隔离不能修复过宽的原始数据,但能减少客户之间、客户与个人生活之间的意外混合,并让撤权、导出、删除和证据归档有清楚边界。
工作区内部也按最小权限分层:陈祺的日常工作身份可以提交获批数据集,但只有单独的管理员身份能改留存、启用应用或创建外部分享;两者都不使用共享密码。恢复码离线保存,登录通知开启,闲置会话定期撤销。一个人经营不等于所有动作都必须由同一个高权限会话完成。
她为48家客户生成不同项目键和输出目录,禁止把客户A的历史对话作为客户B的内存。每轮开始页明确显示客户别名、计划和数据类别;结束后清空运行上下文并核对远程对象列表。隔离不仅防服务商混租户,也防陈祺自己把上一家客户的上下文带进下一家。
用 18 个字段核对服务条款和实际配置
陈祺在 2026-07-21 保存适用于所选计划的商业条款、数据处理协议、隐私与安全说明、子处理方列表、留存文档、数据位置说明和配置截图。公开页面可以帮助筛选,但发生冲突时,应由专业人士结合签署协议、订单表单和适用版本作出解释。
| 证据字段 | 要回答的问题 |
|---|---|
| 签约实体/计划 | 谁提供哪个具体服务 |
| 控制者/处理者角色 | 双方对哪些数据承担何角色 |
| 许可目的 | 是否只为交付、安保与法律义务处理 |
| 模型训练/改进 | 默认、主动选择、反馈例外是什么 |
| 留存 | 输入/输出/日志各保存多久 |
| 删除 | 用户删、终止、备份和法律保留如何处理 |
| 人工访问 | 支持、滥用审查、承包商在何条件访问 |
| 子处理方 | 名单、地点、变更通知与异议机制 |
| 数据位置/传输 | 处理与存储分别在哪里 |
| 安全 | 加密、访问、审计与认证范围 |
| 事件 | 通知责任、时限和证据 |
| 权利支持 | 访问/删除/导出请求怎样协助 |
另外6项记录数据所有权、机密性、连接器/第三方应用、反馈按钮、功能例外和文档版本/生效日期,共18项。任何状态未知都有负责人与截止日;在高敏任务中,状态未知不是默认接受。
证据注册表要设置失效条件,而不是截图后永久有效。条款或数据处理协议的生效日期变化、计划升级或降级、启用网络搜索或应用、更换模型服务商、子处理方变更、数据区域调整、管理员打开反馈、服务发生事件,都会把状态从“已批准”改成“需要复核”。复核期间,旧的本地结果可以继续人工使用,但不创建新的远程运行。
| 证据状态 | 含义 | 系统动作 |
|---|---|---|
| 当前 | 原文、计划、配置和客户条件一致 | 可按卡片运行 |
| 即将过期 | 30天内需复核/合同将变 | 限期更新,不扩范围 |
| 需要复核 | 功能、条款或配置已变化 | 暂停新上传 |
| 冲突 | 营销页与合同/文档不一致 | 交专业人员解释 |
| 不可用 | 无法取得关键证据 | D2/D3不得运行 |
“通过安全运营中心 2”或“符合某标准”不能单独填满18项:认证范围可能不含所用功能,也不回答客户数据是否进入反馈、具体保存多久或哪个子处理者处理。陈祺把认证当安全证据的一部分,而不是把合规责任转给一个标志。
官方资料本身展示了计划差异:OpenAI当前企业隐私页说明其业务产品默认不将业务数据用于训练,并把留存控制、API例外和应用另行说明;Microsoft 365 Copilot文档说明提示、响应和Graph数据不训练基础模型,但也要求检查智能体的隐私声明/条款;Google Workspace 常见问题区分有企业保护的工作区使用与其他Gemini体验。这里不是做厂商排名,而是证明“听说这家公司不训练”远远不够精确。
不训练、短期保存、无人查看、删除和不跨境是五个问题
| 声明 | 它能回答 | 它不能回答 |
|---|---|---|
| 不用于训练 | 是否进入某类模型训练 | 日志是否保存、谁能访问 |
| 留存 30 天 | 一类副本的通常期限 | 备份/法律/安全例外 |
| 已加密 | 传输/静态保护 | 服务商是否有授权访问 |
| 默认无人工复核 | 常规人工查看 | 支持、滥用、法律例外 |
| 数据驻留 | 某些存储/处理区域 | 所有子处理者与网络调用 |
| 删除聊天 | 用户可见记录删除 | 连接器源、输出、备份完成时间 |
陈祺要求证据写明具体对象:提示词、文件、输出、滥用日志、反馈、微调文件、向量存储和连接器缓存可能各有不同生命周期。若用户主动提交反馈,相关对话可能进入不同的使用和保存规则;因此项目工作区禁用或约束反馈共享,她也不把客户片段作为缺陷示例提交。
她也不把“零保留”当成一句总括。要核对资格、使用入口、功能兼容、元数据、滥用监控例外和实际启用状态;某个入口符合要求,不代表已连接应用、网络搜索或第三方智能体也符合。
删除验证采用三层证据:产品接口返回的对象状态、管理员侧活动或合规记录、合同对备份与例外的期限。三者回答的问题不同。若界面删除后,接口对象仍可取回,验证立即失败;若在线对象已经不可取回,但备份按合同尚未轮转,就记录“计划删除”,而不是写“所有副本已删除”。法律保留或安全调查例外要有依据、范围和到期复核。
客户提出访问、更正或删除请求时,陈祺能从处理记录定位原始系统、本地预发布、远程运行和输出。她不让AI自行决定谁是请求者,也不把映射表上传来“找得更快”;先按客户流程验证身份,再由人协调各副本和法定例外。假名化不是逃避当事人权利的理由。
数据位置要分开检查存储、处理和支持访问
| 位置问题 | 证据 |
|---|---|
| 主存储 | 选定工作区数据区域/合同 |
| 推理处理 | 模型请求实际处理区域承诺 |
| 备份/灾难恢复 | 备份与灾备地区、期限 |
| 子处理者 | 名称、服务、位置、变更日期 |
| 支持/滥用访问 | 人员可能从何地访问 |
| 网络/连接器 | 是否把查询或内容发送到另一服务 |
| 传输机制 | 适用的跨境法律/合同机制 |
服务在某区域托管不必然表示支持人员、子处理者或外部搜索都在该区域;反过来,跨境也不等于自动违法。陈祺只记录事实与客户限制,把法律可接受性留给有责任的人判断。
子处理方列表需要版本和变更监控。新增模型服务商、文字识别、搜索、遥测或文件解析服务,都可能改变数据旅程。若客户拥有事前批准权,不能等项目结束才发现名单已经更新。
连接器会把一次上传升级成持续访问
本案例不连接主客服系统、邮箱或整盘云存储。陈祺从客户批准的查询导出一次性结构化表,本地最小化后上传;工作区没有长期令牌。这样AI无法在下一轮搜索其他客户、历史附件或新工单。
| 连接器风险 | 最小控制 |
|---|---|
| 广泛读取范围 | 项目/服务账户、固定集合 |
| 写入/删除 | 不授予;分析流程只读 |
| 继承访问 | 先清理源系统旧分享和访问控制列表 |
| 跨客户搜索 | 租户过滤器在供应商执行 |
| 后台同步 | 默认关闭、显式时间窗 |
| 令牌持久化 | 保险库、过期、撤销测试 |
| 提示注入 | 外部内容不可信、工具策略 |
若未来每天自动更新,创建只读服务账户,只能访问48家中当前客户明确授权的项目视图;查询固定字段和90天窗口,返回量有上限。每个客户使用独立数据集或强制租户键,AI不能决定删除过滤器。
连接器声称“遵循用户现有权限”也可能暴露多年积累的过宽权限。启用AI前先做访问图审计;AI会放大可搜索性,过去“藏在深目录里”不是访问控制。
访问图抽样发现3个过期外部协作者仍能读取旧项目、一个服务账户可跨全部客户搜索。陈祺先让客户负责人清理权限,再考虑连接器;她没有把这4项源系统问题记成“AI平台风险”。若直接接入,模型只是更快地利用了已有过宽权限,责任边界仍需如实定位。
连接器的撤权测试要从新会话执行:旧令牌从保险库删除后,源系统授权也必须撤销;缓存搜索结果、向量索引或同步副本按各自对象删除。只在 AI 界面关闭应用、但服务商授权仍然有效,不能算撤权完成。
上传前用八道预检阻断错误数据
获批导出 → 本地加密预发布区 → 字段白名单
→ 标识符转换 → 自由文本与机密扫描 → 行列范围检查
→ 人工批准清单 → 项目工作区或服务接口 → 上传回执
→ 输出扫描 → 本地报告 → 远程删除与证据
| 预检放行门槛 | 不通过状态 |
|---|---|
| 客户与项目编号匹配 | 错误租户,停止 |
| 字段结构精确等于 16 列 | 意外字段,停止 |
| 0 个直接标识符 | 发现个人信息,停止 |
| 0 个原始文本或附件网址 | 发现原始内容,停止 |
| 0 个凭证或支付字段 | 发现受限内容,停止 |
| 行数不超过 12,500、窗口不超过 90 天 | 范围超限,停止 |
| 目标账户与计划匹配 | 目标错误,停止 |
| 清单由陈祺批准 | 未获批准,停止 |
上传工具不接受任意文件;它从预发布区生成清单哈希值,只允许已批准的客户集、字段结构和目标。批准后任何字节变化都会让哈希值失效。浏览器拖拽被视为例外路径,项目标准作业程序明确要求不使用。
第一轮240行抽样发现3处产品备注包含罕见客户自称,虽然不属于姓名字段,仍可能重识别;陈祺把备注彻底移除并重跑全表。第二轮分层抽样240行覆盖48客户各5行,直接标识符与罕见自由短语均为0。抽样不证明全表绝对无风险,自动放行门槛仍覆盖全部行。
清单同时记录每种转换的行数和失败数,避免脚本静默跳过:来源行 = 12,480,输出行 = 12,480,丢弃行 = 0;客户键覆盖 48/48;意外空值 0;隔离发现项 326;字段结构哈希值与批准值一致。若输出少一行,流程不会为了赶进度自动继续,而是先解释过滤、解析或编码错误。
上传完成的回执只保存远程对象编号、哈希值、时间、计划和保留策略编号,不复制数据正文。之后每个模型运行引用同一个已批准对象;若重新上传或对象内容改变,就需要新的清单,避免“第一版审过,后面都算批准”。
假名化输入也可能产生可识别输出
AI 只收到假名化表,输出却可能写出“唯一一个本周有 3 次 P1 故障、且下月续约的医疗客户”。陈祺规定:每个展示组至少包含 3 个账户,不展示个人或小账户细节,不生成原始语句,不按敏感属性分组;本地映射只在必要时用于回查。
| 输出检查 | 门槛 |
|---|---|
| 直接标识符 | 0 |
| 客户键外泄到跨客户报告 | 0 |
| 组大小 | 小于3抑制/合并 |
| 来源 | 每个主题都有工单键与计数 |
| 不支持的推理 | 标状态未知,不补画像 |
| 敏感属性推测 | 禁止 |
| 外部共享 | 客户逐份人工批准 |
风险摘要不是事实裁决。模型提出“续约风险高”必须拆回可观察指标:服务等级协议违约数、重开率、重复问题和趋势;陈祺人工检查源工单后才在客户报告中表述。客户之间的基准只用足够聚合的区间,不让一家反推出另一家数据。
输出下载到本地后继承D2分类和30天工作副本期限,不能因为是AI生成文字就改成普通文档。最终交付只含该客户自己的数据,跨客户总览保留在陈祺受控分析区。
用 36 项测试验证拒绝、删除和账户隔离
| 系列 | 数量 | 代表测试 |
|---|---|---|
| 字段结构与数据防泄漏 | 8 | 多一列邮件、隐藏JSON、令牌 |
| 租户/账户隔离 | 6 | 错误客户、个人账户、公共分享 |
| 保留/删除 | 6 | 删除收据、历史、过期运行 |
| 连接器/权限 | 6 | 全局搜索、写入、撤销令牌 |
| 输出/重新识别 | 6 | 小群体、罕见组合、原句 |
| 事件/恢复 | 4 | 错误目的地、凭证轮换 |
| 合计 | 36 | 允许和拒绝都留证据 |
每项测试记录测试数据哈希值、数据类别、预期网关、实际决策、远程请求数、存储对象、删除收据和负责人。错误租户、意外字段、凭证和个人账户目标必须在传输前阻断,远端请求 = 0;远端删除测试必须先创建无害测试用例,再验证用户界面、服务接口状态和合同期限,不能拿真实客户资料试删除。
36项通过只证明当前版本。计划、条款、模型、连接器、区域、工作区设置、预检代码或客户限制变化都触发重测。每月还检查子处理者与条款生效日期,发现变化先暂停新上传再评估。
14 天试点同时衡量安全、价值和人工负担
| 指标 | 目标 | 结果 |
|---|---|---|
| 已发送的直接标识符 | 0 | 0 |
| 已发送的限制性发现 | 0 | 0 |
| 错误租户的远程请求 | 0 | 0 |
| 可追溯的源工单 | ≥95% | 47/48 账户 |
| 分析师复核时间 | 比手工基线降≥30% | 11.5小时→7.4小时,降35.7% |
| 虚假风险主题 | ≤10% | 4/52=7.7% |
| 删除证据完成 | 100% | 14/14 运行 |
47/48可追溯,剩余1家因类别过粗只能标状态未知,不补猜测;52个风险主题中4个经人工判为不成立并删除。节省4.1小时不是用来证明隐私合规,而是判断最小化后仍有业务价值。
试点期间每天最多1个运行、每运行由陈祺批准清单,不设后台自动任务。若出现直接标识符、受限数据、错误租户、无删除证据或客户异议,立即停止,不以平均成功率抵消一次高后果失败。
误传后先停止、删除和取证
若发现把原始表格传到了个人账户:停止继续提问与分享;记录账户、计划、时间、文件哈希值、数据类别、涉及人数或客户、功能和已连接应用;执行远端删除并保存回执;撤销共享链接、连接器令牌和本地同步副本;联系服务商支持确认适用的留存与访问情况;通知客户责任人,再由其法律与隐私流程决定是否需要向监管机构或当事人通知。
| 阶段 | 操作/证据 |
|---|---|
| 包含 | 停运行、撤分享、禁连接器、隔离设备 |
| 识别 | 精确文件、字段、主题、目标、时间 |
| 供应商 | 删除、支持工单、访问/保留说明 |
| 保护 | 令牌轮换、账户重置、检查下载/转发 |
| 评估 | 客户、合同、法律、敏感度、实际访问 |
| 通知 | 由有责任的人按时限决定与执行 |
| 恢复 | 修放行门槛、36项重跑、小范围影子 |
不要把误传文件再附到普通工单,也不要发给另一个 AI“帮我判断严重性”。支持请求只使用必要元数据和受控安全通道。聊天删除可能不涵盖下载、共享、备份、安全日志或第三方应用;事实不清时就记录状态未知,不能宣称已彻底清除。
恢复必须解释根本原因:字段白名单缺失、拖拽绕过、账户混淆、条款误读还是人员步骤失败。只提醒“下次小心”不能关闭事件;修复要落到不可绕过放行门槛、账户视觉区分、权限、培训和验证记录。
用一张可签字的数据决策卡记录条件与停止规则
| 决策卡字段 | 本案例值 |
|---|---|
| 目的/单元 | 账户级续约访谈议题/48客户 |
| 来源与字段结构 | 12,480行,43→16列 |
| 最高级别 | D2;D3 级发现全部隔离 |
| 权限 | 工作说明书+客户处理备注已确认 |
| 目标 | 专用业务工作区/指定计划 |
| 培训/保留 | 默认不训练;项目配置与证据链接 |
| 位置与子处理方 | 清单版本、允许区域、变更监控 |
| 连接器 | 无;一次性已批准导出 |
| 测试 | 36/36,最后运行日期 |
| 负责人/过期时间 | 陈祺;30天复核与删除 |
最终决策不是永久的是,而是“在这份卡片约束下条件允许”。D0/D1可走较轻流程;D2要求目的、授权、最小化、商用条款和隔离证据闭合;D3、权利不明、条款状态未知、地区冲突或高后果自动决策默认停止并升级。无法取得证据时可改用客户系统内置工具、本地离线方法、纯聚合数据或人工处理。
本案例参考 NIST 隐私框架,把隐私作为可以识别和管理的企业风险;参考欧盟委员会关于目的限制、数据最小化、存储限制、完整性、保密性和问责的官方说明;也参考英国信息专员办公室的 AI 与数据保护风险工具包及数据最小化审计项。英国信息专员办公室页面在 2026-07-21 核验时明确提示,相关指南正因英国《数据(使用与访问)法案》的变化而复核,因此本文只把它当作风险检查问题,不把它当作当前英国法的确定解释。服务条款示例只用于说明计划、功能和配置必须逐项核对,实施前应打开当前原文。
- NIST Privacy Framework
- European Commission:Principles of the GDPR
- ICO:AI and data protection risk toolkit
- ICO:AI data minimisation audit guidance
- OpenAI:Enterprise privacy
- Microsoft:Data, Privacy, and Security for Microsoft 365 Copilot
- Google Workspace:Gemini for Workspace FAQ
今天不要先上传一份“试试看”。先复制本篇决策卡,写清一个具体目的,列出源文件全部字段并标出最高敏感度;删除不影响输出的列,把自由文本和附件移出;确认实际账户计划的训练、保存、人工访问、子处理者、位置与删除证据。只要权利、D3路由或目标有一个状态未知,就停在本地。