先看结果:数据不只去了一次模型,旧链路2,160个节点中只有1,238个能证明合规
汐岸运输的人力资源团队试做“工作安排支持助手”。员工通过受限的人力资源入口提交工作安排或休假支持材料;助手从申请表和附件中提取日期、可工作的时段、需要避免的活动和缺失材料,生成给人力资源案例经理的草稿。它不判断医学诊断、不决定员工资格、不向直属经理显示原始健康材料,也不自动改变排班或待遇。
团队制作240个合成案例、960份文档和3,840个标记字段;每个案例经过9类处理节点,因此共有2,160个节点结果。旧数据地图只写“人力资源门户→AI供应商→人事案例”,实际回放却发现:1,238个节点同时具备来源、目的、最小字段、负责人、接收方和处置期限;284个节点虽然可追踪,却带了任务不需要的字段;216个没有明确负责人或留存规则;178个把内容持久写进未批准的应用日志、分析样本或复核导出;244个无法从源文件一路关联到存储与删除状态。
| 处理节点终态 | 旧流程 | 受管流程 |
|---|---|---|
| 符合策略、已关联且字段精简 | 1,238 | 2,076 |
| 在禁止持久化前被阻止的 | 0 | 28 |
| 因缺少必要元数据而被隔离的 | 0 | 52 |
| 可追溯但字段过多的 | 284 | 0 |
| 负责人或保留期缺失 | 216 | 0 |
| 未批准的持久化副本 | 178 | 0 |
| 脱离追踪或未观测的数据血缘 | 244 | 4 |
| 总计 | 2,160 | 2,160 |
| 受管结果 | 1,238/2,160=57.31% | 2,156/2,160=99.81% |
2,156包含2,076个正常处理节点、28个因违反接收方或日志政策而在写入前被阻断的节点,以及52个因连接器缺少来源、区域或留存元数据而被隔离的节点。隔离符合治理要求,但不代表业务已经完成。剩余4个失去追踪的副本来自复核人员工作站中的旧导出和打印暂存区,团队无法在72小时删除演练内证明它们已经清除,因此没有把试点扩到下一个部门。
公司、员工、材料、字段、系统、供应商配置、期限与结果均为虚构教学案例,不对应真实健康或雇佣记录。适用法律、员工权利、必要通知、保留和劳动决策必须由组织的隐私、HR、法务与当地专业人员确定;本文提供工程与治理方法,不提供法律结论。
“数据流向”要回答九个问题:内容是什么、为什么用、谁收到、在哪里、多久和怎样消失
一张只有系统框和箭头的图不能回答隐私或安全问题。每条流程至少要说明数据主体、字段/分类、来源、目的、转换、接收方/访问、位置、保留触发器和处置证据;任何“暂存”“用于改进”“服务日志”都要展开成可查节点。
| 问题 | 类似 CR-1842 的人事案件回答 | 不可接受的答案 |
|---|---|---|
| 什么 | 限制与日期,不含诊断叙述 | 文档数据 |
| 原因 | 准备案件经理草稿 | 改进 AI |
| 来自谁 | 经认证的员工上传 | 用户输入 |
| 转换 | 文字识别→字段→派生类别 | AI处理 |
| 接收方 | 指定的人事审核员和已批准模型端点 | 云 |
| 位置 | 已批准的地区/商店/服务 | 供应商平台 |
| 留存 | 触发事件、时长与保留例外 | 按需 |
| 访问 | 角色、目的与支持例外 | 管理员 |
| 删除证明 | 对象/索引/缓存/供应商状态 | 已删除 |
这里的“节点”不是网络数据包,而是一个有生命周期的数据产物或处理活动:原始文档、识别文字、提取字段、上下文包、供应商请求与响应、人力资源草稿、追踪和人工导出都分别计算。一个对象被复制到新存储或改变接收方,就形成新节点;即使只在同一内存函数中计算且不持久化,也要记录处理类别和最长存活时间。
E24的任务审计回答谁发起、使用哪个版本、谁批准和发生了什么影响;本篇的数据血缘回答每份敏感内容及其派生物去了哪里、谁能访问、为什么保留、是否用于训练或分析,以及如何处置。两者通过运行编号和产物编号相连,但不能用一句“有审计日志”代替数据地图。
流程记录还要区分业务接收方与实际处理方。人力资源应用是业务接收方,托管平台、备份服务、模型供应商、供应商支持人员和子处理者都可能实际处理数据;反过来,一个供应商名称下可能包含多个产品端点,只有其中一个获准。要用处理器编号、具体服务、路由和配置版本把合同与实际运行关联起来,不能用公司标志代替数据边界。
先定任务与个体影响边界:敏感不只等于身份证号,推断和组合也可能伤害人
案例目的被限定为准备工作安排草稿。允许输出的是日期范围、功能限制类别、缺失材料和供人力资源人员复核的问题;禁止输出包括诊断推测、心理或身体状态评分、是否“值得批准”、绩效风险、解雇建议、给经理的医学细节,以及自动改变排班的操作。
| 数据/风险 | 合成案件中的示例 | 潜在的个人问题 |
|---|---|---|
| 直接标识符 | 姓名、员工编号、联系方式 | 不必要的身份识别或联系 |
| 健康叙述 | 临床医师备注, 诊断文本 | 污名化或披露 |
| 就业背景 | 团队, 班次, 经理 | 职场推断 |
| 财务/福利 | 带薪休假字段 | 经济/资格影响 |
| 衍生限制 | 禁止搬运/夜班 | 超出声明目的的推断 |
| 交互元数据 | 上传时间, 重复编辑 | 行为推断 |
隐私风险不只发生在攻击者偷走数据。过度收集、对员工意料之外的二次用途、错误推断被HR相信、无法更正、保留过久或让过多支持人员看到,都可能给个人造成问题。安全负责防未授权访问,隐私还要审视已授权处理是否与目的、透明度和个体影响相称。
模型输出本身也是新数据。即使输入去掉姓名,限制、地点、罕见职位和日期组合可能重新指向一人;“衍生”不等于匿名。所有分类都带适用上下文和负责人,不能因数据经过模型就自动降级。
任务陈述同时写未使用:不用于绩效、纪律、欺诈评分、招聘、保险定价、模型训练或跨部门分析。以后若业务想把“缺件次数”用于员工风险模型,那是新目的、新接收方和新影响,需要另建审批和数据流;不能因为字段已在平台里就顺手复用。目的标识符由工作流下发,模型不能把“为了提供更好服务”当万能理由。
从960份源文档和实际运行发现数据库存:目录、追踪、存储扫描三者互相校验
团队先从240个案例建立预期流程,再读取连接器配置、对象存储、数据库结构、向量与索引、队列、追踪汇点、分析系统、支持导出和供应商接口;用合成诱饵与产物编号跨系统查询。只访谈架构师会漏掉调试数据和临时文件,只扫描存储又不知道处理目的与接收方。
| 证据来源 | 发现项 | 盲区 |
|---|---|---|
| 设计/目录 | 预期目的/负责人 | 运行时漂移 |
| 应用追踪 | 转换/接收方 | 未加监控的副本 |
| 存储/数据防泄漏扫描 | 静态内容 | 临时处理/目的 |
| 云/网络配置 | 区域/端点 | 下游供应商内部细节 |
| 访问日志 | 人员/服务读取 | 为何允许访问 |
| 供应商证据 | 保留/次处理者 | 本地导出 |
| 员工/审核员走查 | 截图/下载 | 后端缓存 |
960份文档平均每个案例4份,包括申请表、支持材料、工作描述和补件;格式覆盖文档、图片与文字识别结果、邮件转存和表单。测试数据虽然是合成的,但保留真实的页数、字段位置和错误格式,避免使用真实员工材料做“测试”。生产扫描只匹配分类与诱饵代号,不能把内容集中复制到新的发现数据库。
库存中的每个节点都分配数据负责人、系统负责人,以及隐私与安全联系人;负责人未知时限期30天修复,高敏感的新处理路径则直接隔离。地图不能只是季度演示文稿:连接器、模型端点、日志设置、区域、子处理者、留存或导出功能发生变化时,应自动产生差异并触发复核。
库存还要支持反向查询:从一个供应商请求能否回到来源和数据主体,从一个来源能否找到所有供应商请求、草稿、下载和删除状态。只支持正向追踪会漏掉共享缓存或汇总产物;只支持按姓名搜索,又可能把身份映射扩散到更多系统。关系图使用案例范围内的主体代号,只有受控的人力资源身份服务可以解析;隐私调查人员必须经过授权才能加入真实身份。
先做字段级目的判断:3,840个值不是“全传或全不传”,而是保留、派生和排除
对3,840个标记字段逐类问:完成草稿是否需要原值?能否用派生属性回答?能否只在HR系统本地匹配、不给模型?缺失会怎样?负责人以字段为单位批准,不用“该文档已获同意”覆盖所有用途。
| 上下文处理 | 字段出现次数 | 示例 | 模型接收 |
|---|---|---|---|
| 必须提供确切值 | 1,344 | 日期范围, 任务类别 | 限定原始数据 |
| 代号化或派生 | 1,536 | 员工代号、限制代码 | 替换后不含原始身份或诊断信息 |
| 排除 | 960 | 家庭住址、无关历史记录、支付详情 | 不进入上下文 |
| 源字段总数 | 3,840 | 跨 240 案例 | 2,880 转换后的值 |
旧上下文平均每个案例携带16个敏感值;新上下文平均携带12个值,其中一部分已经变成员工代号或派生类别。字段数量减少25%不是唯一价值,更重要的是姓名、联系方式、诊断叙述和无关历史不再抵达模型端点,员工代号也只能由受控的人力资源身份服务在案例内解析。
字段策略要写明数据类别、允许目的、允许接收方、转换方式、输出规则、留存和降级路径。若模型必须理解医生叙述才能提取功能限制,可以在隔离提取器中处理,再只传结构化限制与来源片段;若无法可靠提取,就让获得授权的人力资源审核员处理原文,而不是为了自动化放宽整条链路。
分类不是运行一次字符串匹配就结束。结构化字段可以按格式标记,非结构文档则由规则和分类器提出文本片段及置信度,低置信度但高影响的内容转人工;姓名、诊断与账号的组合、重复页眉、图片文字和手写识别结果都要进入抽样。漏标测试关注禁止字段是否抵达接收方,误标测试关注合法日期和限制是否被删除到无法完成任务。策略版本和分类器版本随产物保存,升级后可以重放历史合成集。
数据最小化也需要质量门槛。240个案例中,原始完整上下文基线有226个草稿满足人力资源评分表;最小化上下文最初只有223个,其中3个因为限制单位位于相邻片段而被错误排除。团队修复片段分组后恢复到226个,同时继续排除960个字段。若只看敏感字段减少,就会掩盖错误摘要给员工造成的实际影响。安全与隐私门槛必须和任务正确率并列,不能用其中一方抵消另一方的关键故障。
完整实例:一份医生材料从上传到草稿,原文只停留在人力资源区,模型只见员工代号和功能限制
合成案例HR-0247中,员工上传4页文档,内容包括姓名、联系方式、诊断叙述、“未来21天不可搬运超过10公斤物品”的限制、日期和签字。目标只生成给人力资源案例经理的缺件与工作限制草稿,不判断申请是否成立。
| 时间 | 节点/产物 | 数据/目的/保留期 |
|---|---|---|
| 10:02 | 上传回执S247 | 案例编号 + 哈希;认证与扫描 |
| 10:03 | 加密原始数据R247 | 完整文档;人力资源源数据;关闭后30天 |
| 10:04 | 独立文字识别T247 | 全文;用于提取;最长15分钟 |
| 10:05 | 字段集 F247 | 源片段 + 分类 |
| 10:05 | 上下文C247 | EMP-7K2、21天、搬运限制10公斤;60分钟 |
| 10:06 | 供应商交换P247 | 已批准端点与区域;操作副本最多保留24小时 |
| 10:07 | 草稿D247 | 功能限制 + 不确定性;按人力资源案例留存 |
| 10:09 | 审核员访问 A247 | 指定案件负责人; 查看已记录原因 |
| 关闭 | 处置 X247 | 级联删除/保留/墓碑证据 |
文字识别生成姓名和诊断片段时,立即将它们标为敏感健康信息或直接标识信息;字段转换器在人力资源信任边界内,把员工编号映射为EMP-7K2,把叙述转换为“搬运限制10公斤”,同时保留来源位置,并剔除诊断、住址和签字图。上下文清单显示每个值的来源、转换和允许接收方。
模型返回:“21天内避免搬运超过10公斤的物品;原材料未明确夜班限制;请人力资源人员确认起止日期。”输出验证器拒绝添加诊断名称或资格结论。案例负责人可以在受控界面中点击来源引用查看原文;经理的普通排班界面只有在人力资源人员作出决定后,才会收到获批的工作限制与期限,不会收到原始文档或模型推理。
若供应商端点区域与案例策略不匹配,P247在发送前就被区域网关阻断;若识别文字缺少分类,C247不能构造,只能转人工;若复核人员下载,下载行为会形成独立产物,并记录接收方、设备和过期时间,不能消失在“用户访问过”一行日志里。
完整转换样本保存为受控产物,而不是只展示最后草稿:来源片段包含“21天、10公斤”,F247标出持续21天和搬运上限10公斤,身份映射器生成EMP-7K2,上下文只包含案例目的、两个字段和来源引用;回复提出两条限制及一项未明确事项。验证器逐句绑定F247,任何“诊断为”“应拒绝”或没有来源的数值都被判为不受支持。复核人员的修改也记录字段与原因,用于错误分析,但不会自动反馈进训练。
员工入口用清楚语言说明这个流程会处理哪些资料、用于什么目的、哪些角色可以查看、是否使用外部处理器、多久处置,以及怎样联系人力资源部门更正;界面不要求员工理解令牌或模型术语。若员工选择人工路径,系统不能先把文档发给模型,再标成“已经退出”。通知、选择和适用依据由隐私与法律负责人决定并版本化;工程系统记录本案例使用的通知和路由,但不能把一次点击当成所有未来用途的授权。
摄入记录原始来源、分类和使用条件:文件安全扫描不等于数据获准进入AI
上传网关验证认证主体、案例、MIME、大小、宏/脚本、恶意软件和重复哈希,再生成不可变源收据。安全文件仍可能含超出目的的数据;员工上传整个病历不代表系统应把每页送模型。
| 摄入字段 | HR-0247 值 | 策略使用 |
|---|---|---|
| 来源编号与哈希 | S247 / sha256… | 去重与数据血缘 |
| 主体绑定 | 员工/案件 HR-0247 | 行级边界 |
| 声明目的 | 安排草稿 | 禁止分析或训练 |
| 分类 | 健康 + 身份 | 路由/保护 |
| 解析器 | pdf-ocr-v4.2 | 可复现性 |
| 允许处理器 | 人力资源提取器与上下文构建器 | 接收方网关 |
| 保留触发器 | 案件关闭 | 处置计划 |
用户提示、邮件正文、文件名、元数据和文字识别隐藏层都要分类;提示注入由E26控制,但即使没有恶意指令,元数据中的姓名也可能泄露。文件原文存入人力资源部门管控的对象存储,模型运行器只拿经过策略转换的产物句柄,不具备列出整个存储或任意下载的能力。
来源更正与替换保留版本关系。员工提交新版材料后,旧版不再用于新上下文但按当前案件策略处置;下游草稿标过期并重建,不把两个版本拼接。删除原来源时能查到所有派生产物,是后续删除图成立的前提。
原文与员工代号映射使用不同密钥、存储和角色;模型运行器既不能读取原文存储,也不能解析EMP-7K2。静态存储和传输加密是必要控制,却不会改变谁获得授权:若同一服务同时持有密钥、全表权限和任意导出能力,加密无法阻止它正常解密后过度读取。密钥轮换、备份恢复和支持解密都要形成可测试事件,不能只在架构图上画一个锁形图标。
文字识别、解析器和临时文件都是正式处理节点:临时目录、队列和错误转储也需要负责人和上限
很多团队只登记原始存储和最终数据库,却遗漏文字识别容器磁盘、消息队列、失败消息、缩略图、文档缓存和解析器错误。临时并不等于自动删除;崩溃、重试或支持转储都可能让本应只保留15分钟的文件留存数月。
| 临时存储 | 最大生存期 | 内容规则 | 证据 |
|---|---|---|---|
| 上传缓冲区 | 请求加 5 分钟 | 加密完整文件 | 请求清理指标 |
| 文字识别工作区 | 15分钟 | 隔离完整内容 | 作业终结器 + 清理 |
| 提取队列 | 30分钟 | 句柄,不含原始文本 | 载荷扫描器 |
| 重试/死信队列 | 24小时 | 加密句柄 + 原因 | 负责人/重放/删除 |
| 上下文缓存 | 60分钟 | 最小化字段 | 到期清理 + 命名空间清理 |
| 崩溃与错误记录 | 不含内容 | 仅产物编号 | 日志结构测试 |
作业成功与失败都执行清理,另有清理器查询超过生存时间的对象;清理事件与源/运行关联。若清理器连续两次失败,暂停新高敏摄入,不能依赖“最终会清”。容器镜像、节点、备份和快照的存储边界同样纳入区域与访问控制。
解析器错误只返回页码、错误类别和产物句柄,不能把出错段落塞进日志或工单。需要人工诊断时,通过受控的人力资源支持查看器临时授权查看,这次访问会成为新节点;工程师不能从通用可观测性平台复制全文。
失败消息队列尤其容易越权:通用平台可能跨业务集中管理,值班工程师甚至能够下载消息内容。案例队列只能传产物句柄、租户与案例代号、尝试次数和错误类别,消费者再用自身身份从人力资源存储中短时读取数据;超过24小时或案例关闭的消息不得重放。无法正常处理的消息被隔离后,由负责人选择安全重试或删除,不能把内容导出到个人电脑上修复。
上下文构建器是数据策略执行点:令牌配额不能决定隐私边界
检索相关性只回答哪些文本可能帮助任务,不回答这些文本是否允许交给当前模型或接收方。上下文构建器先按目的、数据主体、分类、来源可信度、接收方、区域和字段规则过滤,再进行排序和截断;所有被包含与被排除的片段都写入清单并记录原因。
| 字段 | 来源 | 转换 | 接收方决策 |
|---|---|---|---|
| EMP-7K2 | 人力资源身份映射 | 代号化 | 模型允许 |
| 21 天 | 临床笔记片段 4 | 精确边界 | 模型允许 |
| 提取≤10kg | 笔记片段 7 | 派生代码 + 值 | 模型允许 |
| 诊断名称 | 笔记片段 2 | 无 | 模型拒绝 |
| 家庭住址 | 表单片段 11 | 无 | 模型拒绝 |
| 福利金额 | 工资附件 | 无/不相关 | 模型拒绝 |
提示模板中写“禁止诊断”不是主要控制,主要控制是原始字段在进入模型前就已经不存在。模型若要求“需要完整病历才能更准确”,编排器不能自行扩大处理目的,而要由人力资源和隐私负责人决定是否建立另一条流程。上下文过长时优先删除低相关字段,但不能为了凑令牌配额而截断分类、来源引用或输出禁令。
清单本身最小化:记录源/产物/字段类别、哈希、转换和决策,不复制值。这样E23 可观测性可复现使用了哪个版本,E24 审计可证明谁批准,同时不给日志新增一份健康材料。
上下文策略在发送前和接收后各执行一次。发送门控查字段、接收方、路径、区域和目的;接收网关防供应商/工具回显原提示词、跨案例内容或禁止类别。回复不因来自受信端点就自动安全,仍以主体/案件绑定和来源支撑验证。被拒回复放入隔离存储,仅安全调查者可按案例查看,普通调试日志只保存原因与哈希。
检索、嵌入和索引不是无内容元数据:文本块、向量、摘要和缓存都继承敏感级别
案例文档不能进入全局检索增强生成知识库。若业务确实需要在案例内检索,索引按租户和案例隔离,文本块带来源、分类、过期时间和访问控制;嵌入向量也被视为派生敏感产物,因为它来自原文并可能支持相似性推断,不能自动当作匿名统计。
| 派生产物 | 继承控制 | 删除动作 |
|---|---|---|
| 分块文本 | 来源分类与访问控制列表 | 按来源和版本删除 |
| 嵌入 | 源/案件/过期 | 移除向量 + 缓存 |
| 摘要 | 所有贡献来源 | 失效/重建 |
| 查询 | 用户、任务与目的 | 简短日志,不含原始密钥 |
| 检索缓存 | 结果访问控制与版本 | 命名空间清理 |
| 评估样本 | 显式批准的转换 | 独立数据集生命周期 |
分块可能复制页眉姓名到每个块,使一个字段变几十份;去重不能因此丢谱系。摘要混合多个来源时继承最严格相关限制,删除其中一个来源要么重建摘要,要么整体删除,不能保留无法拆分的派生文字。
生产对话或案例不会因“很有代表性”自动进评估/训练。需要质量集时优先用合成案例;若组织确有获批的真实样本流程,单独记录目的、选择依据、去标识化评估、访问、过期与退出。NIST关于去标识化的资料也提醒去标识可降低风险但有重新识别可能,不能把删姓名称为零风险匿名。
索引准入要求每个文本块都有来源和过期时间;检索时同时验证当前访问权限,以及产物是否已过时或已删除,不能只在写入时检查。来源关闭后先阻断新检索,再异步清理向量与缓存;删除作业完成前,查询返回空结果而不是旧结果。快照或备份恢复后要重放删除标记,防止已经处置的文本块重新出现。
模型端点和供应商边界要拿证据:区域、留存、训练用途与子处理者不能靠销售口头确认
系统为每个模型路由维护处理器记录。调用前策略读取端点、模型/服务版本、托管/区域、请求/响应保留期、是否用于提供商训练或服务改进、滥用监控、人工访问、子处理程序、加密、删除接口和事件联系人;缺关键字段时高敏路径不可用。
| 供应商证据 | 必选答案 | 案件目标 |
|---|---|---|
| 端点/服务 | 确切产品 + 版本类别 | 已批准的企业端点 |
| 位置 | 处理/存储/支持 | 已批准的区域集 |
| 留存 | 请求/响应/缓存/滥用日志 | 最多 24 小时运行 |
| 次要用途 | 训练/改进 | 受合同/配置禁止 |
| 人工访问 | 角色/原因/日志 | 特殊受控支持 |
| 子处理程序 | 身份/功能/位置 | 当前列表 + 变更通知 |
| 删除 | 方法、处理时限与证据 | 状态查询可用 |
| 事件 | 通知/联系/证据 | 已测试路由 |
这些案件目标是教学政策,不描述任何现实供应商能力。团队同时核对合同、产品文档、管理配置、实际端点/网络、测试响应和保障证据;“企业”“零保留”“不训练”必须对应适用服务、租户与配置。营销页面支持的说法未必适用于当前路径。
数据驻留只是一个属性。即使存储在批准区域,跨区支持、子处理者、遥测、备份、密钥管理或灾备仍可能形成接收方;相反,跨区是否允许要由适用政策和专业人员判断。系统负责人不能用网络知识产权一次测试替代持续配置与供应商变更监测。
供应商评审要按数据类别和具体路径进行,不能给整个供应商一个永久“通过”。低敏感知识助手获准使用的公共端点,不能因此承接人力资源健康材料;同一端点的测试版日志、备用模型或区域自动路由,也可能改变处理方式。配置由可执行策略白名单固定,软件工具包故障转移时,如果目标不在白名单中就停止,不能为了可用性自动改走未知路径。采购续约前,用合成请求验证保留状态、区域和删除接口;证据过期时,相应路由就不能继续视为就绪。
输出、通知和下游系统是新的披露边界:正确答案也可能发给错误的人
模型响应先进入验证器,不能直接展示。验证器校验允许字段、来源支撑、禁止结论、跨案例代号、接收方和网页内容或链接;人力资源审核员看到草稿与来源引用,普通经理只有在获授权的人力资源人员作出决定后,才收到最小必要的工作安排字段。复制、下载、邮件和接口导出都要分别视为新的数据流向。
| 接收方 | 允许查看 | 禁止 |
|---|---|---|
| 指定的人力资源案件经理 | 草稿 + 受控源访问 | 无关案件 |
| 员工 | 自有案例状态与更正路径 | 受限的内部审核员备注 |
| 直属经理 | 已批准的功能安排 | 诊断与原始文档 |
| 调度器 | 日期与工作约束 | 超出需要的身份 |
| AI与产品工程师 | 合成数据与证据元数据 | 生产内容 |
| 模型提供商 | 仅最小化上下文 | 原始来源/员工映射 |
接收方绑定从人力资源工单系统取得,模型不能选择邮箱或员工编号。通知模板只引用工单门户,不在邮件主题或正文中复制健康字段;链接带短期授权,打开时重新验证权限。下载默认关闭,确需下载时使用水印、设备策略、到期限制并记录产物事件。由于这些措施仍不能保证阻止所有截图,相关残余风险必须由业务负责人明确接受。
输出纠正会产生新版本并指向被替换产物;下游已消费的安排逐项通知/更新,不能只改聊天窗口。若模型编造诊断或把另一案例片段混入,立即阻断、查询同路由/上下文缓存与接收方,进入E29事件流程。
输出防泄漏工具可以发现姓名、员工号、账号格式和合成诱饵,却抓不到同义诊断、稀有岗位组合,或“字段正确但发给了错误接收方”这种问题。它只是一层风险信号;真正控制是输入最小化、按工单关联检索、接收方绑定和字段数据结构。界面预览明确显示将发送给谁、包含哪些字段,人力资源人员在最终决定前可以删改;任何外发邮件或接口调用都使用批准后的结构化载荷,不能让模型自由生成收件人或附件。
日志、追踪、反馈和评估最容易形成“为了安全而复制全部内容”的第二数据湖
可观测性需要复现版本和决策,但通常不需要保存完整提示与响应。结构化日志记录运行、产物哈希、模型、提示与上下文清单版本、字段类别与数量、策略决定、令牌数、成本、延迟、错误和结果;敏感值留在原权威存储,需要时通过受控工单查看。
| 遥测需求 | 安全表示 | 禁止默认 |
|---|---|---|
| 重现上下文 | 清单编号、哈希与版本 | 完整提示转储 |
| 调试解析器 | 错误类别/页面/产物处理 | 段落文本 |
| 检测泄露 | 分类、计数与诱饵事件 | 检测到的秘密值 |
| 质量反馈 | 评分 + 工单与结果引用 | 把响应复制到分析系统 |
| 成本与延迟 | 令牌数、时间与路由 | 员工身份 |
| 审计访问 | 执行者/目的/决策 | 日志中的原始文档 |
临时内容日志有单独功能开关、负责人、案例范围、时限和经批准的加密存储;启用状态在界面中对值班人员可见,自动到期,并在结束后触发删除。不能让工程师在事故期间打开全量生产提示记录24小时,之后却忘记关闭。
反馈按钮只保存产物引用和用户选择,训练与评估管道不能自动读取人力资源内容。若用户在支持工单中粘贴敏感文字,工单就成为新的处理节点和存储,要按同级分类和更短访问期限处理;更好的方式是让用户引用案例编号,由获授权的支持查看器读取,而不是复制原文。
遥测采样不能让未采样运行失去最低限度的数据谱系。所有运行都保存元数据事件和策略终态,只有经过批准的小比例隔离样本可能含有最小内容;采样决定要在读取内容前作出,并记录用途与过期时间。成本压力不能靠关闭谱系解决,可以压缩事件、分层存储或缩短无内容指标的保留期。若观测链路故障,高敏感新处理只能先缓冲元数据或暂停,不能在没有去向证据的情况下默默执行。
人工访问、屏幕、下载和第三方支持都属于流程:角色日志不能证明访问目的正确
指定的人力资源审核员按案例关系访问;隐私与安全支持人员需要工单、目的、时间窗口和最小视图;供应商支持若可能访问内容,也要在供应商记录中列明条件、位置与审计。管理员在技术上能够读取存储,并不等于日常获得了读取授权。
| 人工操作 | 数据节点已创建 | 控制 |
|---|---|---|
| 案件视图 | 访问事件 | 分配 + 用途 + 会话 |
| 下载 | 本地/导出产物 | 设备/过期/水印 |
| 截图/打印 | 未受控复制风险 | 在可能处禁用 + 策略 |
| 支持访问 | 支持会话 | 工单 + 双重审批 + 会话记录 |
| 复制到聊天或邮件 | 新接收方与新存储 | 防泄漏检查 + 接收方网关 |
| 注释 | 衍生敏感备注 | 分类 + 保留 |
旧流程中最后4个失联副本,来自复核人员导出后进入本地打印队列;应用只记录了下载,没有记录设备端处置。修复方案取消普通下载,改为提供门户内比较和受控打印服务;在能够证明现有4份副本已经处置前,相关群组不扩大。技术上无法完全阻止拍照时,就限制可见字段、人员和用途,加强培训,并把残余风险写入正式接受记录。
访问复核要查看“谁在什么案例中、出于什么目的、看过哪些类别”,而不只是统计人力资源角色人数。异常包括访问非指定案例、短时间大量查看、支持访问没有工单、离职后会话和跨区域控制台;调查过程仍然遵守最小化原则,不能把内容复制到安全运营中心平台。
屏幕与打印既是技术边界,也是工作设计问题。若案例负责人必须并排核对4页原文,禁止所有本地视图会迫使其用截图绕行;更合理的做法是让受控查看器提供缩放、字段高亮和来源差异,关闭批量导出,打印走中央队列并在完成后清理暂存区。用户研究要观察真实完成路径,把私下绕行的变通办法写进库存,而不是只依赖政策签收。
衍生数据与推断有自己的风险:摘要、分类和“只含限制”不能自动降为普通数据
lift_limit_10kg没有诊断名称,却可能影响排班并让同事推断健康状态;模型置信度、异常标签、案例优先级和审核员备注也可能成为关于员工的新数据。每个衍生字段记录推导、预期用途、禁止用途、质量、来源与过期。
| 衍生字段 | 允许目的 | 禁止复用 | 更正 |
|---|---|---|---|
| 限制代码 | 人力资源草稿与复核 | 绩效评分 | 来源 + 人力资源编辑 |
| 日期范围 | 安排窗口 | 出勤预测 | 员工证据 |
| 缺件标记 | 请求完成 | 欺诈标签 | 案件负责人 |
| 模型不确定性 | 转人工复核 | 人员风险评分 | 重审/复核 |
| 聚合质量指标 | 系统评估 | 个人决策 | 阈值/抽样审计 |
数据聚合也不必然安全,小团队、罕见岗位和时间窗口可能让人可识别。质量仪表盘设最小组、抑制稀疏切片并限制下钻;具体参数由隐私分析决定。对外研究、跨部门分析或模型训练属于新目的,重新评估,不从原案例权限推导。
更正机制沿谱系传播:员工或HR更正源/字段后,上下文、草稿、经理通知和质量标签标过期/重算;不能只改主数据库而让旧嵌入、缓存和导出继续使用。若派生逻辑无法解释或逆转,不用于影响个人的决定。
派生数据的质量与隐私共同决定可用性。限制代码若置信度低,界面显示原来源给HR而不是向经理传播;若置信度本身被下游当成“申请可疑”,就超出原目的。功能注册表列消费者和允许决策,未知消费者不能订阅。删除来源时保留无内容的模型质量计数可以,但不能保留足以重新识别员工的切片与自由文本错误。
数据谱系用实体、活动、处理者和策略决定串起每个副本,但内容本身不进入关系图
数据关系图为每个实体记录产物编号、来源与版本、分类、主体代号、租户与案例、字段、位置、负责人、留存和处置;活动记录转换、代码与模型版本、目的、时间、输入和输出;处理者记录服务、人工人员和供应商;策略决定记录接收方与允许或拒绝原因。
entity R247 --usedBy--> activity OCR-882 --generated--> entity F247
entity F247 --usedBy--> activity CTX-311 --generated--> entity C247
activity CTX-311 --associatedWith--> review-agent/prod
entity C247 --sentTo--> provider-route-hr-01
entity C247 --policy--> ALLOW purpose=ARRANGEMENT_DRAFT exp=60m
| 谱系不变性 | 测试 |
|---|---|
| 每个派生实体都有明确来源 | 拒绝脱离来源的写入 |
| 每次传输都有接收方与目的 | 网关必须作出决定 |
| 分类绝不可静默降级 | 转换规则/审批 |
| 每个持久化实体都有负责人和过期时间 | 存储准入控制 |
| 删除源数据时可找到所有派生物 | 关系图遍历与对账 |
| 图中只存元数据,不存机密值 | 数据结构校验 + 防泄漏扫描 |
W3C PROV-O可表达实体、活动、智能体及来源关系,适合作为互操作概念;本文的隐私字段、策略和留存是领域扩展,不声称W3C标准自动提供这些控制。组织也可用关系表或事件图,关键是可查询和可验证。
谱系事件与业务写入使用事务日志或事务性关联,避免产物已经生成、谱系事件却丢失;无法原子完成时进入对账队列,并对高敏感新路由按安全原则关闭。关系图本身也要限制访问,因为即使没有内容,“某员工存在健康案例”这一元数据仍然敏感。
图每日做三类一致性检查:存储有对象而图无实体、图标已删除但存储仍可读、传输有接收方却找不到适用处理器记录。差异先按数据类别限制访问与新写,再由系统负责人对账;不能让自动任务为消除告警而凭文件名猜来源。谱系完整性以合格节点为分母,排除项也需要理由和负责人,避免把最难追的人工导出从统计范围删除。
留存不是一个天数:每类产物都有触发事件、挂起、删除动作和证明
“保留30天”没有说明从何时开始、覆盖哪些副本、备份何时过期、法律或事件保留如何处理、谁批准例外,以及怎样证明。案例进度表是教学设定:原始材料与提取内容在案例关闭后保留30天,文字识别临时文件15分钟,上下文60分钟,供应商操作副本最多24小时,人力资源正式案例按其批准进度表留存,无内容审计元数据则单独保留。
| 产物 | 触发器 + 持续时间 | 处置 | 证明 |
|---|---|---|---|
| 原始/已提取 | 工单关闭 +30 天 | 加密/对象删除 | 对象状态 |
| 文字识别与临时文件 | 作业结束后最长15分钟 | 工作区清理 | 清理事件 |
| 上下文/缓存 | 运行结束 +60 分钟 | 命名空间清理 | 缓存收据 |
| 提供商交换 | 请求 + 最大 24 小时 | 供应商生命周期 | 状态/保障 |
| 人事草稿/决策 | 人事排期 | 删除/归档/保留 | 工单记录 |
| 审计元数据 | 独立排期 | 只保留无内容元数据 | 数据结构扫描 |
| 备份 | 备份周期 | 过期密钥/集合 | 备份目录 |
关闭24个合成案例后启动72小时删除演练,预期处置24×9=216个节点:172个删除,18个在明确挂起下保留,22个转为无内容审计墓碑,4个审核员导出无法确认;可证明212/216=98.15%。挂起不等于永久:记录权限、范围、原因、开始/复核/结束,结束后重新入删除队列。
删除来源时,要沿派生关系图处理识别文字、字段、上下文、供应商副本、草稿、索引与向量、缓存、导出和反馈;备份按设计周期失效,并防止恢复后让已删除数据重新上线。不可删除的业务或审计记录只保留经过批准的最小字段并限制用途,不能以“审计需要”为由保留完整提示词。
保留引擎不会直接相信产物自己声明的过期时间:进度表由数据类别、目的、案例状态和保留服务计算,产物只引用策略版本。提前删除可能破坏员工案例和调查,过期保留则会增加风险,两类错误都要在测试中设定严重程度。删除失败进入有负责人、截止日期和重试上限的队列;超过承诺处理时限时,暂停向同一存储写入新的高敏感数据,防止积压变成永久例外。
供应商、子处理者与跨区处理持续变化:合同字段必须对应运行时路由和变更事件
采购记录与运行时路由使用同一处理器编号和版本连接。每次请求只记录适用端点、区域和配置,不记录内容;供应商新增子处理者、改变留存、支持地点或服务功能时,系统要判断差异会影响哪些数据类别和任务,并在生效前重新批准或切换路径。
| 处理器记录字段 | 证据负责人 | 运行时验证 |
|---|---|---|
| 法律实体/服务 | 采购/法律 | 端点映射 |
| 数据/目的 | 隐私 + 业务 | 上下文清单 |
| 区域/传输 | 隐私/安全 | 路由/网络配置 |
| 保留/删除 | 供应商经理 | 演练/状态证据 |
| 培训/二次使用 | 法律/产品 | 租户设置 + 条款版本 |
| 子处理程序 | 供应商经理 | 列表/版本/变更通知 |
| 安全/支持访问 | 安全 | 保障 + 访问报告 |
| 退出/导出 | 系统负责人 | 迁移/删除演练 |
合同写“适当安全”不能回答P247。需要把当前路径的技术配置、适用条款、供应商声明和测试证据合并;无法验证的条目保持状态未知。隐私/法律决定状态未知是否可接受,工程不能把空字段默认成“否”。
退出计划要在签约时完成:如何停止新请求、导出必要业务产物、删除供应商侧内容和派生存储、取得证明、处理备份与争议挂起、撤销密钥和更新谱系。没有退出接口时,就约定人工流程与处理时限,并用合成工单演练。
供应商证据也有有效期。子处理器列表、条款和管理配置至少在上线、续约、重大版本与变更通知时重核;保障报告覆盖的服务、时期和控制例外要与实际路径匹配。供应商回答“内容不用于训练”仍需追问是否进入滥用复核、质量分析、支持对话记录或长期备份,分别记录目的与持续时间,不能把所有二次处理压成一个布尔值。
2,160节点回放同时测正常处理、阻断和删除:全链路没有状态未知才算可证明
240个案例中的每个案例都固定9个预期节点。测试框架从来源回执启动,捕获存储、队列、上下文、供应商模拟端点、输出、访问、遥测和处置事件;判定程序比较字段策略、接收方、区域、目的、留存与谱系。网络请求成功本身不算通过。
| 测试类 | 案例/节点 | 预期 | 严重故障 |
|---|---|---|---|
| 正常最小化流程 | 180个案例 | 每个案例9个关联节点 | 原始字段到达供应商 |
| 禁止日志/导出 | 28 节点 | 持久化前拦截 | 内容已保存 |
| 元数据缺失/区域错误 | 52 节点 | 隔离/不发送 | 失败时开放 |
| 跨案例/跨收件人 | 24 案例 | 拒绝/无存在泄露 | 其他员工数据 |
| 删除与保留 | 24×9=216 | 已确认处置 | 仍有失联副本 |
| 供应商变更 | 6种路由版本 | 复审或停止 | 静默使用子处理者 |
新结果为2,076个正常处理节点、28个写入前阻断节点、52个隔离节点和4个脱离追踪的副本,合计2,160;其中2,156个受控节点不等于业务成功率。业务完成情况要按240个案例另行报告:元数据缺失或供应商不可用的案例转到获授权的人力资源人工路径,不能从数据门禁数字推断自动化价值。
评分以实际存储、查询和接收方证据为主,模型评分器不能证明数据已经删除,也不能证明访问控制有效。测试框架故意在调试、失败消息队列、缓存、导出和供应商模拟端点中放置合成诱饵字段,用来验证数据防泄漏与谱系;诱饵不使用真实个人信息。任何真实内容进入未批准日志、跨案例输出、供应商路由不符或删除后仍有脱离追踪的副本,都构成关键否决。
正常案例同样包含容易被误拦的内容:员工姓名与医生姓名可能同形,日期既可能是限制期限也可能是文件页码,健康术语也可能出现在政策引用中。字段分类器不能为了零泄露把所有文字删光;标准答案由人力资源与隐私负责人共同标记文本片段、目的和预期转换,人工分歧标为模糊并转复核。每次模型、文字识别、策略或供应商路由发生变化,配套套件都要同时报告关键泄露、正确草稿、错误隔离和人工负荷。
监测与事件处置以数据为中心:发现错误副本后先阻断新流,再查所有派生物与接收方
生产仪表盘报告按类别/用途/处理器的节点、被拦截/被隔离、原始至模型、内容日志、跨区域、人工导出、保留过期、删除未确认、血缘覆盖和供应商变更。所有比例带合格分母,不用“扫描到多少个人身份信息”替代风险。
| 信号 | 立即行动 | 范围查询 |
|---|---|---|
| 供应商处出现原始健康字段 | 停止路由并隔离运行 | 从字段与来源追到所有请求 |
| 错误收件人/跨案例 | 撤销访问权限/禁用输出 | 产物→视图/通知 |
| 日志中出现内容 | 关闭内容日志开关并限制接收端 | 按哈希、时间和服务查询副本 |
| 处理器配置已更改 | 冻结高敏感发送 | 路径→任务/类别 |
| 保留过期 | 若系统性则停止新增持久化 | 负责人/存储/过期 |
| 删除后仍有失联副本 | 阻止扩大 | 来源→派生物→导出 |
事件保存最小证据,停止连接器/路由/导出,限制受影响存储,查来源→衍生→接收方→访问→处置,联系处理器取得保全/删除状态,并由隐私、安全、HR、法务判断个体影响、通知与恢复要求。不能在调查工单再次复制原文。
恢复要求根因控制、历史范围、所有可达副本处置、供应商/人工接收方确认、负面工单回归和负责人签署。若删除无法证明,记录状态未知与残余风险,不把“未发现访问日志”写成“数据从未被访问”。E29会展开AI事件响应,本篇只定义数据证据。
个体查询或更正也依赖数据地图。获授权的人力资源人员使用主体代号查询来源、活跃派生字段、接收方和处置状态,不能混入内部安全细节或其他人的数据;无法解释的失联副本进入人工调查。系统若做不到按一名员工定位数据,就也很难在事故中准确判断影响范围。具体响应义务、身份核验和例外由适用政策与专业人员确定,产品不能用一个通用的“删除账号”按钮冒充完整处置。
分阶段上线并交付数据流包:先证明一个案例的九个节点,再增加人群、区域或供应商
阶段0只用240个合成案例建立库存和谱系;阶段1在后台构造上下文但不发送给供应商;阶段2向已批准的模拟端点或正式端点发送最小数据,但输出不进入正式人事案例;阶段3只开放给小组人力资源审核员。每增加一种数据类别、接收方、区域、模型路由、日志或导出能力,都要重新评估。
| 放行门槛 | 通过证据 | 立即停止 |
|---|---|---|
| 库存 | 9/9节点拥有负责人和目的 | 未知存储或接收方 |
| 最小化 | 3,840 字段已分类 | 上下文中禁止的原始字段 |
| 处理器 | 路由、配置和当前证据 | 训练、保留或区域未知 |
| 输出与访问 | 接收方与字段测试通过 | 跨案例披露 |
| 留存 | 24个案例的演练已核对 | 无边界复制内容 |
| 运营 | 事件与紧急停止演练 | 无法停止供应商路由或导出 |
交付的数据流包包括:任务目的与影响声明、字段策略、节点清单、已完成的HR-0247谱系、处理器与子处理器记录、上下文与输出规则、人工访问矩阵、保留与删除计划、2,160个节点测试报告、24个案例删除报告、监控与查询运行手册和残余风险登记册。地图、策略与运行时事件使用稳定编号,避免各团队维护互不相认的表。
来源边界:NIST隐私框架1.0用于清单与映射、数据处理生态系统和全生命周期隐私风险管理;NIST SP 800-122用于按上下文识别个人身份信息,并防止不当访问、使用与披露;NIST AI 600-1用于生成式人工智能的数据隐私、记忆化,以及第三方与生命周期风险背景;OWASP LLM02:2025用于输入、应用上下文和输出中的敏感信息泄露,以及访问与最小化建议;W3C PROV-O用于表达实体、活动和处理者之间的来源关系;NISTIR 8053用于说明去标识化可以降低风险,但仍存在重新识别残余。这些来源都不提供本案例的240、960、3,840、2,160组数据或期限。来源核验于2026-07-21。
- NIST Privacy Framework 1.0
- NIST SP 800-122:Protecting the Confidentiality of PII
- NIST AI 600-1:Generative AI Profile
- OWASP LLM02:2025:Sensitive Information Disclosure
- W3C PROV-O Recommendation
- NISTIR 8053:De-Identification of Personal Information
今天选一个会处理敏感内容的AI任务和一条形态真实的合成案例。不要先问“供应商是否安全”,先列出来源、临时处理、上下文、供应商、输出、访问、日志和处置等九类节点;为每个节点填写字段、目的、接收方、位置、负责人、保留触发器和删除证据。再挑一个最敏感字段,从上传一路查询到所有派生物与副本,并实际执行一次删除。如果任何一步只能回答“大概在云里”“应该不会记录”或“用户可以自行删除”,就先阻断该字段进入模型,直到状态未知得到验证,或由有权负责人明确接受。