AI 数据链路合规地图:prompt 会落进的 10 类存储各留多久
OpenAI、Anthropic、Google、Mistral、xAI、Cohere 这六家厂商的 API 默认把 prompt 留 30 到 55 天,在你自己的追踪库和向量记忆里默认留到你动手删。产品要在欧美上线,把用户数据接进 AI 应用之后,海外监管和企业客户的安全团队要看的不是”用了哪家模型”,而是 prompt 在整条链上被写进了哪些地方:追踪平台、评测数据集、向量库、网关日志与缓存、厂商的滥用监控日志、有状态 API 对象,还有你自己的应用日志。每一处都要回答同样几个问题:留多久,会不会被拿去训练,谁能看到,落在哪个国家,删不删得掉。
核心要点
- 一条 prompt 在生产链路上可能落进 10 类存储,分布在 Agent 与应用层、AI 网关、推理方和你自己的基础设施上;具体有哪几类取决于你启用了哪些功能。追踪库、评测数据集、向量记忆是最常见的不会自己过期的几类。
- 合规上最要紧的一个问题是:某一方是否把你的数据用于它自己决定的目的,比如训练面向其他客户的模型。这类用途要单独评估角色和合法性,签了数据处理协议不等于这个问题已经解决;“产品改进”则要看具体用途,CCPA 下并不自动越线。
- 零留存(ZDR)的范围要逐家从条款里确认:覆盖哪些账户、接口和模型,缓存算不算在内,有状态功能是否可用。我们核对过的几家里,有的开启后批处理、文件等功能直接不可用,有的在合同里把缓存排除在零留存之外,但这些不能当成通用规律。
- “选了欧盟区”只覆盖一部分数据流:全局端点、跨区域推理、不支持区域端点的有状态功能、滥用审查人员所在地,都可能让数据出区。
- 已经生效的 AI 专门法对使用方的要求集中在三件事:告诉用户在和 AI 交互、标注生成内容、在文件元数据里写入生成标识,三件都能做成产品默认能力。
本文写给要把 AI 产品或服务卖到欧美市场的团队,是”AI 供应链的隐私合规”系列的第一篇:先画出整条链的地图,再按美国隐私与安全团队做供应商评估的路数给出判断方法;后续几篇会按文末的六个问题,逐层核对模型厂商、AI 网关与推理托管、追踪平台与编码 Agent 的真实条款。法律要点以欧盟和美国法为主,英国、韩国、印度、越南等法域已生效的规定只在有增量时提到;正文只写结论,一手文件列在文末。本文不构成法律意见。
一条 prompt 会被写进哪些地方?
常见的有 10 类存储,分布在四个位置上。这是一张排查清单,不代表每个应用都用到全部 10 类;也不能凭组件名称判断它实际采集了什么,要落到具体字段和配置上核对。
| 位置 | 存储 | 存了什么 | 默认留存 | 例子 |
|---|---|---|---|---|
| Agent 与应用层 | 追踪与可观测平台 | prompt、输出、工具调用参数与结果 | 14 天到”直到你删除” | LangSmith 基础 14 天、扩展 180 天;Langfuse 自托管默认无限期 |
| Agent 与应用层 | 评测数据集 | 从 trace 复制出来的输入输出 | 不删除 | LangSmith 数据集”永远不会被删除” |
| Agent 与应用层 | 向量记忆 | 对话切片及其 embedding | 不自动过期 | 删对话不会连带删向量 |
| Agent 与应用层 | 前端埋点与会话回放 | 用户在输入框里敲的内容 | 按工具设置 | 比你的后端更早拿到 prompt |
| AI 网关 | 请求日志与控制台 | 完整请求与响应(若开启) | 按套餐或按条数 | Cloudflare AI Gateway 默认开启,按条数淘汰而不按天 |
| AI 网关 | 响应缓存与语义缓存 | 完整响应;语义缓存另存 prompt 文本与向量 | 分钟到 1 个月 | LiteLLM 语义缓存会存原始 prompt 文本 |
| 推理方 | 滥用监控日志 | prompt 与输出;被标记内容单独计时 | 我们核对的六家主要厂商为 30 到 55 天;被标记内容另行计时 | Anthropic 被标记内容最长 2 年、分类分数 7 年 |
| 推理方 | 有状态 API 对象 | 会话状态、上传文件、批处理输入输出 | 按功能各自计时,常见”直到删除” | OpenAI Conversations 对象”直到删除” |
| 推理方 | prompt 缓存 | prompt 前缀或 KV 张量 | 分钟到 24 小时 | OpenAI 30 分钟到 24 小时;Anthropic 5 分钟或 1 小时 |
| 你自己的基础设施 | 应用日志、反向代理日志、开发者本地转录 | 请求体、错误堆栈、会话记录 | 默认常开 | Claude Code 本地明文转录默认 30 天 |
盘点时还有一点容易漏:发给模型的 prompt 不等于用户输入。应用会往里补系统指令、历史对话、检索到的文档片段和工具返回的结果,所以要同时看用户提交了什么、应用在后面几步又加进了什么。对象存储、数据库副本、备份、人工导出的文件这些底层位置,也要一并列进清单。
从左往右读,四个位置的风险性质不同。
Agent 与应用层的留存是设计出来的。 追踪平台的产品形态本身就是一个存 prompt 和输出的数据库,留多久是项目设置。评估器、自动化规则会悄悄把 trace 升到更长的留存档,被加进数据集的记录不再受留存策略管。Langfuse 的文档写得很直接:项目留存策略”不删除数据集条目”,把 trace 加进数据集后,保存下来的输入、预期输出和元数据在原 trace 过期后仍然可用。向量库没有过期概念,记忆功能写进去的东西会一直在。
网关留什么由它自己选。 计费要用量记录,这部分躲不开;payload 技术上可以完全不存。越过这条线的通常是两个功能:请求检视控制台,和缓存。聚合型网关还多一层:它把请求转发给上游模型厂商,上游就成了你链上的又一方。
推理方有三种,条款差得很远。 模型厂商自己的 API;云厂商在自己的共享推理平台上托管模型,走你的云合同和区域设置,但不在你自己的租户里;GPU 托管商跑开源权重。同一份开源权重换一家托管方,落地国家和训练条款可能全变。
自建推理去掉的是模型厂商和网关,不是第三方。 权重跑在你租的机房、云主机或 GPU 上,数据中心运营商和 GPU 租赁商仍然是你的数据处理者,只是不再有谁把读取 prompt 当作服务功能。留存面搬回自己家:推理服务器、反向代理、追踪文件默认都在记日志,问题从”管好供应商”变成”管好自己的日志”,外加基础设施供应商那一份 DPA。
供应商什么时候就不再只是”替你处理数据”?
当它开始把你的数据用于它自己决定的目的。训练是最典型的一种,但判断要看具体用途和决定者,不能只看功能名称。另外,技术链路上的位置本身不决定法律角色:同一家供应商在不同处理活动里可能是不同角色。
| 行为 | 是否越线 | 链上常见位置 |
|---|---|---|
| 用 prompt 与输出训练或微调面向其他客户的通用模型 | 需要单独评估角色和合法性,通常不能按”替你处理”对待 | 模型厂商免费层、部分国产厂商国内版 |
| 把对话用于”产品改进” | 看具体用途:只用于改进向你提供的服务,CCPA 下可能仍在服务提供者范围内;用来服务其他主体则不行 | 追踪平台、Agent 平台、部分开源权重托管方 |
| 用请求数据训练自己的路由或分类模型 | 需要单独评估,取决于模型服务谁、数据是否脱离你的业务关系 | 聚合网关 |
| 以折扣换取对 prompt 的永久使用许可 | 越线,许可本身就是为供应商自己的用途授权 | 聚合网关的可选项 |
| 为你提供服务所需的缓存、计费、滥用检测 | 不越线,但要写明留多久 | 所有位置 |
| 只为你微调、只给你用的模型 | 不越线 | 托管方的客户专属模型 |
GDPR 和 CCPA(加州消费者隐私法,美国各州隐私法里最常被企业客户拿来当基准的一部)在这条线上的方向一致,但判断方法不同,不能拿一部的结论直接套另一部。按 GDPR,看的是谁决定处理目的和关键方式:供应商为自己决定的用途处理数据,就那部分活动要单独判断角色、合法性基础和透明度,数据处理协议(DPA)覆盖不了这部分;供应商超出约定使用数据,也不会让合同里的用途限制自动失效,它照样违约。按 CCPA,实施规章允许服务提供者在限定条件下为改进向该企业提供的服务而内部使用数据,所以看到”产品改进”不能直接判不合规,要继续核对具体用途、以及数据是否被用来服务其他主体;真正越出范围的,向其披露可能构成”出售或共享”,用户有权要求退出。美国联邦贸易委员会(FTC)的态度也清楚:模型服务公司不兑现自己的隐私承诺要担责,悄悄改条款开始拿数据训练可能构成欺骗。
实操结论:签约前先看训练与产品改进开关的默认值、作用范围和条款里对”改进”的具体定义,再看 DPA 写得好不好。欧盟各国监管机构发给 OpenAI 的问卷,披露部分的头两个问题问的也是角色:你是不是唯一的控制者,你有没有替你处理数据的一方。
这个判断要逐跳做,不能只对模型厂商做一次。追踪平台拿你的 prompt 做产品分析,网关拿请求数据训练路由模型,GPU 托管商留日志改进推理栈,是同一个问题出现在不同位置。
在别人的模型上包一层卖给客户,还要看另一条线。欧盟 AI Act 把开发系统、并以自己名义投放市场的一方叫提供者,把使用系统的一方叫部署者。通用模型的技术文档、训练数据摘要这些义务留在模型厂商那边。按预期用途使用别人的高风险系统,你仍是部署者。以下几种情况会让你成为高风险系统的提供者,要承担合格评定、技术文档、风险管理这些义务:给高风险系统贴上自己的名称或品牌,对它做实质性修改,或者把通用模型等非高风险系统改作招聘筛选、信用评分这类高风险用途。在通用模型上做一个招聘或信贷工具,是最常见的触发路径。非欧盟公司只要系统输出在欧盟被使用,也在范围内。
供应商背后还有谁?
还有它的子数据处理者,而在聚合网关上,这一层是按请求变化的。
常规做法你应该都熟:要一份子数据处理者清单,确认新增时有没有提前通知、你能不能提异议。这套机制在传统 SaaS 上够用,因为清单是稳定的。到了 AI 链路上,它有两处跟不上。
第一处是聚合网关。你的 prompt 发给哪家上游,由路由决定,而路由可以每个请求都不一样。OpenRouter 的接口列出 82 家上游,其中 36 家会留存 prompt、25 家没写留多久;它公开的子数据处理者清单里涉及推理的只有三家,DPA 的变更通知也明文把模型提供方排除在外。对聚合器来说,真正的变更是路由变更,而没有一家承诺通知路由变更。技术上要分清三个不同的控制目标:不训练、数据驻留、固定路由。OpenRouter 的 data_collection: deny、Vercel 的 disallowPromptTraining 按上游的数据政策过滤,解决的是第一个,不等于把路由锁死,也不限制留存或境外处理。业务需要限定接收方时,要用明确的上游允许名单,把故障切换和重试的备用路径也算进去,在请求日志里记下每次实际命中的是哪家,并把下游授权和变更安排写进合同。
第二处是云托管推理。模型提供方接不接触你的数据,由云厂商的架构决定,不由模型决定。同一个 Claude Fable 5,在 Bedrock 上的留存审查”不与模型提供方共享”,在 Google 的平台上则要求”你必须启用与 Anthropic 共享这些数据”。选哪家云,决定了 Anthropic 是不是你链上的一方。
合同里写的条款,技术上怎么验证?
把每一条合同要求翻译成一个可以查的配置、日志或接口行为。查不到的,就是这条要求在你这里还没有落地。
| 合同要求 | 技术上对应什么 | 去哪查 |
|---|---|---|
| 只按你的指令处理 | 训练与产品改进开关的默认值;开关作用在组织、项目还是工作区 | 控制台、各套餐条款 |
| 处理目的写具体 | 推理、缓存、日志、评测、滥用检测分开列,每项对应一类存储 | 你自己的数据流图 |
| 保密与人工访问 | 谁能看被标记的内容,审批流程,审查人员在哪个国家 | 厂商的滥用监控文档 |
| 安全措施 | 传输与静态加密、租户隔离、缓存键里有没有租户标识 | 安全白皮书、问卷、开源项目的源码 |
| 子数据处理者 | 清单、通知渠道(邮件还是 RSS)、路由能不能锁定 | 信任中心、网关配置 |
| 协助响应用户请求 | 能不能按用户 ID 在 trace、向量库、日志里检索并删除 | API 文档 |
| 终止后删除 | 删除窗口、备份清除周期、数据集与评测副本是否一并删除 | DPA 附件、产品文档 |
| 证明合规 | 逐请求证据、访问日志、第三方审计报告 | 响应头、信任中心 |
验证分三层,三层要互相对得上:合同描述义务,配置反映功能状态,请求记录呈现可观察的运行情况。
合同层:把厂商的功能资格表作为合同附件,别引用一个随时会改的网页。
配置层:确认开关的作用范围。有的按组织生效,有的按项目,有的按工作区,开在哪一层决定它覆不覆盖你的生产流量。
可观测层:要逐请求的证据。xAI 在每个响应里返回 x-zero-data-retention 头,每一次调用在厂商声明下是不是零留存都能记录下来。但这只是厂商对这次请求所声明的状态,不能单独证明后台没有保存、复制或拿去训练;厂商内部的安全日志、备份这些看不到的部分,要靠合同、技术说明和审计报告补证据,并把没核实的范围写清楚。
零留存的范围要逐家确认,不能预设。以我们核对过的厂商为例:OpenAI 的零留存只覆盖无状态端点,Assistants、Files、Batches 等不可用;OpenRouter 的 DPA 把”严格必需的缓存”排除在零留存定义之外。其他厂商不一定如此,要按条款和功能清单逐项核对:覆盖哪些账户、接口和模型,哪些数据仍会保存,保存多久。还有一种反方向的情况,厂商可以强制留存:Anthropic 把 Claude Fable 5、Mythos 5 等列为 Covered Models,在所有平台都要求至少 30 天留存,零留存客户直接调用会被拒绝。Anthropic 表示,Fable 5 和 5.1 在其”企业前沿安全保障”(Enterprise Frontier Safeguards)安排下的零留存方案将于 2026 年秋季推出。
数据到底留多久,删得掉吗?
每类存储各有自己的时钟,最长的通常在你自己一侧;删掉存储里的副本,也不等于从模型里删掉。
GDPR 和 CCPA 的要求说起来简单:留存要和目的相称,收集时要告诉用户留多久,或者告诉他怎么确定期限。两类数据有更硬的规则:COPPA 要求儿童数据有书面留存政策、不能无限期保留;GLBA 下的 FTC 保障规则(Safeguards Rule,适用于非银行金融机构)要求客户信息在最后一次使用后两年内处置,除非业务运营仍需要、法律要求保留,或者无法有针对性地删除。AI Act 对高风险系统的要求方向相反,部署者要把系统日志留至少六个月。
落到工程上,就是每一类存储都要有用途、期限或到期条件、清理方式和负责人,而不是”默认”。系统支持无限期保存,不能证明业务需要无限期保存。上面那张表里写着”直到你删除”和”不删除”的格子,就是要你自己写删除任务的地方。用户发起删除时,要能定位到关联的会话、评测样本、向量条目和文件;备份没法立即定向清除的,要写明访问限制、覆盖周期,以及从备份恢复后怎么重新执行删除。
删除本身也要验证。可以用不含真实个人信息的测试记录跑一遍链路:建会话、产生 trace,在实际启用的功能里生成评测样本或记忆条目;触发删除后逐个查对象和索引,确认哪些立即删了、哪些等到期、失败后会不会重试。测试数据查不到了,只能证明测到的对象和路径删掉了;厂商内部日志和备份这些查不到的部分,仍要靠合同与审计材料。GDPR 的删除权本身有例外,法律保全也可能暂停删除,但要核对依据、范围和持续时间,“可能需要保全”不能当成长期保留全部内容的通用理由。
买卖双方落差最大的一处,是删对话和从模型里删除的区别。美国高校采购用的安全问卷 HECVAT 4.1.6 里有一题 AISC-01,是出海厂商进入美国教育市场时几乎必答的题,它直接问供应商:敏感数据进了你的 AI 模型之后,能不能应请求移除,并点名训练集、向量库和记忆。我们核对的厂商信任中心没有一家回答这道题,它们回答的都是旁边那道容易的:“能不能删掉我存储的对话”。数据一旦进了训练,删掉源文件够不够回应删除请求,要结合模型的处理方式另行评估,这恰恰是厂商最少回答的那一半。所以评估任何一方时,“默认是否训练”要比”留存多少天”先看。
训练用途还有两个告知与透明度的要点。欧盟数据保护委员会(EDPB)要求在收集时就告诉用户,他的输入可能被用于训练,而且不能在条款里把责任推给用户自己。AI Act 要求通用模型的提供者按欧盟委员会的模板公开训练内容摘要,其中一项就是”是否使用了用户与模型交互的数据来训练”,勾是或否。判断一家厂商训不训练,可以直接去看这份摘要,不必只听销售。
每一跳的数据落在哪个国家?
要按端点、功能和访问者逐个看。出海团队最常见的误区是把”选了欧盟区”当成跨境问题的终点,它只覆盖其中一部分。
| 容易漏的点 | 为什么会让数据出区 | 例子 |
|---|---|---|
| ① 全局端点、全局部署类型 | 推理可以在任意区域处理 | Google 的全局端点”不提供数据驻留保证”;Azure 的 Global 部署可在任何地理区域处理 |
| ② 跨区域推理 | 请求被调度到别的区域,留存数据存在目标区域 | Bedrock 开启跨区域推理时 |
| ③ 区域的定义 | ”欧盟”不一定含英国和瑞士 | Google 的 eu 多区域端点不含英国、瑞士 |
| ④ 有状态功能 | 常常不支持区域端点 | Mistral 的有状态功能不支持区域端点 |
| ⑤ 滥用审查 | 数据存放地和审查人员所在地是两件事 | Azure 写明欧洲经济区部署的审查人员位于欧洲经济区 |
| ⑥ CDN 与边缘网络 | 在离用户最近的节点处理 | 托管方通常把 CDN 列为子数据处理者 |
| ⑦ 远程访问 | 数据没动,但区外的人能登录查 | 供应商在区外的支持与运维人员;EDPB 指南把这类访问视为 GDPR 下的传输,EO 14117 规则管的也正是谁能接触 |
欧美两套规则的判断口径不一样,技术上要准备的材料也不一样。
GDPR 看数据去了哪,也看谁能从哪里访问。 数据离开欧洲经济区,每一跳都要有传输机制和评估,供应商再往下传也算。数据存在欧洲不代表跨境问题结束了:EDPB 关于传输的指南写明,第三国的另一个控制者或处理者获得远程访问权限,哪怕只是在支持、排障或管理时在屏幕上查看,也算传输。访问主体要分清,你公司自己的员工出差时远程访问本公司数据不算传输,境外独立供应商获得访问权限则算。评估方法可以参考CNIL 的六步 TIA 指南。
美国看谁能接触。 美国没有一部联邦层面的通用隐私法,跨境这件事管的是司法部依 EO 14117(限制向”受关注国家”提供美国敏感数据的行政令)制定的数据安全规则,它关注的是,批量美国敏感个人数据能不能被中国等”受关注国家”控制的实体或人员接触到;云计算服务明确在规则覆盖的供应商协议里。AI 供应商是否落入范围,官方没有专门表态,是按定义推出来的判断。可以先做EO 14117 三条件自测。
对应到工程上,数据流图里每一跳都要标出三件事:端点类型(区域、全局、跨区域),滥用日志和审查人员的位置,以及访问主体是谁(本公司员工还是供应商)、能从哪个国家访问。
哪些行业要多满足一层?
医疗、儿童、金融、教育这四类数据,以及招聘和信贷这类用途,链上每一方都要多满足一套要求,不会因为对方”只是个中间件”就豁免。对出海美国的产品,这些行业法往往比通用隐私法更早成为障碍,因为美国的隐私规则本来就是按行业和州分别立的。
| 数据或场景 | 多出来的要求 | 技术上意味着什么 |
|---|---|---|
| 医疗(HIPAA,美国医疗隐私法) | 链上每一方及其下游都要签业务伙伴协议(BAA,美国医疗数据法下和每个接触健康数据的供应商都必须签的合同);美国卫生部已把第三方 AI 聊天机器人供应商列为业务伙伴的例子 | 找不到愿意签的模型厂商时,改走已经对托管推理签 BAA 的云厂商,这是受监管团队普遍先选云而不是直连厂商的原因 |
| 儿童(COPPA,美国儿童在线隐私法) | 把数据交给会拿去训练 AI 的第三方,要单独取得家长同意;要有书面留存政策 | 训练开关必须关死并留证据;每类存储写明过期时间 |
| 金融(GLBA,美国金融隐私法) | 按 FTC 保障规则,要定期评估服务提供者;客户信息最后使用两年内处置,有例外 | 条款变更要触发重新评估;trace 和备份设过期 |
| 教育(FERPA,美国教育记录隐私法) | 外包方要受学校直接控制,不能自用数据 | 保留”产品改进”权利的供应商基本不行 |
| 招聘与信贷(AI Act) | 属于高风险系统:人工监督、日志留至少六个月、发现风险要暂停使用;这些类别里对个人做画像的系统一律算高风险;2027 年 12 月 2 日起适用(原定 2026 年 8 月 2 日,2026 年的修订条例推迟) | 日志设下限而不是上限;系统要有能立即停用的开关;在工作场所和学校推断情绪是禁止的 |
英国脱欧后保留的 UK GDPR 另有一条:纯自动化做出的重大决定要给人工介入和申诉渠道,义务在你,不会因为结果来自第三方模型就转移。韩国《人工智能基本法》要求上线前自查系统是否属于高影响 AI,招聘和贷款审查明确在列。
用户那一侧要看到什么?
告诉用户在和 AI 交互,把生成内容标出来,把训练和留存写进隐私政策。已经生效的 AI 专门法要的基本就是这几件事,而且都能做成产品默认能力。
| 要求 | 哪些法域 | 工程实现 |
|---|---|---|
| 告知输入可能用于训练、保留多久 | GDPR、CCPA | 隐私政策加首次使用提示,文案要和实际开关状态一致 |
| 告知用户在和 AI 交互 | 韩国《人工智能基本法》、越南《数字技术产业法》 | 界面标识、语音开场提示 |
| 生成内容显式标注 | AI Act(深度伪造)、印度 IT 规则、越南 | 文字提示、图片角标、视频片头 |
| 文件元数据里的隐式标识 | 印度 IT 规则 | 导出文件时嵌入生成属性或唯一标识;印度还要求不得提供去除标识的能力 |
| 情绪识别与生物特征分类的告知 | AI Act | 对被处理的人单独告知 |
把 AI 身份披露、生成内容标注、元数据标识做成默认能力,就覆盖了目前绝大多数已生效的 AI 专门义务。剩下要按法域单独判断的,只有韩国的高影响自查和欧盟的高风险分类。欧盟这部分的产品清单见AI Act 透明度义务。
日本的 AI 推进法已经生效但没有罚则,加拿大的 AIDA 已随国会休会失效,英国没有跨行业 AI 成文法,巴西还是法案,暂时都不产生额外的工程动作。
什么时候要做影响评估,要准备哪些技术材料?
按 GDPR,处理可能给个人权利和自由带来高风险时要做数据保护影响评估(DPIA)。上线 AI 应用本身不是独立的触发标准,要结合处理的性质、规模、背景和目的判断;监管指南里的常见信号是新技术叠加大规模处理、敏感数据或员工数据,生产级 AI 链路经常同时满足几项。CCPA 实施规章对处理敏感个人信息、以及训练用于重大决定的自动化决策系统,也要求事前风险评估。跨境传输本身不是触发条件,那是另一套传输评估。
评估报告写得好不好,取决于技术材料准备得全不全。至少要有这七样:
- 逐跳数据流图:每类存储、每个端点的类型和区域。
- 每类存储的留存时长和删除方式,包括缓存、数据集和备份。
- 子数据处理者清单,以及网关路由是怎么锁定的。
- 训练与产品改进开关的状态,以及能证明它的配置截图或响应头。
- 人工访问:谁、在什么条件下、从哪个国家能看到 prompt,被标记的内容留多久。
- 用户请求的执行路径:按用户检索和删除,覆盖到哪几类存储,覆盖不到哪几类。
- 保全与例外:出现法律保全时,哪些删除任务会暂停。
CCPA 实施规章对评估报告有一条很具体的写法要求:目的不能写成”改进我们的服务”或”安全目的”这种笼统说法,每类信息打算留多久、交给了哪些接收方,都要写出来。上面七样材料能支撑评估,但替代不了对必要性、比例性和风险措施的判断。系统新增长期记忆、把生产记录转进评测、换上游路由或调整留存配置时,原来的结论都可能变,数据清单和验证范围要跟着更新。
某一跳被法院要求保全,你的删除承诺还算数吗?
不一定。供应商承诺的”N 天后删除”,碰上法院的保全令就得让路,这件事已经发生过。
《纽约时报》诉 OpenAI 案中,法院在 2025 年 5 月 13 日命令 OpenAI 保全并隔离所有原本会被删除的输出日志,包括用户主动要求删除的。这项义务到 2025 年 9 月 26 日才停止,之前已经保全的数据继续保留,只有欧洲经济区、瑞士和英国发起的请求除外。
对链上任何一方都成立的推论(属于分析):你在隐私政策里给用户的删除时限,依赖每一个供应商的删除任务按时执行,而这些任务可能因为和你无关的诉讼暂停。能做的工程动作有三个:不需要的身份标识在进网关之前就去掉或做假名化;优先用无状态端点;把”供应商处于保全义务下”作为一个风险写进影响评估。
评估任何一方的六个问题
把上面的内容压成一张能逐项打钩的表,后面三篇都用它来核对供应商。
| # | 问题 | 要拿到的证据 |
|---|---|---|
| 1 | 默认留存多久?不同功能有没有差异? | 按端点和功能列出的留存表,含滥用日志、被标记内容、缓存、有状态对象 |
| 2 | 有没有不落盘的选项?覆盖哪些功能,开启后什么会失效? | 零留存覆盖的账户、接口与模型清单,缓存是否在内,开启后不可用或行为改变的功能 |
| 3 | 默认会不会用于训练或产品改进?开关作用在哪一层? | 各套餐的默认值;组织、项目还是工作区生效;逐请求证据 |
| 4 | 数据落在哪?能不能选区域?下游和审查人员在哪? | 端点类型、跨区域开关、子数据处理者位置、审查人员所在地 |
| 5 | 谁能人工访问?被标记的内容留多久? | 审查触发条件、审批流程、留存天数 |
| 6 | 签约主体是谁?DPA 和子数据处理者清单公开吗,变更怎么通知? | 主体名称与所在国;DPA 版本;清单地址和通知渠道 |
这张表对链上每一方都要填一遍:追踪平台、向量记忆服务、网关、模型厂商、云托管方、GPU 托管方。哪个格子填不出来,那就是你的合规缺口,不是供应商的。
常见问题
只要和供应商签了 DPA,是不是就合规了?
不是。DPA 管的是约定,合规看的是实际发生了什么:训练开关的真实状态、每类存储的留存、网关实际路由到了哪家上游、条款有没有悄悄改过。选供应商时要确认它有能力做到,签约后还要持续核实,条款一变就重新评估。CCPA 实施规章给的参考频率是至少每 12 个月评估一次。
厂商说不训练、不留存,我怎么验证?
分三层核对,三层要互相对得上。合同层,把功能资格表作为附件;配置层,确认开关作用在组织、项目还是工作区,是否覆盖全部生产流量和旧数据;可观测层,要逐请求的证据,比如响应头里的零留存标志位。标志位只是厂商对单次请求的声明,不能单独证明后台没保存或没训练,看不到的部分要靠审计报告和书面说明补充。
员工用个人账号把客户数据贴进 AI 工具,算什么?
算把个人信息交给了一个没有数据处理协议、而且消费者版通常默认拿数据去训练的第三方,荷兰数据保护局的说法是:员工违反公司约定这样做,就构成个人数据泄露,很多情况下要上报;如果是公司允许的用法,不算泄露,但往往仍不合法。治理上是三个动作:把业务流量迁到企业账号或企业 API 密钥,并用单点登录强制;在网络出口或网关层拦截消费者版域名;给员工一份写清”能不能用、怎么用”的使用规范。
这条链上出了事,用户会找谁?
先找你。在 GDPR 下,决定处理目的的一方是控制者,面向 AI 应用的用户通常就是你;供应商及其下游对你负责,但对用户负责的是你;CCPA 给了用户私人诉权,因为没维持合理安全措施导致未加密的个人信息泄露,用户可以向你主张每人每次 100 到 750 美元的法定赔偿。供应商有过错,不会自动变成你的免责理由。
一手文件(2026 年 9 月 8 日核对,印度 IT 规则于 9 月 14 日补核)
欧盟:GDPR 全文;EDPB 控制者与处理者指南;EDPB 关于境外传输的指南;EDPB ChatGPT 工作组报告;数据保护影响评估指南 WP248;AI Act与修订条例 2026/1744;训练内容公开摘要模板;荷兰数据保护局提示。
美国:FTC:AI 公司应遵守隐私承诺、FTC:悄悄修改条款;加州隐私保护局规章;美国卫生部业务伙伴指引;FTC 保障规则;COPPA 修订规则;司法部数据安全项目;《纽约时报》诉 OpenAI 保全令与终止合意令。
厂商文档(2026 年 9 月 8 日至 9 日核对,OpenAI、Anthropic、Mistral 于 9 月 15 日补核):模型厂商 OpenAI 数据控制;Anthropic API 与数据留存、商业客户数据留存、Covered Models;Mistral 区域推理;xAI 安全 FAQ。AI 网关 OpenRouter 提供方日志、数据收集、DPA;Vercel 禁止 prompt 训练;Cloudflare AI Gateway 日志;LiteLLM 缓存文档。云托管推理 AWS Bedrock 数据保护、数据留存、滥用检测;Google 滥用监控、数据驻留;Azure 数据、隐私与安全、滥用监控。追踪与编码 Agent:LangSmith 管理概览与数据留存;Langfuse 数据留存;Claude Code 数据使用。
其他法域:韩国 AI 基本法;越南数字技术产业法;印度 IT 规则 2021(MeitY 2026 年 2 月 10 日更新版,含 G.S.R. 120(E) 合成内容修正);EDUCAUSE HECVAT 4.1.6。
相关阅读:CNIL 发布 TIA 实用指南草案、EO 14117 自测、自主智能体 OpenClaw 的个人信息合规风险、GDPR 数据泄露 72 小时上报。
