你随手发的一张照片、一段聊天记录、一篇带真名的博客,可能正安静地躺在某个大模型的训练集里。过去这件事几乎无人追问,但 2026 年,监管把"你的数据是怎么进模型的"推到了台前。
从"原则"走向"追责"
欧盟 AI 法案的节奏是风向标。2026 年 5 月 7 日的 Omnibus 协议把 Annex III 高风险系统的强制执法期限从 2026 年 8 月 2 日推迟到 2027 年 12 月 2 日,但第 50 条的透明度义务从 2026 年 8 月起已经生效——面向公众的高风险 AI 必须告知用户正在与 AI 交互,AI 生成内容也必须标识。聪明的企业仍把更早的日期当规划锚点。
比"标识"更硬的是"溯源"。训练数据来源(data provenance)——知道并证明数据从哪来、以什么法律基础收集、当初收集的目的和训练模型是否兼容——已经从"最佳实践"变成"法律义务"。欧盟 AI 法案和加州 AB 2013 都要求被覆盖的系统记录训练数据来源。意大利数据保护局早在 2025 年初就因训练数据处理违反 GDPR,对 OpenAI 开出 1500 万欧元罚单;巴西 ANPD 也从 2025 年起追查社交媒体公司未经同意用个人数据训练 AI。
两个让企业头疼的数字
安全公司 Kiteworks 2026 年的调研给出两个刺眼的数据:78% 的组织无法在训练前验证数据是否合规,53% 的组织在事后没有机制把数据从已训练模型中移除。这意味着什么?当某个数据主体行使 GDPR 的"被遗忘权",要求删掉嵌在模型里的自己,企业要么花大代价重训模型,要么直接不合规——二选一。
更微妙的是"匿名"的边界。欧洲数据保护委员会(EDPB)2026 年 7 月 7 日通过的《匿名化准则 02/2026》给出了累计三标准:无记录隔离(No Record Isolation)、无关联(No Linkage)、无推断(No Inference),三条全过才算真正匿名、脱离 GDPR。换句话说,把名字换成代号、做哈希或 token 化,在监管眼里通常只是"伪匿名"(pseudonymisation),仍然属于个人数据,该走的义务一步不少。业界此前标榜的"匿名数据集",大量其实是伪匿名。
新加坡的样本:把"公开可得"收窄
新加坡个人数据保护委员会(PDPC)2026 年 7 月 20 日发布生成式 AI 个人数据咨询准则,提供了另一个范本。它把"公开可得例外"收紧:想爬取数字屏障后的个人数据用于训练,必须写下来做影响评估并记录理由;同时强调,用个人数据训练 AI,必须准备AI 专用的告知,让用户能给出有意义的同意,且不得把"同意训练"作为使用产品/服务的条件。这等于堵死了"用服务就得默许我拿你数据练模型"的常见做法。
对普通人的含义很具体:你上传的照片、写的帖子、聊的天,平台能不能拿去训练,要看它有没有单独、清楚地告诉你,以及你有没有真正选择的空间;而 AI 生成内容的标识、被遗忘权在模型时代的执行难,也都在这套新规的射程内。
技术也在给隐私留后路
治理的另一条线是用技术降低风险:联邦学习让各方在本地训练、只共享模型更新而不集中原始数据;隐私增强技术(PETs)让跨机构分析在不汇集敏感信息的前提下进行;数据最小化与匿名化替代,成了模型开发者的可选项。
对开发者而言,2026 年的共识是:在数据进训练管道之前就摸清家底,因为一旦信息进了模型,再想补告知、补同意、补删除,成本指数级上升。对普通人而言,最该记住的一句话是——在网上留过的痕迹,可能比你自己记得更久,而模型,可能比你还记得你。