荷兰数据保护局(AP)正式建议 Twitch 用户立即关闭「用于改进
核心争议点在于 Twitch 如何界定「合法权益」。Amazon 在隐私条款里把模型训练归类为「服务改进」,勾选框默认开启,退出入口藏在「设置 → 安全和隐私 → 数据共享」三级菜单底部,且关闭后并不承诺删除已入库的向量表示。AP 认为:聊天弹幕属于用户原创文本,受版权与隐私双重保护;观看行为画像属于敏感偏好数据;二者混入预训练语料,既非履行合同所必需,也未获自由、具体、知情的明示同意。
一、数据范围比你想的大
不仅是公开频道的弹幕。私密频道、仅订阅者聊天、Whisper 私信元数据、甚至主播后台的收入仪表盘交互日志,全在「服务改进」范围内。AP 的技术报告附件里列出的数据字段表长达 47 项,包含 user_id、channel_id、message_hash、emote_usage_count、watch_time_seconds 等高维行为指纹。这些特征组合足以在潜在空间还原出具体自然人的兴趣图谱。
二、退出操作的实测路径与局限
目前唯一官方渠道:
1. 网页端登录 → 头像 → 设置 → 安全和隐私 → 数据共享与个性化广告
2. 取消勾选「允许 Twitch 使用我的数据改进 Amazon 的 AI 技术」
3. 点击「保存更改」后弹窗二次确认
实测生效延迟约 72 小时。关键限制:关闭开关仅阻止新增数据进入训练管线,历史数据已通过对比学习固化进模型权重,Amazon 拒绝提供「被遗忘权」接口。主播若想保护 VOD 内容,需额外在「频道与视频 → 直播录像」里关闭「存储录像」或手动批量删除——但这会同步失去重播流量变现能力。
三、对标 X / Reddit / Meta 的合规姿态对比
- X(原 Twitter)在欧盟被迫上线「Grok 训练数据排除」表单,需逐账号提交,审核周期 30 天。
- Reddit 直接在用户协议里写明「授权商业化训练」,并出售数据给 Google、OpenAI,目前正面临爱尔兰 DPC 跨境调查。
- Meta 依靠「合法权益」豁免在欧盟投喂公开帖子,但被挪威、奥地利监管机构接连禁令,被迫提供「反对权」表单且承诺 6 个月内清洗向量库。
Twitch 这次属于「默认开启 + 隐藏入口 + 不可逆」三大雷全踩,AP 给的整改窗口期到 10 月底,大概率随后跟进正式裁决。
四、技术层面的缓解方案(给在欧盟的开发者/主播)
如果你在跑基于 Twitch 数据的下游任务(如情感分析、推荐系统),建议在数据入湖层加入 gdpr_consent_flag 字段,配合 Apache Iceberg 的分区演进能力,实现行级删除向下传播。参考配置片段:
# spark-structure-streaming sink to Iceberg
sink:
type: iceberg
table: analytics.twitch_chat_events
write-format: parquet
properties:
"write.delete.mode": "merge-on-read"
"write.merge.mode": "delete"
# 配合 CDC 同步 Twitch 用户隐私偏好变更流
cdc-source: kafka:twitch.privacy.consent.changes配合夜ly 批处理 Job,按 user_id + consent_version 做 MERGE INTO DELETE,能在不重写全表前提下满足「撤回同意即停止处理」的合规底线。
五、别指望平台主动守规矩
AP 这份意