PII脱敏实测:Nova Pro打平4GB笔记本模型
94%对93%。一组德语PII脱敏测试里,Amazon Nova Pro追平了一台笔记本上跑的4GB开源权重模型——注意Nova Pro是API调用,人家是本地跑。更狠的是Nova Micro,整个系列最便宜的那档,跟Comprehend测了个平手,单位文档成本只有后者的二十分之一。然后测试里输得最惨的那个,反而是专门为德语微调过的模型。
下一篇
GRPO、Dr. GRPO、DAPO 原来都是同一个公式的变体 →
反直觉是吧。但我觉得真正的反直觉点在这儿:你处理PII的瓶颈从来不是模型选哪个,而是数据根本不敢往模型里送。
GDPR、HIPAA、数据处理协议卡着数据流向。你以为内网权限能兜底?权限边界在你的业务系统里是清晰的,一旦原始数据进了共享RAG索引或者某个prompt模板,边界立刻蒸发。再加上生产数据泄到开发环境这事儿谁都拦不住——合规流程要走三天,不合规的只要三分钟,你猜一线工程师选哪个?这不是安全问题,是工作流设计问题。
所以脱敏层得前置:数据进模型之前先过一遍,把身份信息替换成带类型的占位符,让模型安心提取结构。
分规模说:
小规模(个人/临时)
别自己造轮子。有Kiro或者Claude Enterprise席位的话,桌面应用加一个PII脱敏skill就够。这个规模下token成本没意义,固定月费二十份文档随便造,直接上最好的模型,上下文判断力比省几毛钱token值钱。
中等规模(团队级自动化)
分数据驻留看。数据能进AWS的话,Nova Micro是性价比之王:德语92%准确率、亚秒级延迟、十万份文档约3.9美元。Nova Pro换云端最高精度(德语94%),十万份约88美元,跟Comprehend持平、比Haiku便宜三分之二。但买Pro之前先看业务里是不是真有一堆德语金融标识符要处理,没有就别花这个钱。
Comprehend是另一类选手:100毫秒延迟、开箱30多种实体类型、不用写prompt也不用管模型版本迭代。
我的结论是:先把脱敏层立起来,再谈模型选型——后者只是算术题,前者才是架构题。
这个方向的上手步骤与避坑记录见用Claude整理的AI副业教程,有不少直接可参考的案例。
