把合同直接贴给 ChatGPT、Claude 或 Gemini,确实方便;问题是姓名、地址、税号和 IBAN 等个人信息也会随之离开电脑。Rizzo PII 想补上这道缺口:文档先在本机脱敏,云端模型只看到替代后的版本,适合仍想使用强大模型、又不愿上传敏感原文的用户。
它用约 3 亿参数、可在 CPU 上运行的 token classification 模型——也就是逐词识别敏感字段及其边界——检测 22 类个人数据,并以 [FULLNAME_1]、[IBAN_1] 等占位符替换。相同内容使用同一占位符,尽量保留文档内部关系;云端返回结果后,软件再依据留在本地的映射表恢复原值。项目尤其面向意大利语材料,并称覆盖税号、增值税号和地籍数据等当地法律标识。
严格说,这属于可逆的假名化,而非不可逆匿名化:映射表一旦泄露,原文仍可还原。因此,它的价值是把敏感字段挡在云端调用之前,但实际保护程度仍取决于识别是否完整,以及本地映射表能否妥善保管。