项目概览
OpenAI Privacy Filter 是 OpenAI 于 2026 年 4 月 17 日开源的双向 Token 分类模型,专注于文本中个人可识别信息(PII)的检测与脱敏,属于 NLP 安全/隐私合规技术体系。其核心定位是为企业级数据清洗流水线提供一个可本地部署、高速、上下文感知且可调优的 PII 检测模型。模型采用自回归预训练加双向分类微调的方式,总参数量 1.5B,但通过稀疏 MoE 架构,每个 Token 仅激活 50M 参数,可在浏览器和笔记本上运行。模型支持 128,000 tokens 的上下文窗口,使用带状注意力将计算复杂度从 O(n²) 降至 O(n×w)。它可检测账号、私人地址、私人邮箱、人名、电话号码、私人 URL、私人日期等 8 类 PII,并通过约束 Viterbi 解码保证标签序列连贯。模型采用 Apache 2.0 许可证,支持 PyTorch、ONNX、Transformers.js 等多种部署格式。
解决什么问题
在 Privacy Filter 出现之前,PII 检测主要依赖三种路径:正则表达式规则引擎、云端 API 调用(如 AWS Comprehend、Google DLP、Microsoft Presidio)以及基于 BERT/RoBERTa 的 NER 模型微调。这些传统方案存在明显痛点:规则引擎缺乏上下文理解能力,无法区分 "Apple"(公司)和 "Apple"(人名),容易误报;云端 API 存在数据出域风险,合规要求严格的企业无法将含 PII 的数据发送到第三方云端;NER 模型标签体系固定,修改标签需要重新训练;多数 NER 模型上下文窗口不超过 512 tokens,长文档需要分块处理,导致跨块信息丢失;大模型推理成本高,不适合高吞吐数据清洗流水线;部分方案许可证限制或依赖链过长,部署复杂。
Privacy Filter 本质上优化了数据入湖/入模型前的清洗环节,即原始数据经过 PII 检测与脱敏后,再进入下游训练、分析或存储。此前开源界缺乏一个小体积、高精度、可本地运行且采用 Apache 许可的 PII 检测模型。
工作方式
Privacy Filter 的核心思想是"用生成式预训练的底子,做判别式分类的活"。它先通过 Next-Token Prediction 自回归预训练一个语言模型以理解文本语义,再将其改造成双向 Token 分类器,逐 Token 打标签,最后用约束 Viterbi 解码器保证标签序列的连贯性。
模型架构包含 8 层 Transformer Encoder,采用 Token Embedding(维度 640)加旋转位置编码(RoPE),支持 131,072 最大位置。注意力机制采用分组查询注意力(GQA),14 个 Query 头、2 个 KV 头,每组 7 个 Query 共享 1 对 KV,并使用带状注意力窗口(有效窗口 257),使计算复杂度从 O(n²) 降至 O(n×w)。前馈网络采用稀疏混合专家(Sparse MoE),共 128 个专家,每个 Token 通过 Top-4 路由激活 4 个专家,因此 1.5B 总参数中每个 Token 仅使用约 50M 活跃参数。分类头将 640 维残差流映射为 33 维 Logits(1 背景 + 8 类 × 4 BIOES 标签),使用监督 Token 级分类交叉熵作为损失函数。
训练流程为:大规模文本语料 → 自回归预训练 → 架构转换(LM Head 换成分类 Head,单向往双向)→ 监督微调 → Viterbi 校准(优化过渡偏置参数)。
核心能力
- 双向 Token 分类,单次前向传播标注整个序列
- B 总参数 / 50M 活跃参数,可在浏览器和笔记本运行
- K 上下文窗口,长文档无需分块
- 带状注意力,计算复杂度 O(n×w) 线性增长
- 类 PII 检测:账号、私人地址、私人邮箱、人名、电话号码、私人 URL、私人日期等
- 约束 Viterbi 解码,保证 BIOES 标签序列连贯
- 运行时可调精度/召回权衡,无需重新训练
- Apache 2.0 许可证,可商用、可修改、可再分发
- 支持 PyTorch、ONNX(FP16/INT4/FP32)、Transformers.js(WebGPU/WASM)多格式部署
- 提供 CLI 命令行、Python API、浏览器端集成方式
使用前需要了解
- AI 整理 · 本地测试,未经人工复核;依据历史报告节选,不代表当前产品状态。
- 根据报告,该模型存在以下局限:标签体系固定为 8 类,不能运行时动态增减;修改标签策略需要重新微调整个模型;主要针对英文优化,多语言/非拉丁脚本性能可能下降;1.5B 总参数仍需一定推理资源(虽然活跃参数仅 50M);缺少 GUI 管理界面。
报告明确指出,Privacy Filter 不是匿名化工具,只是脱敏辅助,不满足完全匿名化要求。它对罕见人名、区域性命名习惯、敬语密集文本可能漏检;高熵字符串(如哈希值、占位符)可能被误报为 secret。在医疗、法律、金融等高敏感场景需要额外人工审核。

