上周遇到个事:一份仲裁裁决书的 PDF 要发给外部合作方做背景说明,里面当事人姓名、身份证号、案号全都在正文里,直接发出去肯定不行。
我一开始想的老办法是打开 PDF 编辑器手动盖黑框,盖了半页发现两个问题:一是慢,全文十几处要一个个画;二是心里没底——很多编辑器画的黑框只是一个覆盖图层,文字还在底层,对方 Ctrl+C 一复制就全出来了。后来换成了在线脱敏的思路,把整个过程记录一下。
先说清楚:涂黑和脱敏不是一回事
真正的 PDF 脱敏(redaction)要做到两点:
只满足"看起来黑了"的方案都不可靠,包括截图再贴回去、画黑色矩形覆盖这类操作。这也是我放弃手动方案的主要原因。
实操过程
我用的测试文件就是那份仲裁裁决书,475KB,正文里有人名、身份证号这些信息。工具是在线的 PDF 敏感信息脱敏(工具派网站 PDF 分类下面那个),整个流程四步。

第一步:配置匹配规则
打开工具页,上半部分是规则配置区,支持三种匹配方式叠加:
- 关键词:直接填要屏蔽的词,逗号分隔。我填了两个当事人姓名。
- 正则表达式:适合有固定模式的内容,比如 \\d{18} 匹配身份证号、\\d{11} 匹配手机号。
- 预设规则:不想手写正则的话,下拉框里内置了身份证号、手机号、邮箱、银行卡号、姓名(2-4 位中文)这几种常用模式,我直接选了身份证号。
下面还有几个可选项:页码范围(格式如 1-3,5,留空处理全部)、区域坐标(只想处理某个固定区域时用,x,y,w,h 每行一个)、遮盖颜色(黑/白/红/模糊四种,我选了最稳妥的黑色)。元数据和批注默认是保留的,按需勾选。

第二步:上传文件
把 PDF 拖进上传区,单文件最大支持 100MB,也支持批量。上传后会显示文件名和大小。

第三步:点"擦除内容"
处理在服务端跑,475KB 的文件大概十几秒。完成后页面会提示"处理完成",输出文件名自动加了 _redacted 后缀,点"下载结果文件"拿到处理后的 PDF。

第四步:本地验证
这一步别省。我下载后做了两个检查:选中涂黑位置复制,剪贴板是空的;Ctrl+F 搜当事人姓名和身份证号,0 条结果。确认通过才发出去。
几个踩坑点
- 遮盖方式优先选黑色实块。模糊(pixelize)模式视觉上柔和,但理论上存在被还原的风险,正式外发的文件不建议用。
- 先备份原文件。脱敏是不可逆操作,擦除后底层内容真的没了,自己留一份原件。
- 关键词匹配是全文精确匹配。姓名这种短词注意误伤,如果文档里恰好有同名的非敏感内容,建议改用区域坐标限定处理范围。
- 需要审计留痕的话可以勾选"同时下载脱敏报告",会多给一份处理记录,说明哪些规则命中了多少处。
小结
整个流程下来,比手动盖黑框快是其次,关键是结果是可验证的——复制不出、搜不到,这两点过了心里才踏实。类似场景还有合同外发、病历归档、简历脱敏,套路都一样:配规则 → 上传 → 擦除 → 验证。
相关工具地址:https://gjupai.com/ (PDF 分类下的"PDF 敏感信息脱敏")
网硕互联帮助中心






评论前必须登录!
注册