产品更新2026-09-24约 1 分钟阅读

分享之前:Sanitize 与 Redact 到底做什么

Sanitize 剥离脚本、嵌入文件与元数据,Auto Redact 把命中词的整页涂黑。两者各管一段,黑框涂黑也不等于内容真的被删除,须一并核对。

PDF123 · 更新于 2026-09-24

安全地分享一份 PDF 是两份活。Sanitize 剥离主动或隐蔽的附加物:JavaScript、嵌入文件、元数据、链接。Auto Redact 针对的是页面上你不想让人读到的可见文字。先涂黑必须不可读的内容,再清理不该跟着文件一起外发的东西。

Sanitize 不会隐藏页面上的姓名

清理(POST /api/v1/security/sanitize-pdf)编辑的是文档目录与页面字典。门户默认值下(多数移除标志为 true,removeFonts 为 false),它会移除:

  • 文档与页面级 JavaScript 钩子(AA、OpenAction)
  • 嵌入文件名树
  • XMP 与 Info 元数据
  • 链接注释

它不重写段落文字。内容流里躺着一个身份证号,清理之后它还在。把清理当成针对嵌入物与脚本的分享卫生,而不是隐私涂黑。

Auto Redact 先匹配文字,再把整页涂黑

自动涂黑(POST /api/v1/security/auto-redact)接受逗号分隔的 listOfText。它会逐页抽取文本层,检查某个词是否出现;一旦命中,就在该页上盖一层整页黑色矩形。

这种做法按设计就是钝的:命中的页变黑,没命中的页原样不动。没有文本层的纯图像扫描件,得先 OCR 才能匹配上关键词。下载前务必抽查结果,包括试一下选择、复制或做一次文本抽取。

黑框与真正的涂黑

在查看器里画个黑矩形,和删掉底层文字对象不是一回事。经典的“假涂黑”把字形留在内容流里,复制、搜索或 pdftotext 都能从墨迹下把敏感串捞回来。真正的涂黑会移除或替换那些对象,让字符串从文件字节里消失。

PDF123 的 Auto Redact 是服务端的匹配加覆盖步骤,面向模式卫生,需要人工复查,不是经过认证的电子取证套件。若合规策略要求内容删除的保证,请对输出做抽取验证,并按规定保留未清理的原件。

一条实用的分享前路径

  1. 只有在你被允许移除加密时才解锁。
  2. 先 OCR 扫描件,Auto Redact 才看得见关键词。
  3. 用不得外发的字符串跑 自动涂黑。
  4. 对准备分发的那份副本跑 清理。
  5. 打开结果,确认页面、附件与文字行为。

浏览器工具不需要账号。想从脚本调同一批 op,见 开发者。

打开工具
在浏览器里完成处理,不加水印,文件处理完就会删除。
打开工具