分享之前:Sanitize 与 Redact 到底做什么
Sanitize 剥离脚本、嵌入文件与元数据,Auto Redact 把命中词的整页涂黑。两者各管一段,黑框涂黑也不等于内容真的被删除,须一并核对。

安全地分享一份 PDF 是两份活。Sanitize 剥离主动或隐蔽的附加物:JavaScript、嵌入文件、元数据、链接。Auto Redact 针对的是页面上你不想让人读到的可见文字。先涂黑必须不可读的内容,再清理不该跟着文件一起外发的东西。
Sanitize 不会隐藏页面上的姓名
清理(POST /api/v1/security/sanitize-pdf)编辑的是文档目录与页面字典。门户默认值下(多数移除标志为 true,removeFonts 为 false),它会移除:
- 文档与页面级 JavaScript 钩子(
AA、OpenAction) - 嵌入文件名树
- XMP 与 Info 元数据
- 链接注释
它不重写段落文字。内容流里躺着一个身份证号,清理之后它还在。把清理当成针对嵌入物与脚本的分享卫生,而不是隐私涂黑。
Auto Redact 先匹配文字,再把整页涂黑
自动涂黑(POST /api/v1/security/auto-redact)接受逗号分隔的 listOfText。它会逐页抽取文本层,检查某个词是否出现;一旦命中,就在该页上盖一层整页黑色矩形。
这种做法按设计就是钝的:命中的页变黑,没命中的页原样不动。没有文本层的纯图像扫描件,得先 OCR 才能匹配上关键词。下载前务必抽查结果,包括试一下选择、复制或做一次文本抽取。
黑框与真正的涂黑
在查看器里画个黑矩形,和删掉底层文字对象不是一回事。经典的“假涂黑”把字形留在内容流里,复制、搜索或 pdftotext 都能从墨迹下把敏感串捞回来。真正的涂黑会移除或替换那些对象,让字符串从文件字节里消失。
PDF123 的 Auto Redact 是服务端的匹配加覆盖步骤,面向模式卫生,需要人工复查,不是经过认证的电子取证套件。若合规策略要求内容删除的保证,请对输出做抽取验证,并按规定保留未清理的原件。
一条实用的分享前路径
浏览器工具不需要账号。想从脚本调同一批 op,见 开发者。