OCR 将图像转换为可搜索、可复制、可分发的文本,一旦输出被存储到日志、转发到协作工具或被下游系统索引,数据暴露面显著扩大。包含个人身份信息(PII)、受保护健康信息(PHI)或敏感财务数据的文档经 OCR 处理后,如果访问控制不当,可能引发数据泄露。
OCR 生成的可搜索 PDF 在原始图像下方创建了不可见的文本层。如果文档在 OCR 处理前未正确脱敏,即使后续通过黑色矩形遮盖敏感信息,底层 OCR 文本层仍可通过技术手段恢复。历史上多起知名脱敏失败事件(如 2014 年纽约时报 NSA 文档事件)均源于此。
将敏感文档上传至云端 OCR 服务时,文档内容可能被用于模型训练或微调,构成数据最小化原则的潜在违规。欧洲数据保护委员会(EDPB)指出,大量个人数据用于训练 OCR 模型可能违反 GDPR 的数据最小化原则。