1. 图像质量因素
- 分辨率不足:低于 300 DPI 的图像字符边缘模糊,特征提取困难
- 光照不均:局部过曝或阴影导致二值化失效
- 倾斜与畸变:透视变形使字符行方向偏离预期
- 噪声与伪影:扫描噪点、JPEG 压缩块效应干扰字符分割
2. 文档特征因素
- 字体多样性:装饰性字体比标准衬线体和无衬线体更难识别
- 字符尺寸:小字号文字像素信息有限,特征不明显
- 版面复杂度:多栏排版、嵌套表格、图文混排增加布局分析难度
- 手写体变异:连笔、省略、个性化写法导致字符边界模糊
3. 语言与字符集因素
- 字符集大小:中文(GBK 编码含 21003 个汉字)远比英文(26 个字母)复杂
- 形近字:中文"己/已/巳"、英文"O/0"等形近字符容易混淆
- 多语言混排:同一页面混合多种语言文字增加语言检测和模型切换难度
4. 模型与系统因素
- 训练数据覆盖度:模型对训练集中未出现的字体和场景泛化能力有限
- 后处理策略:语言模型纠错和领域词典约束能有效降低错误率
- 系统参数配置:检测阈值、识别置信度过滤等参数的调优直接影响最终输出