专栏首页python小白到大牛Python识别验证码的另一种花样玩法
原创

Python识别验证码的另一种花样玩法

概述

简介

坑!

安装 Tesseract-OCR

使用 pytesseract 识别验证码

高级玩法 - 除线

简介

首先呢,简单的验证码是这样的:

code.jpg

不是这样的:

image.png

这里使用了 pytesseract 来进行验证码识别,它是基于 Google 的 Tesseract-OCR ,所以在使用之前需要先安装 Tesseract-OCR。使用 PIL 来进行图像处理。pytesseract 默认支持 tiff、bmp 图片格式,使用 PIL 库之后,能够支持 jpeg、gif、png 等其他图片格式;

坑!

PIL(Python Imaging Library) 库只支持 32 位的系统,如果要在 64 位系统中使用,请安装 pillow。嗯,这个真是坑死我了,为了安装这个倒腾了很久。希望能帮到你。

pillow 中文文档

pillow 的缘由:由于PIL仅支持到Python 2.7,加上年久失修,于是一群志愿者在PIL的基础上创建了兼容的版本,名字叫Pillow,支持最新Python 3.x,又加入了许多新特性。

32 位系统

pip install PIL

64 位系统

pip install pillow

安装 Tesseract-OCR

在使用 pytesseract 之前,必须安装 tesseract-ocr ,因为 pytesserat 依赖于 tesseract-ocr ,否则无法使用

Mac

brew install tesseract

centos7

yum-config-manager --add-repohttps://download.opensuse.org/repositories/home:/Alexander_Pozdnyakov/CentOS_7/yum updateyum install tesseract yum install tesseract-langpack-deu

windows

download-address

使用 pytesseract 识别验证码

首先将图像灰度化

#使用路径导入图片im = Image.open(imgimgName)#使用 byte 流导入图片# im = Image.open(io.BytesIO(b))# 转化到灰度图imgry = im.convert('L')# 保存图像imgry.save('gray-'+ imgName)

灰度化的图像是这个样子的:

gray-code.jpg

然后将图像二值化

# 二值化,采用阈值分割法,threshold为分割点threshold =140table = []forjinrange(256):ifj < threshold: table.append(0)else: table.append(1)out= imgry.point(table,'1')out.save('b'+ imgName)

二值化的图像是这个样子的:

two-code.jpg

最后进行识别

# 识别text = pytesseract.image_to_string(out)print("识别结果:"+text)

识别结果是这样的:

image.png

高级玩法 - 除线

上面的知识简单的处理,在日常网络冲浪中,我们还会遇到这样的验证码:

logo3.gif

这个给我们的识别增加了难度,我们要做的就是将这条线去掉。详细代码如下:

那么我们的运行结果是这样的:

bremove-logo3.gif

总结

经过这么一些折腾,我们总算是看到了我们想要的结果,但是我很遗憾地告诉你,pytesseract 还是无法识别处理过的图片,他的识别结果是这样的:

image.png

结果有点令人痛心,不过我们也算是为我们的目标踏进了一小步。你以为这篇文章就这样完了吗?嗯,是的,这篇文章就这样完了。不过好在 pytesseract 提供了自定义训练功能,来提高识别能力(也可以自建神经网络进行识别)

我有一个微信公众号,经常会分享一些python技术相关的干货;如果你喜欢我的分享,可以用微信搜索“python语言学习” 关注,欢迎大家加入千人交流答疑裙:699+749+852

原创声明,本文系作者授权云+社区发表,未经许可,不得转载。

如有侵权,请联系 yunjia_community@tencent.com 删除。

我来说两句

0 条评论
登录 后参与评论

相关文章

  • 用Python每秒钟下载一张高清大图,快不快?

    如果爬虫需要展现速度,我觉得就是去下载图片吧,原本是想选择去煎蛋那里下载图片的,那里的美女图片都是高质量的,我稿子都是差不多写好了的,无奈今天重新看下,妹子图的...

    猫咪编程
  • 3行代码Python搞定图片清晰度识别,原来我们看到的不一定是这样的

    在通常情况下,图片是否清晰是个感性认识,同一个图,有可能你觉得还过得去,而别人会觉得不清晰,缺乏一个统一的标准。然而有一些算法可以去量化图片的清晰度,做到有章可...

    猫咪编程
  • 零基础学习python编程不可错过的学习总结,小白福利!

    通过以上可以看到我们写的很贱的程序随便保存了一个.txt结尾的格式,竟然也执行了,并没有按照统一要求的.py格式来设计, 那是不是说明后缀名可以说是任意的呢?理...

    猫咪编程
  • 【独立开发】从点子到创收

    上一篇文章讲了,想做独立开发,从一开始,我们怎样才能有一个所谓的“好点子”。首先,你要拓宽思路、发散思维地去想;然后,要把这些想法真正地和日常生活中的实际需求结...

    KyXu
  • 二维数组取最大最小值

    return max($temp);最大值//改成return min($temp)就是最小值 

    双面人
  • 跟我一起学Laravel-EloquentORM基础部分

    使用Eloquent [‘eləkwənt] 时,数据库查询构造器的方法对模型类也是也用的,使用上只是省略了DB::table('表名')部分。

    用户2131907
  • 直男福利!手把手教你做一只口红色号识别器,秒变李佳琦

    快乐橙、伤心紫,姨妈红,鸡屎绿…直男眼里没什么区别的颜色,在女生眼里各种色调、质地细微的区别都能分析一清二楚。

    大数据文摘
  • 2018.01.21.一周机器学习周记

    3.根据提示,在官网下载对应的CUDA版本,下载完成后进行安装(安装之前先卸载本地的旧版本)

    凌川江雪
  • web基础之Structs(一篇)

    为什么有 struts 框架 Struct 的优点之处: 1.       struct的好处 2.       程序更加规范化 3.       程序的可...

    Gxjun
  • DefinedCrowd筹集1180万美元为AI模型建立定制数据集

    收集用于训练机器学习模型的数据并不是简单的工作。算法需要标记良好的高质量源,这就是为什么整理数据集所花费的时间几乎与开发模型一样长,甚至更长。

    AiTechYun

扫码关注云+社区

领取腾讯云代金券