python爬虫怎么识别图片验证码-创新互联
这篇文章主要介绍python爬虫怎么识别图片验证码,文中介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们一定要看完!
十载的汕尾网站建设经验,针对设计、前端、开发、售后、文案、推广等六对一服务,响应快,48小时及时工作处理。营销型网站的优势是能够根据用户设备显示端的尺寸不同,自动调整汕尾建站的显示方式,使网站能够适用不同显示终端,在浏览器中调整网站的宽度,无论在任何一种浏览器上浏览网站,都能展现优雅布局与设计,从而大程度地提升浏览体验。创新互联从事“汕尾网站设计”,“汕尾网站推广”以来,每个客户项目都认真落实执行。爬虫真的像别人说的那么强大,可以获取很多信息,帮助或者参考别人的内容,补全自己吗?实际上确实是可以实现的,但是大家不了解的是,除了被动让爬虫去爬取,很多网站都可有主动防御技能,比如,现在跟大家说的图片验证问题,爬虫必须得去解决,不然没有办法可以进行下一步,解决操作如下所示:
1、先安装一个pytesseract
2、接着我们就打开一张图片,使用 pytesseract 识别。
代码如下:
captcha = Image.open("captcha1.png")result = pytesseract.image_to_string(captcha)print(result)
输出结果:没有问题。
3、我们在试试其他图片,如下所示
代码所示:
captcha = Image.open("claptcha2.png")result = pytesseract.image_to_string(captcha)print(result)
处理结果是有问题,也许是pytesseract没有办法处理噪点比较大的内容。
4、首先进行图片灰度处理
captcha = Image.open("captcha2.png")result = captcha.convert('L')result.show()
5、在进行二值化
def convert_img(img,threshold): img = img.convert("L") # 处理灰度 pixels = img.load() for x in range(img.width): for y in range(img.height): if pixels[x, y] > threshold: pixels[x, y] = 255 else: pixels[x, y] = 0 return img
6、调用一下
convert_img(captcha,150)
7、之后再跟第一个图片处理方式一样,就可以解决了哦~
好啦,一般情况下,第一种方式,几行代码就可以处理完成,还有一些情况可以调用第二种方式。
以上是“python爬虫怎么识别图片验证码”这篇文章的所有内容,感谢各位的阅读!希望分享的内容对大家有帮助,更多相关知识,欢迎关注创新互联行业资讯频道!
本文名称:python爬虫怎么识别图片验证码-创新互联
文章地址:http://scyanting.com/article/dspesh.html