爬取带验证码网站思路的小结
2022/2/2 23:44:57
本文主要是介绍爬取带验证码网站思路的小结,对大家解决编程问题具有一定的参考价值,需要的程序猿们随着小编来一起学习吧!
由于现在网站技术的发展及爬虫技术的推进,现在网站很多都有访问时需要填写验证码的问题,经过查询,现对验证码问题进行总结,如下:
1.IP代理 当我们频繁用一个IP登陆某个网站时,会出现需要填写验证码的问题,解决此种问题可以用IP代理的思路具体有三种方法:
(1)借用VPN,更换不同的线路,进而更换IP。
(2)IP代理池,借用一些厂商提供的IP代理池的API,更换IP
(3)ADSL,利用拨号上网每次分配不同IP的机制,实现更换IP
2 cookie登陆,为了避免每次登陆都要输入账号密码,验证码的麻烦,我们可以将登陆后的cookie存储到本地,访问网站时加入即可。
3.传统验证码识别。可以借助tesseract-ocr,pytesseract和Pillow
4.人工打码 当传统验证码识别难度加大时,可以结合自动识别和人工打码平台解决问题。
5.滑动验证码:可以结合selenium实现。
这篇关于爬取带验证码网站思路的小结的文章就介绍到这儿,希望我们推荐的文章对大家有所帮助,也希望大家多多支持为之网!
- 2024-05-15鸿蒙生态设备数量超8亿台
- 2024-05-13TiDB + ES:转转业财系统亿级数据存储优化实践
- 2024-05-09“2024鸿蒙零基础快速实战-仿抖音App开发(ArkTS版)”实战课程已上线
- 2024-05-09聊聊如何通过arthas-tunnel-server来远程管理所有需要arthas监控的应用
- 2024-05-09log4j2这么配就对了
- 2024-05-09nginx修改Content-Type
- 2024-05-09Redis多数据源,看这篇就够了
- 2024-05-09Google Chrome驱动程序 124.0.6367.62(正式版本)去哪下载?
- 2024-05-09有没有大佬知道这种数据应该怎么抓取呀?
- 2024-05-09这种运行结果里的10.100000001,怎么能最快改成10.1?