Python反爬虫:,获取代理ip,检测代理ip可用性

本人对于Python学习创建了一个小小的学习圈子,为各位提供了一个平台,大家一起来讨论学习Python。欢迎各位到来Python学习群:960410445一起讨论视频分享学习。Python是未来的发展方向,正在挑战我们的分析能力及对世界的认知方式,因此,我们与时俱进,迎接变化,并不断的成长,掌握Python核心技术,才是掌握真正的价值所在。

随机User-Agent

fake_useragent库,伪装请求头

获取代理ip

在免费的代理网站爬取代理ip,免费代理的采集也很简单,无非就是:访问页面页面 —> 正则/xpath提取 —> 保存

代理ip网站

有代理:https://www.youdaili.net/Daili/guonei/

66代理:http://www.66ip.cn/6.html

西刺代理:https://www.xicidaili.com/

快代理:https://www.kuaidaili.com/free/

根据网页结果,适用正则表达式匹配

这种方法适合翻页的网页

先获取特定标签

解析

检测代理ip可用性

第一种方法:通过返回的状态码判断

第二种方法:使用requests包来进行验证

第三种方法:使用telnet

  • 发表于:
  • 原文链接https://kuaibao.qq.com/s/20190103A0CRET00?refer=cp_1026
  • 腾讯「云+社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 yunjia_community@tencent.com 删除。

扫码关注云+社区

领取腾讯云代金券