写好爬虫的原则只有一条: 就是让你的抓取行为和用户访问网站的真实行为尽量一致。
1、伪造UA字符串,每次请求都使用随机生成的UA。 为了减少复杂度,随机生成UA的功能通过第三方库fake-useragent实现
pip install fake-useragent
2、生成一个UA字符串只需要如下代码:
from fake_useragent import UserAgent
ua=UserAgent()
print(ua.random)
3、亲测:
n [5]: ua.random
Out[5]: 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.93 Safari/537.36'
In [6]: ua.random
Out[6]: 'Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:16.0.1) Gecko/20121011 Firefox/21.0.1'
In [7]: ua.random
Out[7]: 'Mozilla/5.0 (Windows NT 5.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/31.0.1650.16 Safari/537.36'
In [8]: ua.random
Out[8]: 'Mozilla/5.0 (X11; NetBSD) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.116 Safari/537.36'
In [9]: ua.random
Out[9]: 'Mozilla/5.0 (Windows NT 4.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/37.0.2049.0 Safari/537.36'
In [10]: ua.random
Out[10]: 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/33.0.1750.517 Safari/537.36'
原创文章,转载请注明: 转载自URl-team
本文链接地址: python 爬虫伪造UA字符串-第三方海量ua库