2分钟完成30*15页拉勾网职位需求关键词的抓取

不同的语言,有它们各自擅长的应用场景,选择一门适合自己的语言需要勇气与毅力。

而当你下定决心要在甄选的语言上一条道走到黑的时候,孰不知,选择才刚刚开始。

一门编程语言往往有许多分支,每一个分支都需要掌握不同的技能,我们时常会感到困惑:怎么才能较为准确的分配技能点?

需求决定选择,从招聘方的角度来观察,看看我们未来的金主需要现在的你我掌握什么技能,或许能够从繁多的技术分支中受到启发:

一、获取职位需求数据

通过观察可以发现,拉勾网的职位页面详情是由http://www.lagou.com/jobs/+*****(PositionId).html组成,而PositionId可以通过分析Json的XHR获得。而红框里的职位描述内容是我们要抓取的数据。

知道了数据的源头,接下来就按照常规步骤包装Headers,提交FormData来获取反馈数据。

获取PositionId列表所在页面:

 1 # 获取职位的查询页面(参数分别为网址,当前页面数,关键词) 2 def get_page(url, pn, keyword): 3     headers = { 4         'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) ' 5                       'Chrome/45.0.2454.85 Safari/537.36 115Browser/6.0.3', 6         'Host': 'www.lagou.com', 7         'Connection': 'keep-alive', 8         'Origin': 'http://www.lagou.com' 9         }10     if pn == 1:11         boo = 'true'12     else:13         boo = 'false'14     # 通过页面分析,发现浏览器提交的FormData包括以下参数15     data = parse.urlencode([16         ('first', boo),17         ('pn', pn),18         ('kd', keyword)19         ])20     req = request.Request(url, headers=headers)21     page = request.urlopen(req, data=data.encode('utf-8')).read()22     page = page.decode('utf-8')23     return page

通过Json获取PositionId:

1 # 获取所需的岗位id,每一个招聘页面详情都有一个所属的id索引2 def read_id(page):3     tag = 'positionId'4     page_json = json.loads(page)5     page_json = page_json['content']['result']6     company_list = []7     for i in range(15):8         company_list.append(page_json[i].get(tag))9     return company_list

合成目标url:

 1 # 获取职位页面,由PositionId和BaseUrl组合成目标地址 2 def get_content(company_id): 3     fin_url = r'http://www.lagou.com/jobs/%s.html' % company_id 4     headers = { 5         'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) ' 6                       'Chrome/45.0.2454.85 Safari/537.36 115Browser/6.0.3', 7         'Host': 'www.lagou.com', 8         'Connection': 'keep-alive', 9         'Origin': 'http://www.lagou.com'10         }11     req = request.Request(fin_url, headers=headers)12     page = request.urlopen(req).read()13     content = page.decode('utf-8')14     return content

二、对数据进行处理

获取数据之后,需要对数据进行清洗,通过BeautifulSoup抓取的职位内容包含Html标签,需要让数据脱去这层“外衣”。

1 # 获取职位需求(通过re来去除html标记),可以将职位详情单独存储2 def get_result(content):3     soup = Bs(content, 'lxml')4     job_description = soup.select('dd[class="job_bt"]') 
5     job_description = str(job_description[0])6     rule = re.compile(r'<[^>]+>') 
7     result = rule.sub('', job_description)8     return result

现在得到的数据就是职位描述信息,我们要从职位信息当中筛选我们所关注的任职要求关键词。

我们将这些关键词筛选出来,存储到List当中。经过对整个500+职位进行爬去,我们得到了职位技能关键词的总表。

1 # 过滤关键词:目前筛选的方式只是选取英文关键词2 def search_skill(result):3     rule = re.compile(r'[a-zA-z]+')4     skill_list = rule.findall(result)5     return skill_list

对关键词按照500+职位需求出现的频次进行排序,选取频次排序Top80的关键词,去除无效的关键词。

1 # 对出现的关键词计数,并排序,选取Top80的关键词作为数据的样本2 def count_skill(skill_list):3     for i in range(len(skill_list)):4         skill_list[i] = skill_list[i].lower()5     count_dict = Counter(skill_list).most_common(80)6     return count_dict

三、对数据进行存储和可视化处理

 1 # 对结果进行存储并生成Area图 2 def save_excel(count_dict, file_name): 3     book = xlsxwriter.Workbook(r'C:\Users\Administrator\Desktop\%s.xls' % file_name) 4     tmp = book.add_worksheet() 5     row_num = len(count_dict) 6     for i in range(1, row_num): 7         if i == 1: 8             tag_pos = 'A%s' % i 9             tmp.write_row(tag_pos, ['关键词', '频次'])10         else:11             con_pos = 'A%s' % i12             k_v = list(count_dict[i-2])13             tmp.write_row(con_pos, k_v)14     chart1 = book.add_chart({'type': 'area'})15     chart1.add_series({16         'name': '=Sheet1!$B$1',17         'categories': '=Sheet1!$A$2:$A$80',18         'values':  '=Sheet1!$B$2:$B$80'19     })20     chart1.set_title({'name': '关键词排名'})21     chart1.set_x_axis({'name': '关键词'})22     chart1.set_y_axis({'name': '频次(/次)'})23     tmp.insert_chart('C2', chart1, {'x_offset': 25, 'y_offset': 10})

这就是抓取之后的数据可视化展示。

30*15页的内容抓取需要花费2分多钟,相对来说还是有些慢,可以加入并行模块抓取数据。

至此,拉勾网职位需求关键词的抓取就完成了。

这个爬虫的目的就是为了抓取与编程语言相关的技能需求,大家可以通过排名靠前的关键词获知主流的框架或结构,避免遗漏。也可以通过长尾关键词来扩展自己的知识面。

原文发布于微信公众号 - 大数据挖掘DT数据分析(datadw)

原文发表时间:2016-07-04

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏信安之路

轻松理解什么是 webshell

学安全基础很重要,安全中有很多的特有的关键字,理解这些关键字至关重要,今天给大家分享一下我对于 webshell 的理解。

1080
来自专栏牛客网

猫眼测开一二三面面经,给口头offer

一面: 计算机网络: 面试官:浏览器输入URL地址到呈现页面给用户,中间到底发生了什么?用到了什么协议。 我:balabala,扯到了DNS 面试官:DNS的查...

5649
来自专栏顶级程序员

10位顶级PHP大师的开发原则

来源:Andrew 译 ,译者网站已经停止运营 网址:http://net.tutsplus.com/tutorials/php/10-principles-...

2835
来自专栏前端达人

源码福利(文末有彩蛋) | vuejs 2 Material Design 后台模板源码大放送

各位亲们,关于vue3.0的方案已在拟定中了,想必大家都听说过了吧,2.0你学会了吗?没学会的还不抓紧时间补补,看完官方文档再加上本文分享的重量级源码,想必各位...

101
来自专栏架构师之路

YouTube系统架构【YouTube如此,你应该更有信心】

上一期,和大家分享了12306架构优化思路,本期讲和大家分享YouTube架构设计,阅读了本文你将了解到YouTube初期架构是个什么样子,以此,增强自己站点架...

5556
来自专栏IT技术精选文摘

京东网络接入体系解密之高性能四层网关DLVS

DLVS诞生之初 在SLB这块,京东用户接入系统提供四层负载均衡服务和应用层负载均衡服务,对于公网流量接入部分,和很多公司一样采用的是四层和应用层负载相结合的架...

3019
来自专栏安恒信息

窥探家庭网络的恶意木马

近几年,我们已经看到了很多关于家庭路由器遭受攻击的报道。攻击路由器的恶意软件会将用户的上网访问重定向到各种恶意站点,其他的攻击方式还包括植入后门和DNS劫持。在...

2315
来自专栏企鹅号快讯

前后端分离实践

前后端分离并不是什么新鲜事,到处都是前后端分离的实践。然而一些历史项目在从一体化 Web 设计转向前后端分离的架构时,仍然不可避免的会遇到各种各样的问题。由于层...

3328
来自专栏安恒信息

Mozilla出现漏洞,开发人员数万电邮或遭窃取

火狐浏览器开发商Mozilla近日宣布,由于数据库存在漏洞,Mozilla开发人员的数万个电子邮件地址和加密密码可能遭到黑客窃取。 ...

2655
来自专栏FreeBuf

20多万台MikroTik路由器被黑,用户被迫扛起锄头挖矿

研究人员发现20 多万台MikroTik路由器被黑客接管,让用户不知不觉中为他们挖矿。

763

扫码关注云+社区