爬取许嵩的所有微博并存入MongoDB

我很喜欢许嵩的音乐,我以前基本上他的每首歌都会唱,比如《素颜》、《灰色头像》、《玫瑰花的葬礼》、《清明雨上》、《庐州月》等等,打开播放器,基本上都是循环播放许嵩的歌,简直欲罢不能!

这次我就来爬取许嵩的所有新浪微博,我打算之后把许嵩音乐的网易云评论都爬取下来,现在水平还不够,暂时爬个微博玩玩。

分析网页:

先打开许嵩的微博首页:

现在微博的内容都是采用Ajax的加载方式,形象描述就是:我们不停的往下翻微博,它是动态加载出来的下一页,而页面URL没有改变。

鼠标右键—检查—选择network—选择XHR选项卡,这里面就是Ajax动态加载出来的内容。

我不停的下滑鼠标,看XHR选项卡的变化:

点击其中一个包,查看它的headers信息:

这个就是我们用来构造URL的参数,还好都没加密,我才能爬下来,否则我就不会了。多点开几个包查看这些参数,我们发现这几个参数都没有变,这就好办了。

接着查看返回的源代码:

这里,每条微博信息都是在data标签下的cards标签下,每一页共有10条微博,total表示共有395条微博,page是当前页数,可以通过修改page达到翻页的效果。

点开mblog标签,attitudes_count是点赞数,comments_count是评论数,reposts_count是转发数,text是微博文本信息,id是每条微博携带的一个编号

分析到这里就可以写代码了。

完整代码

完整代码如下:

    from urllib.parse import urlencode
import requests
from pyquery import PyQuery as pq    
from pymongo import MongoClient
import time


base_url = 'https://m.weibo.cn/api/container/getIndex?'

headers = {    
    'Host': 'm.weibo.cn',    
    'Referer': 'https://m.weibo.cn/u/1251000504',    
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) 
    Chrome/67.0.3396.87 Safari/537.36',
}

# 这里需要提前创建好‘weibo’数据库
# 并在‘weibo’数据库中创建一个‘weibo’集合
# 我是用mongodb可视化工具Robo 3t手动创建的
client = MongoClient()
db = client['weibo']
collection = db['weibo']
   
def get_page(page):
    # 这个params参数可以直接从浏览器中复制过来
    # 记得添加一个page参数
    params = {        
    'uid': '1251000504',        
    'luicode' : '10000011',        
    'lfid': '100103type=1&q=许嵩',        
    'featurecode': '20000320',        
    'type': 'uid',        
    'value': '1251000504',        
    'containerid': '1076031251000504',        
    'page': page
    }
    # 动态构造URL
    url = base_url + urlencode(params)    
    try:
        response = requests.get(url, headers=headers)        
        if response.status_code == 200:            
            return response.json()    
    except requests.ConnectionError as e:
        print('Error', e.args)
    time.sleep(5) # 休息一下,防止封ip
    
def parse_page(json):    
    if json:
        items = json.get('data').get('cards')        
        for index, item in enumerate(items):            
            if page == 1 and index == 1:                
                continue
            else:
                item = item.get('mblog')
                weibo = {}
                weibo['id'] = item.get('id')
                weibo['text'] = pq(item.get('text')).text()
                weibo['attitudes'] = item.get('attitudes_count')
                weibo['comments'] = item.get('comments_count')
                weibo['reposts'] = item.get('reposts_count')                
                yield weibo

                                
if __name__ == '__main__':  
    # 这个41是我算出来的
    # 一共395条微博,每页10条,从1开始计数  
    for page in range(1, 41):
        json = get_page(page)
        results = parse_page(json)        
   ‍‍     for result in results:            
            # print(result)
            # 将结果插入数据库
            collection.insert(result)        
‍‍    

查看爬取数据

然后看一下存在mongodb中的数据:

这里我使用的是mongodb的可视化工具:Robo 3T。利用它可以方便的查看mongodb数据库里的数据,

这里可以看到,许嵩的第一条微博是2011年8月25号发的,那个时候的许嵩正在疯狂写歌~

原文发布于微信公众号 - 一个爱吃西瓜的程序员(youcoding)

原文发表时间:2018-06-15

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏跟着阿笨一起玩NET

DataTable.AcceptChanges & DataAdapter.Update

The AcceptChanges method makes rows status to Unchanged, then the DataAdapter.Up...

7610
来自专栏编程微刊

highcharts中的x轴如何显示时分秒时间格式

上一篇文章写道:三分钟上手Highcharts简易甘特图:https://www.jianshu.com/p/d669d451711b,在官方文档里面,x轴默认...

26720
来自专栏晨星先生的自留地

老司机带我飚车(2)一个有趣的漏洞PoC调试

35260
来自专栏视频咖

如何写出一手好的小程序代码,从架构说起

? 作为微信小程序底层 API 维护者之一,经历了风风雨雨、各种各样的吐槽。为了让大家能更好的写一手小程序,特地梳理一篇文章介绍。如果有什么吐槽的地方,欢迎去...

58520
来自专栏恰童鞋骚年

操作系统核心原理-3.进程原理(下):进程通信

进程作为人类的发明,自然也免不了脱离人类的习性,也有通信的需求。如果进程之间不进行任何通信,那么进程所能完成的任务就要大打折扣。人类的通信方式无外乎对白(通过...

11520
来自专栏程序猿

性能优化的磁盘阵列

上题讲到mysql的硬件优化的时候,有提到磁盘阵列(Redundant Arrays of Independent Disks,RAID )...

42980
来自专栏小詹同学

同样是追星 ,他们是这样做的 。

最近我朋友疯狂迷恋韩国的偶像团体防弹少年团,于是拜托我帮忙写一段程序实时检测韩国新闻网站instiz旗下两个板块pt和clip,当出现自家idol的新闻时,程序...

15260
来自专栏友弟技术工作室

RAID及mdadm命令

介绍一个新概念,RAID,这也是大学的时候的学的东西了,一直很少在工作中使用,有点忘记,今天复习更新一下。分享给大家。 保存数据安全,大家都知道备份。 数据安...

43380
来自专栏青青天空树

node.js+vue.js搭建程序设计类课程教学辅助系统

  毕业才刚刚两个多月而已,现在想想大学生活是那么的遥不可及,感觉已经过了好久好久,社会了两个月才明白学校的好啊。。。额,扯远了,自从毕业开始就想找个时间写下毕...

59420
来自专栏腾讯技术工程官方号的专栏

免费开放阅读 | 数据库管理系统的事务原理(上)

作者介绍: 那海蓝蓝,腾讯技术工程事业群计费平台部金融云TDSQL数据库T4级专家,熟悉PostgreSQL、MySQL、Informix等数据库内核技术,著有...

54380

扫码关注云+社区

领取腾讯云代金券