Python数据分析之简书粉丝敌我差距爬虫分析及代码敌我差距

罗罗攀

发布于 2018-07-03 14:39:30

5210

发布于 2018-07-03 14:39:30

文章被收录于专栏：有趣的Python和你

最近粉丝涨的飞快，已突破3500大关，虽然比起大咖来说，是微乎其微，但看过我简书风云榜的都知道，3500粉丝也能排上前200名（虽然只爬取了20多万的数据）。

但随着粉丝的增长，也担心粉丝的质量问题，我发现许多粉丝都是没有发表任何文字的，我把这些用户定义为非活跃用户（这样太过偏激），今天就已作者本人的粉丝和向右奔跑前辈的粉丝做比较，看下敌我差距~

爬虫分析及代码

简书的原因，这里只能爬取粉丝的前100页，一页就是9个粉丝，总共只能爬取900个粉丝，爬取的字段也是很简单：

粉丝id
关注量
粉丝量
文章数（这里我把没写过文章的定义为非活跃用户）

import requests
from lxml import etree
import pymongo

client = pymongo.MongoClient('localhost', 27017)
jianshu = client['jianshu']
luopan = jianshu['luopan']
xiangyou = jianshu['xiangyou']

urls = ['http://www.jianshu.com/users/54b5900965ea/followers?page={}'.format(str(i)) for i in range(1,101)]
for url in urls:
    html = requests.get(url)
    selector = etree.HTML(html.text)
    infos = selector.xpath('//ul[@class="user-list"]/li')
    if len(infos) > 0:
        for info in infos:
            id = info.xpath('div/a/text()')[0]
            topic = info.xpath('div/div[1]/span[1]/text()')[0].strip('关注 ')
            fans = info.xpath('div/div[1]/span[2]/text()')[0].strip('粉丝 ')
            article = info.xpath('div/div[1]/span[3]/text()')[0].strip('文章 ')
            content = {
                'id':id,
                'topic':topic,
                'fans':fans,
                'article':article
            }
            # print(id,topic,fans,article)
            xiangyou.insert_one(content)
    else:
        break