前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >Python爬取糗事百科段子

Python爬取糗事百科段子

作者头像
北山啦
发布2022-11-27 13:39:58
3070
发布2022-11-27 13:39:58
举报
文章被收录于专栏:北山啦的博客北山啦的博客

Python爬取糗事百科段子


糗事百科是一个原创的糗事笑话分享社区,糗百网友分享的搞笑段子,使用Python爬取段子

在这里插入图片描述
在这里插入图片描述

翻页操作

代码语言:javascript
复制
http://www.qiushibaike.com/text/
http://www.qiushibaike.com/text/page/2/?s=4964629
http://www.qiushibaike.com/text/page/3/?s=4964629
http://www.qiushibaike.com/text/page/4/?s=4964629

观察可知,我们只需要修改page/{i}参数即可

这里使用正则表达式来提取数据

代码语言:javascript
复制
import requests
import re
from fake_useragent import UserAgent
headers= {'User-Agent':str(UserAgent().random)}

def get_info(url):
    res = requests.get(url,headers=headers)
    ids = re.findall('<h2>(.*?)</h2>',res.text,re.S)
    levels = re.findall('<div class="articleGender \D+Icon">(.*?)</div>',res.text,re.S)
    contents = re.findall('<div class="content">.*?<span>(.*?)</span>',res.text,re.S)
    laughs = re.findall('<span class="stats-vote"><i class="number">(\d+)</i>',res.text,re.S)
    comments = re.findall('<i class="number">(\d+)</i> 评论',res.text,re.S)
    for id,level,sex,content,laugh,comment in zip(ids,levels,sexs,contents,laughs,comments):
        info = {
            'id':id,
            'level':level,
            'content':content,
            'laugh':laugh,
            'comment':comment
        }
        print(info)

if __name__ == '__main__':
    urls = ['http://www.qiushibaike.com/text/page/{}/'.format(str(i)) for i in range(1,15)]
    for url in urls:
        get_info(url)
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2021-03-05,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • Python爬取糗事百科段子
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档