前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >pyquery爬取知乎发现

pyquery爬取知乎发现

作者头像
松鼠先生
发布2022-02-22 14:47:16
7150
发布2022-02-22 14:47:16
举报
代码语言:javascript
复制
 import requests 
from pyquery import PyQuery as pq 
url = 'https://www.zhihu.com/explore' 
headers = {'User-Agent' : '*******'} 
html = requests.get(url, headers=headers).text 
doc = pq(html) 
items = doc('.explore-feed.feed-item').items() 
for item in items: 
question = item.find('h2').text() 
author = item.find('.author-link').text() 
answer = pq(item.find('.content').html()).text() 
  file = open('explore.txt', 'a', encoding='utf-8') 
  file.write('\n'.join([question, author, answer])) 
  file.write('\n' + '='*50 + '\n') 
 file.close()

是的,崔大佬书上的例子,但是因为知乎更改网页标题,所以其中有更改。

answer = pq(item.find('.content').html()).text()

此句是提取完整回答是个动态,还不懂。以后回来补上。。

这里.html()其实是返回网页模块。认真看了一下。这个class=content的网页标签里面就是回答的全部。但是里面有html的格式。所以崔大佬在这里应该是返回回答的完整内容,再用一个pq初始化,直接提取内容,而将文字格式丢弃。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档