首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >python爬虫爬取赶集网数据

python爬虫爬取赶集网数据

作者头像
py3study
发布2020-01-16 00:26:17
5360
发布2020-01-16 00:26:17
举报
文章被收录于专栏:python3python3

一.创建项目

scrapy startproject putu

二.创建spider文件

scrapy genspider  patubole patubole.com

三.利用chrome浏览器分析出房价和标题的两个字段的xpath表达式,开始编写patubole.py文件。网络的爬取是通过这个文件进行的

以下代码是最终的代码

所建的patubole.py文件必须实现name,parse函数,start_url这三个属性

四.将爬取的数据保存到数据库sufang中。

(1)在pycharm中新建数据库

完成后会出现

(2)将数据存放在新建的数据库zufang的数据表sufang中

数据的爬取是有patubole.py实现的,数据的存储是由pipelines.py实现的,pipelines.py又是有items.py提供数据的支持

所以编写items.py

此时就要回过头来修改刚开是为了测试编写的patubole.py 文件

代码如下

3)在settings.py中进行PatuPipeline文件配置

ITEM_PIPELINES = {

      'patu.pipelines.PatuPipeline': 300,

 }

(5)pipelines.py文件代码,实现存储数据到数据库中

其中包含SQL的相关知识

最终结果

 其中main.py文件是为了调式方便而添加的,可以不用,直接用相关命令启动爬虫

本文参与 腾讯云自媒体分享计划,分享自作者个人站点/博客。
原始发表:2019-05-27 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 一.创建项目
相关产品与服务
数据库
云数据库为企业提供了完善的关系型数据库、非关系型数据库、分析型数据库和数据库生态工具。您可以通过产品选择和组合搭建,轻松实现高可靠、高可用性、高性能等数据库需求。云数据库服务也可大幅减少您的运维工作量,更专注于业务发展,让企业一站式享受数据上云及分布式架构的技术红利!
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档