Loading [MathJax]/jax/output/CommonHTML/config.js
前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
圈层
工具
发布
首页
学习
活动
专区
圈层
工具
社区首页 >专栏 >scrapy 也能爬取妹子图 ?

scrapy 也能爬取妹子图 ?

作者头像
小小詹同学
发布于 2019-11-12 09:02:38
发布于 2019-11-12 09:02:38
6520
举报
文章被收录于专栏:小詹同学小詹同学

本文授权转载自公众号:zone7

目录

  • 前言
  • Media Pipeline
  • 启用Media Pipeline
  • 使用 ImgPipeline
  • 抓取妹子图
  • 瞎比比与送书后话

前言

我们在抓取数据的过程中,除了要抓取文本数据之外,当然也会有抓取图片的需求。那我们的 scrapy 能爬取图片吗?答案是,当然的。说来惭愧,我也是上个月才知道,在 zone7 粉丝群中,有群友问 scrapy 怎么爬取图片数据?后来搜索了一下才知道。现在总结一下分享出来。

Media Pipeline

我们的 itempipeline 处理可以处理文字信息以外,还可以保存文件和图片数据,分别是 FilesPipeline 和 ImagesPipeline

Files Pipeline
  • 避免重新下载最近已经下载过的数据
  • 指定存储路径
FilesPipeline的典型工作流程如下:
  • 在一个爬虫里,你抓取一个项目,把其中图片的URL放入 file_urls 组内。
  • 项目从爬虫内返回,进入项目管道。
  • 当项目进入 FilesPipeline,file_urls 组内的URLs将被Scrapy的调度器和下载器(这意味着调度器和下载器的中间件可以复用)安排下载,当优先级更高,- - 会在其他页面被抓取前处理。项目会在这个特定的管道阶段保持“locker”的状态,直到完成文件的下载(或者由于某些原因未完成下载)。
  • 当文件下载完后,另一个字段(files)将被更新到结构中。这个组将包含一个字典列表,其中包括下载文件的信息,比如下载路径、源抓取地址(从 file_urls 组获得)和图片的校验码(checksum)。 files 列表中的文件顺序将和源 file_urls 组保持一致。如果某个图片下载失败,将会记录下错误信息,图片也不会出现在 files 组中。
Images Pipeline
  • 避免重新下载最近已经下载过的数据
  • 指定存储路径
  • 将所有下载的图片转换成通用的格式(JPG)和模式(RGB)
  • 缩略图生成
  • 检测图像的宽/高,确保它们满足最小限制

启用Media Pipeline

# 同时启用图片和文件管道 ITEM_PIPELINES = { # 使用时,请修改成你自己的 ImgPipeline 'girlScrapy.pipelines.ImgPipeline': 1, } FILES_STORE = os.getcwd() + '/girlScrapy/file' # 文件存储路径 IMAGES_STORE = os.getcwd() + '/girlScrapy/img' # 图片存储路径 # 避免下载最近90天已经下载过的文件内容 FILES_EXPIRES = 90 # 避免下载最近90天已经下载过的图像内容 IMAGES_EXPIRES = 30 # 设置图片缩略图 IMAGES_THUMBS = { 'small': (50, 50), 'big': (250, 250), } # 图片过滤器,最小高度和宽度,低于此尺寸不下载 IMAGES_MIN_HEIGHT = 128 IMAGES_MIN_WIDTH = 128

需要说明的是,你下载的图片名最终会以图片 URL 的 hash 值命名,例如:

0bddea29939becd7ad1e4160bbb4ec2238accbd9.jpg

最终的保存地址为:

your/img/path/full/0bddea29939becd7ad1e4160bbb4ec2238accbd9.jpg

使用 ImgPipeline

这是我 demo 中的一个 ImgPipeline,里面重写了两个方法。

from scrapy.pipelines.images import ImagesPipeline class ImgPipeline(ImagesPipeline):#继承 ImagesPipeline 这个类 def get_media_requests(self, item, info): for image_url in item['image_urls']: image_url = image_url yield scrapy.Request(image_url) def item_completed(self, results, item, info): image_paths = [x['path'] for ok, x in results if ok] if not image_paths: raise DropItem("Item contains no images") return item

分别是:

get_media_requests(self, item, info): item_completed(self, results, item, info):

get_media_requests(self, item, info):

在这里,我们可以获取到 parse 中解析的 item 值,因此我们可以获取到相应的图片地址。在这里返回一个 scrapy.Request(image_url) 去下载图片。

item_completed(self, results, item, info):

item 和 info 打印出来都是 url 地址列表。其中 results 打印出来是如下值。

# 成功 [(True, {'path': 'full/0bddea29939becd7ad1e4160bbb4ec2238accbd9.jpg', 'checksum': '98eb559631127d7611b499dfed0b6406', 'url': 'http://mm.chinasareview.com/wp-content/uploads/2017a/06/13/01.jpg'})] # 错误 [(False, Failure(...))]

抓取妹子图

ok,理论部分也讲完了,那我们来实践一下吧

spider

spider 部分很简单,如下:

class GirlSpider(scrapy.spiders.Spider): name = 'girl' start_urls = ["http://www.meizitu.com/a/3741.html"] def parse(self, response): soup = BeautifulSoup(response.body, 'html5lib') pic_list = soup.find('div', id="picture").find_all('img') # 找到界面所有图片 link_list = [] item = ImgItem() for i in pic_list: pic_link = i.get('src') # 拿到图片的具体 url link_list.append(pic_link) # 提取图片链接 item['image_urls'] = link_list print(item) yield item

item

class ImgItem(scrapy.Item): image_urls = scrapy.Field()#图片的链接 images = scrapy.Field()

ImgPipeline

class ImgPipeline(ImagesPipeline):#继承 ImagesPipeline 这个类 def get_media_requests(self, item, info): for image_url in item['image_urls']: image_url = image_url yield scrapy.Request(image_url) def item_completed(self, results, item, info): image_paths = [x['path'] for ok, x in results if ok] if not image_paths: raise DropItem("Item contains no images") return item

启动

scrapy crawl girl

最终爬取结果如下:

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2018-12-17,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 小詹学Python 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
暂无评论
推荐阅读
编辑精选文章
换一批
用Scrapy爬取汽车之家的网站图片就是爽
本文将介绍如何使用scrapy框架来快速爬取某网站汽车的图片,并将爬取到的图片保存到本地。
码农飞哥
2022/03/31
1.3K0
用Scrapy爬取汽车之家的网站图片就是爽
毕业设计(四):多页爬取和数据持久化
上次说到电视剧的列表信息是通过Ajax网络请求获取到数据的,当我们打开页面的时候,页面再向另一地址发出请求,得到数据后再渲染到网页上,我们是在network中找到的目标url。所以说,当我们想要爬取第二页,第三页以后的内容所要请求的url都可以在network中找到。
Cloud-Cloudys
2020/07/06
2940
scrapy爬取1024种子
1024不必多说,老司机都懂,本文介绍scrapy爬取1024种子,代码不到50行!Scrapy,Python开发的一个快速、高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据。Scrapy用途广泛,可以用于数据挖掘、监测和自动化测试。 关于scrapy用下图来说明即可(图片来自https://cuiqingcai.com/3472.html )
LiosWong
2019/03/14
3.1K0
scrapy爬取1024种子
(原创)Scrapy爬取美女图片续集
上一篇咱们讲解了Scrapy的工作机制和如何使用Scrapy爬取美女图片,而今天接着讲解Scrapy爬取美女图片,不过采取了不同的方式和代码实现,对Scrapy的功能进行更深入的运用。 在学习Sc
七夜安全博客
2018/06/21
1.8K1
Scrapy爬取妹子图
本来呢,一开始想爬取的是这个网站,http://www.mzitu.com/,但是呢?问题发现比较多,所以先爬取了http://www.meizitu.com/这个网站,下一步再去爬取第一个。 Gi
听城
2018/04/27
1.6K0
Scrapy爬取妹子图
Scrapy之FilesPipeline和ImagesPipline文件与图片下载
Scrapy为下载item中包含的文件(比如在爬取到产品时,同时也想保存对应的图片)提供了一个可重用的 item pipelines . 这些pipeline有些共同的方法和结构(称之为media pipeline)。我们可以使用FilesPipeline和Images Pipeline来保存文件和图片,他们有以下的一些特点:
菲宇
2019/06/13
3.2K0
Scrapy之FilesPipeline和ImagesPipline文件与图片下载
一日一技:如何正确使用 Scrapy 自带的 FilesPipeline?
Scrapy自带的 FilesPipeline和ImagesPipeline用来下载图片和文件非常方便,根据它的官方文档[1]说明,我们可以很容易地开启这两个 Pipeline。
青南
2021/01/05
2.8K0
一日一技:如何正确使用 Scrapy 自带的 FilesPipeline?
想要快速爬取整站图片?速进(附完整代码)
图片地址:https://car.autohome.com.cn/pic/series/65.html
不温卜火
2020/10/28
7980
想要快速爬取整站图片?速进(附完整代码)
scrapy爬虫框架(三):爬取壁纸保存并命名
首先我们先分析网页结构,打开网址:http://desk.zol.com.cn/dongman/1920x1080/
渔父歌
2018/09/26
6060
爬虫小白:11.scrapy框架(六) _媒体管道
直接使用ImagePipeline类 , 所有的图片都是保存在 full文件夹下:
见贤思齊
2020/08/05
9030
爬虫小白:11.scrapy框架(六) _媒体管道
Scrapy框架之批量下载360妹纸图
0.导语1.项目初始化2.定义存储结构3.Spider核心代码4.pipeline下载及存储5.json知识
公众号guangcity
2019/09/20
5430
Scrapy框架之批量下载360妹纸图
Python:Scrapy实战项目手机App抓包爬虫
1. items.py class DouyuspiderItem(scrapy.Item): name = scrapy.Field()# 存储照片的名字 imagesUrls = scrapy.Field()# 照片的url路径 imagesPath = scrapy.Field()# 照片保存在本地的路径 2. spiders/douyu.py import scrapy import json from douyuSpider.items import Douyuspider
Lansonli
2021/10/09
6430
python scrapy爬虫练习(1) 爬取豆瓣电影top250信息
文章目录 一、分析网页 目标URL:https://movie.douban.com/top250?start=0&filter= 每一页有25条电影信息,总共10页。检查网页可以发现,每条电影的详细
叶庭云
2020/09/17
5.1K0
python  scrapy爬虫练习(1)   爬取豆瓣电影top250信息
scrapy爬虫笔记(2):提取多页图片并下载至本地
所以只需要构造一下传入的url即可,例如需要爬取10页图片,则 url 后缀需要从1遍历至10
冰霜
2022/03/15
7070
scrapy爬虫笔记(2):提取多页图片并下载至本地
python爬虫 scrapy爬虫框架的基本使用
在编写爬虫的时候,如果我们使用 requests、aiohttp 等库,需要从头至尾把爬虫完整地实现一遍,比如说异常处理、爬取调度等,如果写的多了,的确会比较麻烦。利用现有的爬虫框架,可以提高编写爬虫的效率,而说到 Python 的爬虫框架,Scrapy 当之无愧是最流行最强大的爬虫框架了。
叶庭云
2020/09/17
1.6K0
爬虫课堂(二十一)|使用FilesPipeline和ImagesPipeline下载文件和图片
在上一章节,我们学会了使用Item Pipeline处理数据,而有时候我们可能需要下载爬虫网站中的文件信息,比如图片、视频、WORD文档、PDF文档、压缩包等。 Scrapy提供了两个Item Pipeline来下载文件和图片,它们分别是FilesPipeline和ImagesPipeline。 一、FilesPipeline和ImagesPipeline 这两个管道都实现了: 避免重复下载。 可以指定下载后保存的目录。 图片也是文件,下载图片本质上也是下载文件,Images Pipeline是Fil
黄小怪
2018/05/21
1.1K0
#Python爬虫#Item Pipeline介绍(附爬取网站获取图片到本地代码)
当spider爬取到item后,它被发送到项目管道(Item Pipeline),通过几个组件按顺序进行处理。每一个Item Pipeline是一个实现了简单方法的Python类,它接收到一个item并对其执行一个操作,也要决定该item是否应该继续通过管道,或者被丢弃,不再进行处理。
程序员迪迪
2022/01/06
1.3K0
Scrapy笔记五 爬取妹子图网的图片 详细解析
这部分相当有用,咱们不多说,目前是2016.6.22日亲测可用.环境方面是linux_ubuntu_15.04 python_scrapy的环境搭建有问题请看之前的scrapy笔记
十四君
2019/11/27
6190
Scrapy框架之利用ImagesPipeline下载图片
版权声明:本文为博主原创文章,未经博主允许不得转载。 https://blog.csdn.net/sinat_35512245/article/details/72802184
大黄大黄大黄
2018/09/14
3.1K0
Scrapy框架之利用ImagesPipeline下载图片
学会运用爬虫框架 Scrapy (四) —— 高效下载图片
爬虫程序爬取的目标通常不仅仅是文字资源,经常也会爬取图片资源。这就涉及如何高效下载图片的问题。这里高效下载指的是既能把图片完整下载到本地又不会对网站服务器造成压力。也许你会这么做,在 pipeline 中自己实现下载图片逻辑。但 Scrapy 提供了图片管道ImagesPipeline,方便我们操作下载图片。
猴哥yuri
2018/08/16
7470
推荐阅读
相关推荐
用Scrapy爬取汽车之家的网站图片就是爽
更多 >
领券
社区富文本编辑器全新改版!诚邀体验~
全新交互,全新视觉,新增快捷键、悬浮工具栏、高亮块等功能并同时优化现有功能,全面提升创作效率和体验
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档