腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
scrapy-redis
如何将第一个请求实现为post请求
python
、
scrapy
我们知道scrapy_redis可以通过重写start_request函数来实现post请求,那么scrapy呢?
浏览 26
提问于2019-03-18
得票数 0
2
回答
为什么
scrapy-redis
不起作用?
python
、
redis
、
scrapy
、
web-crawler
我从github下载了
scrapy-redis
,并按照说明运行它,但它失败了,并给出了这个错误: 2013-01-04 17:38:50+0800 [-] ERROR: Unhandled error
浏览 0
提问于2013-01-04
得票数 1
回答已采纳
1
回答
Scrapy请求方法
的
meta是浅拷贝,而请求方法
的
meta在scrapy_redis.Why中是深拷贝?
scrapy
response.meta.get('L')输出: L-id: 2769118042568秒 print("L-id:", id(L),"second")第一个L-id: 1338852858312秒这是很深
的
副本
浏览 2
提问于2018-08-17
得票数 4
回答已采纳
1
回答
我是否正确地使用
scrapy-redis
来抓取大量URL?
scrapy
我对分布式scrapy爬虫是个新手,但是我发现了
scrapy-redis
并且一直在使用它。我在一个覆盆子pi上使用它来抓取大量我推送到redis
的
URL。我所做
的
就是在Pi中创建多个SSH会话,然后运行scrapy crawl myspider让爬行器“等待”。然后我启动另一个SSH并执行redis-cli lpush "my links“。然后爬虫运行,尽管我不确定它们实际运行
的
并发程度。 我希望这是清楚
的
,如果没有,请让我知道,我可以澄清。我真的只是在寻找在实现这个基本版本
的</em
浏览 0
提问于2020-07-31
得票数 0
1
回答
如何使用
scrapy-redis
管道?
python
、
redis
、
scrapy
我现在正在使用
scrapy-redis
,我可以使用它,并且我成功地通过使用相同
的
redis服务器在不同
的
计算机上爬行。但我不明白如何正确使用
scrapy-redis
管道。在我
的
理解中,我认为我需要另一个脚本而不是爬行器来处理redis管道列表中
的
项,然后我可以做一些事情,比如将它们存储到数据库中。
浏览 13
提问于2017-07-31
得票数 0
2
回答
scrapy被redis阻塞
python
、
redis
、
scrapy
、
yield
我使用一个抓取
的
爬虫来充当消费者,也有一个生产者来产生urls并不定期地将它们放在redis中,我
的
代码如下: def start_requests(self): for msg in self.redis_sub.listenpageCount': pageCount, 'id': id, 'dont_redirect': True}) 代码可以正常接收urls,但是当它阻塞在第二行等待urls时,所有的scrapy都会暂停,包括之前产生
的
请求我想它应该继续运行旧
的</e
浏览 52
提问于2019-01-23
得票数 0
回答已采纳
1
回答
scrapy_redis停止我
的
蜘蛛在x次空闲之后
python
、
web-scraping
、
redis
、
scrapy
我有一个scrapy_redis蜘蛛池,它侦听红色队列(蜘蛛
的
数量并不总是相同
的
)。这个队列由另一个脚本提供。我希望我
的
蜘蛛在没有活动
的
X分钟后停下来,那时红色
的
队列里什么都没有了。我在我
的
settings.py中设置了settings.py,但它似乎不起作用。这是我
的
settings.pyDUPEFILTER_CLASS = "scrapy_r
浏览 2
提问于2017-04-21
得票数 4
1
回答
如何顺利地重启
scrapy-redis
蜘蛛?
scrapy
、
web-crawler
、
resume
我用
scrapy-redis
写了一个简单
的
爬虫来制作分布式蜘蛛。当我启动两只蜘蛛,然后把它们都杀死时,我发现了这点。redis队列只留下了‘dupfilter’队列。
浏览 0
提问于2016-05-30
得票数 0
1
回答
如何从redis获得一个正常
的
url,而不是通过url cPikle转换?
python
、
redis
、
scrapy
、
scrapy-spider
、
scrapy-pipeline
我使用scrapy简单地构建了一个分布式爬虫,从机器需要读取url形式
的
主队列url,但是有一个问题是,我到达url从机器是在cPikle转换后
的
数据,我想从redis- url队列中获得url是正确
的
)MySpider继承了RedisSpider,当我运行scrapy runspider myspider_redis.py时,它不是合法
的
url
浏览 5
提问于2016-03-21
得票数 1
回答已采纳
2
回答
scrapy程序不会自动关闭。
python
、
redis
、
scrapy
、
web-crawler
2017-08-07 09:17:06 [scrapy.extensions.logstats] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items (at 0 items/min) 2017-08-07 09:18:06 [scrapy.extensions.logstats] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items
浏览 4
提问于2017-08-07
得票数 1
回答已采纳
1
回答
如何让scrapy使用两个队列来管理urls?
python
、
redis
、
scrapy
、
priority-queue
我想用scrapy框架和
scrapy-redis
库做一个有针对性
的
分布式爬虫。这里我需要两个队列,一个称为prior_queue,另一个是urls_queue.Both queues,它根据请求
的
得分来维护排序后
的
请求。所有产生
的
请求都被推送到urls_queue中。有了这样
的
要求,有没有人可以给我一些解决方案或想法来实现它呢?我应该修改哪些scrapy模块来满足我
的
需求?
浏览 14
提问于2018-08-23
得票数 0
1
回答
Scrapy将变量与URL一起发送到爬行器
python
、
scrapy
、
web-crawler
、
bots
、
scrapy-spider
我正在使用创建一个从Redis列表中读取URL
的
爬行器。我
的
问题是,我想发送一个唯一
的
ID与每一个网址。这样我就可以再次识别数据库中
的
条目。我
的
redis列表是这样
的
: self.guid = mm[1].replace("]", "") return self.make_requests_from_u
浏览 1
提问于2016-02-26
得票数 0
2
回答
Scrapy-Redis
中
的
Dupefilter没有按预期工作。
python
、
redis
、
scrapy
我感兴趣
的
是使用来存储在Redis中刮过
的
物品。特别是,似乎是一个有用
的
特性。使用”部分中
的
设置,并使蜘蛛yield成为Item对象,而不是普通
的
Python字典。(我认为这是触发所必需
的
)。:items"127.0.0.1:6379> llen quotes:items如果我再次运行scrapy crawl quotes,列表
的
长度将加倍到40: 127.0.0.1:6379&
浏览 25
提问于2017-05-04
得票数 1
回答已采纳
1
回答
将刮伤改为刮红后,启动url头改变。
scrapy
、
header
我有一个刮伤项目,我想将它修改为scrapy :主要
的
刮伤文件如下: name = 'ScrapyBot' )Ac
浏览 2
提问于2022-03-29
得票数 0
0
回答
如何将post参数推送到
scrapy-redis
python-3.x
、
redis
、
scrapy
:我可以使用redis-cli lpush保存post参数并让我
的
爬虫运行它吗
浏览 4
提问于2016-12-29
得票数 0
2
回答
我应该把db/redis连接绑定到什么地方?
python
、
web-scraping
、
scrapy
、
web-crawler
、
scrapy-pipeline
这是个糟糕
的
问题,似乎真正让我困惑
的
是ItemPipeline是如何在刮刮中工作
的
。我会结束它,开始一个新
的
问题。我应该将db/redis连接绑定到scrapy、Spider或Pipeline
的
哪个位置。那么,哪种方法更好呢? 我对管道并行运行感到困惑
浏览 5
提问于2020-07-10
得票数 1
回答已采纳
1
回答
Scrapy中
的
持久重复过滤
python
、
redis
、
scrapy
、
web-scraping
我刚刚开始使用scrapy,我想要一种方法来持久化以前爬行过
的
URL,这样我就可以运行后续
的
抓取,并且只能从未知
的
URL获取新
的
数据。我看到了几种不同
的
方法来过滤重复
的
数据和几种持久化数据
的
方法。我想知道在0.24版本中进行这些活动
的
推荐方法是什么。以下是我所看到
的
选择:在文档中仍然引用
的
DUPEFILTER_CLASS文件中有settings.py。我还看到了一些文档,指的是在I
浏览 2
提问于2014-07-25
得票数 3
1
回答
如何设置
scrapy-redis
设置以密码连接远程redis-server?
redis
、
scrapy
、
remote-access
、
remote-server
NOAUTH Authentication required. REDIS_URL = 'redis://:aaaaaaaa@111.111.111.111:12000/0' 但是我发现redis
的
数据被保存到本地主机
浏览 0
提问于2017-11-23
得票数 0
0
回答
ImportError: No module named 'distutils.version'?
python
、
云数据库 Redis®
、
编程算法
、
爬虫
from distutils.version import StrictVersionLocation: c:\users\youziku\appdata\roaming\python\python36\site-packagesRequired-by:
scrapy-redis
浏览 678
提问于2020-06-01
3
回答
将抓取
的
URL从一个爬虫传递到另一个爬虫
python
、
xml
、
web-scraping
、
scrapy
如何将抓取
的
网址从一个爬行器发送到另一个爬行器
的
start_urls? 具体地说,我想运行一个从XML页面获取URL列表
的
爬行器。在URL被检索后,我希望它们被另一个爬行器用来抓取。
浏览 30
提问于2017-02-23
得票数 2
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
实时音视频
即时通信 IM
活动推荐
运营活动
广告
关闭
领券