当发生这种情况时,它会在响应中给出一个403 status code。如果IP地址不更新,crawler将使以下所有请求失败。因此我添加了一个HTTP代理,它是一个托管数百个IP的集线器,并为每个TCP连接分配一个随机的IP。Scrapy,它默认使用持久连接,这意味着它将对每个连接使用相同的代理IP: class TestSpider(scrapy.Spider): allowed_domains.199
我正在运行25个刮擦作业,每个任务在一台重型机器上都有50个并发请求(使用Ubuntu12.04.3LTS)。我正在使用代理发送请求。大约15分钟后,我从几乎所有的请求中得到了这个错误:
Connection was refused by other side: 111: Connection refused.Ubuntu有连接限制吗?