前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >python使用scrapy-pyppeteer中间件使用代理IP

python使用scrapy-pyppeteer中间件使用代理IP

作者头像
小白学大数据
发布2024-06-08 18:00:09
560
发布2024-06-08 18:00:09
举报
文章被收录于专栏:python进阶学习python进阶学习

要提高scrapy-pyppeteer的效率,可以考虑以下几个方面:

  • 减少不必要的页面操作,如滚动、点击等,只执行对数据抓取有用的操作。
  • 使用pyppeteer_page_coroutines参数传入一个可排序的迭代器(如列表、元组或字典),指定在返回响应之前需要在页面上执行的协程。这样可以避免多次调用page.evaluate方法。
  • 设置合理的并发数和下载延迟,避免过多的请求导致浏览器崩溃或被目标网站封禁。
  • 使用缓存或增量爬取,避免重复爬取相同的页面。
代码语言:javascript
复制
# settings.py
# -*- coding: utf-8 -*-

Sydney = 'scrapy_pyppeteer'

SPIDER_MODULES = ['scrapy_pyppeteer.spiders']
NEWSPIDER_MODULE = 'scrapy_pyppeteer.spiders'

# 设置下载中间件
DOWNLOADER_MIDDLEWARES = {
    'scrapy_pyppeteer.middlewares.PyppeteerMiddleware': 543,
    'scrapy_pyppeteer.middlewares.RandomUserAgentMiddleware': 544,
}

# 设置请求头
DEFAULT_REQUEST_HEADERS = {
    'Accept': '*/*',
    'Accept-Language': 'en',
}

# 设置日志级别
LOG_LEVEL = "DEBUG"

# 设置pyppeteer启动选项
PYPPETEER_LAUNCH_OPTIONS = {
    # 是否显示浏览器界面,默认False
    "headless": False,
    # 是否忽略HTTPS错误,默认False
    "ignoreHTTPSErrors": True,
    # 添加代理服务器的地址,格式为host:port或protocol://host:port
    "args": ["--proxy-server=www.16yun.cn:31111"]
}

# 设置并发数,默认16
CONCURRENT_REQUESTS = 8

# 设置下载延迟,默认0秒
DOWNLOAD_DELAY = 1

# 启用缓存,默认False
HTTPCACHE_ENABLED = True
代码语言:javascript
复制
# middlewares.py
# -*- coding: utf-8 -*-
import asyncio

import pyppeteer

from scrapy import signals, Request, Spider, http


class PyppeteerMiddleware:
    # 定义一个类属性browser,表示浏览器对象
    browser: pyppeteer.browser.Browser

    @classmethod
    def from_crawler(cls, crawler):
        # 创建中间件实例,并传入crawler对象作为参数
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2024-04-15,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
相关产品与服务
消息队列 TDMQ
消息队列 TDMQ (Tencent Distributed Message Queue)是腾讯基于 Apache Pulsar 自研的一个云原生消息中间件系列,其中包含兼容Pulsar、RabbitMQ、RocketMQ 等协议的消息队列子产品,得益于其底层计算与存储分离的架构,TDMQ 具备良好的弹性伸缩以及故障恢复能力。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档