前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >python爬虫了解第一篇

python爬虫了解第一篇

作者头像
py3study
发布2020-01-02 16:36:36
3400
发布2020-01-02 16:36:36
举报
文章被收录于专栏:python3

爬虫开始

爬虫的实际例子

  • 搜索引擎:关键字匹配提取,前提是要将所有的页面爬一遍,然后存到自己的服务器,当用户惊醒搜索的时候,根据自己的搜索内容,搜索引擎将用户搜索信息返回给用户。
  • 伯乐在线: 文章的搬运工(http://www.jobbole.com/
  • 惠惠购物助手: 谷歌插件,爬到电商平台的价格对比。
  • 数据分析与研究: 某一行业的数据分析(基于实际的数据分析),数据冰山&舆情分析&数据可视化
  • 抢票软件:模拟人点击的操作。

什么是网络爬虫

  • 通俗理解就是: 一个模拟人请求网站的程序,可以自动请求网页并将所定义需求的数据抓取下来,然后提取有价值的数据。

通用爬虫和聚焦爬虫

  • 通用爬虫:类似于搜索引擎抓取系统的重要组成部分。主要将网页信息下载到搜索引擎存储,形成一个互联网内容的镜像备份
  • 聚焦爬虫: 面向特定需求的一种爬虫。会将爬去到的信息进行筛选和处理

准备工具

  • Python3+
  • Pycharm Professional
  • 虚拟环境
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2019/10/11 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 爬虫开始
    • 爬虫的实际例子
      • 什么是网络爬虫
        • 通用爬虫和聚焦爬虫
          • 准备工具
          领券
          问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档