专栏首页python学习指南Python爬虫(九)_非结构化数据与结构化数据

Python爬虫(九)_非结构化数据与结构化数据

爬虫的一个重要步骤就是页面解析与数据提取。更多内容请参考:Python学习指南

页面解析与数据提取

实际上爬虫一共就四个主要步骤:

  1. 定(要知道你准备在哪个范围或者网站去搜索)
  2. 爬(将所有的网站的内容全部爬下来)
  3. 取(分析数据,去掉对我们没用处的数据)
  4. 存(按照我们想要的方式存储和使用)
  5. 表(可以根据数据的类型通过一些图标展示)

以前学的就是如何从网站去爬数据,而爬下来的数据却没做分析,现在,就开始对数据做一些分析。

数据,可分为非结构化数据结构化数据

  • 非结构化数据:先有数据,再有结构
  • 结构化数据:先有结构,再有数据
  • 不同类型的数据,我们需要采用不同的方式来处理

非结构化的数据处理

文本、电话号码、邮箱地址

  • 正则表达式Python正则表达式

HTML文件

  • 正则表达式
  • XPath
  • CSS选择器

结构化的数据处理

JSON文件

  • JSON Path
  • 转化为Python类型进行操作(json类)

XML文件

  • 转化为Python类型(xmltodict)
  • XPath
  • CSS选择器
  • 正则表达式

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

我来说两句

0 条评论
登录 后参与评论

相关文章

  • Elasticsearch--配置文件

    config目录下有2个配置文件:es的配置文件:elasticsearch.yml日志配置文件:logging.yml,更多内容请参考:ELK教程 c...

    用户1174963
  • Elasticsearch--配置文件

    config目录下有2个配置文件:es的配置文件:elasticsearch.yml日志配置文件:logging.yml,更多内容请参考:ELK教程 c...

    用户1174963
  • Python网络_UDP编程

    本章将介绍UDP编程,更多内容请参考:Python学习指南 TCP是建立可靠连接,并且通信双方都可以以流的形式发送数据。相对TCP连接,UDP则是面向无连接的...

    用户1174963
  • 大数据的10个常见误解,带你走出思维误区

    如果数据有一点点就不错了,那么数据是海量的话就一定棒极了,对不对?这就好比说, 如果一个炎日夏日里的微风让你感觉凉爽,那么你会为一阵一阵的凉风感到欣喜若狂。 也...

    CSDN技术头条
  • 微软数据科学负责人:数据不是现实,“数据驱动”会导致很多问题

    编者按:数据已经成为我们个人生活、业务和工作中越来越重要的一个部分。那些需要花时间解决棘手问题的人将依靠数据来帮助他们理解这个世界,并有所创新。本文作者 Bil...

    企鹅号小编
  • 数据库系统的特点

    爱学习的孙小白
  • 湖北跨平台大数据可视化工具,波若大数据平台如何实现数据轻松采集?

    数据可视化,是关于数据视觉表现形式的科学技术研究。数据可视化是指以图形或图表格式通过人工或以其他方式组织和显示数据,以使受众能够更清楚地查看分析结果、简化正在使...

    数道云大数据
  • Google首席决策师告诉你数据科学究竟是什么?

    因此,数据科学诞生了。最开始数据科学家的的定义是“能够编程的统计学家”。如今看来,这个说法并不准确,但首先让我们看到数据科学本身。

    CDA数据分析师
  • 刘晨:大数据怎能没有你--数据治理

    大数据文摘
  • 不仅要清楚如何收集数据,还要清楚如何创造数据

    业界估计数据每年的增长率在30%到50%之间,对于许多企业来说,每年将增长上PB的数据量。问题显然不是缺少数据,而是缺少“正确”的数据。 根据埃森哲近期的调查显...

    CDA数据分析师

扫码关注云+社区

领取腾讯云代金券