前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >Python爬虫之BeautifulSoup

Python爬虫之BeautifulSoup

作者头像
YungFan
发布2018-05-03 14:58:08
8720
发布2018-05-03 14:58:08
举报
文章被收录于专栏:学海无涯学海无涯

上一篇博文中提到用正则表达式来匹配数据项,但是写起来容易出错,如果有过DOM开发经验或者使用过jQuery的朋友看到BeautifulSoup就像是见到了老朋友一样。

安装BeautifulSoup

Mac安装BeautifulSoup很简单,打开终端,执行以下语句,然后输入密码即可安装

代码语言:javascript
复制
sudo easy_install beautifulsoup4
改代码
代码语言:javascript
复制
#coding=utf-8
import urllib
from bs4 import BeautifulSoup

# 定义个函数 抓取网页内容
def getHtml(url):
    webPage = urllib.urlopen(url)
    html = webPage.read()
    return html

# 定义一个函数 抓取网页中的图片
def getNewsImgs(html):
    # 创建BeautifulSoup
    soup = BeautifulSoup(html, "html.parser")
    # 查找所有的img标签
    urlList = soup.find_all("img")
    length = len(urlList)
    # 遍历标签 下载图片
    for i in range(length):
        imgUrl =  urlList[i].attrs["src"]
        urllib.urlretrieve("http://www.abc.edu.cn/news/"+imgUrl,'news-%s.jpg' % i)

# 获取网页
html = getHtml("http://www.abc.edu.cn/news/show.aspx?id=21430&cid=5")
# 抓取图片
getNewsImgs(html)
效果:换了一个新闻,抓取了新闻中的三张图片O(∩_∩)O~

爬虫抓图片.gif

本文参与 腾讯云自媒体分享计划,分享自作者个人站点/博客。
原始发表:2017.06.14 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 安装BeautifulSoup
  • 改代码
  • 效果:换了一个新闻,抓取了新闻中的三张图片O(∩_∩)O~
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档