前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >python的Gzip模块

python的Gzip模块

作者头像
狼啸风云
修改2022-09-03 22:06:30
3.2K0
修改2022-09-03 22:06:30
举报

Gzip模块为python的压缩和解压缩模块,读写gzip 文件

一、使用gzip模块压缩文件:

代码语言:javascript
复制
import gzip #导入python gzip模块,注意名字为全小写
g = gzip.GzipFile(filename="", mode="wb", compresslevel=9, fileobj=open('sitemap.log.gz', 'wb'))#filename参数是压缩文件内文件的名字,为空也可以。fileobj是生成的压缩文件对象
g.write(open('d:\\test\\sitemap.xml').read())
g.close()

二、使用gzip解压缩文件:

代码如下:

代码语言:javascript
复制
g = gzip.GzipFile(mode="rb", fileobj=open('d:\\test\\sitemap.log.gz', 'rb')) # python gzip 解压
open(r"d:\\haha.xml", "wb").write(g.read())

三、实际应用:

在实际应用中,例如在爬取网页的过程中,我们检查网页源代码的head头部信息发现,是结果gzip压缩处理的,所以在显示过程中显示不完全,例如:

我们要抓取指定url的源代码

代码语言:javascript
复制
#-*-coding:utf8 -*-
import urllib2
from lxml import etree


request = urllib2.Request('http://outofmemory.cn/')

response = urllib2.urlopen(request)

print data.text()

发现显示出的源代码是经过压缩的数据

此时我们需要对齐进行解压操作,最终代码入下:

代码语言:javascript
复制
#-*-coding:utf8 -*-
import urllib2
from lxml import etree
from StringIO import StringIO  #StringIO模块就是在内存中读写str
import gzip  #加压缩文件
request = urllib2.Request('http://outofmemory.cn/')
request.add_header('Accept-encoding', 'gzip') #添加头信息
response = urllib2.urlopen(request)
if response.info().get('Content-Encoding') == 'gzip':
    buf = StringIO( response.read()) #将读取的response信息作为stringIO方便后面作为文件写入
    f = gzip.GzipFile(fileobj=buf)  #解压缩response
    data = f.read()
print data
本文参与 腾讯云自媒体分享计划,分享自作者个人站点/博客。
原始发表:2019年08月28日,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 一、使用gzip模块压缩文件:
  • 二、使用gzip解压缩文件:
  • 三、实际应用:
相关产品与服务
文件存储
文件存储(Cloud File Storage,CFS)为您提供安全可靠、可扩展的共享文件存储服务。文件存储可与腾讯云服务器、容器服务、批量计算等服务搭配使用,为多个计算节点提供容量和性能可弹性扩展的高性能共享存储。腾讯云文件存储的管理界面简单、易使用,可实现对现有应用的无缝集成;按实际用量付费,为您节约成本,简化 IT 运维工作。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档