前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >抽取python 标准库页面生成 mob

抽取python 标准库页面生成 mob

作者头像
py3study
发布2020-01-13 11:37:22
4240
发布2020-01-13 11:37:22
举报
文章被收录于专栏:python3

前段时间买了个 kindle ,所以就不想老是开电脑 看 书了。而在学习python 时,看到python 主要的还是熟悉一些库的功能。 所以就想着把标准库给捉下来看。 python 标准库https://docs.python.org/2/library/

下面是一段用来练手的 python 捉取html 内容的代码:

代码语言:javascript
复制
    import urllib2
    import os
    import re



    #打开并保存hmtl
    def save_html(urlname):
      main_url=r'https://docs.python.org/2/library/'
      main_dir=r'E:BOOKpythonpython_library'
      
      url=main_url+urlname+'.html'
      file_name=main_dir+'\' +urlname+'.html'
      try:   
        req=urllib2.urlopen(url)
       
        urlfile=open(file_name,'w')
        urlfile.write(req.read())
      except:
        print url
       
      finally:
        urlfile.close()
       
      

    #保存主页
    save_html('index')


    #正则表达式查找链接并保存对应文件
    req=urllib2.urlopen(r'https://docs.python.org/2/library/index.html')
    p=re.compile(r'''<li class="toctree-.+?"><a class="reference internal" href="(.+?).html">.+?</a></li>''')
    matchs=p.findall(req.read())


    for row in matchs:
      save_html(row)

捉完后,使用了 [ calibre - E-book management ] 把html 转换成mobi 格式的文件。

mobi 下载链接: http://f.dataguru.cn/forum.php?mod=attachment&aid=MTQ5OTQzfDc1Y2MyMDk5fDE0MDgxNzEzNTB8NDQxMTd8MzM3NjMy

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2019/07/23 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档