抽取python 标准库页面生成 mob

发布时间：2019-07-23 09:45:28编辑：auto阅读（1928）

前段时间买了个 kindle ，所以就不想老是开电脑看书了。而在学习python 时，看到python 主要的还是熟悉一些库的功能。
所以就想着把标准库给捉下来看。

python 标准库：https://docs.python.org/2/library/

下面是一段用来练手的 python 捉取html 内容的代码：

    import urllib2
    import os
    import re



    #打开并保存hmtl
    def save_html(urlname):
      main_url=r'https://docs.python.org/2/library/'
      main_dir=r'E:BOOKpythonpython_library'
      
      url=main_url+urlname+'.html'
      file_name=main_dir+'\' +urlname+'.html'
      try:   
        req=urllib2.urlopen(url)
       
        urlfile=open(file_name,'w')
        urlfile.write(req.read())
      except:
        print url
       
      finally:
        urlfile.close()
       
      

    #保存主页
    save_html('index')


    #正则表达式查找链接并保存对应文件
    req=urllib2.urlopen(r'https://docs.python.org/2/library/index.html')
    p=re.compile(r'''<li class="toctree-.+?"><a class="reference internal" href="(.+?).html">.+?</a></li>''')
    matchs=p.findall(req.read())


    for row in matchs:
      save_html(row)

捉完后，使用了 [ calibre - E-book management ] 把html 转换成mobi 格式的文件。

mobi 下载链接：

http://f.dataguru.cn/forum.php?mod=attachment&aid=MTQ5OTQzfDc1Y2MyMDk5fDE0MDgxNzEzNTB8NDQxMTd8MzM3NjMy

关键字：

上一篇： Python if 和 for 的多种写

下一篇： python uuid库的使用



搜索

热门推荐

最新文章

Python搭建一个RAG系统(分片/检索/召回/重排序/生成)
 1580°
Browser-use:智能浏览器自动化(Web-Agent)
 2302°
使用 LangChain 实现本地 Agent
 1910°
使用 LangChain 构建本地 RAG 应用
 1851°
使用LLaMA-Factory微调大模型的function calling能力
 2170°
复现一个简单Agent系统
 1892°
LLaMA Factory-Lora微调实现声控语音多轮问答对话-1
 2583°
LLaMA Factory微调后的模型合并导出和部署-4
 4321°
LLaMA Factory微调模型的各种参数怎么设置-3
 4173°
LLaMA Factory构建高质量数据集-2
 2977°

博主信息

姓名：Run
职业：谜
邮箱：383697894@qq.com
定位：上海 · 松江

扫我打开

友情链接

百度 淘宝 腾讯 慕课网 CSDN 博客园 51cto博客