大家好,今天小编来为大家解答怎样彻底保存网站源码分享这个问题,网站源码放在哪里很多人还不知道,现在让我们一起来看看吧!
用python实现csdn博主全部博文下载,html转pdf,有了学习的电子书了。。。(附源码)
我们学习编程,在学习的时候,会有想把有用的知识点保存下来,我们可以把知识点的内容爬下来转变成pdf格式,方便我们拿手机可以闲时翻看,是很方便的
先来一个单个的博文下载转pdf格式的操作
私信小编01即可获取大量Python学习资源
python中将html转化为pdf的常用工具是Wkhtmltopdf工具包,在python环境下,pdfkit是这个工具包的封装类。如何使用pdfkit以及如何配置呢?分如下几个步骤。
下载wkhtmltopdf安装包,并且安装到电脑上。
我下的是这个版本,安装的时候要记住路径,之后调用要用到路径
开发工具
pythonpycharmpdfkit(pipinstallpdfkit)lxml
今天目标:博主的全部博文下载,并且转pdf格式保存
基本思路:1、url+headers2、分析网页:CSDN网页是静态网页,请求获取网页源代码3、lxml解析获取boke_urls,author_name4、循环遍历,得到boke_url
5、xpath解析获取文件名6、css选择器获取标签文本的主体7、构造拼接html文件8、保存html文件9、文件的转换
分析网页:CSDN网页是静态网页,请求获取网页源代码
start_url=“https://i1bit.blog.csdn.net/”
为例确定网址为同步加载
css选择器获取标签文本的主体为代码要点部分css语法部分
\thtml_css=parsel.Selector(响应的数据)\nhtml_content=html_css.css(&39;).get()\n
点开博主的一篇博文打开开发者工具
39;article&构造拼接html文件\nhtml=\\\n&39;&34;en&34;UTF-8&39;&39;.format(html_content)\n
文件的转换
config=pdfkit.configuration(wkhtmltopdf=r&39;)\npdfkit.from_file(\n第一个参数要转变的html文件,\n第二个参数转变后的pdf文件,\nconfiguration=config\n)\n39;这里为下载wkhtmltopdf.exe的路径&1、url+headers\nstart_url=input(r&39;)\nheaders={\n&39;:&39;\n&39;\n}\n\n3、解析获取boke_urls,author_name\nhtml_xpath_1=etree.HTML(response_1)\n\nauthor_name=html_xpath_1.xpath(r&34;floor-user-profile_485&39;)[0]\n\nboke_urls=html_xpath_1.xpath(r&34;blog-list-box&39;)\n\n\n5、请求\nresponse_2=session.get(boke_url,headers=headers).text\n\n39;//h1[@id=&34;]/text()&7、css选择器获取标签文本的主体\nhtml_css=parsel.Selector(response_2)\nhtml_content=html_css.css(&39;).get()\n\n39;&39;\n<!DOCTYPEhtml>\n<htmllang=&34;>\n<head>\n<metacharset=&34;>\n<title>Title</title>\n</head>\n<body>\n{}\n</body>\n</html>\n&39;&9、创建两个文件夹,一个用来保存html一个用来保存pdf文件\nifnotos.path.exists(r&39;.format(author_name)):\nos.mkdir(r&39;.format(author_name))\n\nifnotos.path.exists(r&39;.format(author_name)):\nos.mkdir(r&39;.format(author_name))\n\n39;{}-html/{}.html&39;w&39;utf-8&39;文件名错误&11、文件的转换\ntry:\nconfig=pdfkit.configuration(wkhtmltopdf=r&39;)\npdfkit.from_file(\n&39;.format(author_name,file_name),\n&39;.format(author_name,file_name),\nconfiguration=config\n)\na=print(r&39;.format(file_name))\n\nexceptExceptionase:\ncontinue\n\n\nif__name__==&39;:\nmain()\n\n
代码操作:
关于怎样彻底保存网站源码分享和网站源码放在哪里的介绍到此就结束了,不知道你从中找到你需要的信息了吗 ?如果你还想了解更多这方面的信息,记得收藏关注本站。