此文章与 52 破解论坛同步,但是源码与文件下载没有对各位大佬进行任何限制!
路过的各位佬 赏个免费的红心
好喜欢 Python 尤其是爬虫 尤其是没有反爬手段的网站
上次在 52 论坛分享了同样的知乎脚本,有人就问 我不是盐神 onehu.xyz 这个网站能不能爬取?

这就安排!!!!!!!!!!!
先看结果

第一步:读取所有链接并保存下来
这一步的目的如题,但是,预防请求太多封 ip,于是设置请求一条保存一条,并且记录已经请求第几页了,方面断了之后再续
这是所有的链接文件,不用重复爬取咯:https://www.123pan.com/s/cnHcVv-jalgv.html
代码如下:有多线程 爬的很快
第二步:逐条访问保存的链接,将文本保存为 txt 以及 markdown
最后一步:打包下载!!!
我已经打包好了 ,地址:
最后的最后~~~~~
提醒各位,源码仅仅做学习交流,千万别都去爬取,给网站造成负担,毕竟这个网站公益很多年了,担心跑路,打包文章。
小的还贴心的给各位看官提供了一键爬取功能,所有的代码以及过程输出都放在了谷歌的 colab 中,这是链接,方便小白也能体验一把爬虫的乐趣~~~(不要乱试哦)
有关Notion安装或者使用上的问题,欢迎您在底部评论区留言,一起交流~

原文归档:https://blog.7998888.xyz/technology/1a5a8b91-8e49-8083-a3d5-e0500046721c
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END







暂无评论内容