# geekTime **Repository Path**: Conquer_yang/geek-time ## Basic Information - **Project Name**: geekTime - **Description**: 借用一个极客时间账号,还你专题文章.... - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2021-11-11 - **Last Updated**: 2021-11-14 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README 该项目仅限学习交流使用,请勿用于任何商业行为和损害其它人利益的行为。 如何使用 1. 将代码 clone 到本地 git clone git@github.com:zhengxiaotian/geek_crawler.git 2. 直接在终端或者 Pycharm 中运行脚本(ps: 代码是在 Python3 下编写的,需要使用 Python3 运行) # 运行前需安装一个第三方库 requests python geek_crawler.py 3. 输入账号密码 E:\geek_crawler (master -> origin) λ python geek_crawler.py 请输入你的极客时间账号(手机号): ************* 请输入你的极客时间密码: ************ 4. 抓取完成 PS:如果抓取过程中有接口报错导致抓取中断,可以查看日志中对应的报错信息,然后直接重新跑脚本继续抓取(之前抓取成功的文章会在本地有文档记录,后续不会重复抓取的) 2020-04-28 19:32:41,624 - geek_crawler.py[line:307] - INFO: 请求获取文章信息接口: 2020-04-28 19:32:41,633 - geek_crawler.py[line:320] - INFO: 接口请求参数:{'id': 225554, 'include_neighbors': 'tru e', 'is_freelyread': 'true'} 2020-04-28 19:32:42,047 - geek_crawler.py[line:349] - INFO: ---------------------------------------- 2020-04-28 19:32:47,131 - geek_crawler.py[line:478] - INFO: 正常抓取完成。 功能清单 [X] 输入账号密码后自动将该账号下所有可以看到的专栏(图文+音频),保存到本地【以.md内嵌音频线上地址实现】; [X] 可以支持选择保存成 Markdown 文档或者 HTML 文档; [X] 支持配置排除某些课程的拉取(比如已经有的课程不再下载); [ ] 支持抓取指定名称的课程; [ ] 支持抓取指定课程中指定的文章【UI页面实现】 [ ] 将每篇文章的评论与正文一起保存到本地; [ ] 将视频拉取下来保存成 MP4 文件; [ ] 将音频单独的获取成MP3文件 [ ] 可以支持分别设置文章、音频的保存路径 [ ] 可以创建下载任务队列,跟踪文章、音频的下载进度 [ ] 可以记录已下载课程、文章,