# 百度知道爬虫 **Repository Path**: benchover/baidu_spider ## Basic Information - **Project Name**: 百度知道爬虫 - **Description**: 根据关键字搜索百度知道,爬取问题和所有回答,并存入txt文本。当有多个搜索任务时,支持多进程 - **Primary Language**: Python - **License**: Apache-2.0 - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 2 - **Forks**: 0 - **Created**: 2019-01-25 - **Last Updated**: 2022-01-24 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 百度知道爬虫 #### 介绍 根据关键字搜索百度知道,爬取问题和所有回答,并存入txt文本。当有多个搜索任务时,支持多进程 仅支持 Python3.x 推荐 Python 3.5+ #### 使用说明 1. 需要 requests lxml 库,使用pip进行安装 pip install requests pip install lxml 2. 只能确认目前(2019年1月25日)能正常爬取数据,如果百度知道网页发生变化,那么无法获取数据 #### 使用方法: 将待搜索的关键词 放入 search.txt 这个文件中,一行一个关键词。目录与 主程序 py 文件同级。 当有多个关键词时,支持多进程。一个搜索任务一个进程。 程序运行完后,会将搜索的结果保存至txt文本中。结果的txt的文件名,以进程编号命名,例如 1.txt 2.txt ……