# 数据挖掘_CNKI实践 **Repository Path**: gaogaolo/cnki ## Basic Information - **Project Name**: 数据挖掘_CNKI实践 - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2021-06-15 - **Last Updated**: 2021-06-19 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 数据挖掘_CNKI实践 * 撰写人:高智浩 * 最新撰写时间: 2021.6.15 ## 项目意义: * 更深入selenium熟悉自动化挖掘操作 * 学习爬取知网内容 ## 项目目的 1. 爬取合适的有价值的论文 2. 爬取文章数量大于800篇 3. 导出refworks文件(.txt) 4. 下载原文 ## 项目结果 * 成功爬取指定关键词下的论文总计16页的所有文章,总计800篇文章。爬取内容包括论文篇名、作者、刊名、发表时间、下载次数以及导出refworks文件(.txt),并成功保存在本地的文件夹中。 ## 所遇问题以及解决方案 1.在操作中遇到了的操作问题很多都是因为对selenium的不熟悉而造成的,解决方案是去浏览selenium的操作指南[selenium操作指南](https://www.selenium.dev/documentation/zh-cn/webdriver/browser_manipulation/) 2.若出现多个页面,需要对页面进行切换才可继续进行下一步骤。 ``` driver.switch_to_window(driver.window_handles[1]) ``` ## 总结 * 在本次项目实践中,我学习并更加深入了解了selenium的操作,并加深了对数据挖掘这门课的理解。感谢在项目中给我帮助的智超老师和同学们。