# lda-learn **Repository Path**: wkc/lda-learn ## Basic Information - **Project Name**: lda-learn - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2014-12-10 - **Last Updated**: 2020-12-19 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README 话题分析程序 使用方法见 jieba-with-zhihu-look.py文件 关键函数为 get_theme sina-blog-download.py 下载新浪博客的文章并保存到mongodb数据库,供话题分析使用 generate-zhihu-idf.py 把zhihu/topic.txt转换并叠加到zhihu/idf.txt.big上生成zhihu/idf-zhihu.txt.big jieba-with-zhihu-look.py 结果演示文件,直接运行可以生成 result_origin.txt和result_zhihu.txt 分别为使用zhihu话题前后的运行结果。 zhihu文件夹: idf.txt.big 结巴自带的IDF文件。 idf-zhihu.txt.big 生成的IDF文件。 topic.txt 抓取自知乎的话题列表(有向图) topic_set.pkl 就是topic.txt中词汇的set。因为txt太大了(20M),序列化之后只有500kb。这样代码可以不依赖 topic.txt 其它各种实验的中间数据和代码由于体积太大(>100MB),暂时没有放在版本库里面。 有需要我再上传。