Score
0
Watch 2 Star 5 Fork 1

apple123456 / tf-idf-keywordPythonMIT

Join us
Explore and code with more than 2 million developers,Free private repositories !:)
Sign up
Keyword extraction based on TF-IDF of specific corpus. 基于特定语料库的TF-IDF的中文关键词提取 spread retract

Clone or download
Cancel
Notice: Creating folder will generate an empty file .keep, because not support in Git
Loading...
README.md

基于TF-IDF的中文关键词提取

requirements

默认环境python3,需要结巴分词器的支持

$ pip install jieba

IDF(逆文档频率)生成

用法:

$ python gen_idf.py -i <inputdir> -o <outputfile>
  • -i <inputdir> : 语料库目录,程序会扫描目录下的所有文件
  • -o <outputfile> : 保存idf到指定文件

TF-IDF关键词提取

用法:

$ python tfidf.py -i <idffile> -d <document> -t <topK>
  • -i <idffile> : idf文件路径
  • -d <document> : 所需处理文档路径
  • -t <topK> : 返回topK结果

示例

$ python tfidf.py -i idf.txt -d test.txt -t 20

返回结果:


处理器
服务器
系统核心
封装
系列
插槽
核心
主频
产品
伊斯坦布尔
英特尔
功耗
多处理器
低仅
折合
浮点运算
性能
构建
吹起

注:该repo中提供的idf.txt由清华NLP组的新闻数据集训练获得。

Comments ( 0 )

Sign in for post a comment

Python
1
https://gitee.com/apple12345656/tf-idf-keyword.git
git@gitee.com:apple12345656/tf-idf-keyword.git
apple12345656
tf-idf-keyword
tf-idf-keyword
master

Help Search