1 Star 0 Fork 1

linzhengtian/Bert-Chinese-Text-Classification-Pytorch-Learn

加入 Gitee
与超过 1200万 开发者一起发现、参与优秀开源项目,私有仓库也完全免费 :)
免费加入
克隆/下载
贡献代码
同步代码
取消
提示: 由于 Git 不支持空文件夾,创建文件夹后会生成空的 .keep 文件
Loading...
README
MIT

Bert-Chinese-Text-Classification-Pytorch-Learn

Bert-Chinese-Text-Classification-Pytorch项目学习材料,补充Huggingface案例。

中文文本分类,Bert,ERNIE,Huggingface,基于pytorch,开箱即用。

介绍

推荐2080Ti及以上配置GPU,显存建议20G及以上。

中文数据集

THUCNews 中抽取了20万条新闻标题,文本长度在20到30之间。一共10个类别,每类2万条。数据以字为单位输入模型。

类别:财经、房产、股票、教育、科技、社会、时政、体育、游戏、娱乐。

数据集划分:

数据集 数据量
训练集 18万
验证集 1万
测试集 1万

其他数据集

jd-京东读书数据集,laws-法律文书,news-新闻摘要(多标签),或者按照以上数据集的格式来格式化你的中文数据集。

THUCNews效果

模型 acc 备注
bert 94.83% 单纯的bert
ERNIE 94.61% 中文bert
bert_CNN 94.44% bert + CNN
bert_RNN 94.57% bert + RNN
bert_RCNN 94.51% bert + RCNN
bert_DPCNN 94.47% bert + DPCNN

CNN、RNN、DPCNN、RCNN、RNN+Attention、FastText等模型效果,见仓库

预训练语言模型

bert模型放在 bert_pretain目录下,ERNIE模型放在ERNIE_pretrain目录下,每个目录下都是三个文件:

  • pytorch_model.bin
  • bert_config.json
  • vocab.txt

预训练模型下载地址:
bert_Chinese:

ERNIE_Chinese:

解压后,按照上面说的放在对应目录下,文件名称确认无误即可。

原始模型使用说明

下载好预训练模型就可以跑了。

# 训练并测试:
# bert
python run.py --model bert

# bert + 其它
python run.py --model bert_CNN

# ERNIE
python run.py --model ERNIE

参数

模型都在models目录下,超参定义和模型定义在同一文件中。

Huggingface使用说明

执行huggingface_example目录代码

对应论文

[1] BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
[2] ERNIE: Enhanced Representation through Knowledge Integration

MIT License Copyright (c) 2019 huwenxing Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software, and to permit persons to whom the Software is furnished to do so, subject to the following conditions: The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software. THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE.

简介

Bert-Chinese-Text-Classification-Pytorch学习代码,支持ERNIE 展开 收起
取消

发行版

暂无发行版

贡献者

全部

近期动态

不能加载更多了
马建仓 AI 助手
尝试更多
代码解读
代码找茬
代码优化
1
https://gitee.com/linzhengtian/bert-chinese-text-classification-pytorch-learn.git
git@gitee.com:linzhengtian/bert-chinese-text-classification-pytorch-learn.git
linzhengtian
bert-chinese-text-classification-pytorch-learn
Bert-Chinese-Text-Classification-Pytorch-Learn
master

搜索帮助