中文新闻分类全栈实践:ML到BERT蒸馏
覆盖随机森林、FastText、BERT及知识蒸馏四条技术路线的中文新闻分类项目,含18万条语料和Flask部署方案。适合需要快速对比传统方法与深度学习落地效果的工程团队参考。
This is a text classification project based on the "Category News" feature of Toutiao. Initially, we used the random forest algorithm, then upgraded to FastText, and finally built a new text classification model using a BERT pre-trained model with an added fully connected layer.There may still contain several bugs—let's work together to fix them.
做中文NLP落地的团队常面临一个尴尬:GitHub上要么是纯学术的SOTA复现,要么是 toy demo 级别的教程,能直接对比 TF-IDF、FastText、BERT 同一数据集效果的项目很少见。这个项目把四条路线跑通了,还补了动态量化和 Flask 部署,对要做技术选型报告的团队很实用。
不过要注意两个坑:一是作者明确说蒸馏方案有问题待修,生产环境别直接用;二是 BERT 模型需自行去官网下载,国内用户得换源。如果你正纠结"小场景要不要上 BERT",跑一遍它的 benchmark 比看十篇博客管用。
中文NLP教学型项目,覆盖传统到深度学习全技术路线对比
独特价值:提供18万中文语料与四条路线完整对比,含Flask部署方案