通过这道赛题可以引导大家走入自然语言处理的世界,带大家接触NLP的预处理、模型构建和模型训练等知识点。 任务目标 要求选手根据新闻文本字符对新闻的类别进行分类,这是一个经典文本分类问题。 训练集共200,000条新闻,每条新闻平均907个字符,最短的 ...
从 THUCNews 中随机抽取20万条新闻标题,一共有10个类别:财经、房产、股票、教育、科技、社会、时政、体育、游戏、娱乐,每类2万条标题数据。数据集按如下划分: 训练集:18万条新闻标题,每个类别的标题数为18000 验证集:1万条新闻标题,每个类别的标题数 ...