有两点疑问: 1、如何利用这些词典训练人名识别模型? 2、如何利用这些词典构建训练语料? 感谢!
wainshine如果是jieba分词、或hanlp分词的话,可以改改直接当自定义词典使。 如果是BERT或其他模型,可以随机抽取等量的男女性别(如男女各10万条),作为训练集/测试集/验证集。目前的数据,男女比率接近男2女1了,不抽样没法用。