《计算机应用研究》|Application Research of Computers

中文分词模型词典融入方法比较

Comparison of methods for integrating lexicon information in Chinese word segmentation

免费全文下载 (已被下载 次)  
获取PDF全文
作者 冯雪
机构 北京信息科技大学 计算机学院
统计 摘要被查看 次,已被下载
摘要 目前比较流行的中文分词方法为基于统计模型的机器学习方法。基于统计的方法一般采用人工标注的句子级的标注语料进行训练,但是这种方法往往忽略了已有的经过多年积累的人工标注的词典信息。这些信息尤其是在面向跨领域时,由于目标领域句子级别的标注资源稀少,从而显得更加珍贵。因此如何充分而且有效的在基于统计的模型中利用词典信息,是一个非常值得关注的工作。最近已有部分工作对它进行了研究,按照词典信息融入方式大致可以分为两类:一类是在基于字的序列标注模型中融入词典特征,而另一类是在基于词的柱搜索模型中融入特征。对这两类方法进行比较,并进一步进行结合。实验表明,这两类方法结合之后,词典信息可以得到更充分的利用,最终无论是在同领域测试和还是在跨领域测试上都取得了更优的性能。
关键词 中文分词;条件随机场;柱搜索;领域自适应
基金项目 北京市教委科技计划面上项目(KM201411232012)
本文URL http://www.arocmag.com/article/02-2019-01-001.html
收稿日期
修回日期
页码 -
中图分类号 TP391.1
文献标志码