你好,游客 登录 注册 发布搜索
背景:
阅读新闻

[期刊]词类共现频率的MapReduce并行生成方法

[日期:2014-01-30] 来源:CNKI  作者:程兴国 肖南峰 [字体: ]

词类共现频率的MapReduce并行生成方法

程兴国    肖南峰

语料库在自然语言处理(NLP)领域的应用越来越广泛,词类共现频率的统计是其研究内容之一.针对词类共现的计算特点,给出了基于MapReduce编程模型实现的并行方法,即pairs和stripes方法[1].虽然stripes模式性能明显优于pairs模式,但其在词汇表很大时存在内存溢出问题.针对此缺陷,给出了划分词汇表的解决方法,对输入词汇表进行拆分,此过程可利用MapReduce模型进行预处理.实验结果表明:利用MapReduce的并行性能较好地提高海量语料库中词类共现频率统计的效率和性能.


词类共现频率的MapReduce并行生成方法

收藏 推荐 打印 | 录入:574107552 | 阅读:
相关新闻      
本文评论   查看全部评论 (0)
表情: 表情 姓名: 字数
点评:
       
评论声明
  • 尊重网上道德,遵守中华人民共和国的各项有关法律法规
  • 承担一切因您的行为而直接或间接导致的民事或刑事法律责任
  • 本站管理人员有权保留或删除其管辖留言中的任意内容
  • 本站有权在网站内转载或引用您的评论
  • 参与本评论即表明您已经阅读并接受上述条款