你好,游客 登录 注册 发布搜索
背景:
阅读新闻

[期刊]基于Hadoop的领域术语抽取研究

[日期:2015-07-16] 来源:中国知网  作者:杜丽萍 李晓戈 周元哲 邵春昌 [字体: ]

基于Hadoop的领域术语抽取研究

杜丽萍 李晓戈 周元哲 邵春昌

传统单机领域术语抽取系统的扩展性已经成为基于大规模语料库进行领域术语抽取的瓶颈。对此提出了一种基于Hadoop分布式平台的统计与规则相结合的无监督的专业术语抽取算法,该算法首先利用 PMI(Point-wise Mutual Information)的改进方法确定 2 元待扩展种子,其次采用左右扩展的方式逐字地把 2 元待扩展种子扩展至 2-n 元候选术语(n表示抽取术语的最大长度,可根据需要指定),最后利用两个基本规则过滤候选术语集合。实验结果表明当 PMI 改进方法的参数取值大于等于 3 时可解决 PMI 方法的缺点、 基于大规模语料库进行专业术语抽取的必要性和基于并行算法的高效性。


基于Hadoop的领域术语抽取研究

 

收藏 推荐 打印 | 录入:574107552 | 阅读:
相关新闻      
本文评论   查看全部评论 (0)
表情: 表情 姓名: 字数
点评:
       
评论声明
  • 尊重网上道德,遵守中华人民共和国的各项有关法律法规
  • 承担一切因您的行为而直接或间接导致的民事或刑事法律责任
  • 本站管理人员有权保留或删除其管辖留言中的任意内容
  • 本站有权在网站内转载或引用您的评论
  • 参与本评论即表明您已经阅读并接受上述条款