你好,游客 登录 注册 发布搜索
背景:
阅读新闻

[期刊]基于MapReduce虚拟机的Deep Web数据源发现方法

[日期:2015-01-27] 来源:通信学报  作者:辛洁 崔志明 赵朋朋 张广铭 鲜学丰 [字体: ]

基于MapReduce虚拟机的Deep Web数据源发现方法

辛洁 崔志明 赵朋朋 张广铭 鲜学丰

为了提高Deep Web爬虫发现和搜集数据源的效率,提出了一种融合MapReduce和虚拟化技术实现DeepWeb海量数据挖掘的并行计算方法。基于MapReduce架构提出了一个Deep Web爬虫模型,通过链接过滤分类、页面过滤分类、表单过滤分类等3个MapReduce过程找到Deep Web数据源接口,并利用虚拟机构建单机集群进行性能测试。实验结果显示该方法可以实现大规模数据的并行处理,有效提高爬虫数据源发现的效率,避免网络及物理资源的浪费,验证了云计算技术在Deep Web数据挖掘方面的可行性。


基于MapReduce虚拟机的Deep Web数据源发现方法

 

 

收藏 推荐 打印 | 录入:574107552 | 阅读:
相关新闻      
本文评论   查看全部评论 (0)
表情: 表情 姓名: 字数
点评:
       
评论声明
  • 尊重网上道德,遵守中华人民共和国的各项有关法律法规
  • 承担一切因您的行为而直接或间接导致的民事或刑事法律责任
  • 本站管理人员有权保留或删除其管辖留言中的任意内容
  • 本站有权在网站内转载或引用您的评论
  • 参与本评论即表明您已经阅读并接受上述条款